ttok 发布 1.0 版本,默认切换至 GPT-5/GPT-6 tokenizer
ttok 升级到 1.0 版本,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6 系列。
ttok 升级到 1.0 版本,将默认 tokenizer 从 GPT-4 切换为 GPT-5/GPT-6 系列。
Simon Willison 发布 ttok 0.4,距离上次更新已过两年。ttok 是基于 OpenAI 开源 tiktoken 库的 CLI 工具,本版修复了 Click 警告、更新了 CI,并新增 --list-models 命令用于列出可用模型;通过 uvx 即可调用,典型用法为 `cat file.txt | uvx ttok`。
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
NVIDIA 工程师使用 GPT-6 Astra 等前沿 AI 模型,配合 NVIDIA Omniverse 库,在仓储人形机器人、自主驾驶测试、RTX 传感器数字孪生、机器人运动仿真、CAD 拆装和国际空间站可视化等场景中,通过自然语言指令搭建仿真应用。
AWS 在 Amazon SageMaker HyperPod 上推出基于 Amazon EKS 的多租户参考架构,让多个团队共享同一 GPU 集群。
Parseable 是一个兼容 OpenTelemetry 的新型可观测性工具,提供 AGPL 开源 Rust 版本(约 180MB 单二进制)、企业版及云托管方案。
AWS 在博客中演示如何在 Amazon Bedrock AgentCore 上搭建航司语音旅行管家,核心是用 Amazon Nova 2.5 Sonic 做实时语音交互,通过 Strands Agents 框架和 AgentCore Gateway 以 MCP 协议连接后端服务,支持改座位、查航班、改餐食、答政策问题并可转接人工坐席。
Amazon SageMaker HyperPod 为 ML 团队提供大规模加速算力用于训练和微调,多团队共享集群时治理成为核心挑战。
AWS 发布博客解读 ISO/IEC 42005:2025 国际标准,帮助客户在企业风险治理体系中高效整合 AI 系统影响评估。标准涵盖评估全生命周期(范围界定、执行、分析报告、持续监测与复评),并提供触发复评的条件与简化流程,Annex D 支持与现有 IT/隐私/安全等评估协同去重,Annex E 提供独立实施的即用模板。
AWS 在 Amazon Quick 与 Amazon Bedrock Knowledge Bases 中引入实时 ACL 校验,作为预检索过滤之外的第二层安全机制,以解决企业 RAG 场景下的权限控制难题。
微软研究院发布并开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与强化学习,开发者无需把 agent 重新实现到训练框架中。
推荐理由:框架以约 3,500 行代码实现与真实 agent harness 直接对接的 RL 控制平面,并用 SWE-bench Verified 上的 14.6 个百分点提升给出可复现的工程样例。
AWS 发布博客文章,针对 AI 卓越中心(AI CoE)提出名为 "Agentic Value Model" 的商业论证框架,替代仅按 RPA 时代"节省工时 × 人力成本 − 构建成本"思路设计的传统 ROI 模型。
AWS 推出基于 AWS Lambda Durable Functions、Amazon EventBridge 与 Amazon Bedrock 的自动化修复工作流,可承接 AWS DevOps Agent 完成的故障调查,将根因分析结果转化为预校验的修复方案并执行。
AWS 设计了一个为期六周、每周约四小时的结对项目,让非工程师背景的业务人员亲手构建 AI 智能体原型以缩小"知识-能力"差距。项目数据显示,分阶段学习的参与者比两天速成班多保留三倍实操技能。
Cornerstone OnDemand 基于 Amazon Bedrock 与开源 Strands Agents 框架构建多智能体系统 Orion AI,将数据库故障诊断时间从 45 分钟降至 10 分钟,降幅 78%,并由三人团队在六个月内交付。
OpenAI 推出 Decisions API 及 gpt-6-luna 决策模型,支持文本与图像输入的 yes/no、选项和评分三类判断,按输入 token 收费,价格为 10 美分/百万 input tokens。
AWS 博客演示了如何在 Amazon Bedrock AgentCore runtime 上运行开源 agentic 系统 OpenClaw,构建一个能跨对话保留上下文的个人助手 Sprout,并可一键通过 CloudFormation 部署,按使用量计费,轻度个人使用每月约 1–2 美元。
AI 正在改变开发者的工作方式,GitHub 建议开发者强化三项技能:学会指挥 AI 智能体而非仅被动使用、不盲信 AI 的首次输出、以及利用 AI 节省的时间去解决更宏观的问题。
GitHub Copilot app 中的 canvases(canvas extension)是一项可由用户与 agent 共享的可定制界面,支持看板、issue 分类面板、发布清单、表单或电子表格等形态。
GitHub Copilot 应用推出 Canvas 功能,一种可在 App 内运行的全栈小应用,允许与 Copilot 智能体双向通信,让用户用定制 UI 替代聊天框来完成具体任务。
GitHub Security Lab 推出基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目实现端到端自动化模糊测试流水线。
GitHub Copilot 应用针对巨型 Pull Request 重构了 diff 视图渲染架构,将文档高度拆分为代码几何与动态块几何两个独立域:代码行高度在绘制前即可精确计算,评论、回复框等动态块则按需懒测量并以文件、行号和侧别为锚点定位,避免估算误差和滚动跳变。文章以一个含 2200 个文件、超 100 万行变更和 400 余条行内评论的开源 PR 为极端用例验证性能。
Mistral 与一家欧洲能源运营商合作,将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,并接入 PetSc 等现代科学计算框架。项目先用 state 快照导出与 C++ 测试框架构建"数值一致性校验"基线,再通过 Vibe CLI 启动上百个智能体,配合自定义解析器生成的调用树和 Mistral OCR 整理散落文档,逐模块完成翻译与 PR 提交。