跳到正文
今天10月9日周五3 条
10月8日周四
  1. AWS Machine Learning Blog63

    Claude Haiku 5.5 在 Amazon Bedrock 上线

    Anthropic 的 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 正式可用,被定位为 Claude 5.5 系列中速度最快、成本最低的型号,主打 subagent 和高吞吐、成本敏感型任务。

    推荐理由:把 Claude Haiku 5.5 接入 Amazon Bedrock 的可用区域、计费方式和与 Opus 5.5 的搭配用法集中讲清,便于在 AWS 上做模型选型。

  2. NVIDIA Blog82

    NVIDIA 与 Microsoft 发布 RTX Spark 与 Windows AI 智能体平台

    NVIDIA 与 Microsoft 在旧金山 Windows AI 与 Surface 活动中发布 RTX Spark,将 Blackwell RTX GPU 与 Grace CPU 整合的统一内存最高 128GB,FP4 AI 性能达 1 petaflop,可本地运行 Qwen 3.8 Flash Next 等模型。

    推荐理由:原文给出 RTX Spark 硬件规格、上市时间以及 MXC 等系统级能力,可据以判断端侧 AI 形态如何改变现有 PC 工作流。

  3. Microsoft Research70

    微软研究院发布 Agent Lightning v1.0:用约 3,500 行代码实现对接真实 agent harness 的轻量智能体强化学习框架

    微软研究院发布并开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与强化学习,开发者无需把 agent 重新实现到训练框架中。

    推荐理由:框架以约 3,500 行代码实现与真实 agent harness 直接对接的 RL 控制平面,并用 SWE-bench Verified 上的 14.6 个百分点提升给出可复现的工程样例。

10月7日周三
10月6日周二
  1. Mistral AI78

    Mistral 发布 Large 4(ML4)公开预览,1 万亿参数原生多模态模型

    Mistral 推出 Mistral Large 4(昵称 Le Chonk)公开预览 API,模型为 1 万亿参数、52 亿激活参数的原生多模态架构,训练使用 Mistral 欧洲自建数据中心中的 3800 颗 NVIDIA Grace Blackwell GPU。

    推荐理由:公开预览同步给出网络与编码等多维度基准与排名,读者可横向对比当前主流闭源与开源模型的能力差距。

  2. Google Research36

    Google Research 发布智能体隐私与安全研讨会报告,提出以情境完整性为核心的防护框架

    Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。

10月5日周一
  1. GitHub Blog · AI & ML48

    GitHub 发布开源代码审查基准 ReviewBench,覆盖 219 个真实 PR

    GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。

10月4日周日
10月2日周五
9月29日周二
9月28日周一
9月26日周六
9月25日周五
  1. Google Research60

    Google Research 提出 AI 视频联合导演框架,把多智能体协同用于长视频一致性生成

    Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。

    推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。

9月18日周五
9月9日周三
  1. Mistral AI44

    Mistral 如何用 AI 智能体重构 Fortran 77 遗留代码库

    Mistral 与一家欧洲能源运营商合作,将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,并接入 PetSc 等现代科学计算框架。项目先用 state 快照导出与 C++ 测试框架构建"数值一致性校验"基线,再通过 Vibe CLI 启动上百个智能体,配合自定义解析器生成的调用树和 Mistral OCR 整理散落文档,逐模块完成翻译与 PR 提交。

8月20日周四
7月26日周日
7月7日周二