跳到正文
10月7日周三
10月5日周一
  1. GitHub Blog · AI & ML48

    GitHub 发布开源代码审查基准 ReviewBench,覆盖 219 个真实 PR

    GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。

10月4日周日
10月1日周四
  1. Google DeepMind88

    Google DeepMind 发布 Gemini 4 Argon,主打 1M token 长链推理与网络安全防御

    Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,面向软件工程、法律与金融知识工作以及网络安全防御等长链路复杂流程。模型输出 token 上限从 64K 提升到 1M,定价为输入 $2 / 输出 $10 每百万 token,缓存输入享 95% 折扣。

    推荐理由:官方一次性放出 1M 输出 token、$2/$10 per M tokens 定价与 Fairwind 安全分阶段策略,方便和同代前沿模型直接做能力与部署节奏比较。

9月30日周三
9月23日周三
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度创意角色设计与高吞吐低成本场景。

    推荐理由:两款 TTS 模型在多角色台词导演、长音频一致性和音色克隆安全机制上做了系统级说明,读者可对照自身配音与多语种本地化场景评估。

8月20日周四