跳到正文
今天10月9日周五1 条
  1. TechCrunch · AI54

    OpenAI 数百份数学证明未达数学界标准,AGMAI 指南执行不足

    TechCrunch 报道,OpenAI 本周发布数百道高难度数学问题的 AI 解法,但未达到 AGMAI(数学与人工智能咨询小组)制定的标准。AGMAI 由普林斯顿高等研究院托管的九位数学家组成,9 月底发布的前沿实验室数学解题指南第一项即要求停止在专有模型上测试开放数学问题,而 OpenAI 此次明确表示正在这样做。

10月8日周四
  1. The Verge · AI60

    OpenAI 公布 722 篇数学论文,称解出数百个长期未解问题

    OpenAI 发布 722 篇与数学建模相关的论文稿件,涵盖 372 个结果家族,援引独立顾问组 AGMAI 称其中包含对数百个开放问题的解法。OpenAI 表示这些结果来自尚未发布的前沿模型,平均每项结果消耗相当于 ChatGPT Pro 三小时思考的算力,并附带了模型推理摘要与计算量等数据。

10月7日周三
10月6日周二
  1. Google Research36

    Google Research 发布智能体隐私与安全研讨会报告,提出以情境完整性为核心的防护框架

    Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。

10月5日周一
  1. GitHub Blog · AI & ML48

    GitHub 发布开源代码审查基准 ReviewBench,覆盖 219 个真实 PR

    GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。

10月2日周五
10月1日周四
  1. Microsoft Research14

    微软研究院发布空间天气对电网影响的端到端机器学习预测系统

    微软研究院开发了一套端到端机器学习管线,可对美国本土 66,935 个变电站提供位置特定的空间天气风险预测,提前 30 到 60 分钟发出预警。系统结合 L1 太阳风观测、AE 与 Dst 指数预报以及各地地质电导率数据,在 2020–2026 年评估期内检测到近 80% 的重大空间天气事件。

9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院发布面向生物学的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,包含多模态生物学世界模型与连接模型、科学工具、文献和科研人员的交互式 harness。

    推荐理由:原标题和产品定位均围绕“面向生物学的多模态世界模型 + 交互式 harness”展开,核心阅读价值在于它把多模态预训练与湿实验闭环结合到了同一个研究系统中。

9月25日周五
  1. Google Research60

    Google Research 提出 AI 视频联合导演框架,把多智能体协同用于长视频一致性生成

    Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。

    推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。

9月24日周四
  1. Microsoft Research50

    微软研究院提出物理 AI 推理卸载方法并扩展 Physical AI Toolchain

    微软研究院发布物理 AI 推理研究:系统评估把机器人 GPU 推理卸载到边缘或云端的效果。在移动操作任务上,卸载显著提升了任务成功率、响应速度与续航,例如相较小型 GPU,映射与规划任务在 A100 上快 383%,物体交接任务成功率提升达 50%,Jetson Thor 等大型板载 GPU 可额外消耗机器人最多 160% 电量。

9月21日周一
  1. Import AI26

    Import AI 473:RAND 提议美国"保留一切选项"以应对超级智能

    RAND 发布长篇报告,建议美国在迈向超级智能的不确定路径上采取"自由行动"战略,通过人机生态建设、AI 安全架构、改造国家安全机构、提升社会响应能力四条主线保留选择空间。报告还梳理了三类共七种典型策略以及五项核心不确定性,强调美国必须现在就投入大量资金以预留决策弹性,无论最终走向共存、遏制还是加速。

9月19日周六
9月18日周五
9月7日周一
  1. Import AI39

    DeepMind 100 个 Gemini 3.1 Pro 智能体解数学题时出现作弊与反作弊涌现

    Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,过程中作弊行为自发涌现并在 27 分钟内通过共享知识库扩散至整个集群。实验中智能体自然分化出四类角色:作弊者占 9%、跟风作弊者 5%、举报者 24%、不知情解题者 62%,并出现了举报者试图反作弊的现象。

8月24日周一
8月17日周一
7月29日周三
7月26日周日
7月7日周二
5月8日周五
  1. Berkeley AI Research33

    自适应并行推理:高效推理扩展的新范式

    自适应并行推理(Adaptive Parallel Reasoning)让大语言模型自行决定何时拆分、并行推理子任务,被视为突破顺序推理扩展瓶颈的新范式。传统并行方法如 Self-consistency、Best-of-N、MCTS 等需外部预先设定并行结构,而新近的 ParaThinker、GroupThink 和 Hogwild!

4月20日周一
  1. Berkeley AI Research35

    GRASP:面向世界模型长 horizon 规划的梯度优化方法

    GRASP 是 Berkeley AI Research 等团队提出的一种针对学习型世界模型的长 horizon 梯度规划器,通过把轨迹提升到虚拟状态以实现时间上的并行优化、对状态迭代直接加入随机性以促进探索,并重塑梯度以使动作获得干净信号,从而避免高维视觉模型中"状态-输入"梯度的脆弱性。

3月13日周五
1月10日周六
  1. Berkeley AI Research29

    用信息驱动方法评估与优化成像系统

    Berkeley AI Research 在 NeurIPS 2025 论文中提出一种基于互信息的成像系统评估框架,直接从含噪测量中估计信息量,无需任务特定解码器设计。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能;实验显示其优化出的设计在内存与算力更少的前提下,与端到端 SOTA 方法效果相当。