OpenAI 在 GitHub 发布 372 个 AI 生成的数学证明
OpenAI 在 GitHub 仓库一次性发布 372 个由其内部前沿模型生成的数学结果,称每一项都试图解决一个开放问题或在关键方向上取得实质进展,其中部分工作改进了主流计算机算法并涉及黎曼猜想。
OpenAI 在 GitHub 仓库一次性发布 372 个由其内部前沿模型生成的数学结果,称每一项都试图解决一个开放问题或在关键方向上取得实质进展,其中部分工作改进了主流计算机算法并涉及黎曼猜想。
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
OpenAI 发布内部 frontier model 在数学开放问题上的最新结果,并在 GitHub 分享 Lean 证明形式化与研究细节。材料未提供具体问题、模型名称或结果数据。
作者以 AlphaGo 第 37 手的"推理"机制为参照,指出当前 LLM 依靠 next-token prediction 与 chain-of-thought 生成中间步骤,本质上仍是 system 1 式直觉模式,并不构成真正的推理。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发及沙特与中东地区 AI 解决方案部署,合作规模达数亿欧元。双方将推进先进模型的本地化,初期聚焦网络安全和语音领域,并开发在阿拉伯语上表现强劲的前沿模型;Mistral 将探索使用 HUMAIN 的数据中心基础设施以满足本地算力需求,双方还将制定面向金融、制造、电信等重点监管行业的联合市场策略。
METR 研究指出,2026 年 AI 在网络安全领域带来显著加速,漏洞报告速率较 2025 年大幅上升;数学研究有少量加速但难以量化,而 AI 算法本身在七个问题领域上未出现可衡量的加速。
DiG-bench 是一个由牛津、普林斯顿、Swiss AI Lab 等机构联合发布的游戏发现基准,包含 70 个隐藏规则的小型交互游戏,目前 21 个已公开、其余私有,用于衡量模型在未知环境中通过探索发现规则的能力。
自适应并行推理(Adaptive Parallel Reasoning)让大语言模型自行决定何时拆分、并行推理子任务,被视为突破顺序推理扩展瓶颈的新范式。传统并行方法如 Self-consistency、Best-of-N、MCTS 等需外部预先设定并行结构,而新近的 ParaThinker、GroupThink 和 Hogwild!