NVIDIA Nemotron 团队公布 IOI 2026 与 IMO 2026 双金牌级别微调结果
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
OpenAI 发布内部 frontier model 在数学开放问题上的最新结果,并在 GitHub 分享 Lean 证明形式化与研究细节。材料未提供具体问题、模型名称或结果数据。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
Microsoft Research 在《Nature》公布并开源逆合成预测模型 RetroChimera,采用 Transformer 的 R-SMILES 2 与图神经网络 NeuralLoc 集成框架,通过 learned ensembling 融合两类子模型的互补优势。
Google Research 在论文中推出开源 C++ 实例生成器 MilleMiglia,用于为"中段物流"(middle-mile)配送生成保真的合成基准数据,弥补该领域长期缺乏公开高质量数据集的空白。
Berkeley Sky Lab 在 K-Search 进化式核函数优化框架中加入 MLX 后端,新增一层 CUDA-to-MLX 结构化翻译,把既有 CUDA 核函数作为知识库自动改写为 Apple Silicon 可用的高质量核函数。
Berkeley AI Research 介绍 SPEX 与 ProxySPEX 两套面向 LLM 的可解释性算法,可在特征归因、数据归因与机制可解释性中以少量扰动识别高阶交互。