GitHub 发布开源代码审查基准 ReviewBench,覆盖 219 个真实 PR
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
微软研究院开发了一套端到端机器学习管线,可对美国本土 66,935 个变电站提供位置特定的空间天气风险预测,提前 30 到 60 分钟发出预警。系统结合 L1 太阳风观测、AE 与 Dst 指数预报以及各地地质电导率数据,在 2020–2026 年评估期内检测到近 80% 的重大空间天气事件。
微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,包含多模态生物学世界模型与连接模型、科学工具、文献和科研人员的交互式 harness。
推荐理由:原标题和产品定位均围绕“面向生物学的多模态世界模型 + 交互式 harness”展开,核心阅读价值在于它把多模态预训练与湿实验闭环结合到了同一个研究系统中。
微软研究院发布物理 AI 推理研究:系统评估把机器人 GPU 推理卸载到边缘或云端的效果。在移动操作任务上,卸载显著提升了任务成功率、响应速度与续航,例如相较小型 GPU,映射与规划任务在 A100 上快 383%,物体交接任务成功率提升达 50%,Jetson Thor 等大型板载 GPU 可额外消耗机器人最多 160% 电量。
Microsoft Research 在《Nature》公布并开源逆合成预测模型 RetroChimera,采用 Transformer 的 R-SMILES 2 与图神经网络 NeuralLoc 集成框架,通过 learned ensembling 融合两类子模型的互补优势。