跳到正文
10月8日周四
10月7日周三
10月6日周二
  1. Google Research36

    Google Research 发布智能体隐私与安全研讨会报告,提出以情境完整性为核心的防护框架

    Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。

10月5日周一
  1. GitHub Blog · AI & ML48

    GitHub 发布开源代码审查基准 ReviewBench,覆盖 219 个真实 PR

    GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。

10月2日周五
10月1日周四
  1. Microsoft Research14

    微软研究院发布空间天气对电网影响的端到端机器学习预测系统

    微软研究院开发了一套端到端机器学习管线,可对美国本土 66,935 个变电站提供位置特定的空间天气风险预测,提前 30 到 60 分钟发出预警。系统结合 L1 太阳风观测、AE 与 Dst 指数预报以及各地地质电导率数据,在 2020–2026 年评估期内检测到近 80% 的重大空间天气事件。

9月30日周三
9月29日周二
  1. Microsoft Research62

    微软研究院发布面向生物学的 AI 研究系统 Quine

    微软研究院发布 Quine,一个面向生物学复杂性的 AI 研究系统,包含多模态生物学世界模型与连接模型、科学工具、文献和科研人员的交互式 harness。

    推荐理由:原标题和产品定位均围绕“面向生物学的多模态世界模型 + 交互式 harness”展开,核心阅读价值在于它把多模态预训练与湿实验闭环结合到了同一个研究系统中。

9月25日周五
  1. Google Research60

    Google Research 提出 AI 视频联合导演框架,把多智能体协同用于长视频一致性生成

    Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。

    推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。

9月24日周四
  1. Microsoft Research50

    微软研究院提出物理 AI 推理卸载方法并扩展 Physical AI Toolchain

    微软研究院发布物理 AI 推理研究:系统评估把机器人 GPU 推理卸载到边缘或云端的效果。在移动操作任务上,卸载显著提升了任务成功率、响应速度与续航,例如相较小型 GPU,映射与规划任务在 A100 上快 383%,物体交接任务成功率提升达 50%,Jetson Thor 等大型板载 GPU 可额外消耗机器人最多 160% 电量。

9月21日周一
9月19日周六
9月18日周五
7月29日周三
7月26日周日
7月7日周二
5月8日周五
  1. Berkeley AI Research33

    自适应并行推理:高效推理扩展的新范式

    自适应并行推理(Adaptive Parallel Reasoning)让大语言模型自行决定何时拆分、并行推理子任务,被视为突破顺序推理扩展瓶颈的新范式。传统并行方法如 Self-consistency、Best-of-N、MCTS 等需外部预先设定并行结构,而新近的 ParaThinker、GroupThink 和 Hogwild!

4月20日周一
  1. Berkeley AI Research35

    GRASP:面向世界模型长 horizon 规划的梯度优化方法

    GRASP 是 Berkeley AI Research 等团队提出的一种针对学习型世界模型的长 horizon 梯度规划器,通过把轨迹提升到虚拟状态以实现时间上的并行优化、对状态迭代直接加入随机性以促进探索,并重塑梯度以使动作获得干净信号,从而避免高维视觉模型中"状态-输入"梯度的脆弱性。

3月13日周五
1月10日周六
  1. Berkeley AI Research29

    用信息驱动方法评估与优化成像系统

    Berkeley AI Research 在 NeurIPS 2025 论文中提出一种基于互信息的成像系统评估框架,直接从含噪测量中估计信息量,无需任务特定解码器设计。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域均能预测解码器性能;实验显示其优化出的设计在内存与算力更少的前提下,与端到端 SOTA 方法效果相当。