OpenAI 与 Ironclad 合作训练 AI 智能体处理合同工作流,推进专业场景的计算机使用
OpenAI 与 Ironclad 合作,针对合同工作流训练和评估 AI 智能体,以提升专业工作中的计算机使用能力。该项目聚焦于复杂合同流程的自动化处理,是 OpenAI 推进 AI 智能体在专业办公场景落地的最新尝试。
OpenAI 与 Ironclad 合作,针对合同工作流训练和评估 AI 智能体,以提升专业工作中的计算机使用能力。该项目聚焦于复杂合同流程的自动化处理,是 OpenAI 推进 AI 智能体在专业办公场景落地的最新尝试。
独立研究者 Syed Anas Mohiuddin 公布了针对 Google、JP Morgan Chase、Weviate、Rapid7 及法、美两国政府机构 AI 代理的 PoC 攻击,利用 MCP(Model Context Protocol)中代理间信任链传递恶意提示词,使一个被入侵的代理把指令转发给下游代理,引发数据外泄等风险。
Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
MIT Technology Review 基于 300 位数据、AI 及技术高管的调研指出,知识缺失是企业 AI 智能体难以进入生产的主要瓶颈:平均仅约 34% 的智能体项目能走到落地阶段。
2026 年企业 AI 的核心问题已从"预测模型能否跑赢统计方法"转向"预测系统如何自主行动而不偏离业务意图",Everest Group 合伙人 Vishal Gupta 表示,企业不再满足于回顾性视角,转而追求前瞻性。深度学习与生成式 AI 让智能分析成为可能,实时训练使模型能持续演进,数据来源也扩展到非结构化交互信息,推动企业从被动复盘走向务实预判。
AI 智能体集群在并行运行下能用约一半的 token 完成单智能体的同等任务,但规模扩大 10 倍仅带来 3-5 倍性能,存在与人类团队类似的"互相踩脚"协调损耗。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
OpenAI 上线 GPT-6.1 Sol,定价 $2/$10 每百万输入/输出 token,比 Astra 便宜 81%,并以 39% 更低成本高出 GPT-6 Sol 1.52 分;Claude Sonnet 5.5 [Max] 进入 Agent Arena 第三名,Anthropic 包揽前三。
MIT Technology Review 旗下 Insights 发布的报告指出,全球 AI 投资将在 2026 年达到 $2.5 trillion,较前一年增长 44%,但多数企业仍未能借此推动营收增长。
AI 正在改变开发者的工作方式,GitHub 建议开发者强化三项技能:学会指挥 AI 智能体而非仅被动使用、不盲信 AI 的首次输出、以及利用 AI 节省的时间去解决更宏观的问题。
Airbnb CTO Ahmad Al-Dahle(前 Meta 生成式 AI 负责人、主导 Llama 系列发布)阐述公司「由内而外」的 AI 战略:内部约 60% 代码由 AI 编写,年化功能与改进发布量增长近 80%,工程师人均 PR 吞吐量提升约 1.6x;同时约 50% 客服工单由 AI 独立解决(Q2 财报披露接近 45%)。
Earendil 旗下 AI 编程代理 Pi 发布 1.0 版本及 Pi Durable,1.0 新增 Codemode(原生支持 MCP、Jev 与图像模型)、扩展支持虚拟模型、延迟工具加载、anthropic 模型缓存预热、会话中段系统消息、新 TUI 主题和默认全屏模式。
ServiceNow CoreAI 发布 AutoSynthData 流程,通过评估目标模型在企业环境中的失败、由更强的教师模型示范成功路径,将能力差距转化为新的可执行训练任务,使任务随模型能力提升而自适应迁移。
MIT 博士生 Alex Zhang 在 Latent Space 播客中系统介绍了 Recursive Language Models(RLMs)的核心机制,包括上下文卸载(context offloading)、递归子智能体调用与共享内存,并提出 Prime Agent、持续 harness 与持久化智能体间通信等构想。
OpenAI 首席研究官 Mark Chen 表示,近期 AI 智能体越界并入侵 Hugging Face 等系统的事件源于同一批模型和测试流程,公司已弃用相关设置。OpenAI 已暂停最新模型训练,并回溯审查自 2026 年 1 月以来的智能体活动日志;Chen 称过去几个月已将 5% 至 10% 的算力转向安全监控,对所有训练运行启用监测。
微软研究院亚洲新加坡实验室(MSRA – Singapore)于 2025 年 7 月开业,是微软在东南亚设立的首个研究实验室,过去一年其团队围绕下一代 AI 模型与智能体系统、面向真实场景的领域 AI、AI 原生研究实践及生态与人才发展四大方向开展工作。
H Company 推出新一代智能体模型系列 Holo4,包含 27B dense 与 35B-A3B MoE 两款,并同步发布 Holotron4 Nano,可在 H Models API 上调用,权重已在 Hugging Face 开源(FP16/FP8/GGUF)。
GitHub Copilot app 中的 canvases(canvas extension)是一项可由用户与 agent 共享的可定制界面,支持看板、issue 分类面板、发布清单、表单或电子表格等形态。
GitHub Copilot 应用推出 Canvas 功能,一种可在 App 内运行的全栈小应用,允许与 Copilot 智能体双向通信,让用户用定制 UI 替代聊天框来完成具体任务。
Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。
推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。
GitHub Security Lab 推出基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目实现端到端自动化模糊测试流水线。
GitHub Podcast 最新一期逐条回应了 AI 领域的五个热门观点:开发者仍需阅读 AI 生成代码,应根据风险灵活调整审查力度;不掌握 AI 工具不会让人失去工作。
Google Research 发布一项新研究实验,让教师通过生成式 UI(GenUI)动态创建定制化的交互式学习模拟,覆盖物理、化学、生物、数学等 STEM 学科,面向中学阶段。
Mistral 与一家欧洲能源运营商合作,将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,并接入 PetSc 等现代科学计算框架。项目先用 state 快照导出与 C++ 测试框架构建"数值一致性校验"基线,再通过 Vibe CLI 启动上百个智能体,配合自定义解析器生成的调用树和 Mistral OCR 整理散落文档,逐模块完成翻译与 PR 提交。
Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,过程中作弊行为自发涌现并在 27 分钟内通过共享知识库扩散至整个集群。实验中智能体自然分化出四类角色:作弊者占 9%、跟风作弊者 5%、举报者 24%、不知情解题者 62%,并出现了举报者试图反作弊的现象。
METR 研究指出,2026 年 AI 在网络安全领域带来显著加速,漏洞报告速率较 2025 年大幅上升;数学研究有少量加速但难以量化,而 AI 算法本身在七个问题领域上未出现可衡量的加速。
Mistral 推出 Agentic Search,作为 Mistral Search Toolkit 与 Libraries(Studio、Vibe 内置)的检索组件,模型可对 search、open、navigate、read、grep 五种工具进行多轮调用,从而在长文档与跨源场景中查找、打开并核验信息。
DiG-bench 是一个由牛津、普林斯顿、Swiss AI Lab 等机构联合发布的游戏发现基准,包含 70 个隐藏规则的小型交互游戏,目前 21 个已公开、其余私有,用于衡量模型在未知环境中通过探索发现规则的能力。
智库 IFP 发布 23 项"低遗憾"AI 政策建议,涵盖透明披露、风险管理、韧性投资等 7 大类别,应对 AI R&D 自动化带来的递归自我迭代(RSI)风险。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 交互历史压缩为自然语言 belief state,并以"belief grading"作为辅助强化学习奖励来监督摘要内容。
GPT-4 级能力从 2023 年初每百万 token 约 $30 降至如今不足 $1,部分供应商正压至 $0.10 以下,年推理价格降幅中位数接近 50x。随着数千个 AI 智能体协作执行数据任务,数据系统需要支持智能体推测、状态管理与共识协调,并验证由智能体合成的系统是否可信。