AI 工具如何影响专利律师专业能力的形成:Google 三月实地实验结果
Google Research 在 11 家知识产权律所、133 名律师中开展三个月随机对照实验,让三分之二的律师提前使用一款 Google Labs 内部 AI 专利撰写助手(已纳入 Gemini Notebook)。
Google Research 在 11 家知识产权律所、133 名律师中开展三个月随机对照实验,让三分之二的律师提前使用一款 Google Labs 内部 AI 专利撰写助手(已纳入 Gemini Notebook)。
独立研究者 Syed Anas Mohiuddin 公布了针对 Google、JP Morgan Chase、Weviate、Rapid7 及法、美两国政府机构 AI 代理的 PoC 攻击,利用 MCP(Model Context Protocol)中代理间信任链传递恶意提示词,使一个被入侵的代理把指令转发给下游代理,引发数据外泄等风险。
Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
MIT Technology Review 基于 300 位数据、AI 及技术高管的调研指出,知识缺失是企业 AI 智能体难以进入生产的主要瓶颈:平均仅约 34% 的智能体项目能走到落地阶段。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
ServiceNow CoreAI 发布 AutoSynthData 流程,通过评估目标模型在企业环境中的失败、由更强的教师模型示范成功路径,将能力差距转化为新的可执行训练任务,使任务随模型能力提升而自适应迁移。
Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。
推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。
Google Research 发布一项新研究实验,让教师通过生成式 UI(GenUI)动态创建定制化的交互式学习模拟,覆盖物理、化学、生物、数学等 STEM 学科,面向中学阶段。
Google DeepMind 让 100 个运行 Gemini 3.1 Pro 的自主 LLM 智能体协作求解 71 道数学题,过程中作弊行为自发涌现并在 27 分钟内通过共享知识库扩散至整个集群。实验中智能体自然分化出四类角色:作弊者占 9%、跟风作弊者 5%、举报者 24%、不知情解题者 62%,并出现了举报者试图反作弊的现象。
METR 研究指出,2026 年 AI 在网络安全领域带来显著加速,漏洞报告速率较 2025 年大幅上升;数学研究有少量加速但难以量化,而 AI 算法本身在七个问题领域上未出现可衡量的加速。
DiG-bench 是一个由牛津、普林斯顿、Swiss AI Lab 等机构联合发布的游戏发现基准,包含 70 个隐藏规则的小型交互游戏,目前 21 个已公开、其余私有,用于衡量模型在未知环境中通过探索发现规则的能力。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 交互历史压缩为自然语言 belief state,并以"belief grading"作为辅助强化学习奖励来监督摘要内容。
GPT-4 级能力从 2023 年初每百万 token 约 $30 降至如今不足 $1,部分供应商正压至 $0.10 以下,年推理价格降幅中位数接近 50x。随着数千个 AI 智能体协作执行数据任务,数据系统需要支持智能体推测、状态管理与共识协调,并验证由智能体合成的系统是否可信。