Epoch AI 用 InnovationEval 测试 AI 智能体自主科研能力
热点事件持续更新
Epoch AI 用 InnovationEval 测试 AI 智能体自主科研能力
1 篇报道1 个报道来源2 小时前更新
先了解这件事
AI 综述
Epoch AI 公布 InnovationEval 基准测试结果,称当前 AI 智能体仍远未具备自主科研能力。测试中,Claude Fable 5 和 GPT-5.6 Sol 被要求在无 SDPO 先验知识、也无法访问互联网的条件下,独立提出并实现新的语言模型训练方法,各自最多可使用 3000 小时高端芯片算力。 Epoch AI 表示,结果显示这些智能体目前尚不能在无人指引的情况下完成真正的科研任务。该结论仅基于 Epoch AI 自行设计的基准与其发布的结果,测试对象也仅限于上述两款模型。
AI 根据报道生成 · 1 小时前更新
最新进展10月11日 21:44
Epoch AI 研究称 AI 智能体仍远未具备自主科研能力报道时间线
沿着报道,了解事件的不同侧面。
10月11日
- The DecoderEpoch AI 研究称 AI 智能体仍远未具备自主科研能力
Epoch AI 用 InnovationEval 基准测试了 Claude Fable 5 和 GPT-5.6 Sol,要求它们在无 SDPO 先验知识的条件下独立提出并实现新的语言模型训练方法。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。