用 ML Intern 在 Hugging Face 上自己造模型的实践分享
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
NVIDIA 工程师使用 GPT-6 Astra 等前沿 AI 模型,配合 NVIDIA Omniverse 库,在仓储人形机器人、自主驾驶测试、RTX 传感器数字孪生、机器人运动仿真、CAD 拆装和国际空间站可视化等场景中,通过自然语言指令搭建仿真应用。
Incarna 在 Amazon Bedrock AgentCore payments 的支持下,将其智能体按单次推理付费接入 BlockRun,由后者通过 x402 协议路由 15 家以上供应商的 90 多个模型。
AWS 在博客中演示如何在 Amazon Bedrock AgentCore 上搭建航司语音旅行管家,核心是用 Amazon Nova 2.5 Sonic 做实时语音交互,通过 Strands Agents 框架和 AgentCore Gateway 以 MCP 协议连接后端服务,支持改座位、查航班、改餐食、答政策问题并可转接人工坐席。
Amazon SageMaker HyperPod 为 ML 团队提供大规模加速算力用于训练和微调,多团队共享集群时治理成为核心挑战。
Google Research 在 11 家知识产权律所、133 名律师中开展三个月随机对照实验,让三分之二的律师提前使用一款 Google Labs 内部 AI 专利撰写助手(已纳入 Gemini Notebook)。
Anthropic 的 Claude Haiku 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 正式可用,被定位为 Claude 5.5 系列中速度最快、成本最低的型号,主打 subagent 和高吞吐、成本敏感型任务。
推荐理由:把 Claude Haiku 5.5 接入 Amazon Bedrock 的可用区域、计费方式和与 Opus 5.5 的搭配用法集中讲清,便于在 AWS 上做模型选型。
NVIDIA 与 Microsoft 在旧金山 Windows AI 与 Surface 活动中发布 RTX Spark,将 Blackwell RTX GPU 与 Grace CPU 整合的统一内存最高 128GB,FP4 AI 性能达 1 petaflop,可本地运行 Qwen 3.8 Flash Next 等模型。
推荐理由:原文给出 RTX Spark 硬件规格、上市时间以及 MXC 等系统级能力,可据以判断端侧 AI 形态如何改变现有 PC 工作流。
GitHub 与 Microsoft Applied Sciences 联合微调的分类器,可在不到 2 毫秒内评估一组候选密钥,有望将可阻止的泄漏密钥数量翻倍,从而把 push protection 扩展到无固定模式的非结构化密钥。
微软研究院发布并开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 训练范式,让部署时使用的 agent harness 直接参与强化学习,开发者无需把 agent 重新实现到训练框架中。
推荐理由:框架以约 3,500 行代码实现与真实 agent harness 直接对接的 RL 控制平面,并用 SWE-bench Verified 上的 14.6 个百分点提升给出可复现的工程样例。
AWS 发布博客文章,针对 AI 卓越中心(AI CoE)提出名为 "Agentic Value Model" 的商业论证框架,替代仅按 RPA 时代"节省工时 × 人力成本 − 构建成本"思路设计的传统 ROI 模型。
Qlik 基于 Amazon Bedrock 构建了 Qlik Answers,让员工用自然语言提问并获得带来源的可信回答,自 2026 年 2 月正式上线以来,其 Discovery Agent 已为客户发现超过 10 万条异常。
AWS 推出基于 AWS Lambda Durable Functions、Amazon EventBridge 与 Amazon Bedrock 的自动化修复工作流,可承接 AWS DevOps Agent 完成的故障调查,将根因分析结果转化为预校验的修复方案并执行。
AWS 设计了一个为期六周、每周约四小时的结对项目,让非工程师背景的业务人员亲手构建 AI 智能体原型以缩小"知识-能力"差距。项目数据显示,分阶段学习的参与者比两天速成班多保留三倍实操技能。
Cornerstone OnDemand 基于 Amazon Bedrock 与开源 Strands Agents 框架构建多智能体系统 Orion AI,将数据库故障诊断时间从 45 分钟降至 10 分钟,降幅 78%,并由三人团队在六个月内交付。
AWS 博客演示了如何在 Amazon Bedrock AgentCore runtime 上运行开源 agentic 系统 OpenClaw,构建一个能跨对话保留上下文的个人助手 Sprout,并可一键通过 CloudFormation 部署,按使用量计费,轻度个人使用每月约 1–2 美元。
微软研究院播客邀请 partner research manager Jennifer Neville 与应用科学家 Chad Atalla 对谈,探讨评估在推动 AI 系统性能边界、满足用户需求中的作用,以及模型在传统 benchmark 之外出现的"意外失败"。
Mistral 推出 Mistral Large 4(昵称 Le Chonk)公开预览 API,模型为 1 万亿参数、52 亿激活参数的原生多模态架构,训练使用 Mistral 欧洲自建数据中心中的 3800 颗 NVIDIA Grace Blackwell GPU。
推荐理由:公开预览同步给出网络与编码等多维度基准与排名,读者可横向对比当前主流闭源与开源模型的能力差距。
OpenAI 与 Ironclad 合作,针对合同工作流训练和评估 AI 智能体,以提升专业工作中的计算机使用能力。该项目聚焦于复杂合同流程的自动化处理,是 OpenAI 推进 AI 智能体在专业办公场景落地的最新尝试。
Google Research 发布《Open and Emergent Problems in Agentic Privacy and Security: A Contextual Angle》研讨会报告,汇集 50 余位学术界与产业界专家,梳理 LLM 驱动的 AI 智能体在隐私与安全上面临的三项核心挑战:非结构化输入模糊、概率性控制流、自主性与任务委派削弱用户监督。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
AI 正在改变开发者的工作方式,GitHub 建议开发者强化三项技能:学会指挥 AI 智能体而非仅被动使用、不盲信 AI 的首次输出、以及利用 AI 节省的时间去解决更宏观的问题。
ServiceNow CoreAI 发布 AutoSynthData 流程,通过评估目标模型在企业环境中的失败、由更强的教师模型示范成功路径,将能力差距转化为新的可执行训练任务,使任务随模型能力提升而自适应迁移。
微软研究院亚洲新加坡实验室(MSRA – Singapore)于 2025 年 7 月开业,是微软在东南亚设立的首个研究实验室,过去一年其团队围绕下一代 AI 模型与智能体系统、面向真实场景的领域 AI、AI 原生研究实践及生态与人才发展四大方向开展工作。
H Company 推出新一代智能体模型系列 Holo4,包含 27B dense 与 35B-A3B MoE 两款,并同步发布 Holotron4 Nano,可在 H Models API 上调用,权重已在 Hugging Face 开源(FP16/FP8/GGUF)。
GitHub Copilot app 中的 canvases(canvas extension)是一项可由用户与 agent 共享的可定制界面,支持看板、issue 分类面板、发布清单、表单或电子表格等形态。
GitHub Copilot 应用推出 Canvas 功能,一种可在 App 内运行的全栈小应用,允许与 Copilot 智能体双向通信,让用户用定制 UI 替代聊天框来完成具体任务。
Google Research 发布一套面向长视频生成的多智能体框架 AI video co-director,将长视频创作建模为全局优化与世界状态追踪问题,包含 Co-Director、CANVAS、A²RD 和 VQQA 四个组件,分别负责层级化编排、视觉分镜、长时间序列外推与插值、以及基于视觉问答的闭环提示词优化。
推荐理由:原文以统一框架把多镜头分镜、长时间序列生成与闭环修复拆成四块,给出了可直接对照的多镜头一致性基准结果。
GitHub Security Lab 推出基于 Taskflow Agent 的 Fuzzing Taskflow,面向 C/C++ 项目实现端到端自动化模糊测试流水线。
GitHub Podcast 最新一期逐条回应了 AI 领域的五个热门观点:开发者仍需阅读 AI 生成代码,应根据风险灵活调整审查力度;不掌握 AI 工具不会让人失去工作。
Google Research 发布一项新研究实验,让教师通过生成式 UI(GenUI)动态创建定制化的交互式学习模拟,覆盖物理、化学、生物、数学等 STEM 学科,面向中学阶段。
Mistral 与一家欧洲能源运营商合作,将 4 万行 Fortran 77 油藏模拟器代码迁移到 C++,并接入 PetSc 等现代科学计算框架。项目先用 state 快照导出与 C++ 测试框架构建"数值一致性校验"基线,再通过 Vibe CLI 启动上百个智能体,配合自定义解析器生成的调用树和 Mistral OCR 整理散落文档,逐模块完成翻译与 PR 提交。
Mistral 推出 Agentic Search,作为 Mistral Search Toolkit 与 Libraries(Studio、Vibe 内置)的检索组件,模型可对 search、open、navigate、read、grep 五种工具进行多轮调用,从而在长文档与跨源场景中查找、打开并核验信息。
Berkeley AI Research 提出 ABBEL 框架,将 LLM 交互历史压缩为自然语言 belief state,并以"belief grading"作为辅助强化学习奖励来监督摘要内容。
GPT-4 级能力从 2023 年初每百万 token 约 $30 降至如今不足 $1,部分供应商正压至 $0.10 以下,年推理价格降幅中位数接近 50x。随着数千个 AI 智能体协作执行数据任务,数据系统需要支持智能体推测、状态管理与共识协调,并验证由智能体合成的系统是否可信。