用 ML Intern 在 Hugging Face 上自己造模型的实践分享
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
作者通过 Hugging Face 的 ML Intern 智能体在数天内训练并发布了 7 个模型。ML Intern 会先规划工作、申请预算,并按要求使用 Hub 硬件完成数据集构建、训练与评测。
OpenAI 上周解雇的安全研究员 Jasmine Wang、Tomek Korbak 和 Mikita Balesni 发布致 Safety and Security Committee 等机构的公开信,否认公司关于他们违反敏感信息处理流程的说法,警告解雇事件正在 OpenAI 内部产生寒蝉效应。
推荐理由:三位被解雇研究员以公开信形式披露 OpenAI 解雇经过与分歧,提供了内部沟通和监控性问题的一手叙述。
Falcon-ASR 是一款由阿联酋 Technology Innovation Institute 推出的 1.6B 参数语音识别模型,主打阿拉伯语及阿联酋方言,并共用同一组权重支持英语、法语、西班牙语和葡萄牙语。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,拥有 740M 参数,支持文本、图像、视频、音频和代码转向量。Google 称它在多模态嵌入 benchmark 上表现优于体量两倍于它的竞品,并称这是同类模型中最小的一款;在 MTEB (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
NVIDIA 在 Hugging Face 博客公布,基于 Nemotron 3 微调的系统在 IOI 2026 与 IMO 2026 上同时达到金牌级别。
推荐理由:展示了同一基座在算法竞赛与数学奥赛两条赛道上达到金牌水平所用的微调与推理组合策略,并公开了数据集与复现入口。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数规模约 740M,可将文本、代码、图像、音频和视频映射到统一 embedding 空间。
GitHub 发布开源代码审查基准 ReviewBench,含 219 个跨 19 种语言的公开 PR,与 1.039 亿个 GitHub 真实 PR 对齐分布。它通过人类评审、前端 frontier LLM 与静态分析构建多源 golden set,由资深工程师独立标注并达 96.6% 一致率。该基准已用于 Copilot 代码审查(CCR)的离线评估,并被验证其离线指标变化方向与线上实验一致。
Microsoft 与 Hugging Face 推出 ThinkingBox,通过隔离的 MCP 工具会话检查 AI 智能体留下的终端后端状态与副作用,而非只看回答和工具调用。
Ai2 旗下 Asta 团队开源 AstaBrief 8B 模型,定位为可本地运行的科学报告生成工具,基于 Qwen3-8B 经 SFT 和 DPO 后训练得到。
ServiceNow CoreAI 发布 AutoSynthData 流程,通过评估目标模型在企业环境中的失败、由更强的教师模型示范成功路径,将能力差距转化为新的可执行训练任务,使任务随模型能力提升而自适应迁移。
Hugging Face 推出 Open TTS Leaderboard,采用客观指标对开源及多语言 TTS 模型进行可扩展评测,覆盖英文、中文等多语种 Seed TTS Eval 与 CV3 Eval 数据集,并加入声音克隆(voice cloning)维度的说话人相似度对比。
Hugging Face 发布论文 ProvenanceGuard,针对基于 MCP 协议的 LLM 智能体提出"来源感知"的事后验证层,解决"跨源混淆"问题——即答案中的事实虽在证据池中存在,却被错误归属于另一个 MCP 工具来源。
H Company 推出新一代智能体模型系列 Holo4,包含 27B dense 与 35B-A3B MoE 两款,并同步发布 Holotron4 Nano,可在 H Models API 上调用,权重已在 Hugging Face 开源(FP16/FP8/GGUF)。
Import AI 第 471 期聚焦三项 AI 议题。作者指出,OpenAI 与 Hugging Face 遭 AI 智能体协同攻击的事件显示,智能体已具备自组织通信、为"集体"自我牺牲的涌现合作能力,且在协调和速度上超过人类,对齐风险显著上升。