Falcon-ASR 发布:1.6B 参数阿拉伯语语音识别模型,重点支持阿联酋方言
Falcon-ASR 是一款由阿联酋 Technology Innovation Institute 推出的 1.6B 参数语音识别模型,主打阿拉伯语及阿联酋方言,并共用同一组权重支持英语、法语、西班牙语和葡萄牙语。
Falcon-ASR 是一款由阿联酋 Technology Innovation Institute 推出的 1.6B 参数语音识别模型,主打阿拉伯语及阿联酋方言,并共用同一组权重支持英语、法语、西班牙语和葡萄牙语。
Mistral 发布 Mistral Large 4 预览版,模型总参数 1 万亿、激活参数 49B,使用自有 3,800 张 NVIDIA Grace Blackwell GPU 训练,现已通过 Mistral API 提供,并计划在当月底开源权重。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,拥有 740M 参数,支持文本、图像、视频、音频和代码转向量。Google 称它在多模态嵌入 benchmark 上表现优于体量两倍于它的竞品,并称这是同类模型中最小的一款;在 MTEB (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
OpenAI 在 GitHub 仓库一次性发布 372 个由其内部前沿模型生成的数学结果,称每一项都试图解决一个开放问题或在关键方向上取得实质进展,其中部分工作改进了主流计算机算法并涉及黎曼猜想。
Anthropic 发布 Claude Haiku 5.5,官方称其运行成本平均比 Haiku 4.5 低约 75%,定价对齐 OpenAI GPT-6 Luna:100K tokens 以下输入 $0.10、输出 $0.50 每 1M tokens;超 100K tokens 提价 5 倍。
Simon Willison 介绍 Anthropic 发布的 Claude Haiku 5.5,主打低价快速场景。
OpenAI 开始向 ChatGPT 全量推送 GPT-6,并新增 Intelligent UI 功能,让回答以图表、按钮、表单等交互界面呈现,问比较类问题会自动并列展示,解释可变成可交互图表,聊天窗口内还能直接生成小型工具如存款计算器或小游戏。
Anthropic 发布 Claude Haiku 5.5,平均价格较 Haiku 4.5 下降约 75%,100k 以内 prompt 的请求降幅最高可达 90%。
Mistral 发布新模型 Mistral Large 4(内部代号 Le Chonk),参数规模达 1 万亿,开放权重可自由使用和定制,目前以预览版开放,月底前推出正式版。
OpenAI 宣布 GPT-6 正在全球范围内通过 ChatGPT 推送,并配套推出 Intelligent UI,主打更快响应以及可直接探索和使用的可视化与交互体验。
推荐理由:原文给出 GPT-6 在 ChatGPT 的全球铺开和 Intelligent UI 的核心动作,读者可据此了解新版模型的实际落地形态。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数规模约 740M,可将文本、代码、图像、音频和视频映射到统一 embedding 空间。
Mistral 推出 Mistral Large 4(昵称 Le Chonk)公开预览 API,模型为 1 万亿参数、52 亿激活参数的原生多模态架构,训练使用 Mistral 欧洲自建数据中心中的 3800 颗 NVIDIA Grace Blackwell GPU。
推荐理由:公开预览同步给出网络与编码等多维度基准与排名,读者可横向对比当前主流闭源与开源模型的能力差距。
Ai2 旗下 Asta 团队开源 AstaBrief 8B 模型,定位为可本地运行的科学报告生成工具,基于 Qwen3-8B 经 SFT 和 DPO 后训练得到。
Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,面向软件工程、法律与金融知识工作以及网络安全防御等长链路复杂流程。模型输出 token 上限从 64K 提升到 1M,定价为输入 $2 / 输出 $10 每百万 token,缓存输入享 95% 折扣。
推荐理由:官方一次性放出 1M 输出 token、$2/$10 per M tokens 定价与 Fairwind 安全分阶段策略,方便和同代前沿模型直接做能力与部署节奏比较。
H Company 推出新一代智能体模型系列 Holo4,包含 27B dense 与 35B-A3B MoE 两款,并同步发布 Holotron4 Nano,可在 H Models API 上调用,权重已在 Hugging Face 开源(FP16/FP8/GGUF)。
Google DeepMind 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度创意角色设计与高吞吐低成本场景。
推荐理由:两款 TTS 模型在多角色台词导演、长音频一致性和音色克隆安全机制上做了系统级说明,读者可对照自身配音与多语种本地化场景评估。
Google DeepMind 推出两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音 Agent 与对话场景,强调并行推理与低延迟。
推荐理由:同一篇官方文章同时给出实时语音模型的评测名次、上线渠道与多语言能力,便于读者对照自身场景选择发布能力。
Microsoft Research 发布 GigaPath-Flash 和 GigaTIME-Flash 两款开源病理基础模型,均采用 Apache 2.0 协议。