Google 开源 EmbeddingGemma 2,主打 740M 参数多模态嵌入
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,拥有 740M 参数,支持文本、图像、视频、音频和代码转向量。Google 称它在多模态嵌入 benchmark 上表现优于体量两倍于它的竞品,并称这是同类模型中最小的一款;在 MTEB (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google 发布开源多模态嵌入模型 EmbeddingGemma 2,拥有 740M 参数,支持文本、图像、视频、音频和代码转向量。Google 称它在多模态嵌入 benchmark 上表现优于体量两倍于它的竞品,并称这是同类模型中最小的一款;在 MTEB (Code) 上得分 78.68,较前代 68.76 提升近 10 分。
Google DeepMind 发布 EmbeddingGemma 2,基于 Gemma 4 架构,采用 Apache 2.0 协议开源,参数规模约 740M,可将文本、代码、图像、音频和视频映射到统一 embedding 空间。
Google DeepMind 发布新一代前沿模型 Gemini 4 Argon,面向软件工程、法律与金融知识工作以及网络安全防御等长链路复杂流程。模型输出 token 上限从 64K 提升到 1M,定价为输入 $2 / 输出 $10 每百万 token,缓存输入享 95% 折扣。
推荐理由:官方一次性放出 1M 输出 token、$2/$10 per M tokens 定价与 Fairwind 安全分阶段策略,方便和同代前沿模型直接做能力与部署节奏比较。
Google DeepMind 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度创意角色设计与高吞吐低成本场景。
推荐理由:两款 TTS 模型在多角色台词导演、长音频一致性和音色克隆安全机制上做了系统级说明,读者可对照自身配音与多语种本地化场景评估。
Google DeepMind 推出两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音 Agent 与对话场景,强调并行推理与低延迟。
推荐理由:同一篇官方文章同时给出实时语音模型的评测名次、上线渠道与多语言能力,便于读者对照自身场景选择发布能力。