跳到正文

技术方向

语音与音频 最新动态

AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。

2 条精选近 30 天 2 条共收录 9 条

更新

语音与音频的精选

9月23日周三第 1–2 条
  1. Google DeepMind68

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度创意角色设计与高吞吐低成本场景。

    推荐理由:两款 TTS 模型在多角色台词导演、长音频一致性和音色克隆安全机制上做了系统级说明,读者可对照自身配音与多语种本地化场景评估。

9月16日周三
  1. Google DeepMind67

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音对话模型

    Google DeepMind 推出两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音 Agent 与对话场景,强调并行推理与低延迟。

    推荐理由:同一篇官方文章同时给出实时语音模型的评测名次、上线渠道与多语言能力,便于读者对照自身场景选择发布能力。