Falcon-ASR 发布:1.6B 参数阿拉伯语语音识别模型,重点支持阿联酋方言
Falcon-ASR 是一款由阿联酋 Technology Innovation Institute 推出的 1.6B 参数语音识别模型,主打阿拉伯语及阿联酋方言,并共用同一组权重支持英语、法语、西班牙语和葡萄牙语。
Falcon-ASR 是一款由阿联酋 Technology Innovation Institute 推出的 1.6B 参数语音识别模型,主打阿拉伯语及阿联酋方言,并共用同一组权重支持英语、法语、西班牙语和葡萄牙语。
AWS 在博客中演示如何在 Amazon Bedrock AgentCore 上搭建航司语音旅行管家,核心是用 Amazon Nova 2.5 Sonic 做实时语音交互,通过 Strands Agents 框架和 AgentCore Gateway 以 MCP 协议连接后端服务,支持改座位、查航班、改餐食、答政策问题并可转接人工坐席。
Hugging Face 推出 Open TTS Leaderboard,采用客观指标对开源及多语言 TTS 模型进行可扩展评测,覆盖英文、中文等多语种 Seed TTS Eval 与 CV3 Eval 数据集,并加入声音克隆(voice cloning)维度的说话人相似度对比。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话原生结合,为企业用户带来带视觉形象、唇形同步和自然表情的多模态对话体验。
Google DeepMind 发布两款文本转语音模型 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS,分别面向深度创意角色设计与高吞吐低成本场景。
推荐理由:两款 TTS 模型在多角色台词导演、长音频一致性和音色克隆安全机制上做了系统级说明,读者可对照自身配音与多语种本地化场景评估。
Google DeepMind 推出两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,面向语音 Agent 与对话场景,强调并行推理与低延迟。
推荐理由:同一篇官方文章同时给出实时语音模型的评测名次、上线渠道与多语言能力,便于读者对照自身场景选择发布能力。