在 SageMaker AI 上用 vLLM-Omni 构建实时语音应用(Part 1)
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配 Gradio 应用试用。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配 Gradio 应用试用。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。
推荐理由:OpenAI 在 API 中上线全双工语音模型,读者可据此判断语音应用的接入方式与能力边界。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的转写模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等指标,并对比上一代 Chirp 3,可据此判断语音转写的能力边界。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循度和结构感知更好的歌词、更具情感表达和发音改进的人声,以及对输出节奏和时长的更易控制。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:Google DeepMind 公开医疗 AI 智能体的多模态评测结果,读者可了解 AI 在临床场景中的能力边界与协作定位。
Google DeepMind 推出 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数。
推荐理由:官方给出 Elo 1211 与多语言、音频标签等能力细节,可据此判断语音生成的可控性进展。