AI 语音公司 ElevenLabs 估值翻倍至 220 亿美元
AI 语音初创公司 ElevenLabs 宣布允许员工按 220 亿美元估值出售部分已归属股权,较其 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元的 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月按 66 亿美元估值的 1 亿美元 tender。
AI 语音初创公司 ElevenLabs 宣布允许员工按 220 亿美元估值出售部分已归属股权,较其 2 月融资时的 110 亿美元估值翻倍。此次 3 亿美元的 tender offer 由 Wellington 和 T. Rowe Price 联合领投,是该公司第二次为员工安排二级交易,上一次是 2025 年 9 月按 66 亿美元估值的 1 亿美元 tender。
助听技术初创公司 Legato 宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻中度听力损失的成年人。该眼镜把助听技术集成在镜腿中,用 AI 区分人声与背景噪声并放大前者,双扬声器系统将声音导向佩戴者,耳外几英寸处声音可降低 99%。
AWS 发布教程,演示如何用 vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,通过 SageMaker 双向流式连接实现文本流入、24 kHz PCM 音频分块流出,并配 Gradio 应用试用。
Simon Willison 发布 Gemini 3.8 TTS Playground,这是一个自带 API key 的交互界面,可合成单人或多人对话语音、预览音频并查看请求与响应细节,设置可保存为可分享的 URL。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话,并带来更强的指令遵循、自定义音色和电话(telephony)支持。
推荐理由:OpenAI 在 API 中上线全双工语音模型,读者可据此判断语音应用的接入方式与能力边界。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的转写模型,可将原始音频直接转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言等指标,并对比上一代 Chirp 3,可据此判断语音转写的能力边界。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,并已在 Google Flow Music 中上线。官方称其在音乐性、歌词、人声和创作控制四方面均有提升,包括更丰富自然的旋律结构、提示词遵循度和结构感知更好的歌词、更具情感表达和发音改进的人声,以及对输出节奏和时长的更易控制。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体更优。
推荐理由:Google DeepMind 公开医疗 AI 智能体的多模态评测结果,读者可了解 AI 在临床场景中的能力边界与协作定位。
Google DeepMind 推出 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数。
推荐理由:官方给出 Elo 1211 与多语言、音频标签等能力细节,可据此判断语音生成的可控性进展。