Tavus 推出实时视频对话模型 Griffin,48% 测试者误认为真人
Tavus 推出名为 Griffin 的 Human Interaction Model,可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。Tavus 的一项研究中,48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。Tavus 的一项研究中,48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%。
Google 母公司 Alphabet 发布 Gemini 4 Argon,称其可处理编码、研究和写作等任务,并专门针对防御性网络工作训练,能自主发现、验证并修补关键软件漏洞。
Google DeepMind 发布新前沿模型 Gemini 4 Argon,先通过 Fairwind Program 向受信任的网络安全防御方开放,随后逐步扩展至开发者、企业和消费者。
推荐理由:官方给出 Argon 在编码、企业知识与网络安全上的基准表现和分阶段开放路径,可据此判断前沿模型的能力边界与落地节奏。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款模型,具体能力与开放方式尚未公布。
Google DeepMind 发布 Gemini Omni 1.1 Flash,为开发者带来更可控的生成视频能力,通过 Gemini API 在 Google AI Studio 提供。
推荐理由:原文列出场景延长、首尾帧插值与 4K 放大等具体能力变化,可据此判断生成视频工作流的可控程度。
Google DeepMind 发布多语言手语转文本模型 SL2T,可将手语直接翻译为流式文本,首批支持美国手语(ASL)转英文,并已接入 Pixel 11 的 Gboard 与 Live Transcribe,后续将扩展更多设备与语言。
推荐理由:官方披露 SL2T 的训练数据规模、手语到文本的翻译路径与隐私处理方式,可了解手语 AI 落地的技术取舍。
Google DeepMind 发布面向机器人具身推理的 Gemini Robotics ER 2,作为高层大脑负责理解物理世界、规划多步任务,并把动作执行交给底层 VLA 模型,同时原生支持调用 Google Search 等工具。
推荐理由:官方给出进度分类、时刻定位与多机协作的具体指标,可据此判断机器人高层推理的当前水位。
Google DeepMind 发布 Gemini Robotics 2,作为新一代机器人的智能层,解锁全身控制、灵巧操作和多机器人协作。
推荐理由:原文给出三款模型的职责分工与开放入口,读者可据此判断机器人全身控制与多机协作的落地路径。
Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash 两款模型,前者是 Nano Banana 系列中速度最快、成本最低的图像模型,后者支持高质量视频生成与对话式编辑。
推荐理由:两款新模型同时开放开发者入口,并给出延迟、价格与能力边界,便于评估多模态工作流成本。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。
推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。
Google DeepMind 发布 Gemma 4 12B,一款面向笔记本本地运行的多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。官方称其基准表现接近 26B MoE 模型,内存占用不到后者一半,可在 16GB VRAM 或统一内存上运行,也是该系列首个支持原生音频输入的中等规模模型。
推荐理由:Gemma 4 12B 用无编码器架构把多模态能力压到 16GB 显存,可对照其与 26B MoE 的取舍。
Google DeepMind 发布 Gemini Omni 家族首个模型 Gemini Omni Flash,可组合图像、音频、视频和文本输入生成高质量视频,并通过自然语言对话逐轮编辑视频。
推荐理由:Gemini Omni 把多模态输入与对话式视频编辑结合,可了解其能力边界与首发落地渠道。
Google DeepMind 发布 Gemini 3.5 系列,首发 3.5 Flash,定位为面向智能体与编码的前沿模型,即日起通过 Gemini app、Google Search 的 AI Mode、Google Antigravity、Gemini API、Android Studio 及 Gemini Enterprise 等渠道开放。
推荐理由:官方给出 3.5 Flash 在编码与智能体基准上的成绩和开放入口,可据此判断其速度与成本取舍。
Google DeepMind 推出 Gemini 3.1 Flash TTS,一款主打可控性与表现力的文本转语音模型,在 Artificial Analysis TTS 榜单上取得 1,211 的 Elo 分数。
推荐理由:官方给出 Elo 1211 与多语言、音频标签等能力细节,可据此判断语音生成的可控性进展。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,强化了空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与前代及 Gemini 3.0 Flash 的对比,并新增仪表读数能力,可据此判断机器人高层推理的进展。