Tavus 推出实时视频对话模型 Griffin,48% 测试者误认为真人
Tavus 推出名为 Griffin 的 Human Interaction Model,可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。Tavus 的一项研究中,48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%。
Tavus 推出名为 Griffin 的 Human Interaction Model,可在接收和生成视频的同时处理语音、面部表情、语调、手势和停顿。Tavus 的一项研究中,48% 的参与者在 1 分钟视频通话后认为 Griffin 是真人,此前系统最高为 2%。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,面向智能体编码、计算机使用和专业工作负载提供更强的推理能力。据 OpenAI 称,它在 DeepSWE v1.1 上达到 GPT-6 Astra 的水平,单任务成本约为其五分之一,并比 GPT-6 Sol 的最佳成绩高出 6.4 个百分点,且推理投入更低。
推荐理由:原文给出 GPT-6.1 Sol 在 Bedrock 上的能力与成本对比,读者可据此判断智能体编码任务的性价比变化。
Ideogram 发布新模型 Ideogram 4.5,称其只修改用户指定的区域,其余部分保持不变,可减少多次编辑后的画面瑕疵。该模型提供四档质量档位,单张价格从 0.8 美分到 22 美分,均为原生 2K 分辨率,目标场景包括产品摄影、室内设计、照片修复和图像内文字编辑。
Instagram 周三宣布,其独立应用 Edits 将加入 AI 创作助手,可调取账号的点赞、播放、留存和分享等数据,回答什么内容在流行、某条视频为何表现好或差等问题,并给出内容创意、开场钩子、文案、热门音轨和脚本建议。该功能对创作者免费,但 Meta 表示重度用户需购买 Meta One 订阅以获得更多用量。YouTube 此前也宣布更新其 AI 仪表盘,为创作者提供提升互动的方法。
AI 智能体公司 Instinct 上线名为 Instinct Selections 的商品推荐功能,由创始人 Noah Shinn 宣布,通过与厨师、设计师、建筑师、旅行向导等合作,在餐饮、旅行、购物等领域提供人工策展的个性化推荐。
DoorDash 周三宣布推出 text-to-order AI 智能体,用户可通过 Apple Messages 下单,发送“order my usual”这类提示词即可,智能体还能理解具体菜品需求、给出本地推荐、搜索附近餐厅并生成购物车,甚至发送推荐食物的照片。
Shopify 发布建站工具 Canvas,商家通过与 AI 智能体 Sidekick 对话即可搭建店铺。Canvas 实时渲染店铺真实代码而非静态预览,可测试页面交互与动画并查看不同屏幕尺寸下的效果;Sidekick 还会截图以同步商家所见。
Amazon Quick Sight 发布层级筛选器,可将最多五级的相关字段(如 Region → Sub-Region → Country → City)收纳进单个紧凑控件,替代多个独立筛选器。
Albertsons 正使用 ChatGPT Enterprise 和 OpenAI API 帮助团队加快工作速度,并让数百万顾客的购物更便捷。这家杂货零售商将 OpenAI 技术用于内部效率提升与顾客购物体验改善。
OpenAI 在年度 DevDay 大会上发布由 GPT-6 Astra 驱动的 AI 智能体 Dots,定位为可委派 QA、网站设计、行程规划等工作的个人助理或幕僚长,目前仅面向每月 20 美元的 Pro 及以上订阅用户开放。
助听技术初创公司 Legato 宣布其 AI 助听眼镜 Legato Frames 正式开售,起售价 999 美元,面向轻中度听力损失的成年人。该眼镜把助听技术集成在镜腿中,用 AI 区分人声与背景噪声并放大前者,双扬声器系统将声音导向佩戴者,耳外几英寸处声音可降低 99%。
SpaceXAI 为 AI 百科 Grokipedia 推送 v0.3 更新,新增 logo,并改版首页与实时编辑页。新首页加入精选条目、最多阅读列表和“最新编辑”追踪器,精选与最多阅读区均以可旋转、横向滚动的书脊形式呈现。该站 2025 年 10 月下旬以 v0.1 上线,v0.2 在一个月后发布,此前曾被指超过三个月无条目变动。
OpenAI 在周二 Dev Day 上由 CEO Sam Altman 宣布推出 Decisions API,可给 Luna 模型预设一组选项让其从中选择,例如图像分类类别或不同智能体行为,从而在保持图像理解、多语言支持和安全防护的同时做到极快速度。
Google 在 Gemini 聊天中面向全球推出 Skills,用可保存和复用的详细提示词取代此前的 Gems。用户输入斜杠加名称即可调用 Skill,Gemini 也能从历史对话生成 Skill 并在识别到匹配提示时自动运行,多个 Skill 可串联处理更大任务,目前支持文本、PDF 和图片作为参考材料。
Amazon Bedrock AgentCore 新增 Runtime Instances 计算选项,基于 AWS 托管的 EC2 基础设施,支持最长 14 天会话、GPU、持久卷,并可在单实例上以 1:N 方式共置多个智能体。
Meta 推出 Muse AI 智能体,称可帮用户发邮件、在线购物,前提是愿意把数据交给 Meta 并绑定信用卡。此后 Meta 又宣布为这一吉祥物形象推出类似 Tamagotchi 的 Muse Charm 设备,并陆续扩展小企业工具、企业平台、Mac 应用与智能眼镜端支持。汇总还收录了 Muse 泄露 YouTuber 地址、被 Amazon 屏蔽以及攻击者控制智能体的漏洞修补等事件。
Amazon Bedrock 在印度上线 Anthropic 的 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5,通过地理跨区域推理让请求仅在 ap-south-1 与 ap-south-2 之间路由,数据留在印度境内。
Amazon Bedrock 现已在首尔和新加坡支持 Anthropic Claude 模型的区域内推理:首尔支持 Claude Opus 5 和 Claude Sonnet 5,新加坡支持 Claude Sonnet 5,均通过 bedrock-runtime 端点调用。
Simon Willison 用 GPT-6 Astra 构建了实验性工具 Photo Scrubber,可自动识别人脸并模糊处理,同时清除照片元数据。该工具基于 Google 的 MediaPipe C++ 库,通过 @mediapipe/tasks-vision 编译为 WebAssembly,并使用 BlazeFace 人脸检测模型,全部在本地运行。
Condé Nast 与 AWS 生成式 AI 创新中心(GenAIIC)合作,基于 Amazon Bedrock 和 Amazon OpenSearch Service 构建多模态视频检索方案,并选用 TwelveLabs Marengo 嵌入模型联合编码画面、音频与转录文本。
OpenAI 发布 dots,将其定位为可跨复杂项目和日常任务持续工作的主动型助手。官方说明 dots 在推进工作的同时让用户保持控制,目前公开信息仅有这一摘要。
推荐理由:OpenAI 官方发布 dots 这一主动型助手,读者可了解它在复杂项目与日常任务中的持续工作方式。
xAI 的 Grok 4.7 已在 Amazon Bedrock 上线,提供 500K token 上下文窗口和 low、medium、high、xhigh 四档可配置推理强度,通过 bedrock-runtime 的跨区域推理配置文件提供服务,支持 Responses、Chat Completions 和 Converse API。
推荐理由:梳理 Grok 4.7 在 Bedrock 上的接入方式与四档推理强度,便于评估长任务智能体的成本取舍。
AWS 博客介绍用 Amazon Nova Act 结合 Amazon Bedrock AgentCore 构建智能体驱动的合成监控方案,以自然语言动作替代 Selenium、Playwright 的 DOM 选择器脚本。
OpenAI 正在为 Codex Originals 项目征集使用 Codex 的开发者、研究者与创作者的真实故事和项目。有意参与者可通过下方表单提交自己的经历与项目介绍,入选者将参与该项目的下一阶段。
Simon Willison 用 Opus 5.5 开发了一款 Bluesky 回复机器人检测工具,通过分析近期帖子的打字速度、发帖时间、互动模式等行为信号,判断账号是否为自动回复机器人。工具会展示每项测量与规则,方便用户核验判断依据,并给出触发信号最多的示例回复。检测信号包括同一账号在他人发帖后数秒内回复、从不发布原创内容或图片链接只回复高粉用户,以及包含问号的回复。
Proaction 借助 Codex、GPT-Live-1 和 GPT-6 Astra,更快地构建、运营和销售现代车队管理产品,实现销售提升 60%、节省 75+ 小时。
GitHub Security Lab 推出 Fuzzing Taskflow,一个基于 Taskflow Agent 的自主模糊测试流水线,只需指向 GitHub 仓库即可自动识别入口点、编写 harness、运行 AFL++、分析覆盖率并生成漏洞报告。
Remedy Entertainment 的 CONTROL Resonant 已在发售当日上线 GeForce NOW,Ultimate 会员可以 GeForce RTX 5080 级性能串流,支持 DLSS 4、光线追踪、NVIDIA Reflex 和最高 5K HDR,无需 100GB 本地安装。
Simon Willison 发布 Gemini 3.8 TTS Playground,这是一个自带 API key 的交互界面,可合成单人或多人对话语音、预览音频并查看请求与响应细节,设置可保存为可分享的 URL。
Google DeepMind 为 Private AI Compute 引入私密的服务端内存,用于个人 AI 场景。该能力以安全方式在服务端保存内存数据,具体参数与可用性未在原文披露。
Harvey 利用 GPT-6 Astra 生成结构更清晰、更贴合上下文的法律文书,让律师得以专注于策略。
invideo 借助 GPT‑6 Astra 以更高精度规划剪辑,将色彩校正与调色效率提升 3 倍,并在一天内生成 50 个自定义特效。
Ringg 基于 GPT-5.6 构建的多语言 AI 智能体可解决最多 65% 的客户来电,覆盖语音、聊天、WhatsApp 和网页渠道。相比 GPT-4.1,其成本降低 90%。
ChatGPT Ads 扩展至东南亚和台湾,符合条件的商家现可在超过 60 个国家和地区投放广告。
Airbnb 正在扩大 GPT-6 Astra 及 OpenAI 前沿模型的使用范围,帮助工程团队排查 bug、设计系统并加快交付。
GPT-6 改进了提示词缓存,带来更高的缓存命中率、新的诊断工具、显式断点以及可降低延迟与成本的控制项。
Simon Willison 发布 llm 0.36。该版本于 2026 年 9 月 22 日发布,具体更新内容原文未披露。
Simon Willison 发布 llm-anthropic 0.29,这是 LLM 命令行工具接入 Anthropic 模型的插件更新。原文未披露该版本的具体功能、参数或可用性细节。
Simon Willison 发布 LLM 插件 llm-typesafe 0.1a0,为 TypeSafe AI 的新模型 Jev 提供支持,可通过 `llm install llm-typesafe` 安装并设置 API key 使用。
NVIDIA 在 ROSCon 发布 Isaac ROS 5.0,新增智能体工作流与平台支持,支持 ROS Lyrical 和 Ubuntu 24.04。新版本提供 Isaac 技能与面向 AI 智能体的文档,FoundationPose 推理库让物体位姿感知与跟踪最高提速 5.5x,pick and place 成为独立技能。