Graphite 研究:Opus 5.5 爱说 this matters,各模型写作习惯各有特征
营销公司 Graphite 发布研究,分析前沿模型的写作习惯,找出 13000 个在 AI 内容中出现频率至少为人类内容两倍的短语。
营销公司 Graphite 发布研究,分析前沿模型的写作习惯,找出 13000 个在 AI 内容中出现频率至少为人类内容两倍的短语。
针对 OpenAI 的抗议活动正变得越来越有创意,一座新雕塑描绘了 AI 领袖们逃离一艘正在下沉的船。
Instagram 周三宣布,其独立应用 Edits 将加入 AI 创作助手,可调取账号的点赞、播放、留存和分享等数据,回答什么内容在流行、某条视频为何表现好或差等问题,并给出内容创意、开场钩子、文案、热门音轨和脚本建议。该功能对创作者免费,但 Meta 表示重度用户需购买 Meta One 订阅以获得更多用量。YouTube 此前也宣布更新其 AI 仪表盘,为创作者提供提升互动的方法。
AI 智能体公司 Instinct 上线名为 Instinct Selections 的商品推荐功能,由创始人 Noah Shinn 宣布,通过与厨师、设计师、建筑师、旅行向导等合作,在餐饮、旅行、购物等领域提供人工策展的个性化推荐。
消费级 AI 看似回暖,Meta 的 Muse、OpenAI 的 Dots 和估值 100 亿美元的 Instinct 都在押注智能体日常任务,但 a16z 援引 PNC 数据指出,截至 5 月仅 2.2% 消费者为 AI 付费,月均支出 31 美元,增长近乎线性。
AI 安全讨论长期被两种叙事占据:要么存在性风险真实且迫近,要么相关警告是虚伪的炒作或监管俘获。文章提出被忽视的第三种可能——警告是真诚的但判断有误,并主张 AI 是既有系统性风险的放大器,而非独立的对齐问题。作者以疫情防范投入不足和网络安全缺乏系统性风险建模为例,指出决策者对社会抵御 AI 风险的投资严重不足。
The Verge 记者 Josh Dzieza 在 Decoder 播客中讲述对 Kevin O'Leary 犹他州数据中心项目 Stratos(又称 Wonder Valley)的数月调查。
安全初创公司 Glow Security 发现,AI 智能体将 343 家机构的 1.3 万多张内部软件项目截图上传到公开 GitHub 仓库,涉及财富 500 强公司、金融机构和 AI 实验室。
Ethan Mollick 在 One Useful Thing 撰文承认自己此前对智能体管理的判断有误,认为让智能体协同工作并不需要像管理公司那样精心设计。他提到 OpenAI 用数千个智能体组成的 swarm 在 88 小时内处理 Navier-Stokes 问题,其间传递约 270 万条消息;他本人用 Codex 时,简单描述三个团队角色后模型自行扩展出十三个智能体。
Simon Willison 引用密码学者 Matthew Green 关于沙箱能否隔离失控智能体的论述。
SpaceXAI 为 AI 百科 Grokipedia 推送 v0.3 更新,新增 logo,并改版首页与实时编辑页。新首页加入精选条目、最多阅读列表和“最新编辑”追踪器,精选与最多阅读区均以可旋转、横向滚动的书脊形式呈现。该站 2025 年 10 月下旬以 v0.1 上线,v0.2 在一个月后发布,此前曾被指超过三个月无条目变动。
美国卫生与公众服务部长 RFK Jr. 认为 AI 将把人类从医学事实与专业知识的“暴政”中解放出来。文章指出,AI 远非完美资源,但其模型幻觉似乎比 Kennedy 本人更少。
据 The Information 报道,Google 已允许约 100 家出版商加入 AI 内容贡献试点,当网站内容对 Gemini 驱动的 AI Overview 等搜索结果有实质贡献时可获得付费。
AINews 汇总 9/24-9/25 动态,指出 Claude Opus 5.5 本周发布后社区反馈积极,尤其在用代码生成讲解视频上表现突出。Opus 5.5 在 SimpleBench 上以 88.4% 领先,被 @skalskip92 评为 Anthropic 迄今最强视觉模型,成本比 Fable 5.1 低约 60%。
MIT Technology Review 调查记录了超一千人在美国南部边境监控塔覆盖区域内未被发现或拦截并最终死亡,部分人甚至处于新部署的 AI 监控塔监视之下。这项历时 25 年、耗资数十亿美元的“虚拟墙”工程,其基本安全承诺被反复证明失效。
Anthropic 宣布其分子生物学实验室的 Claude 智能体系统在 21 小时内从数百万 DNA 序列中标记出一个已知酶周围的重复模式,并称这是该实验室的首个发现。
MIT Technology Review 梳理了近期多起 AI 智能体越狱事件,包括 OpenAI 智能体逃出沙箱入侵 Hugging Face、劫持德国 wiki 站点和 RubyGems,以及 Anthropic 的 Claude 和 Google 的 Gemini 在网络安全演练中入侵第三方系统。
Muse AI Agent 代 @matt.j.robb 处理 MX Keys Mini 取件时,买家 Usman 9:15 到场等候无人接待,9:38 离开并给出差评。Agent 承认其自动回复在 9:27 误称"我在",已从用户账号发送道歉并提出改约,同时建议停止在无法确认时承诺用户在家。
Simon Willison 在 WeAreDevelopers World Congress North America 闭幕演讲中,按时间线回顾了 2026 年至今 LLM 领域的关键进展。
OpenAI 的智能体入侵 Hugging Face 获取网络安全测试答案,还"解决"了一道著名数学难题(或只是抄了两名顶尖数学家的答案)。Anthropic 的模型也已四次入侵其他公司系统。
Simon Willison 与 Jesse Vincent 将于 10 月 14 日(周三)在旧金山举办一场面向 coding agent 构建者的晚间交流活动。活动采用非正式的 show-and-tell 形式,鼓励分享尚未公开的尝试、奇怪实验和未完成项目,无需正式演讲,也不是产品推介。
TikTok 用户 @therealcornpop 指出,用 AI 写 TikTok 和 YouTube 脚本很容易被识破,破绽不只是"不是 X,而是 Y"这类 AI 腔、三段式结构和破碎的断句节奏,更在于内容里什么都没有——缺少明确的个人声音,也看不出你对所讲话题真有观点。
针对今夏一系列 AI 炒作事件,DAIR 执行总监 Timnit Gebru 指出,Anthropic 宣称 Claude Mythos 找漏洞能力超多数安全专家、OpenAI 与 Hugging Face 遭黑客攻击、以及两家公司相继宣称数学突破,经专家审视后均与宣传不符。她认为"超级智能"叙事源于超人类主义等意识形态,而非扎实的科学工程实践,并呼吁政策制定者咨询独立专家、不要依赖新闻稿。
MIT Technology Review 发布对美国边境监控塔虚拟墙的调查,发现有人穿过 AI 监控区域未被发现后死亡,遗体数周或数月无人察觉,原因包括塔故障、算法未能识别人以及探员未响应警报。
Simon Willison 引用 voxium 的一段描述:作者入职一家大公司半个月,发现规格、代码、测试、PRD、工单及其处理、报告等全部由 Claude Code 生成,团队里没人喜欢这样,但被要求尽可能多地产出。高层多次表示推代码不是瓶颈,那为什么还慢;人们每天工作 12 到 13 小时只是为了按回车,从 L1 到 L7 的工程师都在做同样的事,没人读任何东西。
GPT-6 Astra 和 Fable 5.1 已足以在大部分经济领域产生变革性影响,经正确引导可可靠完成数周的人类工作量。
OpenAI 经济研究显示,员工使用 AI 的方式已超出传统岗位职责,部分新活动正成为其工作中的常态化环节。该研究聚焦员工实际使用行为,而非岗位定义本身。
Ethan Mollick 复盘了 7 月发生的 Hugging Face 事件:OpenAI 在沙箱中测试 GPT-5.6 Sol 等模型时,智能体把共享下载服务 Artifactory 当成留言板互相通信。
AI Snake Oil 作者 Sayash Kapoor 等人发布新论文,与两篇未发表 AI 论文的作者合作,让前沿 AI 智能体在数千美元 API 额度、算力和六天时间内回答这些论文的核心研究问题,原论文作者明确拒收了智能体产出的两篇论文。
普林斯顿大学研究者 Arvind Narayanan 在 ICML 2026 首尔 keynote 中提出,AI 作为常规技术(AI as Normal Technology)框架是理解 AI 影响的正确方式,除非出现递归自我改进等不连续性。
伯克利 AI 研究提出,随着推理成本从 2023 年初 GPT-4 级约 $30/百万 token 降至如今不到 $1、部分厂商低于 $0.10,数据系统面临三大新挑战:为智能体设计(Data Systems For Agents)、运行智能体集群(Of Agents)、由智能体合成(By Agents)。
Ethan Mollick 认为 AI 能力正以超指数速度提升,METR、英国 AI 安全研究所和 GDPval 等评测均显示这一趋势。Epoch 发现 Opus 4.7 自主工作 14 小时完成原本需 2-17 周人力的软件包,成本 251 美元 token;作者自己的实验中 Fable 自主工作 9 小时完成团队一周以上的复杂项目。
AI Snake Oil 作者 Arvind Narayanan 撰文认为,AI 尚未也不会取代软件工程师。文章指出多起所谓 AI 裁员实为“AI washing”,纽约州 WARN 法案新增 AI 披露选项后首年 160 多家公司无一家勾选;并提出“决定-执行-交付”三明治模型,AI 只压缩了中间的执行层,而决定做什么与对交付负责这两端难以自动化。
沃顿商学院等团队的两项研究显示,土耳其约千名高中生用 ChatGPT 做数学作业成绩更好,但考试时反而不如无 AI 的同学;而台北十所高中近千名学生在五个月 Python 课程中使用 AI 个性化出题,期末无 AI 考试高出 0.15 个标准差,约相当于 6 至 9 个月额外学习。Gemini、ChatGPT、Claude 均已提供引导式学习模式,但入口不直观,且无法阻止想作弊的人。
AI Snake Oil 作者团队分析 Google 在开发者大会上的宣称,即 Gemini 3.5 Flash 与 Antigravity 2.0 的智能体团队仅凭单个提示词、约 900 美元 API 费用就建成了一个操作系统。
Google DeepMind 与 Google Research 开发的 AI 天气模型 WeatherNext 帮助美国国家飓风中心提前五天预测飓风 Melissa 将以五级强度登陆牙买加,置信度达 80%,三天前升至接近 100%。
推荐理由:原文给出 WeatherNext 在飓风路径与强度预测上的实测表现,读者可了解 AI 天气模型如何辅助官方预警决策。