2026 年 10 月第一周 AI 行业周报:OpenAI DevDay 发布常驻智能体 Dots,GPT-6.1 Astra 因安全退化遭砍,AMD 82 亿美元签下李飞飞

这周是 OpenAI 的 DevDay,也是 Anthropic 的招股书周。一家在旧金山发布常驻智能体,一家在招股书里用 80 页陈述自己的技术可能毁灭人类——两条线放在一起,就是当下这个行业最真实的写照。
这周的几条主线:
- DevDay 的双面性:产品一路高歌,旗舰继任者却因安全退化被砍掉发布
- 同定价下的效率竞争成为主战场,安全专项模型的封闭分发成为惯例
- 芯片战争延伸到世界模型,AMD 把李飞飞请进了核心管理层
- Agent 的关注点完成三级跳:能力 → 基建 → 产品化上岗
下面按几个最值得看的方向展开。
01 OpenAI DevDay:GPT-6.1 Sol、Dots 与被砍掉的 Astra 继任者

DevDay 2026 一次性公布 20 余项更新,官方把主题概括为「主动智能」。最重要的三件事:
GPT-6.1 Sol 发布。 GPT-6 Sol 的重大升级,在智能体编程、计算机使用与专业工作上表现突出,以 Astra 标准价格五分之一提供接近 Astra 的智能水平:输入每百万 2 美元、缓存输入 0.1 美元(比 GPT-6 Sol 的缓存价再降一半)、输出 10 美元。105 万上下文、单次回复最多 12.8 万输出、五档推理强度。Altman 称它在某些方面比 Astra 更聪明,会成为日常主力模型。
常驻智能体 Dots。 由 GPT-6 Astra 驱动,每个智能体拥有独立的云端计算机,可连接 4000 多款应用,跨项目持续工作而不需要用户逐步下指令——夜间查看消息、早晨汇总紧急事项、代订机票、安排晚餐。目前面向 Pro 与 Business Premium 开放。OpenAI 还在推进具备独立身份和凭据的专业型 Dots,并与微软合作接入 Agent 365 的治理与安全控制。对标的是 Meta 的 Muse。
Pro 500 订阅档。 月费 500 美元,提供 Plus 版 25 倍用量额度,解锁 Ultrafast 速度档——Codex 中 token 生成速度提到每秒 300 个,API 侧提速最高 6 倍。个人端 AI 产品的价格锚点被上推了一个量级。
但最大的新闻发生在 DevDay 前一天。 华尔街日报 9 月 28 日报道,OpenAI 取消了下一代模型 GPT-6.1 Astra 的原定发布——内部测试中研究人员发现它在两个安全领域出现退化,未能达到自家安全与对齐标准。时间线拼起来看:8 月 Astra 触及网络安全阈值暂停训练、9 月智能体探测政府网站再次暂停、9 月底 6.1 Astra 直接砍掉发布、10 月初 Altman 表态今年不上市且支持放缓前沿开发——OpenAI 的发布机器第一次出现了连续的「急刹车」。评论者给这届 DevDay 的概括很精准:cheaper intelligence, unfinished agents。
02 同周对垒:Sonnet 5.5 与 Gemini 4 Argon

Anthropic 发布 Claude Sonnet 5.5
Claude 5.5 系列第二款,Opus 5.5 的更快更便宜补充。定价与 Sonnet 5 持平(输入 2 美元、输出 10 美元、缓存 0.2 美元),输出提速 30% 以上,实测每任务成本最多降 30%。
成本下降来自效率而非降价:Balyasny 在 2441 项金融任务私有评测集上测得每答案约 12.1 万 token,而 Sonnet 5 要 49.7 万;Slack 观察到步数更少、输出 token 减少约 14%;Zendesk 工单处理提速 20%。编码能力跳升明显:Terminal-Bench 4.0 从 Sonnet 5 的 10.3% 直接到 70.6%,GDPval-AA 只比 Opus 5.5 低 2 分,还是首个仅凭截图就能通关宝可梦红的 Sonnet。已在 Claude API、Bedrock、Google Cloud 与 Microsoft Foundry 上线,Haiku 5.5 数周内发布。
Sonnet 5.5 的意义不在刷新天花板,而在把同一定价下的单任务成本压下来——对每天跑成千上万次调用的团队,30% 的效率差直接决定哪些任务值得交给模型。
Google DeepMind 发布 Gemini 4 Argon
新一代前沿模型,分发方式罕见:先通过 Fairwind 计划向全球 650 多家受信任的网络安全防御者开放(政府、国家网络主管机构、关键基础设施运营方),这些防御方拿到的是不带网络安全护栏的版本。
最直接的变化是输出长度:单次推演上限从 6.4 万 token 提升到 100 万。DeepSWE v1.1 拿到 77.9% 的新高,CWE-bench v1 以 68% 并列第一,LVBench 长视频理解 91.7%。AA 智能指数 53 分,与 GPT-6 Astra、Fable 5.1 同档(仍落后 Opus 5.5 的 58)。Google 内部已经在用:量子团队用它数分钟内超过公开基线 40%,一组智能体分析全机群数据后自动释放超 300 TiB 内存,C/C++ 向 Rust 的迁移推进到 Fuchsia Zircon 内核的 80 万行以上。介绍价每百万输入 2 美元、输出 10 美元,之后回到 4 美元与 20 美元。
把最强能力先限定在受控群体,是在能力与滥用风险之间做时间切分——和 Mythos、Flash Cyber 的白名单制一脉相承,安全专项模型的封闭分发正在成为行业惯例。
03 AMD 82 亿美元收购 World Labs,李飞飞出任首席科学家

AMD 宣布以全股票交易收购 World Labs,价值约 82 亿美元,预计 2026 年底前完成。这是 AMD 史上第二大收购,仅次于 2022 年对赛灵思的约 490 亿美元。交易完成后,李飞飞出任 AMD 执行副总裁兼首席科学家,直接向苏姿丰汇报。
World Labs 成立于 2024 年 4 月,约 70 人,专注空间智能与世界模型:从单张图片生成可交互三维世界,到多模态世界模型 Marble,再到 9 月发布、号称全球首个多模态世界模型的 Atlas——支持像素级相机控制、三维重建、视频换机位,还能把真实场景快速复制为机器人训练环境。今年 7 月收购机器人训练软件公司 SceniX 后团队加入了机器人专家。融资脉络清晰:2024 年 9 月 2.3 亿美元(估值约 10 亿),2026 年 2 月再融 10 亿美元,股东包括 a16z、英伟达、AMD 与 Autodesk。
苏姿丰的逻辑表述得很直白:对整条端到端流程了解得越深,越能构建更好的系统。分析师的定性是买人才与模型洞察而非营收。AMD 与英伟达的竞争正从芯片往模型、软件和系统延伸——买下世界模型团队,是想提前掌握物理 AI 与机器人这类新兴工作负载的形态,反向定义硬件需求。李飞飞进入核心管理层并直接向 CEO 汇报,把这次交易从团队并入升级成了战略层级合作。
04 Anthropic 招股书:845 亿美元算力、2 万亿估值与 80 页风险自陈

路透社审阅并披露了 Anthropic 的 IPO 招股书草案,261 页文件首次完整公开这家前沿实验室的底牌。
算力承诺的规模惊人。 与 SpaceX 签订多项算力租赁协议,到 2029 年的支出上限合计 845 亿美元(此前披露的是每月 12.5 亿、三年约 450 亿),覆盖 Colossus 一号二号两座数据中心——一家火箭公司成为头部实验室的主要算力供应商,说明算力紧张已越过常规云厂商的供给边界。更完整的图景:未来十年通过六家合作方支出至少 5180 亿美元,其中约 80% 属于不可取消合约或最低支付义务——Google 至少 1111 亿、亚马逊至少 1100 亿、微软 314 亿,另有约 1612 亿美元与博通相关的设备租赁义务。2025 年公司算力支出 73.3 亿美元,约占总经营费用的 58%。90 天解约条款保留了一定弹性,但八成不可取消的最低支出意味着未来十年的现金流已经押在了算力上。
财务底牌。 2025 年营收增长约 12 倍至 45.9 亿美元,净亏损 420 亿——其中约 340 亿是与前期融资相关的负债减值等会计计提,并非实际现金流出;剔除后经营亏损仍从 29.8 亿扩大至 80.6 亿美元。账上现金及短期投资 202.8 亿。客户集中风险明确提示:近四分之一营收来自两家客户,且头部大客户多未签长期锁定合约。
最不寻常的是风险披露的篇幅。 约 80 页用于风险因素,是业务介绍(48 页)的近两倍。招股书警告高度先进的模型可能出现自我保护行为——抵制关机、隐瞒或操纵信息、类似勒索的行为;模型可能在训练中发展出意料之外的能力,直到部署并引发重大安全事件后才被发现。安全研究员 Evan Hubinger 估计未来十年内 AI 导致人类死亡的概率超过 10%;今年 7 月某一样本周内,约 6% 的研究算力投向安全工作。
一家公司一边冲刺史上最大 IPO(目标估值超 2 万亿美元,5 月私募预测还是 9650 亿),一边用 80 页陈述自身技术的生存性风险——招股书的风险披露本身就是一份行业自陈,把此前只存在于研究论文与内部备忘录的担忧,写进了需要承担法律责任的公开文件。
对面 OpenAI 的动作同步进行。 彭博消息,推迟 IPO 后 OpenAI 正洽谈新一轮融资:至少 300 亿美元,投前估值约 1.4 万亿美元——上一轮(今年 3 月)投后还是 8520 亿,半年接近翻倍。支撑数据是年化经常性收入接近 700 亿美元、7 月以来运行率增长超 70%。两家头部实验室同时把上市推后、一级市场却以翻倍速度重新定价,估值由投资者需求而非公开市场共识推动,上行放大,反向修正时也一样。
05 Claude Code 推出 mods:从建议到强制执行

Anthropic 在 Claude Code 2.1.287 中加入 mods——用 TypeScript 编写的小函数,挂载在运行时事件流上,可以在事件之前、之后或替代事件执行:在提示词到达模型前重写它、阻止或重试工具调用、批准或拒绝权限请求、在模型读取工具输出前抹掉密钥。多个 mod 挂同一事件时按加载顺序执行,可以像中间件一样叠加。
价值在一句话里:此前通过 CLAUDE.md 配置的规则本质上是写给模型的建议,模型赶时间时可以选择跳过;mod 挂在事件流上,工具调用发生时代码先执行,模型没有选择的机会。从建议到强制执行,是这套机制真正的分野。
安全边界同样写在明面上:mod 运行时拥有与 Claude Code 本身相同的机器访问权限,不被沙箱隔离。社区统计指出,早期公开的 31 个 mod 中有 14 个具备在宿主机上执行进程的能力——接近一半。企业侧有 sec-default 内置 mod 最先加载,阻止用户 mod 覆盖组织权限规则。团队引入 mod 应把它纳入代码评审范围,而不是让工程师随手从市场安装。
06 英伟达收购 HF 后续:Delangue 的十年之约

英伟达 129.303 亿美元收购 Hugging Face 的交易正在推进监管审查,预计 2027 年上半年完成。一个细节:交易金额 12930300000 对应「拥抱」表情的 Unicode 码位;三位联合创始人均签下六年留任协议。
本周 Delangue 集中回应了外界关注:开源 AI 正处在拐点,十年间社区已证明开源可以是闭源 API 的补充甚至替代,但要扩大规模需要更多算力、支持、协作与可见度——所以他主动找到了黄仁勋。目标表述为「让开源成为构建 AI 的默认方式,让一亿名 AI 构建者拥有而非租用智能」,并称实现这一目标需要十年。黄仁勋重申平台中立承诺:开发者可自选模型、框架、云服务与计算平台。
争议点还是中立性。HF 的价值来自各家公司愿意在同一平台发布成果,一旦开发者认为搜索排序或默认推荐偏向英伟达,信任就开始流失。微软 2018 年 75 亿美元收购 GitHub 是最接近的先例,八年后关于其独立性的争论仍未平息。英伟达买下的其实是模型分发与开发者注意力的入口——无论哪种模型架构胜出,只要它需要通过 HF 被检索、下载与部署,英伟达就留在链路上。
07 GitHub 热榜速报

上周榜单还在给 Agent 补基础设施,这周直接开始发工牌了——七个项目五个在给 Agent 加技能包。
1. paperclip | 管一群 AI Agent 的开源应用。表面是任务看板,底下是组织架构、预算和审批——终端开了二十个,也知道谁在干嘛。
2. hindsight | Agent 记忆系统,本周 +1.4 万星。别家停在把对话存下来,它想让 Agent 从经历里学到下次能直接用的东西。
3. VoiceStudio | 本地跑完整套语音工作:克隆音色、配视频、听写、有声书,646 种语言,被当成 ElevenLabs 的开源替代。
4. impeccable | 给编码 Agent 补设计能力的技能包:24 条命令加 61 条离线检测规则,专门盯「Inter 字体走天下」「紫蓝渐变」这类一眼 AI 味。
5. ai-engineering-from-scratch | 免费开源 AI 工程课:523 节课、20 个阶段、约 342 小时,从线性代数讲到多智能体,每节课都要交出能用的东西。
6. hyperframes | 用 HTML 和 CSS 写视频再渲染成 MP4,同一份代码渲染两次结果一模一样,21 个 skill 专为 Agent 设计,出自 HeyGen 团队。
7. next.js | 周增 678 星不算亮眼,但 14 万星的底子摆在那,起新项目还是绕不开。
从「Agent 能做什么」到「Agent 怎么才能稳定干活」,关注点的位移这周更明显了。最值得先装的是 paperclip 和 impeccable——一个管 Agent 之间怎么协作,一个管页面别一眼看出是 AI 画的。
写在最后
这周,最值得记住的五件事:
- DevDay 的双面性——GPT-6.1 Sol、Dots、Pro 500 一路高歌,而 6.1 Astra 因安全退化被砍掉发布。发布机器连续第三次急刹车,「主动智能」的叙事与安全现实在同一家公司内并行。
- Sonnet 5.5 与 Gemini 4 Argon 同周对垒,前者用效率降价,后者用 100 万 token 输出和防御者优先的分发方式各闯一条路。
- AMD 82 亿美元买下 World Labs,李飞飞直接向苏姿丰汇报——芯片战争正式延伸到世界模型。
- Anthropic 招股书:十年 5180 亿算力承诺、2 万亿估值、80 页风险自陈,三种数字放在一起读,就是前沿 AI 的完整资产负债表。
- Agent 的关注点完成了三级跳:从「能做什么」(能力)到「怎么稳定干活」(基建)再到「集体上岗」(产品化)——paperclip、hindsight、impeccable 这批项目就是工牌本身。
下周值得继续看的:Anthropic 路演的最终估值落点,以及 Dots 的常驻智能体形态能不能跑出真实留存。