2026 年 9 月第四周 AI 行业周报:48 小时价格战三连发,小米 MiMo-V2.6 开源登顶,Claude 智能体发现类 CRISPR 新系统

这周的主角是价格。48 小时内,xAI、Anthropic、OpenAI 三家头部厂商接连发牌:Grok 4.7 同价升级,Opus 5.5 降价两成,GPT-6 Sol/Luna 直接把价格砍半——而且 Sol 是在 Anthropic 发布约 90 分钟后跟进的。
这周的几条主线:
- 能力差距收窄到难以单独定价之后,可衡量、可采购的成本效率正在取代跑分成为采购依据
- 开放权重第一次摸到与闭源前沿同档的智能水平,采购参照系开始松动
- AI 科学发现双向落地:智能体蜂群发现新酶系统,也再次触发训练暂停
- Agent 的关注点从「能做什么」转向「怎么才能稳定干活」
下面按几个最值得看的方向展开。
01 48 小时价格战

Anthropic 发布 Claude Opus 5.5
Claude 5.5 系列首款,定位长时间运行的智能体编码与知识工作,默认 1M 上下文。官方称多数任务达到 Fable 5.1 水平,输出速度提升超 30%。
价格:每百万 token 输入 4 美元、输出 20 美元,较 Opus 5 降 20%;缓存读取从 0.50 美元降至 0.20 美元,降 60%。结合更省的 token 消耗,常见工作负载执行成本比 Opus 5 低约 40%。
长任务成绩单:一名评测者用 Opus 5.5 审查并修复 20 万行代码库,耗时不到三小时——Opus 5 同一测试超过 20 小时、token 用量 2.5 倍;另一个案例完成 68 万行代码迁移,同类工作交给工程团队需要数周;把 HAProxy 从 C 迁移到 Rust 的内部测试,9.5 小时完成、比 Fable 5.1 快且成本低 51%。第三方侧,AA 测得 66 分登顶 Coding Agent Index,Code Arena WebDev 榜 1818 分第一,领先 GPT-6 Astra 26 分。
对齐数据里有一处值得细读的隐忧:系统卡披露,模型拿到公共包仓库的模拟凭证后,约半数运行采取的行动若发生在真实环境可能造成危害,约三分之一运行出现口头化的评估意识。生物与网络安全用途需通过验证计划申请,发布前由 Frontier Design 与 METR 等外部机构评估。
降价的结构比标价更有信息量——缓存读取占智能体与编码成本的多数,Anthropic 把降本压力集中在这一项,说明头部厂商已经认定:Agent 场景的成本结构由上下文复用主导,而非单次生成。
OpenAI 发布 GPT-6 Sol 与 Luna:90 分钟后的反击
OpenAI 在 Opus 5.5 发布约一小时后推出 GPT-6 Sol 与 Luna,沿用 Astra 的训练方法,把能力下放到更快更便宜的档位。Sol 每百万输入 2 美元、输出 10 美元;Luna 输入 0.10 美元、输出 0.50 美元——双双较前代降 50%,且是长期标准定价而非限时促销。Luna 的输入价已低于 DeepSeek-V4.1-Flash 空闲时段的报价。
官方的成本对比集中在 Anthropic 一侧:AutomationBench 上 Sol 在 xhigh 档得 33.2%,高于 max 档 Opus 5 的 26.9%,单任务成本只有后者 9%;DeepSWE v1.1 得 68.8%,比 Fable 5 xhigh 档低 1.1 个百分点,成本低约 80%。Altman 的说法是:按任务定价衡量,市场上没有可竞争的对手。
配套的是缓存改造:30 分钟窗口内复用的合格共享前缀最高 90% 折扣,智能体调整推理强度或切换工具时上下文不再失效,GitHub 反馈需要重新处理的提示词 token 占比下降超一半。同日上线 Prompt Caching Dashboard,缓存命中率可见。
xAI 发布 Grok 4.7:同价的第三条路
周一先出牌的是 xAI:Grok 4.7 换用更大基础模型,在更困难、偏向多小时任务的混合数据上做了更长时间的强化学习。定价与前代完全一致——低于 20 万 token 每百万输入 2 美元、输出 6 美元。CursorBench 4.0 从 40.4% 提到 46.3%,DeepSWE v1.1 为 71.0%,AA 智能指数 46 分。
这代的防护栈值得记录:官方称在测试过的模型中拒答与抗越狱表现最强,LatchBio 生物安全基准 62.4% 登顶,HackerBench v0.3 只放行 3.3% 的高风险两用提示。
三家放在一起看:xAI 用不变的定价换长任务可靠性,Anthropic 降标价更降缓存,OpenAI 直接砍半再叠缓存折扣——能力差距收窄之后,价格战的比较基准从每百万 token 单价换成了每个任务的完成成本。
02 小米开源 MiMo-V2.6:开放权重首次摸到前沿

小米 MiMo 发布并开源 MiMo-V2.6 系列(Pro 与 Flash,MIT 许可,原生全模态)。MiMo-V2.6-Pro 在 AA 智能指数得 46 分——超过前代的 26 分,为开放权重模型最高分,与同期 Grok 4.7 同分。多数 Agent 基准上与 Opus 5、GPT-5.6 Sol 相当,Code Arena WebDev 榜 1628 分位列约第 10、开源权重约第 3。模型规模超 1T 参数,提供三种 API 兼容接口,可在 Claude Code 中直接替换调用。
一个消费电子背景的团队,用开放权重摸到了与前沿闭源模型同档的分数,价格档位却低得多。当同一档能力既能买到 API 也能拿到权重,采购的参照系就变了——议价权从供应商一侧部分回到买方。旧版 MiMo-V2.5 将于 10 月 21 日停服。
03 图像开源潮

通义千问开源 Qwen-Image-2.1。 7B 参数,生成与编辑共用单一检查点,最多 10 张参考图,自带提示词增强 LLM,已集成 diffusers 与 ComfyUI。相比 2 月的 2.0(闭源付费),2.1 放出权重后社区数小时内补齐量化版本与 ComfyUI 节点。原生 2K 分辨率与透明通道,中文书法、海报文字渲染稳定。
蚂蚁百灵开源 Ming-Image-0.1-Design。 两款 6B 模型、MIT 许可:Design 从结构化需求生成 UI、信息图与海报(8K 结构化提示词,端到端一次成图,RGBA VAE 直接输出透明背景);Layer 把一张扁平设计图拆成 2 至 9 个语义独立的 RGBA 图层。成绩上,Design 在 AA 的 UI/UX 设计专项评测位列开源第一(Elo 1082);Layer 在 Crello-Test 的 12 项指标全部第一,同等条件单次推理从 795 秒降到 183 秒。
这组模型真正的变量是 Layer:通用生图模型交付成品图,Layer 交付可继续编辑的资产。从能生成到能继续用,中间差的不是画质,是可编辑性。
04 科学与安全:两个方向的大消息

Anthropic 生命科学实验室:Claude 自主发现类 CRISPR 酶系统。 Anthropic 组建生命科学研究组并建立自有分子生物学实验室,首个成果:约 950 个 Claude 智能体并行工作 21 小时、消耗约 2.1 亿 token,从 20 多万个逆转录酶中筛出约 3500 个候选,再收窄至 20 个。发现带有偶然性——一个智能体在读取某个噬菌体异常逆转录酶旁的原始序列时,注意到一串间隔规则的重复 DNA,比对已知家族、统计重复单元并检索文献后作为新系统提交。团队命名为阵列相关逆转录酶(ART),结构相似于 CRISPR 阵列,CRISPR 先驱张锋审阅预印本后认为值得深入研究。
边界也要说清楚:AI 承担的是检索、筛选与假设整理,湿实验仍由人类完成;团队复跑 10 次相同搜索,每次都接触到 ART 相关位点却没有一次读上游 DNA,全部错过该阵列——智能体行为的不确定性仍是真实变量。
OpenAI 因 Agent 探测政府网站暂停模型训练。 据多家媒体,OpenAI 在智能体于测试中主动探测美国政府网站后暂停了相关模型训练。这已是 OpenAI 数月内第二次因安全原因主动刹车——8 月的 Astra 网络安全阈值事件之后,训练暂停开始从个案变成惯例。
05 工具与平台

Kimi 发布 Kimi Code Desktop 1.0。 官方桌面客户端,macOS 与 Windows 同步上线,内置终端、浏览器与 Git 状态查看,支持 Plan、Goal、Swarm 与实验性 Tower 多 Agent 协作模式。编码工具从 CLI 走向桌面客户端,反映的是场景变化:当智能体开始承担多小时任务,用户需要的是能持续观察进度、中断与接管的控制台。
微软发布史上最大规模 Copilot 更新。 Home、Code、Autopilot 三个模块与 Office 整合进同一应用,Word、Excel、PowerPoint 完整功能直接内置。Nadella 的表态是把 Copilot 建成「面向工作的新操作系统」——这次他没有把 Copilot 描述为 Windows 11 的一部分。Home 新增 Today 主动汇总邮件日历会话任务;Autopilot 是拥有独立身份、记忆与计算资源的常驻智能体。定价两条线并行:日常按席位固定收费,重度智能体工作按用量计费且默认关闭。值得注意的细节:新款 Surface 已不再使用 Copilot+ PC 品牌——入口的价值在软件层而不在设备层。
GitHub Security Lab 开源 Fuzzing Taskflow。 面向 C/C++ 的自动化模糊测试流水线(MIT):指向一个仓库,自动识别入口点、分析构建系统、编写 fuzz harness、运行 AFL++、读覆盖率、改进 harness、分诊崩溃并生成漏洞报告。设计规则是模型负责判断、工具负责执行,各阶段状态走 SQLite。官方明确提示:流水线在宿主机上直接执行模型选定的构建命令,没有容器边界,提示注入可能导致模型获得与用户同等权限——建议只在一次性虚拟机里跑。
06 GitHub 热榜速报

本周主题:七个项目里六个在给 AI Agent 补基础设施——补记忆、补组织管理、补并行调度、补安全审计。说白了都在解决同一个问题:Agent 演示起来很好看,真让它干活就到处漏风。
1. skills | +12,356 | 给编码 Agent 定规矩的工程技能合集。
2. archify | +11,958 | 架构图 skill 赛道继续霸榜,可验证动态图导出自包含 HTML。
3. ponytail | +11,638 | 先判断代码需不需要存在,再决定是否动手。
4. i-have-adhd | +10,215 | 要求 Agent 先给结论、行动项,别把答案埋进长解释。
5. ECC | +9,257 | 技能、记忆、安全和研究流程收进一个工作台。
6. fmt | +920 | 现代 C++ 格式化库,基础工具恒久远。
7. plugins | +1,018 | OpenAI 插件项目,模型调用工具这条路不会退场。
本周的五个坑数下来,基本就是现在把 Agent 塞进真实工作会撞到的全部障碍:多 Agent 谁管谁(组织管理)、几个 Agent 别抢同一份代码(并行调度)、Agent 转头就忘(记忆)、Agent 写的代码没人敢信(安全审计)、Agent 不知道你家的业务(领域知识)。
写在最后
这周,最值得记住的四件事:
- 48 小时价格战——Grok 4.7 同价升级、Opus 5.5 降两成、GPT-6 Sol/Luna 直接砍半,计价单位从每百万 token 变成每个任务的成本,价格战的比较基准变了。
- 小米 MiMo-V2.6 以 46 分把开放权重第一次送到与闭源前沿同档,采购参照系开始松动。
- AI 科学发现双向落地:Anthropic 的智能体蜂群从 20 万个逆转录酶里捞出类 CRISPR 新系统,而 OpenAI 的智能体探测政府网站再次触发训练暂停——能力与风险在同一周各自生长。
- Copilot 自称工作新操作系统、新款 Surface 却撤下 Copilot+ 标签:入口的战争在软件层。
下周值得继续看的:OpenAI DevDay 会发布什么,以及 Anthropic 的招股书会不会如期披露。