2026 年 9 月第一周 AI 行业周报:GPT-6 Astra 落地,GLM-6.0 指向全自训练,Hugging Face 被英伟达收购

上周周报的最后写过一句话:「GPT-6 Astra 带着安全评估报告如约而至」。这周它真的来了,而且来得不太顺利。这一期信息量很大,从头说起。
Part 01 - GPT-6 Astra 发布:一波三折的旗舰

9 月 3 日,OpenAI 正式发布新一代旗舰 GPT-6 Astra,称其在计算机使用、软件工程、科学与网络安全方向达到 SOTA。模型主打计算机与浏览器操作:自主操控浏览器、办公软件与开发工具,根据目标拆解任务,完成资料检索、表格处理、代码开发。上下文 105 万 token,最大输出 12.8 万,支持文本与图像输入。
跑分很猛,但各家的结论并不一致。 FrontierMath Tier 4 得分 97.6%,ARC-AGI-3 在 Provider Adapter harness 下得分 99.9%(还记得两周前黄仁勋宣布英伟达 ARC-AGI-3 满分通关吗),ExploitBench 达到 100%,OSWorld 2.0 得分 72.6%。完成一个复杂任务平均耗时约 40 分钟,上一代 GPT-5.6 Sol 要 75 分钟。Epoch AI 把它排到 267 个模型首位,但 Artificial Analysis 只给出与前代持平的 61 分,不过在 AA 的编码智能体评测里,Astra 得 67 分,追平 Claude Opus 5 与 Fable 5,token 效率比 Sol 高约 70%。
价格涨了。 API 定价每百万 token 输入 10 美元、输出 50 美元,约为 Sol 的 2.5 倍。模型已上线 Microsoft Foundry,Perplexity 也宣布将接入。
发布过程比模型本身更有故事。 Astra 因安全审查数度推迟。上期周报写过,OpenAI 8 月中旬发现它可能触及关键网络安全能力阈值,主动暂停了强化学习训练。上线时 Pro、Enterprise 与 Business Premium 用户优先于 Plus 用户获得访问权,奥尔特曼为此公开致歉并推出补偿机制:付费用户每缺少一天访问权限,即获一次额度重置。模型与 System Card 同步交付,「安全评估直接影响产品上线节奏」这句话本周兑现。
还有个值得留意的细节:Astra 控制自身链式思维的能力从 Sol 的 16.1% 跃升至 60.9%,可监控性随之下降。OpenAI 科学家回应称当前模型计算图深度与 GPT-4 差距不到两倍。旗舰模型的重心从文本推理转向可执行真实任务的智能体形态,安全分级管控与商业发布节奏的冲突,以后只会更频繁。
Part 02 - 大模型混战继续

Anthropic 发布 Fable 5.1 与 Mythos 5.1
Anthropic 一次发了两个版本:Fable 5.1 与 Mythos 5.1 是同一个底层模型,区别在安全防护等级。Fable 5.1 面向全量用户,Mythos 5.1 仅通过可信访问计划提供给网络安全与生命科学领域的受审机构。两者都面向长时间运行的智能体编码、知识工作与研究场景优化,在低或中推理强度下即可达到上一代高推理强度相当或更好的效果。
跑分上,Terminal-Bench 4.0 得分 55.8%(Fable 5 是 42.0%),智能体科学推理能力从 24.7% 提升到 52.6%,多项测试超过 Opus 5 与 GPT-5.6 Sol。
真正的重点是定价。 缓存读取价格从每百万 token 1 美元降到 0.25 美元,降幅 75%;基础价格保持输入 10 美元、输出 50 美元,和 GPT-6 Astra 定在了同一个价位。Anthropic 预计典型负载成本较 Fable 5 下降约 25%,高度 Agent 化工作负载最高降 45%。缓存读取在长程智能体任务里占 token 开销的大头,这一刀直接砍在 Agent 部署的单位经济性上:OpenAI 旗舰涨价 2.5 倍,Anthropic 降价 45%,两条路线正面对冲。
同一模型、不同护栏、面向不同市场,Fable 与 Mythos 的双版本架构可能成为前沿模型发布的通用模板。顺带一提,Fable 5.1 内置了不可见文本水印,以满足欧盟 AI 法案的要求。模型可以自己发现软件漏洞,但不能开发漏洞利用代码,安全防护误报率较上一代降低 60%。
Gemini 3.8 Flash 与 Flash Cyber
9 月 2 日,Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,六周内第三个 Flash 版本(3.6 → 3.7 → 3.8),月度迭代彻底坐实。3.8 Flash 面向智能体任务与软件开发,官方称是迄今最好的 Flash 模型,DeepSWE 得分 71.0%;Cyber 版基于同一底座,针对漏洞检测与自动化修复专项调优,通过 Fairwind 项目仅向受信防御者开放。
价格:年底前早鸟价每百万输入 0.75 美元、输出 3.75 美元,常规价 1.50 与 7.50 美元。1M 上下文,64K 最大输出。Google 还同步推出 Agentic 视频理解,覆盖 3.7、3.6 与 3.5 Flash 系列,动态检索视频片段替代固定帧率采样,token 消耗最高降低 88%。
Cyber 变体的白名单制分发,与 Anthropic 的 Mythos、OpenAI 的受限访问形成呼应,安全专项模型统一采用了封闭分发。用低价档位争夺成本敏感的 Agent 工作负载,开发者按任务复杂度选模型档位的路由模式正在成为常态。
Meta Muse Spark 1.3:五个月第四版
Meta 发布 Muse Spark 1.3,五个月内的第四个版本。AA 智能指数 61 至 62 分,逼近 Fable 5.1 与 GPT-5.6 Sol;AA 编码智能体评测得 68 分,与 Claude Code 加 Opus 5 的组合接近。双轨 API 定价把模型能力与成本选项解耦。
五个月四个版本,说明 Meta 的后训练流程已经工业化到支撑月级迭代,数据、算力与评测管线全部标准化。大模型竞争进入以版本频率论高下的阶段,单一模型的领先窗口持续缩短。
国产动态
DeepSeek 开源 V4-Flash-Vision-Exp。 继 8 月 21 日 API 上线(上期周报写过)之后,DeepSeek 本周在 Hugging Face 开放了权重:MIT License,仓库约 168GB,包含视觉编码器、Aligner、DFlash Attention、MoE 路由等核心模块的最小化推理实现。总参数约 284B、每 token 激活 13B,上下文 1M,ApexBench 从 26.2 升至 36.5。MIT License 没有任何用户门槛和 MaaS 例外条款,在同期开源模型里最为宽松,开源阵营的多模态缺口正在被快速填补。
榜单方面。 凤凰网 AI 大模型周榜显示:Qwen3.8-Max-0902 直接登顶 WebDev 前端榜,GLM-5.3-Flash 首秀杀进代码榜 Top 10。上期周报重点写的 Flash,这周榜单兑现了。另外阿里云千问平台已接入 GLM-5.3 与 DeepSeek-V4-Pro,国产模型之间开始互相接入了。
Mureka V9.5(8/31):AI 音乐模型新版本,情感表现力与作品连贯性提升。
Part 03 - 唐杰首次披露 GLM-6.0:全自训练

8 月 31 日晚的智谱 2026 年中期业绩会上,唐杰谈到了下一代 GLM-6.0 的技术方向,Fully Self-Training,全自训练。没有公布发布时间,但方向第一次摆上了桌面。
他的出发点是:Scaling 并没有结束,只是变成了另一件事。面对「为什么不继续堆参数」的质疑,他的回答是把问题拆成参数、数据、算力、训练和部署几个变量。GLM-5.3 和 GLM-5.2 用同一个基座,靠扩大长周期任务环境和强化学习后训练拿到提升,就是最直接的验证:模型能不能变强,取决于它在什么环境里训练、训练多久、能完成什么任务、能不能从任务中获得有效反馈。
那么自然的问题是:如果后训练和任务环境本身就是 Scaling 的一部分,这些事能不能也逐渐交给 AI?这就是 Fully Self-Training 的具体设想。过去研究人员设计任务、准备数据、搭建环境、训练模型、判断好坏;往后这些环节一段一段交给 AI:自己生成和筛选训练数据,自己构建任务环境,自己完成任务拿反馈,再进入下一轮训练。甚至连基础设施也可以让 AI 参与优化,智谱已经在用 GLM-5.3 驱动的 Infra Agent 参与推理内核、性能诊断和服务栈优化。
于是一个新的循环出现了:GLM 生成任务环境,下一代 GLM 在环境中训练;GLM 优化训练和推理系统,系统再承载更强的 GLM。在海外讨论里,这条路常被放在 RSI(递归式自我改进)的框架下理解。
唐杰自己也点出了最难的地方:模型必须知道哪些数据值得留下、知道自己什么时候错了、知道什么时候该继续训练什么时候已经足够。一旦模型无法可靠判断对错,错误就会随训练循环不断放大。这种自我判断能力,可能才是全自训练最核心也最难解决的问题。他明确表示目前仍有大量人工环节,但「让模型参与训练下一个自己」这条路,已经开始了。
Part 04 - 英伟达 129.3 亿美元收购 Hugging Face,然后 HF 卖鸭子

先说收购
上期周报末尾提过这笔交易的传闻,本周官宣:NVIDIA 以 129.3 亿美元收购 Hugging Face,黄仁勋在官方博客公布。对价约为 2023 年融资轮 45 亿美元估值的 2.9 倍,其中约 119 亿美元现金,另设最高 10 亿美元员工留任激励。这是 NVIDIA 史上第二大收购,仅次于去年末约 200 亿美元收购 Groq 相关资产。
Hugging Face 的分量:1800 万开发者、300 万个模型、50 万个数据集、100 万个应用,超过 20 万家企业依托它完成模型选型与部署。NVIDIA 此前已在 2023 年融资轮投入 2.35 亿美元,本身还是平台最大的开源贡献者之一。
黄仁勋承诺平台保持中立:继续作为面向整个 AI 生态的开放平台独立运营,不强制使用 NVIDIA 计算资源,开源属性完整保留,创始人团队留任至少两年。交易尚需监管审批,预计 2027 年上半年交割。社区担忧的焦点也正在这里,微软收购 GitHub 时说过类似的话,后续的整合路径说明承诺与执行之间存在距离。对 NVIDIA 而言,这笔交易把价值链从硬件层延伸到模型分发与开发者入口,从芯片到框架再到模型库的完整布局成型。
再说鸭子

定价逻辑很反直觉:一位法国机器人博主查了零件价,它用的 Dynamixel XL330 舵机单颗零售四十多欧元,十五颗就超过 650 美元,比 399 美元的整机还贵。决定这个价签的不是硬件毛利,主控是国产瑞芯微 RK3566,便宜、量足、资料齐;深圳矽递科技生产,首批计划超 2 万台,中国大陆暂未开放。
真正的核心是软件:七个出厂动作全部是在 MuJoCo 仿真里用 PPO 强化学习训出的神经网络策略,50Hz 每秒重算五十次。整套软件栈按 Apache 2.0 开源,SDK、仿真环境、训练管线都在 GitHub 上,可以 fork、改参数、重训、推回真机。Hugging Face 还上线了浏览器在线仿真器,跑的是和真机同一套策略,不等圣诞发货,现在就能在电脑前教鸭子踢球。硬件图纸不公开,「大脑」可看可改可重训,身体图纸锁着:软件开放为了转飞轮,硬件是护城河。
往前看,这是 HF 具身智能布局的第三步:2024 年初前特斯拉 Optimus 科学家 Remi Cadene 加入牵头 LeRobot,2025 年 4 月收购法国 Pollen Robotics,Reachy Mini 管对话交互(全球出货约一万台),Microduck 管行动。两条线用不到 500 美元把具身智能最主要的两个方向搬上了桌面。它不解决机器人学的核心难题,但过去跑通这套流程的门槛压在几千美元的真机上,坏一次可能搭上一台减速器和几个工程师的下午,现在真正被压低的,是犯错的成本。
一个放大的注脚:一边是芯片厂商 129 亿美元买下全球最大开源模型社区,一边是这个社区用 399 美元的鸭子证明自己能造硬件入口。英伟达缺的从来不是工具链,而是低价硬件入口和愿意折腾的人;而 HF 最值钱的资产之一是中立,归入一家芯片公司后还剩多少,社区会用行动投票。
Part 05 - Claude 用 11 天验证费马大定理

Anthropic 宣布 Claude 完成费马大定理的首个端到端机器验证证明:模型在 11 天内基本自主运行,用 Lean 语言写出约 1300 万行代码,证明约 3 万个定理,其中约 2.95 万个中间定理被纳入最终证明。整个证明经 Lean 检查,仅使用三条标准公理,代码已在 GitHub 公开,帝国理工教授 Kevin Buzzard 审阅。
先把功劳的边界说清楚:这次工作的创新在验证而非发现。费马大定理由怀尔斯 1995 年证明,原始论证 129 页,发表前经历数月人工核查;把它转化为计算机可逐步验证的形式,数学界此前预计需要数年。Claude 做的是把已有证明自动形式化,遵循 Darmon、Diamond 与 Taylor 的简化版本,并让机器逐步校验,不是独立提出新证明。
工程上的看点是多智能体协作:数十个 Claude 智能体分工完成,使用 Tianyi Peng 与哥伦比亚大学合作者开发的 Prove2Me 平台,以有向无环图记录待证定理与依赖关系,人类输入仅限少量高层次指令。项目消耗约 60 亿输出 token,生成的证明规模超过 Mathlib(主要数学证明库)的五倍。用依赖图替代单个智能体的上下文记忆,解决了多 Agent 并行工作时的状态漂移问题,这套机制对长周期科研任务的有效性,可能比证明本身更有迁移价值。
如果自动形式化扩展到更多数学成果,形式化版本可能成为未来数学成果发布的常规配套,数学知识体系的可靠性验证方式正在被重写。
Part 06 - 工具、资本与行业

Anthropic IPO 推迟至 10 月中旬启动路演。 招股书披露从原定的最早本周推迟至 9 月下旬,路演最早 10 月中旬,挂牌可能落在 11 月。推迟与一笔 150 亿美元循环信贷额度的落实安排有关。部分投资者给出的估值预期达 2 万亿美元,若实现将超过 SpaceX 上市时的 1.77 万亿,成为史上最大 IPO,目标募资额高达 1000 亿美元。支撑数据:截至 7 月底年化营收超 650 亿美元,较去年底增长逾 7 倍,公司对 2028 年收入预测约 1900 亿至 2000 亿美元。用远期收入定 30 倍年化收入的估值,在传统 IPO 里并不常见。高盛预计多家人工智能企业集中上市将令今年美股 IPO 募资总额攀升至创纪录的 2250 亿美元。上期周报写过 OpenAI 最迟 2027 年上市,两家的资本市场竞赛已经白热化。
xAI 发布 Grok Bot 企业版。 定位持久化智能体:拥有身份、记忆、自有计算机与工具,可超越单次会话持续执行任务。产品以 Bot 为主要交互对象而非会话,头像动效呈现空闲、工作、阻塞、思考等状态,工作区提供状态、预览与接管三级访问。Grok 与 Cursor Enterprise 客户未来两周免费可用。最有说服力的是 xAI 自己的落地账本:让 Grok Bot 访问供应商支出、合同与使用数据后,Haggle Bot 已识别超过 10 万美元直接节省。在一个 SaaS 产品里发现 43 个 90 天无活动的付费席位(省 14220 美元),在另一个产品里找出每年 85662 美元的未用 SKU。企业级智能体的价值评估,正从功能演示转向可量化产出。
OpenClaw 2.0 发布。 开源可自托管的 Agent 网关(把 Discord / Telegram / WhatsApp / Slack 接入大模型,24/7 跑任务)迎来史上最大更新:跨设备续接,没做完的任务换设备、换云端 worker 接着跑;共享云会话,队友可实时查看、加入、接管任务;全新聊天式 Web 控制台,安装时自动检测已有的 Claude/ChatGPT 订阅和本地 Ollama 模型。宣传语很直白:「Agent 终于能把没做完的事接着做」, 与 GitHub 上“Agent 持续在线”的主线正好合流。
行业数据。 ChatGPT 与 Gemini 用户双双破 10 亿;记忆张量(Agent 长期记忆方向)完成 Pre-A+ 轮融资,东方富海领投,Agent 记忆赛道从开源项目火到了一级市场;三部门联合发文支持 AI 智能体产业;海外方面,AI 行业向 2026 中期选举投入 2.65 亿美元,数据中心在多地遭遇社区反弹。
Part 07 - GitHub 热榜速报

本周主题延续了上期的判断:AI 项目从「能演示」走向「能评测、能接进代码库、能服务具体流程」,另外本地运行类工具集中上榜。
增量榜 TOP5
① archify | +19,480 | JavaScript
连续两周增量第一(上期 +11.1k,本期 +19.5k,总星 49.7k)。把代码库或系统描述变成可验证的交互式架构图:agent 产出类型化 JSON IR,确定性编译输出 HTML/SVG,支持 Before/Delta/After 三态架构变更对比。本周新增 Proof Lab 在线画廊(11 个可交互验证场景)、三种新预设,并提供了 DeepSeek Harness 集成。图表 skill 赛道从 diagram-design 到 archify,关注点彻底从「画得好看」转向「画得可信、可溯源」。
项目地址:https://github.com/tt-a1i/archify
② THU-MAIC/OpenMAIC | +10,109 | TypeScript
清华大学的多智能体互动课堂:输入主题即可生成完整课程,AI 教师授课、AI 同学实时讨论,支持白板画图、语音问答、随堂测验、3D 交互模拟与项目制学习。8 月 27 日的 v1.0.0 新增 Pro agent 工作台,可聊天式规划课纲、逐页构建课程、上传文档音视频做教材。附带清华 JCST’26 论文,支持 OpenClaw 集成。AI 教育场景开始升温的标志性项目。
项目地址:https://github.com/THU-MAIC/OpenMAIC
③ debpalash/VoiceStudio | +6,761 | Python
完全本地运行的开源语音工具(原 OmniVoice-Studio):语音克隆、视频配音、听写、有声书制作,整合 16 个 TTS 引擎与 11 个 ASR 引擎,支持 646 种语言,无账号、无 API key、无用量计费,本地版 ElevenLabs。会根据硬件自动推荐引擎组合:Apple Silicon 用 MLX-Audio,NVIDIA 用 CosyVoice 3,纯 CPU 用 PocketTTS。
项目地址:https://github.com/debpalash/VoiceStudio
④ bilawalsidhu/gods-eye-view | +5,926 | JavaScript
浏览器中的实时卫星仿真器,数据全部来自公开实时信号:航班应答机、船舶 AIS、卫星轨道、地震、野火与城市公共摄像头,融合在一个 3D 地球上。可以进入飞机座舱视角跟随飞行,切换 NVG/FLIR/CRT 传感器滤镜,带军用风格 HUD。免 API key 即可启动,作者 Bilawal Sidhu 是前 Google 的科技博主,曾登 Trending 首位。
项目地址:https://github.com/bilawalsidhu/gods-eye-view
⑤ Gitlawb/openclaude | +1,839 | TypeScript
「runs anywhere, uses anything」的开放终端编码 agent,通过统一抽象接入不同模型与工具,首次进入周榜就有 32.7k 星。codex、Claude Code 开源后的替代终端生态还在持续发酵。
项目地址:https://github.com/Gitlawb/openclaude
增长榜与新秀
tailscale/tailcat(+3,187)
bradfitz 参与的项目:类似 netcat 的端口直连工具,走 Tailscale 的 WireGuard 数据面但不依赖控制面,两台机器点对点直连。
handsomestWei/patent-disclosure-skill(+1,996)
中文专利 skill:专利点挖掘、交底书编写、通俗解读、审查答复辅助,中文垂直岗位 skill 化的又一案例。
anthropics/commerce-agents(2.1k 星 · 09-01)
Anthropic 官方电商 agent 参考蓝图,双 agent 架构(shopping agent + merchant agent),覆盖零售、电商、电信、娱乐四类场景。
lnkiai/m3e-canvas(3.9k 星 · 09-02)
浏览器里画 Material 3 界面草图,直接生成 vibe-coding 提示词,纯前端实现,3 天 3.9k 星。
shadcn-ui/cn(1.2k 星 · 08-31)
shadcn 团队新库:Tailwind class 合并与冲突处理,官方称兼容 tailwind-merge 与 clsx 的 API,速度快约 30 倍。
老项目方面,deepseek-harness 本周仍 +10.3k(总星 203k+),awesome-gpt-image-2 的周增量从 +12.9k 回落至 +3.0k。新项目热度周期在缩短,能连续上榜的要么迭代快,要么真需求。
一个甄别提醒
本周趋势榜出现一批星数异常高的 skills 合集仓库:ECC(250.1k)、mattpocock/skills(253k)、NousResearch/hermes-agent(242k)等,星数全部高于 openai/codex 的 121.8k,部分 README 含引导点赞文案。代码内容是真的,但星数与内容体量是否匹配存疑。选品时多看账号注册时间与星数增长曲线,GitHub 星数作为参考需要交叉验证。
写在最后
9 月第一周,最值得记住的五件事:
一是 GPT-6 Astra 一波三折地落地,被安全审查数度推迟后,模型与 System Card 一起交付,旗舰模型的重心彻底转向可执行真实任务的智能体形态。
二是定价路线分裂:GPT-6 旗舰涨价 2.5 倍,Anthropic 把缓存读取砍到四分之一、Agent 化负载成本降 45%,同一个价位上,两条相反的策略在对冲。
三是 Scaling 叙事转向:唐杰把 GLM-6.0 指向全自训练,Meta 用五个月四个版本证明后训练已经工业化,参数规模竞赛让位于单位成本下的有效智能。
四是英伟达 129.3 亿美元拿下 Hugging Face,从芯片到模型库的布局成型;而 HF 自己用一只 399 美元、4 秒卖一台的机器鸭,把具身智能的犯错成本压到了桌面级。
五是 Claude 11 天完成费马大定理的机器验证,多智能体加依赖图这套机制对长周期科研的有效性,可能比证明本身更重要。
下周见。
关于作者
持续分享 AI 工具、效率软件和实用黑科技。
如果觉得有用,欢迎点赞、在看、转发三连。