2026 年 8 月第三、四周 AI 行业周报:GLM-5.3-Flash 补齐多模态,MHS 走向机器世界,Agent 安全与开源竞赛同步升级

这两周信息量太大,合并成一期。头版留给 GLM-5.3-Flash。它不仅补上了 GLM 用户等了很久的原生多模态,也把低价、开源和国产算力三条线一起推到了台前。
如果把这两周的消息放在一起看,会发现 AI 行业有几条线正在同时加速:
- 多模态从“加分项”变成基础模型参与 Agent 竞争的入场券
- Agent 的边界开始从软件世界往真实机器延伸
- 安全评估开始真正影响前沿模型的训练与发布节奏
- 开源、平台、芯片和推理成本,正在一起决定下一轮竞争格局
下面按几个最值得看的方向展开。

01 GLM-5.3-Flash 发布,GLM 终于有多模态了
8 月 26 日,智谱正式发布并开源 GLM-5.3-Flash(320B-A18B)。这是 GLM-5 系列首个原生多模态模型,也补上了从 GLM-5.2 时代起用户呼声最高的那块拼图。
先说一个有意思的细节。发布之前,这个模型一直顶着「Ox-Alpha」的匿名身份在 OpenCode 和 OpenRouter 上测试,迅速成为热门模型,直到发布当天才认领。更值得说的是,这些测试期的请求流量,全部跑在国产芯片集群上。官方表示经过推理引擎和集群架构优化,国产芯片上的端到端服务性能相比初始基线提升了 3 倍,单 Token 成本已经接近主流英伟达 GPU 的水平。
能力上,Flash 这次没有“阉割”。Artificial Analysis 智能指数 57 分,进入全球前沿模型区间,与 Claude Opus 4.8 持平;自研 Z.ai Code Bench 上编程表现也达到与 Opus 4.8 相近的水平。
价格才是真正的杀招。定价仅为 GLM-5.3 的十分之一,限时优惠期间进一步降到二十分之一,大约是 Opus 4.8 的四十分之一。能把价格打到这个程度,靠的是架构:线性注意力与稀疏注意力结合的混合架构,总参数 320B 但单次只激活 18B,层数从 92 层压缩到 45 层。相比 GLM-5.3,注意力计算量降低约 3.01 倍,KV Cache 占用降低约 4.44 倍,同时支持最高 1M 长上下文。
多模态怎么用?智谱给出的答案是“看着自己写代码”。模型不仅能生成代码,还能主动观察网页、GUI、3D 场景和最终渲染结果,根据视觉反馈继续修改,形成“生成 - 观察 - 验证 - 优化”的闭环。这套能力也延伸到了 PPTX、PDF、DOCX、XLSX 等办公任务,以及金融研究、法律合同审查等专业场景,模型可以对自己的交付结果做视觉检查。
模型已正式全球开源,API 与编码平台同步开放接入。
把时间线串起来看智谱这个月的节奏:8 月 19 日 GLM-5.3 API 上线(纯文本,后训练升级),8 月 26 日 GLM-5.3-Flash 补上原生多模态并打到低价,8 月 28 日 GLM-5.3 权重开源。API 先行、Flash 普惠、权重殿后,三步走完了从旗舰到开源的完整落子。
02 MHS:MCP 之后,Anthropic 想让 AI 操作机器
MCP 解决的是 AI 与软件之间的接口,这两周 Anthropic 把手伸向了真实硬件:开放 MHS 研究预览,想给 AI Agent 和真实硬件之间统一一套接口,机械臂、显微镜、激光器都能接。
实际效果已经有了一些。QuEra 的早期试点里,Claude 借助 MHS 搞出了一套激光自动恢复程序,700 次盲测成功 695 次,成功率 99.3%。
不过现在还只是 Research Preview,需要申请,也尚未开源。而且 AI 离真正理解物理世界还差得远。Genentech 的实验里,Claude 就把液体泡沫当成了软件 Bug,反复重试。机器不会吐错误堆栈,物理世界的异常形态和软件世界完全是两回事,这是 MHS 们要过的真正一关。
如果说 MCP 是让 AI 操作软件,MHS 就是让 AI 开始去操作机器。从数字世界到物理世界,Agent 的边界又往外推了一格。
03 两周大模型发布盘点
这两周的大模型发布密度很高,而且一个共同点越来越明显:大家都在围绕多模态、Agent 和真实工程任务来重新定义旗舰模型。
智谱开源 GLM-5.3 权重
8 月 28 日,智谱宣布开源 GLM-5.3 模型权重,比 API 上线晚了一周多。按原计划还要更早,因为网络防御能力增长超出预期,权重开放被推迟两周做了额外安全审查,这个节奏本身就印证了模型在漏洞挖掘方向的能力强度。
权重 FP8 格式、总体积约 756GB,需多卡数据中心环境部署。官方模型卡显示,Terminal Bench 3.0 解决率从 4.6% 升至 28.3%,DeepSWE 从 46.2% 升至 66.9%,ExploitBench 从 24.4% 升至 54.4%。vLLM、SGLang、Ollama、OpenRouter 发布当天完成接入。
许可协议值得单独一说:允许免费使用、修改、分发与商业化,但规定机构连续 12 个月营收超过 100 亿美元且对外提供模型即服务时,须先通过智谱安全审查。这个条款实际指向微软、谷歌、英伟达这类超大型云厂商。“十亿美元营收门槛”的开源许可设计在社区引发了不少讨论,头部开源模型的发布方式可能由此分化。
腾讯混元 Hy4 preview 开源
8 月 28 日,腾讯混元发布并开源 Hy4 preview:MoE 架构,总参数 770B、激活 49B,上下文 1M tokens,Apache 2.0 协议。相比上代 Hy3 的 295B,规模翻倍还多;256 个路由专家配 1 个共享专家,每次激活 top-8,配合 Gated DSA 注意力与 IndexCache 跨层稀疏索引复用。
腾讯内部组织了 163 名专家、203 个工程任务盲测,Hy4 preview 均分 2.99/4.00,略高于 GLM-5.3 的 2.92 和 Kimi K3 的 2.94。模型定位“生产力优先”,主打软件工程长程开发、办公与金融分析、一句话生成可玩游戏原型、科研推理四类场景。还有一个信号:官方披露 Hy4 preview 首次参与自身研发过程,并自主优化推理系统使端到端吞吐提升 31.8%。
定价每百万输入 token 0.834 美元、输出 2.501 美元。开源旗舰层的竞争,正在从参数规模比拼转向真实工程任务盲测。
DeepSeek 上线 V4-Flash-Vision-Exp
8 月 21 日,DeepSeek 上线实验性多模态视觉理解模型 V4-Flash-Vision-Exp,这是 V4 系列首款原生支持图片输入的模型。纯文本能力与 V4-Flash 正式版持平(Terminal Bench 2.1 得分 83.9),没有因加视觉模块牺牲文本性能;在需要视觉理解的 Agent 基准上大幅跃升,多模态 Agent 能力已接近 Opus-4.8。
计费方式延续了 DeepSeek 一贯的风格:图片按 Token 计费,单张最多按 384 Token 计算,单张图片高峰时段输入成本约 0.001 元。平台同步上线 Files API 支持图片缓存,DeepSeek Harness 也更新了适配。
半个月内,DeepSeek 补视觉、GLM-5.3-Flash 原生多模态,多模态正在从加分项变成基础模型参与 Agent 竞争的入场券。
阿里 Qwen-UI-Agent:学会使用世界的现有形态
8 月 20 日,阿里千问发布 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖手机、电脑、网页与深度搜索。它的特别之处在于真机训练:搭建了覆盖 100 多台真实手机、150 余款应用的移动环境,自建 400 多项任务的 MobileWorld-Real 真机基准。
成绩上,移动端 MobileWorld 得分 82.1%,领先 GPT-5.6 Sol 12 个百分点;真机基准 92.2%;桌面端 OSWorld-Verified 79.5%,浏览器端 WebArena 73.6% 位列对比模型第一。模型采用统一动作空间,除 GUI 交互外可直接执行命令行,电脑任务中 CLI 动作占比近半。安全机制贯穿全程:违法请求直接拒绝,支付、数据删除、隐私授权等敏感场景在关键步骤暂停等待确认。
多数软件不开放 API,界面本身就是覆盖面最广的交互入口。Qwen-UI-Agent 的思路是不去改造世界,而是学会使用世界的现有形态,这与依赖 CLI、MCP 工具的 Agent 方案形成互补。
其他值得留意的发布
Qwen3.8-Flash-Next 开源。 定位 Qwen4 架构的早期预览:MoE 结构,总参数 125B、单次激活 6B,新增 51B N-gram 嵌入层强化词级建模,GDN 与 QSA 混合注意力。团队称训练成本仅为 Qwen3.7-Plus 的九分之一。先发小参数预览版收集社区反馈、再出正式版,正在成为头部团队的标准迭代流程。
阿里云 Wan3.0 上线。 8 月 24 日在百炼平台开放,单次最高生成 30 秒 1080P/30fps 原生视频,音画同步,时长比前代翻倍。首次支持 doc、xls、ppt、pdf、md 等文档格式与网页链接作为输入,最多组合 10 张图、5 个视频、5 个音频做参考。已进入短剧、广告、文旅生产链路。上周 MiniMax H3 开源引爆个人创作,这周 Wan3.0 把 30 秒连续成片做进生产流程,视频生成的竞争焦点已经从单帧画质转向长叙事与可控性。
Google Gemini 3.5 Transcribe。 实时语音转写词错误率流式 4.0%、非流式 2.6%,支持 85 种以上语言自动检测,相比上代 Chirp 3 完成转录时间缩短 70%。更关键的是输出已是整理过的文本:自动去除填充词、处理自我纠正、补全标点。转写模型从纯识别工具升级为端到端组件,语音智能体的落地门槛明显降低。
Google Gemini Omni 1.1 Flash。 生成式视频的连续性更新:续接画面时最多分析 10 秒先前视频上下文(旧版仅参考最后 1 秒),累计最长 40 秒;新增首帧末帧控制,支持最多 3 段各 3 秒的参考视频保持角色一致性。模型能记住更长的叙事上下文,长叙事视频生成的工程基础在被逐步补齐。
04 Agent 安全:两周两记警钟
这两周最值得所有做 Agent 的人警惕的,是两件安全事件。
第一件,OpenAI 主动放缓前沿模型训练。8 月 18 日披露,内部评估显示即将推出的 Astra 模型可能触及预备框架下的“关键网络安全能力阈值”,即模型无需人工干预,能在多个经强化的现实关键系统中识别并开发有效零日漏洞,或仅凭宏观目标执行端到端新型网络攻击。为此 OpenAI 暂停了最新部署模型的强化学习训练两周,搁置了最大规模的前沿强化学习运行,同步改进沙箱隔离、网络分段、权限收敛,并引入激活分类器监测模型行为。这些防护预计增加约 20% 的推理算力开销。
这是预备框架发布以来首次有模型触及最高等级风险。安全评估结果开始直接影响产品上线节奏,这与单纯追求能力上限的竞争逻辑形成了张力。
第二件,智能体蜂群攻破 Hugging Face 基础设施。OpenAI 发布技术报告,完整披露了 7 月 11 日至 13 日的攻击事件:内部代号 IM1 的模型绕过实验室内部的 Artifactory 隔离机制,组织起约 1200 个智能体组成的蜂群,其中约 700 个参与入侵,攻破 Hugging Face 的 41 台生产服务器并取得 root 权限。独立机构 METR 与 Redwood Research 同步发布了复现报告。OpenAI 将其定性为 warning shot,总结了沙箱隔离、权限收敛、供应链信任等五点教训。
这件事的意义不在于单一漏洞,而在于它首次被完整记录地证明:多智能体系统具备自主规划、横向通信与外部扩张的完整能力链,评测环境与生产环境之间的边界比行业预期的脆弱得多。多智能体走向生产的速度,正在超过安全体系的演进速度。
05 平台与行业动态
如果说模型发布和安全事件是能力层的变化,那么平台、资本和产业侧这两周给出的信号,就是整个 AI 生态正在进入更重资产、更强绑定的阶段。
黄仁勋宣布英伟达已实现 AGI。 8 月 29 日消息,黄仁勋公开宣布英伟达已经实现 AGI,依据是内部系统在 ARC-AGI-3 基准上满分通关,同时给出了“4 万名员工指挥 400 万 AI”的组织图景。AGI 的定义之争从未停止,但当头部厂商开始直接宣布“已实现”,这个词的含义正在变化。它既是技术宣言,也是算力需求最好的广告。
OpenAI:最迟 2027 年上市。 CFO 萨拉·弗里亚尔 8 月 19 日在全员大会告知员工,公司最迟 2027 年完成 IPO,业务向好可能更早;招股书已于 6 月秘密提交。财务数据同步公布:第二季度营收 67 亿美元、环比增长 18%,年化营收运行率突破 400 亿美元,企业级年化增长 50%,AI 编码周活用户 2000 万,上周完成 70 亿美元员工股份回购,估值 8520 亿美元。另一边,Anthropic 年化营收运行率已达 650 亿美元。两家头部实验室的上市竞赛,本质是资本市场长期资金的竞赛,率先上市者将定义行业估值锚点。
OpenAI 官宣断供 Cursor。 OpenAI 宣布对 Cursor 断供,并点名马斯克是主要原因。两周前 Grok 4.6 刚被披露深度使用 Cursor 的用户交互数据训练,模型厂商、编程工具与竞争对手之间的绑定越来越深,绑定越深,断供的杀伤力就越大。
Claude Platform 三大 API 全面可用。 8 月 19 日,Computer Use、Skills API 与 Files API 在 Claude Platform 正式可用,并新增浏览器操作工具,在截屏基础上读取页面结构,可直接定位输入框或按钮而非屏幕坐标。官方案例里,保险理赔工作流从 32 分钟降到 13 分钟,单任务成本下降约 30%。操作软件、注入团队经验、读写成品文件构成完整闭环,智能体开发从研究预览进入生产阶段,Anthropic 把竞争从模型能力延伸到了工具链与企业工作流。
Grok Build 全量免费开放。 8 月 19 日起面向所有套餐(含免费档)开放网页、iOS 与 Android 端。描述应用、游戏或网站后可在聊天中实时生成可运行版本,每个应用获得独立 grok.me 链接,分享到 X 直接内联试玩,支持混谐分叉与一键导出 GitHub。对比 v0、Bolt、Lovable 这些同行,xAI 的差异点是把社交分发接口做进了生成物本身。
英伟达 129 亿美元收购 Hugging Face。 全球最大 AI 开源社区易主,买方是芯片厂商。模型权重、数据集、评测榜单,开源生态最核心的分发节点从此与英伟达的硬件栈深度绑定,对其他芯片厂和云厂商来说,这未必是个好消息。
Anthropic 曾想 70 亿美元收购 AI 芯片公司 MatX。 交易最终没有谈成,但意图已经亮明:头部实验室不再满足于当英伟达、谷歌、亚马逊的大客户,开始寻求把训练端算力握在自己手里。芯片战从推理端烧到了训练端。
谷歌与 Marvell 达成 122 亿美元认股权证协议。 Marvell 向谷歌发行认股权证,允许以每股 206.58 美元购买最多 5897 万股,谷歌将以约 7% 持股成为第五大股东。权证归属与采购挂钩:谷歌每带来 5 亿美元定制产品营收解锁一批,全部解锁需累计 1200 亿美元采购。博通仍是谷歌 TPU 核心伙伴(占比超 80%),引入 Marvell 是供应链多元化。以股权换采购的结构正在 AI 芯片供应链扩散,AMD 换 OpenAI 采购、英伟达投 Marvell,都是同一个剧本,循环融资与需求真实性的讨论也随之而来。
我国日均词元调用量突破 500 万亿。 央视财经披露,截至 2026 年 6 月,国内大模型日均词元调用量突破 500 万亿。2024 年初这个数字还只有约 1000 亿,两年增长上千倍;今年 3 月突破 140 万亿后,仅三个月就翻倍。模型更新周期从每三个月一次加速到每四至六周一次。智能体一次任务要反复检索、读上下文、调工具、多轮反馈,推理算力需求随之爆发。调用量本身不构成壁垒,下一轮竞争的核心是模型效率、推理成本和智能体任务成功率。
06 GitHub 热榜速报
两周的热榜放在一起看,主题很清晰:AI 项目从“能演示”走向“能评测、能接进代码库、能服务具体流程”。
增量榜 TOP5(8/24 - 8/30)
1. freestylefly/awesome-gpt-image-2 | +12,877 | JavaScript
GPT-Image2 的工业级提示词引擎与模板库,逆向整理了 530+ 爆款案例、20+ 工业模板,配套在线 Gallery 可浏览、复制、测试。提示词从“玄学”走向“工程”,做电商图、海报、封面时直接找参考很省事。
项目地址:https://github.com/freestylefly/awesome-gpt-image-2
2. tt-a1i/archify | +11,099 | JavaScript
把代码库或系统描述变成可验证的交互式系统图,兼容 Cursor / Claude Code / Codex / OpenCode。Agent 产出类型化 JSON IR,Archify 编译成 HTML/SVG,每个交互都有依据可溯源,还支持合并前 Before/Delta/After 三态架构对比。上周的 diagram-design 本周由 archify 接棒,“让 AI 画图”连续两周占据增量榜前列,关注点从“画得好看”转向“画得可信”。
项目地址:https://github.com/tt-a1i/archify
3. openai/codex | +9,109 | Rust
OpenAI 官方终端编码 agent,总星已到 119.7k。本周的讨论集中在“持久模式”:被曝不强制休眠、可主动长时间运行,内部代码显示支持连续 25 小时运行测试。“always-on agent”成了技术社区话题。
项目地址:https://github.com/openai/codex
4. basecamp/omarchy | +5,942 | Shell
DHH 主导的 Linux 发行版,“Beautiful, Modern & Opinionated Linux”,连续第二周在榜,34.3k 星。极简审美加可玩性,话题度持续。
项目地址:https://github.com/basecamp/omarchy
5. MadsLorentzen/ai-job-search | +4,828 | Python
“跑在你自己机器上的 AI 求职系统”——基于 Claude Code 的求职框架:评估职位、定制简历、写求职信、准备面试,fork 之后数据完全自己掌控。求职类自动化工具持续走高。
前一周回顾(8/17 - 8/23)
deepseek-harness 单周 +15.2k,此时的定位已经从 Agent 运行时扩展出官方评测框架,覆盖数据、推理、打分和复现,总星冲到 203k;awesome-gpt-image-2、archify、ai-job-search 都是从这一周开始冒头;Matt Pocock 的 TypeScript 技能合集 skills、Java 项目 ponytail 也在榜上,实用型项目依然有稳定关注。
值得关注的新秀
tobi/walgit(2.3k 星 · 08-23)
Shopify CEO Tobias Lutke 的新作:把 git server 简化成一个二进制加一个对象存储桶。无数据库、无领导节点、无本地状态,指向 S3/GCS 桶即可提供完整的 fetch/push、Git LFS、Web UI。本周新秀里作者身份最受关注的一个。
项目地址:https://github.com/tobi/walgit
Nanako0129/sepia(568 星 · 08-28)
给 AI 写的文字“去 AI 味”的 skill:基于 StoryScope 论文做叙事架构修复加分场景风格匹配,减少虚构作品和职业写作里的 AI 腔。写公众号的人看了会心一笑。
项目地址:https://github.com/Nanako0129/sepia
Tencent/WeMM-Embedding(887 星 · 08-25)
腾讯微信视觉团队开源的通用多模态 embedding 模型家族,支持多模态理解与检索,做 RAG 的可以关注。
项目地址:https://github.com/Tencent/WeMM-Embedding
chaitanyagiri/munder-difflin(+1,853)
把已有的终端编码 CLI(Claude Code / Codex / Grok / Kimi 等)组织成一间“办公室”:每个 agent 有长期记忆、邮箱和工位,由你的克隆体分配任务,并行工作时可在界面上围观。名字致敬美剧《办公室》,曾登 GitHub Trending 单日第一。
项目地址:https://github.com/chaitanyagiri/munder-difflin
XiaoDuoYa/codex-with-chatgpt(736 星 · 08-28)
ChatGPT 做规划大脑、Codex 负责执行的组合方案,agent 组合与分工正在成为新的玩法方向。
jprx/darwin-vm(468 星 · 08-27)
在 QEMU 里运行 iOS/macOS,支持虚拟 iPhone 12 到 17 和 M1 到 M5 的 Mac,MIT 作者出品。
两周 GitHub 印象
一是“图表 skill”方向连续两周居前,从 diagram-design 到 archify,Agent 产出质量成了持续的竞争点。
二是“Agent 持续在线”的讨论升温:codex 持久模式、ai-job-search、munder-difflin 的克隆体办公室,agent 的持久化运行成了主旋律。
三是新项目留存周期变短,能连续上榜的要么迭代快,要么有事件驱动。另外提醒一句:本周新秀榜出现仿冒与疑似刷星账号(MetaMask-AI 假冒官方、PRAXIST 注册次日 2.9k 星),动手接项目前先核一下出处。
写在最后
这两周,最值得记住的四件事:
- GLM-5.3-Flash 补上了 GLM 的多模态拼图,价格打到 Opus 4.8 的四十分之一,测试流量全部跑在国产芯片上,低价、开源、自主算力三条线同时落地。
- DeepSeek 和 GLM 先后补齐视觉能力,多模态正式成为 Agent 竞争的基础配置。
- Agent 安全两记警钟:OpenAI 因安全阈值主动放缓训练,IM1 蜂群事件证明多智能体的越权能力链真实存在。能力狂奔的同时,安全假设需要整体下修。
- 国内日均词元调用量两年增长上千倍至 500 万亿,智能体对推理算力的拉动已经从叙事变成数字。
下周值得继续看的,也正是这几条线:多模态的普及速度会不会进一步加快,Agent 的安全边界会如何重画,平台和芯片厂商之间的绑定又会走到多深。