2026 年 8 月第二周 AI 行业周报:DeepSeek V4 Pro、GLM-5.3、MiniMax H3 与 Agent 基建集体提速

这一周的 AI 行业,很像所有战线一起加速了。模型继续卷上限,Agent 开始卷基建,视频生成开始真正落到个人创作者手里,而企业落地则越来越像一场围绕知识、记忆、执行和支付能力的系统工程。
如果只看热搜,这周像是“大模型又打了一架”;但如果把几条线索串起来看,会发现行业重心正在悄悄转移:
- 模型厂商继续把 Agent 和编程能力当作主战场
- 官方级 Agent 基础设施开始集中开源
- 视频生成从炫技走向低成本可交付
- 企业真正缺的,已经不是“再来一个模型”,而是把模型接进真实业务的完整方法论
下面按几个最值得看的方向展开。
01 DeepSeek V4 Pro 正式版上线
8 月 12 日深夜,DeepSeek V4 Pro 正式版在 App、网页端和 API 同步上线。没有发布会,没有预告,API 文档悄悄更新,老接口也直接切到了新模型。
这代最明显的提升在 Agent 能力和长程执行:
- HLE 得分 42.7,配合工具后提升到 60.0
- Terminal Bench 2.1 拿到 87.9
- DeepSWE 从预览版的 12.8 提升到 62.7
- CyberGym 83.3,超过 Claude Fable 5 的 83.1
社区对它的评价也很直接:已经接近“半步 Fable 5”。
规格上,DeepSeek V4 Pro 支持 1M 上下文窗口,并提供三档推理强度可调。价格方面,每百万输入 token 1.32 美元、输出 3.96 美元、缓存命中 0.44 美元。
不过需要一起看的,是 DeepSeek 同日调整了 API 定价结构,引入峰谷分时计费,8 月 17 日起部分价格上调,最高涨幅达到 1100%。即便如此,调整后的整体价格仍然明显低于海外同类模型。这个信号其实很清楚:国产模型正在从“只拼便宜”转向“开始证明自己有提价权”。
02 大模型神仙打架的一周
这一周几乎可以用“一天一个新旗舰”来形容。国内有 GLM-5.3、DeepSeek V4 Pro、Qwen3.8 权重,国外有 Grok 4.6 和 Gemini 3.7 Flash,大家都很默契地把重点押在 Agent 和编程能力上。
智谱 GLM-5.3:编程能力继续上探
8 月 14 日,智谱发布新一代基座模型 GLM-5.3。总参数 7430 亿,和 GLM-5.2 共用同一基座,主要提升来自后训练 Scaling。
官方给出的重点信息很密:
- 编程能力较前代提升约 50%
- Terminal Bench 3.0 和 Agents’ Last Exam(CLI)拿到开源第一
- DeepSWE v1.1 从 46.2 提升到 66.9
- CyberGym 漏洞推理评测达到 84.5%
更值得注意的是安全方向。发布前两周的安全测试中,团队借助这个模型发现了 2404 个潜在漏洞,其中 1088 个属于中高危。这说明新一代编程模型的价值,已经不只是“写代码更快”,而是开始进入审计、攻防、漏洞分析这些高门槛场景。
GLM 用户最关心的,还是多模态
相比跑分,社区对 GLM-5.3 更兴奋的一点,其实是它可能补上视觉能力。
原因也很现实。GLM-5.2 开源时已经是很强的纯文本模型,但面对图像、表格、截图这些真实工作流里非常常见的输入,短板一直存在。对比之下,Fable-5、Kimi K2.5、Qwen3.5-Omni、Gemini 3 等都已经在多模态上走得更远。
从目前曝光的信息看,GLM-5.3 的视觉能力大概率会落在三类:
- 图片识别与理解
- OCR 和复杂表格解析
- 视觉、代码和 Agent 执行链路打通
这是不是“真原生多模态”,社区还有争论。但无论如何,市场已经给出了判断:今天的顶级模型如果不能看图、不能理解截图、不能结合视觉执行任务,就很难说自己真正适合复杂工作流。
xAI Grok 4.6:长时智能体能力继续加码
8 月 12 日,xAI 发布 Grok 4.6,和 DeepSeek V4 Pro 几乎同日亮相。这代重点依然是长时运行的智能体能力:
- MoE 规模约 1.5T 参数
- 50 万 token 上下文
- 训练中使用了大量 Cursor 用户交互数据
Artificial Analysis Intelligence Index 综合九项基准得分 61,与 GPT-5.6 Sol 持平,仅次于 Fable 5 的 62。更有意思的是,它在长程任务上的成本控制表现很突出,达到同级能力时,token 消耗远低于高成本竞品。
Gemini 3.7 Flash:低价高频迭代成为常态
Google DeepMind 发布 Gemini 3.7 Flash,距离 3.6 Flash 仅仅三周。Flash 系列已经进入非常明显的月度迭代节奏。
这代主打编程和智能体任务,支持 1M 上下文以及低、中、高三档思考强度,价格只有 3.6 Flash 首发价的一半。跑分上也有明确提升:
- FrontierCode 1.1:34.4% -> 43.6%
- DeepSWE v1.1:49.0% -> 65.3%
- AutomationBench:17.0% -> 30.4%
谷歌这条路线很有代表性:旗舰不一定每次都先出,但轻量模型必须持续更快、更便宜、更能覆盖产品线。这是把模型能力真正商品化的打法。
阿里开源 Qwen3.8 系列:Max 级权重开始进入开源世界
阿里巴巴通义千问团队本周开源 Qwen3.8 系列,里面最受关注的是两条线:
- Qwen3.8-27B:原生多模态稠密模型,262K 原生上下文,经 YaRN 可扩展至 1M
- Qwen3.8-2.4T-A95B:总参数 2.4 万亿、激活 950 亿
后者的意义尤其大,因为这是千问第一次开放 Max 级别旗舰模型的权重,也是家族里首个突破万亿参数级别的开源模型。
它意味着什么?一句话概括:高水平开源模型,正在从“可以体验”进入“可以严肃部署”。千问同步开放手机、PC 和 AI 眼镜三类终端接入,也说明模型厂商已经不满足于只做 API,而是在往完整生态入口走。
03 MiniMax H3:把视频生成卷到个人创作者手里
如果说语言模型这周是神仙打架,那视频生成方向更像是 MiniMax H3 一家突然把门槛往下踹了一脚。
H3 在 7 月 31 日发布、8 月初开源后,本周热度继续快速发酵。几个关键信号放在一起看很有冲击力:
- Artificial Analysis 视频编辑榜全球第一
- Arena 图生视频榜全球第一
- Hugging Face 热度升到开源第一
- 开源 24 小时内,超过百家合作伙伴完成适配接入
它的核心价值不只是“视频质量高”,而是把音视频一体化做到了真正可用。
H3 是通用全模态模型,统一理解文本、图像、视频、音频,能直接生成包含画面、环境音、音效和配乐的完整音视频内容,支持 15 秒、2K、原生双声道输出。过去很多视频模型最大的问题不是画面不够好,而是要后期补音效、补节奏、补对白,链路太长。H3 直接缩短了整个创作闭环。
同时它还提供三种非常适合创作者的生成范式:
- T2VA:文生视频音频
- FL2VA:关键帧生成视频音频
- Ref2VA:基于参考视频和音频做人物保留、嘴型编辑、音色参考
对短视频、AI 漫剧、AI 真人短剧来说,后者尤其关键。人物不漂移、嘴型能对上、音色能保留,这些都直接决定了内容能不能达到“可发布”的程度。
更重要的是成本。H3 的 2K 生成价格大约只有主流 2K 模型的三分之一左右,这才是真正让个人创作者和中小团队愿意尝试的临界点。
04 DeepSeek Harness v0.1 开源:Agent 执行层开始官方化
8 月 13 日,DeepSeek 开源智能体框架 Harness v0.1,MIT 协议,口号非常简单:Everything is a Plugin。
它的定位不是“再造一个模型”,而是为 Agent 提供一层执行底座:工具、插件、记忆、子代理、沙箱、主循环、日志体系,都围绕“让模型真正开始干活”展开。
从工程视角看,Harness 代表了一个很大的变化:
- 模型层逐渐同质化
- 真正的差异化开始往运行时、工具链、记忆和工作流层迁移
这也是它为什么会爆得这么快。开源当天 28k 星,12 小时破 5 万,48 小时冲到 101.9k,直接进入 GitHub 史上增长最快的开源项目序列。
更夸张的是生态的跟进速度:桌面客户端、Web UI 插件集合、TUI、皮肤、教程,全都在两天内长出来了。你会发现,Agent 生态现在已经和过去的模型生态不一样了,社区不再只关心“这个模型强不强”,而是在追问“它接不接工具、能不能积累经验、是不是方便长期挂机”。
05 Forward Deployed Engineer:AI 时代重新变得重要的角色
这一周里,还有一条很容易被忽视、但我觉得特别重要的线索:Forward Deployed Engineer(FDE)正在 AI 时代重新变得关键。
这个角色最早是被 Palantir 带火的。工程师直接进驻客户现场,对接业务流程、改造数据链路、做定制开发、训练用户、持续迭代。它解决的是所有通用软件都会遇到的老问题:产品和真实业务之间,永远隔着最后一公里。
AI Agent 起来之后,这一公里不但没有消失,反而更宽了。
原因很简单:
- 通用模型谁都能买
- 企业内部流程、历史系统、权限体系、隐性经验,模型并不知道
- 真正费工夫的,是把这些业务知识灌给 Agent
这周 GitHub 热榜其实就是最好的侧面说明:
reverse-skill对应技能包定制TencentDB-Agent-Memory对应企业级记忆cloudflare/computer对应执行环境deepseek-harness对应标准化运行时
工具越来越齐,真正缺的是把这些工具装进具体企业场景的人。
所以 FDE 正在自然演化成新的角色组合:
- AI 解决方案架构师
- Agent 训练与优化工程师
- 知识工程师
- AI 安全工程师
说到底,模型能力越通用,落地越依赖具体场景。这个职业的回潮,本质上说明 AI 正在从“拼谁更聪明”走向“拼谁更能落地”。
06 英伟达调整算力融资布局
据《华尔街日报》报道,英伟达与 OpenAI 围绕美国俄亥俄州超大型数据中心园区的融资安排,正在重新调整条款。
最核心的变化是:英伟达原计划约 2500 亿美元的财务担保规模,被下调到不足 1200 亿美元,只覆盖一期约 5 吉瓦项目,剩余部分以后再谈。
与此同时,英伟达又联合阿波罗、黑石、贝莱德、布鲁克菲尔德、高盛和 KKR 等机构,设立算力融资平台,计划未来数年引入超过 5000 亿美元外部资本,为 AI 企业芯片采购提供融资。
把这两件事放一起看就很有意思:
- 单个超大项目上的直接担保在收缩
- 整体行业融资能力却在平台化扩张
这意味着英伟达正在把 AI 算力从“卖硬件”进一步推进到“把算力变成可融资资产”。当资本市场开始按资产类别理解 GPU 和数据中心,AI 基础设施就不再只是技术问题,而是金融工程问题。
07 本周 GitHub 热榜速报
这一周的 GitHub 热榜几乎可以当作一份 Agent 产业链地图来看。
本周爆火 Top 5
-
deepseek-ai/deepseek-harness
48 小时 101.9k 星,毫无悬念的头条。官方 Agent 运行时一开源,整套生态瞬间跟上。 -
PrimeIntellect-ai/prime-agent
本周增量王之一,主打递归语言模型、自改进与长期任务执行。 -
TencentCloud/TencentDB-Agent-Memory
连续两周强势上榜,说明企业级记忆体系是真需求,不是概念。 -
cloudflare/computer
给 Agent 一台完整的“电脑”,补的是执行环境这一块拼图。 -
guillaumemeyer/watermarks-remover
AI 内容溯源与反溯源的攻防,已经从论文话题进入工具化阶段。
这周值得继续盯的方向
reverse-skill:把编程助手变成逆向工程专家的技能包anydoc:文档解析仍然是 Agent 落地的高频刚需ai-agent-book:系统学习 Agent 原理的资料型项目继续升温h3.c:Redis 作者 antirez 用纯 C 写 MiniMax H3 推理引擎,老派工程师也在往 AI 基础设施里冲loopx:多 Agent 长任务状态管理,说明“如何让 Agent 稳定工作”开始成为独立赛道
我对这周 GitHub 的一个总体判断
本周最明显的变化不是某一个仓库突然爆火,而是 Agent 基建进入官方时代。
DeepSeek 在做运行时,腾讯在做记忆,Cloudflare 在做“身体”,各家都在补自己那一层。接下来一段时间,开源世界的竞争焦点很可能会从“谁的模型更强”逐步转向“谁的 Agent 工程底盘更完整”。
08 行业数据亮点
除了模型和开源项目,本周还有两条数据值得留意:
- 中国大模型调用量连续 15 周超过美国。这说明国内模型的商业化落地和调用规模,已经稳定进入全球领先节奏。
- 首个具身智能数据集质量标准获批,将于 2026 年 11 月 1 日实施。具身智能正在从“先堆数据量”走向“开始卷数据质量”。
这两条放在一起看,其实对应的是 AI 行业的两个成熟信号:一边是调用规模起来了,一边是标准体系开始补上了。
写在最后
如果只用几句话总结 8 月第二周,我会记住这四件事:
- 大模型的竞争重点,已经从“谁更会聊天”转向“谁更擅长 Agent 与编程执行”
- DeepSeek Harness 的爆发,说明 Agent 执行层开始拥有官方级开源基础设施
- MiniMax H3 把视频生成往真正的低成本生产工具又推了一步
- 行业真正的瓶颈,越来越落在知识、记忆、执行环境和业务落地这几层
下周值得继续看的,也正是这几条线:模型上限怎么卷,Agent 底盘怎么搭,企业又会最先在哪些真实场景里把这些能力用起来。