加载中...
3784 字
19 分钟
2026 年 8 月第二周 AI 行业周报:DeepSeek V4 Pro、GLM-5.3、MiniMax H3 与 Agent 基建集体提速

2026 年 8 月第二周 AI 行业周报:DeepSeek V4 Pro、GLM-5.3、MiniMax H3 与 Agent 基建集体提速#

2026 年 8 月第二周 AI 事件总结

这一周的 AI 行业,很像所有战线一起加速了。模型继续卷上限,Agent 开始卷基建,视频生成开始真正落到个人创作者手里,而企业落地则越来越像一场围绕知识、记忆、执行和支付能力的系统工程。

如果只看热搜,这周像是“大模型又打了一架”;但如果把几条线索串起来看,会发现行业重心正在悄悄转移:

  • 模型厂商继续把 Agent 和编程能力当作主战场
  • 官方级 Agent 基础设施开始集中开源
  • 视频生成从炫技走向低成本可交付
  • 企业真正缺的,已经不是“再来一个模型”,而是把模型接进真实业务的完整方法论

下面按几个最值得看的方向展开。

01 DeepSeek V4 Pro 正式版上线#

8 月 12 日深夜,DeepSeek V4 Pro 正式版在 App、网页端和 API 同步上线。没有发布会,没有预告,API 文档悄悄更新,老接口也直接切到了新模型。

这代最明显的提升在 Agent 能力和长程执行:

  • HLE 得分 42.7,配合工具后提升到 60.0
  • Terminal Bench 2.1 拿到 87.9
  • DeepSWE 从预览版的 12.8 提升到 62.7
  • CyberGym 83.3,超过 Claude Fable 5 的 83.1

社区对它的评价也很直接:已经接近“半步 Fable 5”。

规格上,DeepSeek V4 Pro 支持 1M 上下文窗口,并提供三档推理强度可调。价格方面,每百万输入 token 1.32 美元、输出 3.96 美元、缓存命中 0.44 美元。

不过需要一起看的,是 DeepSeek 同日调整了 API 定价结构,引入峰谷分时计费,8 月 17 日起部分价格上调,最高涨幅达到 1100%。即便如此,调整后的整体价格仍然明显低于海外同类模型。这个信号其实很清楚:国产模型正在从“只拼便宜”转向“开始证明自己有提价权”。

02 大模型神仙打架的一周#

2026 年 8 月第二周 AI 事件总结 这一周几乎可以用“一天一个新旗舰”来形容。国内有 GLM-5.3、DeepSeek V4 Pro、Qwen3.8 权重,国外有 Grok 4.6 和 Gemini 3.7 Flash,大家都很默契地把重点押在 Agent 和编程能力上。

智谱 GLM-5.3:编程能力继续上探#

8 月 14 日,智谱发布新一代基座模型 GLM-5.3。总参数 7430 亿,和 GLM-5.2 共用同一基座,主要提升来自后训练 Scaling。

官方给出的重点信息很密:

  • 编程能力较前代提升约 50%
  • Terminal Bench 3.0 和 Agents’ Last Exam(CLI)拿到开源第一
  • DeepSWE v1.1 从 46.2 提升到 66.9
  • CyberGym 漏洞推理评测达到 84.5%

更值得注意的是安全方向。发布前两周的安全测试中,团队借助这个模型发现了 2404 个潜在漏洞,其中 1088 个属于中高危。这说明新一代编程模型的价值,已经不只是“写代码更快”,而是开始进入审计、攻防、漏洞分析这些高门槛场景。

GLM 用户最关心的,还是多模态#

相比跑分,社区对 GLM-5.3 更兴奋的一点,其实是它可能补上视觉能力。

原因也很现实。GLM-5.2 开源时已经是很强的纯文本模型,但面对图像、表格、截图这些真实工作流里非常常见的输入,短板一直存在。对比之下,Fable-5、Kimi K2.5、Qwen3.5-Omni、Gemini 3 等都已经在多模态上走得更远。

从目前曝光的信息看,GLM-5.3 的视觉能力大概率会落在三类:

  • 图片识别与理解
  • OCR 和复杂表格解析
  • 视觉、代码和 Agent 执行链路打通

这是不是“真原生多模态”,社区还有争论。但无论如何,市场已经给出了判断:今天的顶级模型如果不能看图、不能理解截图、不能结合视觉执行任务,就很难说自己真正适合复杂工作流。

xAI Grok 4.6:长时智能体能力继续加码#

8 月 12 日,xAI 发布 Grok 4.6,和 DeepSeek V4 Pro 几乎同日亮相。这代重点依然是长时运行的智能体能力:

  • MoE 规模约 1.5T 参数
  • 50 万 token 上下文
  • 训练中使用了大量 Cursor 用户交互数据

Artificial Analysis Intelligence Index 综合九项基准得分 61,与 GPT-5.6 Sol 持平,仅次于 Fable 5 的 62。更有意思的是,它在长程任务上的成本控制表现很突出,达到同级能力时,token 消耗远低于高成本竞品。

Gemini 3.7 Flash:低价高频迭代成为常态#

Google DeepMind 发布 Gemini 3.7 Flash,距离 3.6 Flash 仅仅三周。Flash 系列已经进入非常明显的月度迭代节奏。

这代主打编程和智能体任务,支持 1M 上下文以及低、中、高三档思考强度,价格只有 3.6 Flash 首发价的一半。跑分上也有明确提升:

  • FrontierCode 1.1:34.4% -> 43.6%
  • DeepSWE v1.1:49.0% -> 65.3%
  • AutomationBench:17.0% -> 30.4%

谷歌这条路线很有代表性:旗舰不一定每次都先出,但轻量模型必须持续更快、更便宜、更能覆盖产品线。这是把模型能力真正商品化的打法。

阿里开源 Qwen3.8 系列:Max 级权重开始进入开源世界#

阿里巴巴通义千问团队本周开源 Qwen3.8 系列,里面最受关注的是两条线:

  • Qwen3.8-27B:原生多模态稠密模型,262K 原生上下文,经 YaRN 可扩展至 1M
  • Qwen3.8-2.4T-A95B:总参数 2.4 万亿、激活 950 亿

后者的意义尤其大,因为这是千问第一次开放 Max 级别旗舰模型的权重,也是家族里首个突破万亿参数级别的开源模型。

它意味着什么?一句话概括:高水平开源模型,正在从“可以体验”进入“可以严肃部署”。千问同步开放手机、PC 和 AI 眼镜三类终端接入,也说明模型厂商已经不满足于只做 API,而是在往完整生态入口走。

03 MiniMax H3:把视频生成卷到个人创作者手里#

如果说语言模型这周是神仙打架,那视频生成方向更像是 MiniMax H3 一家突然把门槛往下踹了一脚。

H3 在 7 月 31 日发布、8 月初开源后,本周热度继续快速发酵。几个关键信号放在一起看很有冲击力:

  • Artificial Analysis 视频编辑榜全球第一
  • Arena 图生视频榜全球第一
  • Hugging Face 热度升到开源第一
  • 开源 24 小时内,超过百家合作伙伴完成适配接入

它的核心价值不只是“视频质量高”,而是把音视频一体化做到了真正可用。

H3 是通用全模态模型,统一理解文本、图像、视频、音频,能直接生成包含画面、环境音、音效和配乐的完整音视频内容,支持 15 秒、2K、原生双声道输出。过去很多视频模型最大的问题不是画面不够好,而是要后期补音效、补节奏、补对白,链路太长。H3 直接缩短了整个创作闭环。

同时它还提供三种非常适合创作者的生成范式:

  • T2VA:文生视频音频
  • FL2VA:关键帧生成视频音频
  • Ref2VA:基于参考视频和音频做人物保留、嘴型编辑、音色参考

对短视频、AI 漫剧、AI 真人短剧来说,后者尤其关键。人物不漂移、嘴型能对上、音色能保留,这些都直接决定了内容能不能达到“可发布”的程度。

更重要的是成本。H3 的 2K 生成价格大约只有主流 2K 模型的三分之一左右,这才是真正让个人创作者和中小团队愿意尝试的临界点。

04 DeepSeek Harness v0.1 开源:Agent 执行层开始官方化#

8 月 13 日,DeepSeek 开源智能体框架 Harness v0.1,MIT 协议,口号非常简单:Everything is a Plugin

它的定位不是“再造一个模型”,而是为 Agent 提供一层执行底座:工具、插件、记忆、子代理、沙箱、主循环、日志体系,都围绕“让模型真正开始干活”展开。

从工程视角看,Harness 代表了一个很大的变化:

  • 模型层逐渐同质化
  • 真正的差异化开始往运行时、工具链、记忆和工作流层迁移

这也是它为什么会爆得这么快。开源当天 28k 星,12 小时破 5 万,48 小时冲到 101.9k,直接进入 GitHub 史上增长最快的开源项目序列。

更夸张的是生态的跟进速度:桌面客户端、Web UI 插件集合、TUI、皮肤、教程,全都在两天内长出来了。你会发现,Agent 生态现在已经和过去的模型生态不一样了,社区不再只关心“这个模型强不强”,而是在追问“它接不接工具、能不能积累经验、是不是方便长期挂机”。

05 Forward Deployed Engineer:AI 时代重新变得重要的角色#

这一周里,还有一条很容易被忽视、但我觉得特别重要的线索:Forward Deployed Engineer(FDE)正在 AI 时代重新变得关键。

这个角色最早是被 Palantir 带火的。工程师直接进驻客户现场,对接业务流程、改造数据链路、做定制开发、训练用户、持续迭代。它解决的是所有通用软件都会遇到的老问题:产品和真实业务之间,永远隔着最后一公里。

AI Agent 起来之后,这一公里不但没有消失,反而更宽了。

原因很简单:

  • 通用模型谁都能买
  • 企业内部流程、历史系统、权限体系、隐性经验,模型并不知道
  • 真正费工夫的,是把这些业务知识灌给 Agent

这周 GitHub 热榜其实就是最好的侧面说明:

  • reverse-skill 对应技能包定制
  • TencentDB-Agent-Memory 对应企业级记忆
  • cloudflare/computer 对应执行环境
  • deepseek-harness 对应标准化运行时

工具越来越齐,真正缺的是把这些工具装进具体企业场景的人。

所以 FDE 正在自然演化成新的角色组合:

  • AI 解决方案架构师
  • Agent 训练与优化工程师
  • 知识工程师
  • AI 安全工程师

说到底,模型能力越通用,落地越依赖具体场景。这个职业的回潮,本质上说明 AI 正在从“拼谁更聪明”走向“拼谁更能落地”。

06 英伟达调整算力融资布局#

据《华尔街日报》报道,英伟达与 OpenAI 围绕美国俄亥俄州超大型数据中心园区的融资安排,正在重新调整条款。

最核心的变化是:英伟达原计划约 2500 亿美元的财务担保规模,被下调到不足 1200 亿美元,只覆盖一期约 5 吉瓦项目,剩余部分以后再谈。

与此同时,英伟达又联合阿波罗、黑石、贝莱德、布鲁克菲尔德、高盛和 KKR 等机构,设立算力融资平台,计划未来数年引入超过 5000 亿美元外部资本,为 AI 企业芯片采购提供融资。

把这两件事放一起看就很有意思:

  • 单个超大项目上的直接担保在收缩
  • 整体行业融资能力却在平台化扩张

这意味着英伟达正在把 AI 算力从“卖硬件”进一步推进到“把算力变成可融资资产”。当资本市场开始按资产类别理解 GPU 和数据中心,AI 基础设施就不再只是技术问题,而是金融工程问题。

07 本周 GitHub 热榜速报#

2026 年 8 月第二周 AI 事件总结 这一周的 GitHub 热榜几乎可以当作一份 Agent 产业链地图来看。

本周爆火 Top 5#

  1. deepseek-ai/deepseek-harness
    48 小时 101.9k 星,毫无悬念的头条。官方 Agent 运行时一开源,整套生态瞬间跟上。

  2. PrimeIntellect-ai/prime-agent
    本周增量王之一,主打递归语言模型、自改进与长期任务执行。

  3. TencentCloud/TencentDB-Agent-Memory
    连续两周强势上榜,说明企业级记忆体系是真需求,不是概念。

  4. cloudflare/computer
    给 Agent 一台完整的“电脑”,补的是执行环境这一块拼图。

  5. guillaumemeyer/watermarks-remover
    AI 内容溯源与反溯源的攻防,已经从论文话题进入工具化阶段。

这周值得继续盯的方向#

  • reverse-skill:把编程助手变成逆向工程专家的技能包
  • anydoc:文档解析仍然是 Agent 落地的高频刚需
  • ai-agent-book:系统学习 Agent 原理的资料型项目继续升温
  • h3.c:Redis 作者 antirez 用纯 C 写 MiniMax H3 推理引擎,老派工程师也在往 AI 基础设施里冲
  • loopx:多 Agent 长任务状态管理,说明“如何让 Agent 稳定工作”开始成为独立赛道

我对这周 GitHub 的一个总体判断#

本周最明显的变化不是某一个仓库突然爆火,而是 Agent 基建进入官方时代

DeepSeek 在做运行时,腾讯在做记忆,Cloudflare 在做“身体”,各家都在补自己那一层。接下来一段时间,开源世界的竞争焦点很可能会从“谁的模型更强”逐步转向“谁的 Agent 工程底盘更完整”。

08 行业数据亮点#

除了模型和开源项目,本周还有两条数据值得留意:

  • 中国大模型调用量连续 15 周超过美国。这说明国内模型的商业化落地和调用规模,已经稳定进入全球领先节奏。
  • 首个具身智能数据集质量标准获批,将于 2026 年 11 月 1 日实施。具身智能正在从“先堆数据量”走向“开始卷数据质量”。

这两条放在一起看,其实对应的是 AI 行业的两个成熟信号:一边是调用规模起来了,一边是标准体系开始补上了。

写在最后#

如果只用几句话总结 8 月第二周,我会记住这四件事:

  1. 大模型的竞争重点,已经从“谁更会聊天”转向“谁更擅长 Agent 与编程执行”
  2. DeepSeek Harness 的爆发,说明 Agent 执行层开始拥有官方级开源基础设施
  3. MiniMax H3 把视频生成往真正的低成本生产工具又推了一步
  4. 行业真正的瓶颈,越来越落在知识、记忆、执行环境和业务落地这几层

下周值得继续看的,也正是这几条线:模型上限怎么卷,Agent 底盘怎么搭,企业又会最先在哪些真实场景里把这些能力用起来。

2026 年 8 月第二周 AI 行业周报:DeepSeek V4 Pro、GLM-5.3、MiniMax H3 与 Agent 基建集体提速
https://blog.hoppinzq.com/posts/ai-weekly-events-2026-second-week-of-august/
作者
HOPPINZQ
发布于
2026-08-15
许可协议
CC BY-NC-SA 4.0

AI助手

有问题随时问我

你好!我是HOPPINAI助手,有什么可以帮助你的吗?

你可能想:

刚刚

按 Enter 发送,Shift+Enter 换行

在线