2026 年 9 月第三周 AI 行业周报:Jev 用「闭嘴」征服 14 万开发者,Qwen3.8-Omni-Flash 拆掉音视频成本门槛,OpenAI 内部 Codex 软件工厂曝光

这周最有意思的故事不是哪个旗舰又涨了几分,而是一个「不会说话的模型」火了——发布三天被 Vercel、Cloudflare、LangChain 集成,36 小时涌进 14 万开发者。它叫 Jev。
这周的几条主线:
- 「System One」范式登场:不做聊天超人,只做毫秒级、零幻觉、可校准的判断
- 国产双发各取一个极限:全模态价格砍到地板,长任务连续跑满 24 小时
- 实时语音与实时视频同时跨过产品化临界点
- OpenAI 内部流水线曝光,代码产出不再受人力限制后,瓶颈转移到审查与组织
下面按几个最值得看的方向展开。
01 Jev:把嘴缝上,只留判断

9 月 15 日,ChatGPT 核心发明人之一、InstructGPT 论文第四作者 Diogo Almeida 带着新创业公司 TypeSafe AI 的首个模型 Jev 出现在公众视野,随后连发长投向行业开炮:当年那条路走偏了。
他的论点很尖锐。RLHF 让模型学会了取悦人类,却也让它们在无人值守的自动化场景里极不可靠——这套机制从第一天起就是为「辅助」设计的,模型干的每件事最后都得有人看一眼。更致命的是「你优化什么,就会得到什么」,而字符串恰恰是世界上最难优化的东西:为了让长文本不跑偏,训练时就得把模型调得过度自信,所以当大模型说「这事我有八成把握」时,这八成全是水分。
Jev 的解法是把嘴缝上。它不生成任何文字,输入一段混乱状态(一封暴怒的客诉邮件、一段卡壳的代码),输出一个类型化决策附精确概率。三种交互:Choice(从给定选项挑一个)、Score(打分)、Noul(输出 0 到 1 的概率值),每个答案带完整的概率分布和整体置信度。因为只给划定好的选项分配概率,它想编也编不出来——零幻觉。
速度和成本是降维打击。所有输出并行采样、一次给完,做一次判断端到端只要 70 到 500 毫秒,同样的活儿交给前沿大模型要 3 到 329 秒;输出 token 免费,输入每百万 token 只收 0.042 美元——对比 Astra 和 Fable 5.1 每百万 50 美元的输出定价。支撑这一切的是新训练法 RLCD(校准决策强化学习):RLHF 奖励「人类看了很爽」,RLCD 奖励「你给的概率必须和实际命中率咬合」——模型说 0.9,就必须九成的时候是对的。
用例已经冒出来几百个:有人给 Mac 做了个语音助手,话没落音 App 已经秒开;有人拿它审 PR,一次七万分之一美元,1000 个 PR 才 7 美分,同样的活儿交给 Opus 5 得烧 14.5 美元。连谷歌都坐不住了,Gemma 官方账号发了「DiffusionGemma as Jev」,把自家扩散模型塞进这个范式。WSJ 的报道说它引发了抄袭者和「LLM 替代品」的大讨论,TechCrunch 的标题则是「开发者为之兴奋」。
当然要泼点冷水:Jev 的数学推理顶多 GPT-4 水平,目前不支持图像输入,在一个围绕文字生成找用例的时代主动放弃文字输出,是一场巨大的冒险。名字里的野心倒是清楚——Jevons 悖论:蒸汽机效率越高,烧掉的煤反而越多。Almeida 押注的是当 AI 决策便宜到几毫秒、几分钱时,代码里会长出成千上万个微小的「神经网络突触」。模型和大模型的关系不是替代而是双核搭档:大模型在前面干活,Jev 在旁边花几十毫秒用概率打分,能过就放行,不能过打回重写。
02 国产双发:全模态降价与长任务的极限

阿里 Qwen3.8-Omni-Flash:把音视频智能体的成本门槛拆了
阿里 Qwen 团队发布原生全模态模型 Qwen3.8-Omni-Flash:文本、图像、音频、视频输入,1M 上下文,已上线千问平台与百炼。官方约 30 项评测平均分较上代提升超 26%,智能体方向 WildClawBench-MM 提高 36.5 分,官方称音视频能力接近 Gemini 3.8 Flash、音频整体超过后者。
长视频理解改用了主动取证:不再逐帧处理全部内容,而是从问题出发自主决定看什么、听什么,多轮由粗到细定位——OmniVideoBench 准确率从 63.4 提到 67.8,token 消耗反降 45.7%。模型还被用于优化模型自身:12 小时内自主完成 4 轮实验、构建 3413 条训练数据,把 Qwen2.5-Omni-3B 的四川话识别错误率从 25.79% 降到 15.30%。
价格才是重锤:输入不再区分文本、图像、音频、视频,全模态同价,每小时音频输入价格下降超 98%,音视频输入下降超 93%。同步开源 Qwen-MM-Plugins(长视频记忆、视频剪辑、Video2Note)与 Qwen-Live Harness(实时全模态交互)。音频输入价格降两个数量级,实际拆掉的是实时音视频智能体最硬的成本门槛。
阶跃星辰 Step 5 Preview:24 小时不间断干活
阶跃星辰发布旗舰基座 Step 5 Preview:稀疏 MoE,600B 总参数、激活 27B,1M 上下文,全量开放 API,权重定于 10 月 15 日开源。AA 智能指数 44 分,与 Kimi K3 Max 持平,全球开源前三,单任务成本为 Claude Opus 5 的八分之一。
重点展示的是长程稳定性:连续 24 小时的 GPU Kernel 优化任务中,模型自主改代码、跑测试、比对结果并迭代,约 22 小时后把 MLA 内核峰值性能提升到 508 TFLOPS,超过 Claude Opus 5 的 493;另一项 24 小时实验里自行设计训练数据,把 Qwen3-30B-A3B 的 AIME24 准确率从 53.3% 提到 60%。当单任务成本下降一个量级,Agent 可承接的任务边界随之扩张——10 月的权重开放,会是这套叙事能否被第三方复现的关键窗口。
03 实时语音与实时视频

Google 发布 Gemini 3.8 Live 与 Live Extended Thinking。 Extended Thinking 在 AA 的 Speech to Speech Quality Index 上以 82.6 分排名第一,τ-Voice 任务完成率 68.6%。交互设计很聪明:先用「让我确认一下」这类过渡语接住用户,再在后台执行多步推理与工具调用并播报进度;标准版则把后台工具执行与语音对话并行。支持 97 种语言自动切换,音频输出全部带 SynthID 水印。但银行场景基准 35.1% 的完成率提示:语音的自然度已接近饱和,真正的短板在复杂多步任务。
生数科技发布 Vidu S2。 距上一代仅 69 天,含 S2-Avatar(实时数字人:720P、25-42 FPS、语音交互、动态参考——互动中可随时上传新参考图换装换背景,还能记住动作状态,「拿起杯子,然后微笑」时杯子还在手里)和 S2-Editing(输入视频流实时编辑:换风格、服装、人物、背景,帧对齐注意力保住姿态与镜头轨迹)。视频的基本单位正在从一段完成的内容,变成一个持续运行的过程。
04 平台与生态

腾讯混元 Hy4 preview 上线硅基流动。 770B-A49B、1M 上下文、Apache 2.0,权重超 1TB,托管渠道让开发者免于八卡起配的自建门槛。深度适配 Claude Code、OpenCode,兼容 OpenAI Chat Completions、Responses 和 Anthropic Messages 三种协议——改三处配置就能让国产模型顶到原有位置。定价每百万输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。横向对比很残酷:同榜单 DeepSeek-V4.1-Flash 排名更靠前,每任务中位成本 0.07 美元、比 Hy4 低 68%,成绩差距不到 0.1 个百分点。开源模型之间的差距正在被成本而不是分数定义。
苹果发布新一代 Apple Intelligence。 随 iOS 27 等新系统推送,重构版 Siri AI 以英语测试版开放:个人语境理解、屏幕感知、系统级应用操作,能检索短信、邮件、照片,跨 iPhone、Mac、iPad、Watch 与 Vision Pro 接续对话。继续走小模型路线——设备端自研小模型加 Private Cloud Compute。这是苹果两年前宣布 AI 版 Siri 后第一次把功能交到用户手里,测试版与等候名单说明完成度仍有保留。真正的变量在入口位置:系统级助手能直接访问用户已有的上下文,这一优势是云端产品难以复制的。
05 OpenAI 内部的 Codex 软件工厂

Gergely Orosz 实地探访 OpenAI 总部,访谈七位工程师与工程负责人,记录了这家公司围绕自研编程智能体组织的工作流水线。
数字先看:Codex 贡献了平均员工 85% 以上的输出 token,工程师这个比例是 99%;财务、招聘、法务等非工程部门在约四个月内从接近零使用率升到 90%,期间没有任何强制要求;内部使用量 4 到 5 月从 60% 跳到 90%,工程负责人把这一跳归因于智能体处理长任务能力的改善——员工开始在单个会话里连续工作数天。
流水线逐段看:人类定义预期成果,工程师的角色更接近产品经理;Codex 收集上下文——公司把所有文档移入源代码以便智能体访问,新入职工程师被建议直接向 Codex 提问,因为它掌握的上下文比任何个人都多;实现完成后由智能体自行验证,CI 智能体盯着 PR 直到绿灯;性能测试框架把有风险的 PR 送进合成 A/B 测试;代码审查由多个领域专精的智能体承担,低风险 PR 进自动批准通道,高风险路径叠加更多 AI 审查与强制人工审查。
代价是基础设施压力:每名工程师的 PR 数量曲棍球杆式增长,部分系统六个月内负载增加约十倍——过去这通常需要两三年。把经验直接外推需要打折:员工拥有几乎无限的 token 预算、深度内部集成和专门改进智能体框架的团队。但有一点具备普遍性:当代码产出速度不再受人力限制,瓶颈就转移到人的注意力、审查系统与组织控制上——现有的 PR 与代码审查流程,是为人类撰写变更的速度设计的。
06 Anthropic 上市进程

Anthropic 已向部分股东表示,本季度调整后营业收入将连续第二个季度为正;第二季度营收同比增长 14 倍至 115 亿美元,7 月底年化营收 650 亿美元,高于去年年底的 90 亿。多位知情人士确认已选定纳斯达克,发行估值可能达到 2 万亿美元或更高,分析师预计其年底年化营收约 1200 亿美元。
盈利口径需要留意:毛利率超 80%,但未计入向亚马逊等分发伙伴的营收分成,也未计入模型训练成本。上市时点恰在行业对开发节奏争论最激烈的阶段——Dario Amodei 公开呼吁放缓前沿模型能力提升,Altman 与马斯克表态支持,而 OpenAI 表示 2026 年内不上市。两家头部公司对是否上市的不同答案,反映的是对增长曲线可持续性的不同判断。
07 GitHub 热榜速报

本周主题:AI 工具往真实流程里走——架构图、本地模型和小模型训练都火了。
1. archify | +19.5k
代码库或系统说明生成可验证架构图,连续第二周增量第一,适合架构梳理和变更评审。
2. OpenMAIC | +10.1k
清华开源多 Agent 互动课堂,把多个教学角色放进同一场景,适合教育产品和课程 Demo。
3. magnitude | +1,396
本地模型推理服务器:检测硬件、推荐模型并运行,能接 Codex、Claude Code、Cline。
4. minimind | +3,649
从零训练 64M 参数小语言模型,把 LLM 训练缩到普通学习者能动手的尺度。
5. timesfm | +2,968
Google Research 的时间序列预测基础模型,TimesFM 3.0 已放出。
6. openclaude | +1,839
开源终端编码 Agent CLI,兼容云端和本地模型,支持工具、Agent、MCP、斜杠命令。
7. microduck_rl | +1,247
Microduck 双足机器人的强化学习环境:MuJoCo Warp、PPO、ONNX 导出和 sim2real 经验——上周那只 399 美元机器鸭的软件栈正在长出社区生态。
本周的判断:优先看 archify、magnitude 和 minimind,分别对应架构表达、本地 Agent 和小模型训练。
写在最后
这周,最值得记住的四件事:
- Jev 把「智能」的定义往回拉了一步——不做聊天超人,只做毫秒级、零幻觉、便宜到不值得计费的判断,36 小时 14 万开发者用脚投了票。
- 国产双发各取一个极限:Qwen3.8-Omni-Flash 把音频输入价格砍掉 98%,阶跃 Step 5 用 Opus 八分之一的成本连续干满 24 小时。
- OpenAI 内部流水线曝光:工程师 99% 的输出 token 来自 Codex,代码产出不再受人力限制后,瓶颈转移到审查与组织控制。
- Anthropic 选定纳斯达克、估值上看 2 万亿美元,头部实验室的竞争正式推进到公开资本市场。
下周值得继续看的:Jev 会不会真的长出一个「System One」生态,以及编码智能体的价格战会不会像这周的价格信号暗示的那样全面开打。