一位搞 AI 的研究员给我发了条消息,说这是她入行后碰到的最爽的一个夏天。
DeepSeek-V4-Flash 正式版总算落地了,性能直接盖过了之前的 V4-Pro-Preview。
基准测试的成绩单拉出来,甚至能跟 Claude Fable 5 放在同一张表里过过招。
一个总参数 284B、激活参数仅 13B 的“轻量版”模型,在好几项任务上,硬是把那个曾经让人仰望的 Opus 4.8 给追平了。
更让人倒吸一口凉气的是价格。Flash 版便宜得有点不讲道理,两块大洋就能让它吐出 100 万 tokens。她把手里所有的项目都跑了一遍优化,最后算下来,还没花掉一杯奶茶钱。
昨天在开发者群里,气氛突然就变了。大家伙儿全把手里的活儿停下了,开始疯狂转发评测截图。她说自己心里特别美,甚至产生了一种身处人类黄金时代的错觉。
谁能想到,DeepSeek 这次又憋了个大招。卡着 7 月的尾巴,把 DeepSeek V4 Flash 的正式版给端了上来。
说实话,刚开始世超对这次更新真没太当回事……
毕竟挂了个 Flash 的名头,主力军 Pro 系列连动都没动一下。
回想上一次只更 Flash 不更 Pro 的大厂是谷歌,后来大家都拿这事儿玩梗。
心想你这 Flash 再怎么折腾,能力总不能越过自家的 Pro 吧……
?
??
不是哥们,你这 Flash 模型的跑分,怎么比 Pro 还猛???
这还是 Flash 吗?
不对啊,DeepSeek,大模型不是这么玩的。按理说你该先发个 Flash,谦虚地说自己只是速度快点,结果你直接把 Flash 追到了自家 Pro 的水平,价格还定在 2 块钱 / 百万 token,偶尔还有打一折的缓存命中优惠。我周末跑了 1 个亿 token,兜里才少了 5 块钱。
世超根据这次 V4 Flash 亮出的跑分捋了捋,发现这模型的能力简直夸张到了极点。
不仅把自己家大哥 Pro 给压下去了,虽然比起 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 这些顶级选手还差口气,但正式版的 V4 Flash,基本上也就跟这几家在一个档次了。
有网友把各家大模型的性能和价格汇总了一张表:
表上的每个点代表一个大模型。越靠左,说明越便宜;越靠上,说明性能越强。
这么一看,市面上绝大多数模型的位置就显得挺尴尬。
性能没 DeepSeek 强就算了,价格还比它贵。
而那些性能确实比 DeepSeek 强的模型,日子也没好过到哪去。
因为它们的定价实在太高了。
各位可能没留意,上面那张图的横轴不是线性坐标轴,而是对数轴。
但我们花钱的时候可不是按这个逻辑算的。
于是世超稍微秀了一下久未施展的 PS 技术,把这图拉成线性坐标轴一看,真实的比例是这样的……
也就是说,论性能,Claude Fable 5、GPT-5.6 Sol 这些模型比起 V4 Flash,提升大概也就两成左右。
但这些模型的价格,却比 V4 Flash 多了两个零。
说得直白点,DeepSeek 又一次重新定义了模型的“斩杀线”。
那么问题来了,DeepSeek 这次是怎么做到的?明明架构和参数没啥大变动,为啥一个模型的能力会有如此巨大的跃升?
世超回头翻了翻 DeepSeek 的论文和公开资料,找到了两个概率最大的方向。
首先最关键的一点,就是后训练。
这也是官方承认的,预览版和正式版差距最大的地方。
这里给不太了解大模型的朋友科普一下,通常我们会把大模型的训练分成两个阶段。
第一阶段叫预训练。
在这个阶段,我们需要给模型灌入海量的文本、代码和其他数据,让它在基本能力上学会如何回答问题。
这个过程有点像培养高中生,语数外、物化生、政史地,甚至是音乐美术体育计算机,各种领域的知识都得往里面塞,通过这种方式夯实基础。
而第二阶段的后训练,才是真正锻炼干活解题的能力。
这块主要的工作就是刷题,让模型通过反复练习,提高应试教育般的能力,学会如何解决具体问题。
研究人员会通过监督微调、强化学习和大量任务数据,教会模型理解指令、拆解问题、使用工具,以及按照人类偏好的方式输出答案。
同样是预训练出来的模型,经过不同的后训练刷题套路,表现很容易天差地别。
之前 DeepSeek R1 的论文里就提过,他们把 V3 拿过来做了 GRPO(群组相对策略优化)强化学习后,模型的数学能力暴涨,在 AIME 2024 测试集上的正确率直接从开始的 15.6% 飙升到了 71%。
OpenAI 当年的 InstructGPT 也是这个路子。
经过监督微调和 RLHF 之后,一个只有 13 亿参数的模型,在真人盲评里,居然能打赢参数量大了 100 多倍的 GPT-3。
如果说预训练决定了模型大脑里有没有相关知识,那么后训练就是决定模型有没有掌握把这些知识调动出来的本事。
当然,光靠后训练,或许还不能完全解释这次 V4 Flash 为何如此惊艳。
仔细看 DeepSeek 的发布说明,还能发现另一件事:
那些公开的跑分,DeepSeek 并不是让模型裸跑得出来的。
而是用上了一个叫 DeepSeek Harness 的未发布工具。
Harness 这个词大家这半年听得不少,现在火得一塌糊涂的 Claude Code、Codex、OpenClaw,其实都可以算作 Harness,或者说是一种 Agent 工具。
就连现在大伙经常刷到的 Workbuddy、Qoder、Trae,也都能归到这一类。
而现在,DeepSeek 也要推出自己的 Agent 工具,准备下场卷了。
这件事,可能比单纯更新一个模型还要关键得多。
因为在现在的 Agent 时代,一个模型最后能干出什么成绩,不只取决于它本身有多聪明,还取决于外面给它套了一套什么样的工具。
一个裸模型就像坐在考场里的学生,遇到复杂问题只能靠脑子硬算。
但 Agent 会给模型装上搜索引擎,配上代码运行环境,帮它管理好项目上下文,检查结果,甚至跑错了还能直接重来。
通过这些外置工具给模型加 Buff,AI 实际做事的能力能得到极大的增强。
今年年初,多伦多大学的一个团队做过研究,把同一个大模型放进不同的 Agent 工具里测试。
结果发现,同一个模型在不同工具里的表现完全不同,完成问题的概率最高能差出好几倍。
前不久有人说过,现在 AI 的发展就像一级级往上爬的阶梯。
去年的阶梯是思维链,通过它让模型学会自己思考,从而拓展 AI 的能力边界。
而今年,AI 发展最重要的阶梯就是 Agent。
如今,DeepSeek 也交出了自己对 Agent 的答案。
靠着高质量的后训练和 Agent 工具,原本负责轻量应用的 Flash,直接被拉到了全球旗舰模型的身后。
说实话,看到世超眼前这个超级强化后的 Super Pro Max 版本的 Flash 模型,已经开始期待起来了。
既然一个用来打下沉市场的小弟,都能靠着出神入化的后训练和 DeepSeek Harness 工具,跟 GPT-5.6 Sol、Claude Fable 5 这些身娇肉贵的“太上皇”们掰掰手腕……
那要是等 DeepSeek 把这套版本答案,套在更强的 V4 Pro 上呢?
撰文:早起
编辑:江江 & 面线
美编:焕妍
图片、资料来源:
https://api-docs.deepseek.com/zh-cn/quick_start/pricing/
https://www.reuters.com/business/retail-consumer/deepseeks-new-ai-model-is-by-far-cheapest-well-known-models-run-research-firm-2026-08-03/
https://artificialanalysis.ai/leaderboards/models
https://artificialanalysis.ai/models
https://artificialanalysis.ai/methodology
https://artificialanalysis.ai/methodology/intelligence-benchmarking
https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash
https://arxiv.org/abs/2606.19348
https://api-docs.deepseek.com/zh-cn/news/news260424
https://www.deepseek.com/transparency/
https://arxiv.org/abs/2501.12948
https://arxiv.org/abs/2203.02155
https://arxiv.org/abs/2602.09540
https://swebenchmobile.com/
















