华潮新闻网
科技

DeepSeek模型性能大跃升 两大优化方向藏在后训练环节

来源:华潮新闻网
DeepSeek模型性能大跃升 两大优化方向藏在后训练环节

昨天收到一位 AI 研究员的私信,她直言这是入行后最舒心的一个夏天。

DeepSeek-V4-Flash 正式版终于落地,性能表现压过了之前的 V4-Pro-Preview。

在基准测试中,它甚至能和 Claude Fable 5 并列一张成绩单。

那个总参数 284B、激活参数仅 13B 的“轻量版”模型,在多类任务上硬是追平了曾经高不可攀的 Opus 4.8。

更让人咋舌的是定价,Flash 版的便宜程度近乎离谱,两块大洋就能让它吐出 100 万 tokens。

她把手头所有项目都跑了一遍,开销还没过一杯奶茶钱。

昨日开发者群里,众人忽然停下手中工作,纷纷转发评测截图。

她说自己特别高兴,恍惚间有种身处人类黄金时代的错觉。

谁也没料到,DeepSeek 这次又憋了个大招,踩着 7 月的尾巴,发布了 DeepSeek V4 Flash 的正式版。

实话说,起初世超对这次更新并没太当回事……

毕竟只是个顶着 Flash 名头的模型迭代,主力 Pro 系列纹丝未动。

此前只更 Flash 不更 Pro 的大厂只有谷歌,早已沦为网友玩梗素材。

心想你这 Flash 再强,总不能超越自家 Pro 吧?

???

不是哥们,这 Flash 跑分怎么比 Pro 还猛?

这还是 Flash 吗?

不对,大模型不该这么玩。按套路,你应该先推个 Flash 说只是速度快,结果你直接让 Flash 追平自家 Pro,价格还只要 2 块钱 / 百万 token,偶尔还有缓存命中的一折优惠。我周末用了 1 个亿 token,才花了 5 块钱。

世超根据 V4 Flash 公布的跑分梳理了一番,发现其能力膨胀得厉害。

不仅胜过自家大哥 Pro,虽不及 Claude Opus5、GPT-5.6 Sol 和 Kimi K3 等顶级模型,但正式版 V4 Flash 与这几家的差距已微乎其微。

有网友将各家大模型的能力与价格汇总制表:

表中每个点代表一款模型,越靠左越便宜,越靠上性能越强。

一眼望去,市面上绝大多数模型位置尴尬。

性能不如 DeepSeek,价格却比 DeepSeek 贵。

那些性能优于 DeepSeek 的模型,处境也好不到哪去。

因为它们的售价实在太高。

各位可能没留意,上图横轴并非线性坐标,而是对数轴。

但我们花钱时可不是按对数算的。

于是世超动用久违的 PS 技术,将图表拉成线性坐标观察,真实比例如下……

换言之,论性能,Claude Fable 5、GPT-5.6 Sol 等相比 V4 Flash,提升约两成。

但这些模型的价格,则高出 V4 Flash 两个数量级。

夸张点说,DeepSeek 又一次重新定义了模型的斩杀线。

那么,DeepSeek 究竟如何做到?架构与参数未变,为何能力突增?

世超回溯 DeepSeek 论文及公开资料,锁定两个最大概率方向。

首要关键在后训练。

这也是官方承认预览版与正式版差距最大的环节。

给不太了解大模型的读者科普下,通常大模型训练分两阶段。

第一阶段叫预训练。

需向模型注入海量文本、代码及其他数据,使其习得回答问题的基础能力。

过程宛如培养高中生,语数外、物化生、政史地乃至音体美计算机,各领域知识都要摄入,以此夯实基础。

第二阶段后训练,则是锻炼真正解题干活的本事。

主要工作是刷题,通过反复练习提升应试能力,教会模型解决问题。

研究人员借助监督微调、强化学习及大量任务数据,让模型学会理解指令、拆解问题、调用工具,并按人类偏好输出答案。

同样预训练出的模型,经不同后训练刷题,表现可天差地别。

DeepSeek R1 论文曾提及,他们将 V3 引入 GRPO(群组相对策略优化)强化学习后,数学能力暴涨,AIME 2024 测试集正确率从 15.6% 飙升至 71%。

OpenAI 当年的 InstructGPT 亦然。

经监督微调与 RLHF 后,仅 13 亿参数的模型,在真人盲评中竟击败参数量大百倍的 GPT-3。

若预训练决定大脑有无相关知识,后训练则决定能否掌握提取知识的能力。

当然,仅靠后训练或许无法完全解释 V4 Flash 的惊人成绩。

细看 DeepSeek 发布说明,还有一处细节:

部分公布跑分并非模型裸跑所得。

而是启用了名为 DeepSeek Harness 的未发布工具。

Harness 一词近半年屡见不鲜,火爆的 Claude Code、Codex、OpenClaw 皆属此类,或称 Agent 工具。

日常刷到的 Workbuddy、Qoder、Trae 也归于此列。

如今,DeepSeek 推出自有 Agent 工具入场角逐。

此事比单纯更新模型更为关键。

在当下 Agent 时代,模型最终成效不只取决于自身智力,更依赖外挂工具链。

裸模如考场学生,遇复杂问题只能硬算。

Agent 则为模型装上搜索引擎,配置代码运行环境,管理项目上下文,检查结果,甚至出错可重来。

借外置工具为模型加持,实际做事能力大幅增强。

今年初,多伦多大学团队开展研究,将同一模型置于不同 Agent 工具中测试。

结果显示,同一模型在不同工具中表现迥异,完成概率最高相差数倍。

前有人言,当前 AI 发展如逐级攀登阶梯。

去年阶梯为思维链,借此让模型学会思考,拓展 AI 能力边界。

今年,AI 发展的核心阶梯转为 Agent。

此刻,DeepSeek 交出其对 Agent 的答案。

依托高质量后训练与 Agent 工具,原本负责轻量应用的 Flash,直接被推向全球旗舰模型身后。

说实话,看到这套超级强化后的 Super Pro Max 版 Flash,世超已心生期待。

既然主打下沉市场的小弟,凭出神入化的后训练与 DeepSeek Harness 工具,能与身娇肉贵的“太上皇”们掰手腕……

那若 DeepSeek 将这套版本答案套于更强的 V4 Pro 之上呢?

撰文:早起

编辑:江江 & 面线

美编:焕妍

图片、资料来源:

https://api-docs.deepseek.com/zh-cn/quick_start/pricing/

https://www.reuters.com/business/retail-consumer/deepseeks-new-ai-model-is-by-far-cheapest-well-known-models-run-research-firm-2026-08-03/

https://artificialanalysis.ai/leaderboards/models

https://artificialanalysis.ai/models

https://artificialanalysis.ai/methodology

https://artificialanalysis.ai/methodology/intelligence-benchmarking

https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash

https://arxiv.org/abs/2606.19348

https://api-docs.deepseek.com/zh-cn/news/news260424

https://www.deepseek.com/transparency/

https://arxiv.org/abs/2501.12948

https://arxiv.org/abs/2203.02155

https://arxiv.org/abs/2602.09540

https://swebenchmobile.com/

相关推荐