Early Tests Suggest DeepSeek V4 Flash Can Beat Pro in Some Tasks, but Results Conflict
Third-party testing of DeepSeek V4 Pro, Pro Max, and V4 Flash suggests that the cheaper Flash model may match or outperform Pro on selected coding, agent, and latency tasks. Other reports still favor Pro for difficult reasoning and engineering work.
A hands-on video centered on DeepSeek-V4-Pro-0813 compares multiple reasoning settings, Pro Max, V4 Flash, and execution through the DeepSeek Harness. Its key questions include whether maximum reasoning can reduce answer quality and whether Flash can outperform the more expensive Pro in practical workloads.
The available evidence does not point to a single winner. Some reports say Flash won several real-world tasks while delivering substantially better cost and speed efficiency. Other reviews continue to position Pro as the stronger option for complex coding, long-context work, and demanding reasoning. The tests use different prompts, workloads, harnesses, and model variants, making direct comparisons unreliable.
Several benchmark figures also lack clear official confirmation, and the candidate video description is incomplete. The most defensible interpretation is that the V4 family may have a strong workload split: Flash for inexpensive, high-volume tasks and Pro for more demanding use cases. Claims that Pro is broadly misaligned or that Flash is universally superior remain unverified.
Source evidence
DeepSeek V4-Pro Review: GA, Pricing & Benchmarkscodersera.com · supportingIndependent numbers on the GA checkpoint (August 2026). The 80.6% below is DeepSeek-reported on the preview. On Vals' neutral harness, V4-Pro-0813 places 2nd on SWE-bench Verified at 96.40% (±0.83) — behind only Claude Opus 5 (97.00%) and ahead of GPT-5.6 Sol (96.20%) and Grok 4.6 (95.60%) — at $0.022 per test against Grok's $0.785 and Opus 5's $1.29. The verdict splits sharply elsewhere. On Terminal-Bench, DeepSeek claims 87.9% on its own unreleased harness; under the reference Terminus 2 harness V4-Pro scores 54.68%, a 33-point gap, and lands 12 points below its cheaper sibling V4-Flash (67.04%). Every lab loses 7–13 points moving to Terminus 2, so Pro's drop is a categorical outlier rather than normal harness variance. And on AA-Omniscience — which measures whether a model knows what [...] AA-Omniscience — which measures whether a model knows what it does not know — V4-Pro-0813 scores 0.83 against Claude Opus 5's 37.07, near the hallucination floor. Read V4-Pro as a coding-benchmark
DeepSeek V4 Pro 发力了,高强度全面测试!DeepSeek V4 Pro “发力了”,2.5折,这个价格就 - 掘金juejin.cn · supportingTitle: DeepSeek V4 Pro 发力了,高强度全面测试!DeepSeek V4 Pro “发力了”,2.5折,这个价格就 - 掘金 # DeepSeek V4 Pro 发力了,高强度全面测试!. DeepSeek V4 Pro “发力了”,2.5折,这个价格就很香了。. 昨天(前天了),DeepSeek V4 真的发布了。. ## 1、问答测试. 而且会和另外几个国内主流模型做一个简单的对比。比如 GLM5.1、Kimi K2.6、Doubao。. 分别是MimMax家最强模型M2.7,智谱家的最强模型GLM5.1 ,Kimi家的最强模型K2.6,以及火山的豆包编码模型。. ### 数字母. 没想到啊,这个时候,还有人数不清字母 e 的数量!. ### 比大小. 11.9 和 11.12 哪个数字大?. 5 个 AI,有三个认为是 11.9 比较大,有两个认为是 11.12 比较大。. GLM5.1说的就是你了:**因为 11.12 < 11.90,所以 11.12 更大,你是在说什么胡话?**. 测试首字最慢的是MiniMax M2.7,总耗时最长的是GLM5.1。Tokens 最多是DS。. ### 找正整数. ### 竹竿过门. 6 米长的竹竿能否通过 4 米高、3 米宽的门?. 从这次抽卡的结果来看只有GLM和Kimi错了,其他人都是对的。其实 MiniMax 和豆包也是猜的。. DS这次首字居然最快,GLM最慢,但是整体耗时 DeepSeek 就比较久了,MiniMax最久。DeepSeek的Tokens消耗最多。. ### 帽子逻辑推理. 有 5 个人排成一排,每人帽子颜色为红或蓝。他们可以看到前面的人的帽子,但看不到自己的。主持人宣布:"至少有一顶红帽子。"从最后一人开始,每人依次说"是"或"否"(表示是否知道自己帽子的颜色)。如果第 5 人说"否",第 4 人说"是",求所有可能的帽子颜色分布。. MiniMax 日常截断,其他全部正常。这个题目一般都是能答对的,就是需要消耗不少算力。. 这次DS的首字又是最快,GLM最慢,总耗时是火山最快,MiniMax最慢,Tokens 方面 DS和MinMax都消耗比较多。. ## 2、速度测试. 因为我在上一次测试的时候,发现DeepSeek V4 Pro消耗的时间还是比较久的,做一个网页,都能
DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住|flash|推理|GP|DeepSeek-V4|Token_新浪新闻k.sina.com.cn · supportingTitle: DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住|flash|推理|GP|DeepSeek-V4|Token_新浪新闻 ## 新浪网. # DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住. ## 热点聚焦. ### 确定不再关注此人吗. 它的纸面数据很猛,参数量最高到了1.6万亿,上下文窗口拉到100万token,API价格比GPT-5.5便宜了一个数量级。但三天下来最让人意外的,不是顶配的Pro,而是最便宜的Flash。有人拿20个真实任务把V4的四个版本全测了一遍,结果Flash赢了7个,好几个编码任务里它用更少的token,做出了和贵几十倍的Pro一样甚至更好的结果。. 当然它也没强到可以闭眼吹。碰上复杂工程落地、精致前端、第一次就得成活的任务,GPT-5.5和Claude Opus 4.7仍然更稳。V4没有全面超车,但它正在把这场竞争从“谁最强”推向“谁最适合干哪种活”。. 但AI工程师Chew Loong Nian不这么想。他在DeepSeek V4发布后几小时内,就搭建了一个包含20个真实世界任务的测试框架,把V4家族的四个模式全部拉出来遛了一遍,分别是V4-Pro、V4-Pro-Max(最大推理努力)、V4-Flash,还有V4-Flash-Max。. 这里需要先理清这几个模式的区别。DeepSeek V4分成了Pro和Flash两条产品线。Pro是更大的选项,参数达到1.6万亿,面向更深度的推理、更难的编码任务、研究以及长上下文工作。Flash则是更小、更快的选项,总参数2840亿,仅13亿激活参数,专为速度、更低成本以及需要重复调用模型的智能体工作流而生。. 在这两个版本之上,用户还可以选择是否开启“深度思考”模式。开启之后,模型会花更多时间进行推理,在解决问题时展示出每一步思考过程,这通常会改善最终结果,但代价是响应速度变慢。. Chew Loong Nian的测试,就是把这四种组合并行投入实战。他的测试任务不是什么抽象基准,而是实打实的编码、Agent工作流、复杂推理和实际项目等场景。. 结果让人大跌眼镜。赢的不是参数最大、思考最深的Pro-Max,而是最便宜、最轻量的Flash。就是这个每百万token输入成本仅约0.14美元的模型,在20个任务中
DeepSeek V4好用吗?【秋芝的AI开箱】mp.weixin.qq.com · supporting# DeepSeek V4好用吗?【秋芝的AI开箱】 1. 没有炸裂,但重回一线 DeepSeek V4 如果跟现在最顶尖的闭源模型(比如 Opus 4.6)比,按它们自己的说法还有3-6个月的差距,算是追平了上一代的Opus 4.5。 放在国产模型和开源模型里比,算是领先了,跟最新的GLM5.1、Kimi2.6比可以说略好一点,但也拉不开差距。 2. 百万上下文从顶配变成标配 这一点几乎是这次发布最重要的一点。100w原生上下文之前在开源领域、国内都是没有的,Claude也得用顶配的Opus才有, 而现在 Agent 时代,有效的长上下文可以说是太重要了,能把百万上下文做成更低成本,变成标配,属于是Agent能普惠到普通人的必备基建。所以龙虾也立马更新,把DeepSeek V4作为了龙虾的默认模型! 3. 价格看着微贵了,其实没有 这次从api价目表表面看,跟国产几家比,DeepSeek V4 Pro的api还微贵一点。 但我实际用下来居然不是这样的,同样的任务,GLM5.1干50块才做完,v4pro只花了10块,我找其他小伙伴也试了几次,也是如此。。 另外,flash版其实不是传统意义上的低配模型,它推理能力跟pro差不多,在普通任务上的表现基本没差,只是在复杂推理上flash差一点。 我昨天调错了api,把flash当pro用了半天我一直没发现,后来改回来一跑,发现也没啥大区别,比如这俩谁是pro谁是flash做的,你能分出来吗,但它们价格却差12倍, 然后这俩是Opus4.6和GLM5.1 , 所以flash承担普通任务,现在可能是性价比最好的,而且5月5号之前调用,是原价1/4的优惠 ~ 4. Agent能力强,可以用到你的Agent里 [...] 4. Agent能力强,可以用到你的Agent里 这次DS的各方面能力都提升了,其中比较突出的是Agent相关能力(工具使用)、世界知识、中文写作、办公任务、竞赛编程和数学。这些方面对标的是海外旗舰模型。 所以大家除了客户端日常免费用以外,还建议接入Claude Code、龙虾、Hermes这类Agent,官网买api,在这里拷贝Anthropic格式的base\_url,把key粘贴过去就好啦, 我已全线接入准备用几天试试,那如果大家要把推理强度拉到最高的话,记得这样设置~
DeepSeek V4降价75%:我接上Claude Code跑了几天,说说真实感受 | 卡码笔记|程序员面试题库,Java、C++、Go、Agent、大模型八股文notes.kamacoder.com · supporting卡码笔记-最强八股文 # # DeepSeek V4降价75%:我接上Claude Code跑了几天,说说真实感受 KamaClaude 前几天DeepSeek V4发布那篇,卡哥写的时候还在吐槽:"V4-Pro输出24元/百万token,这不像DeepSeek的风格。" 结果文章发出去不到一天,DeepSeek官网直接挂了2.5折——输出砍到6元。 这操作真的很DeepSeek。 降价这几天我拿V4-Pro和V4-Flash接上Claude Code实跑了一些项目,说说真实感受,不吹不黑。 ## # V4-Flash:2块钱跑百万token,还要啥自行车 先说结论:V4-Flash才是这次降价里大多数录友应该关注的。 不是V4-Pro不好,是V4-Flash太便宜了。每百万token输出2元,缓存命中输入0.2元。这是什么概念?你在Claude Code里让V4-Flash读10个文件、改3处代码、跑一轮测试,算下来可能就几毛钱。同样的事用Claude Sonnet,轻松几块钱。 V4-Flash直接平替上一代`deepseek-chat`,性能更强,输出价格反而从3元降到2元。迁移零成本,改个模型名就行。 我这几天的用法:简单问答、文件搜索、内容生成、初版代码编写,全丢给V4-Flash。这些场景不需要最强推理,便宜够用就是王道。 有一点要注意:`deepseek-chat`和`deepseek-reasoner`将在7月24日后停用。V4-Flash的模型名是`deepseek-v4-flash`,尽早切过去。 ## # V4-Pro:便宜归便宜,Agent长任务还是差点意思 V4-Pro特惠价确实炸裂——输出6元/百万token,缓存命中输入0.25元。和Claude Opus 4.7的$25输出价相比,差了将近30倍。 [...] 但便宜不等于能替代。 我接上Claude Code跑了一个比较大的重构任务,让V4-Pro读整个项目、理解架构、重写一个模块。结果怎么说呢——单步能力没问题,多步连贯性差一截。 具体表现:第一步读文件、分析结构,做得很好。第二步改代码,也还行。到第三步发现要调整之前的改动,就开始"忘"之前做了什么,改着改着就跑偏了。 这不是V4独有的问题。在DeepSeek V4发布那篇里我们聊过,Termin
DeepSeek-V4 Flash与Pro的区别,哪个写代码更强?全面 ...ai-indeed.com · supporting📈 SWE-bench表现:虽然V4在SWE-bench Verified上的具体得分官方尚未正式公布(早期非官方渠道披露的数据约为80.6%-83.7%,截至发文前官方未给出确切数字),但多家第三方机构的独立验证一致指向:V4-Pro在真实GitHub Issue修复能力上,与GPT-5.5、Claude Opus 4.6等顶级闭源模型处于同一竞争梯队。 🔍 注意力失焦的小问题:在长代码生成中,Pro版偶有概率随机丢弃一些实现细节,但好在经过提醒加自测一到两轮后,问题基本都能自动修复。对于复杂工程代码,Pro仍然是首选——因为它的“智力”足够高,出现问题后能自己修复,而不是反复在同一个错误上打转。 ### 三、Flash的实际定位:不止“够用”,而是“很强且极便宜” 如果你以为Flash只是个“便宜但凑合”的简配版,那就低估它了。 💡 智商相当,成本天壤之别:Flash的推理能力接近Pro,在简单Agent任务上与Pro表现相当。第三方评测显示,Flash版本的智商很强,基本和Kimi K2.6打平甚至更稳定,同时成本只有十分之一。Flash在Agentic Coding等评测中同样进入了开源第一梯队。 ⚡ 速度与效率:Flash的单token推理算力仅为V3.2的10%,KV缓存仅7%。这意味着同样的硬件,Flash可以处理更多请求,响应更快。 💰 价格对比:V4-Flash输出价格仅为2元/百万token,而GPT-5.5输出约为218元/百万token——Flash的成本仅为竞品的约1%。对于日常高频编程(生成函数、写测试、代码补全),Flash完全够用,而且账单不会让你心疼。 ### 四、竞品对比:V4系列在开源和闭源中的代码排名 [...] ### 一、核心区别速览:一张表看懂Pro与Flash的差异 | 对比维度 | V4-Pro | V4-Flash | --- | 总参数量 | 1.6T(万亿) | 284B(2840亿) | | 激活参数 | 49B | 13B | | 预训练数据 | 33万亿token | 32万亿token | | 上下文窗口 | 1M token | 1M token | | 核心定位 | 旗舰性能标杆,对标闭源顶级模型 | 高效经济之选,速度更快、成本更低 | | 推理性能 | 在数学、STE