公告
先看证据,再决定买不买

频道每天最多 3 条价格异动与中转状态;具体商品请用机器人设置降价/补货提醒。交流群提问请带预算、模型、工具和使用频率。

查看
社群与联系Telegram 群点击加入Telegram 频道每天最多 3 条有效价格情报联系我们tgAIPricedb交流群979789483
返回资讯列表
product

早期测试称 DeepSeek V4 Flash 部分任务胜过 Pro,但结论仍存争议

围绕 DeepSeek V4 Pro、Pro Max 与 V4 Flash 的第三方测试显示,价格更低的 Flash 在部分编码、代理和速度任务中可能追平甚至超过 Pro。与此同时,其他评测仍认为 Pro 在复杂推理和工程任务上更有优势。

42% VERIFIED

一段围绕 DeepSeek-V4-Pro-0813 的实测视频,重点比较了 Pro 的不同推理强度、Pro Max、V4 Flash,以及在 DeepSeek Harness 中运行时的表现。测试提出的问题包括最高推理强度是否反而降低结果质量,以及 Flash 是否能在实际任务中击败更昂贵的 Pro。

现有材料并未形成一致结论。一些文章称 Flash 在多项真实任务中获胜,并具备更低延迟和显著成本优势;另一些评测则认为 Pro 仍适合复杂编码、长上下文和高难度推理。不同测试所使用的任务、提示词、运行框架和模型版本并不统一,因此不能据此断言 Pro 整体“失配”或 Flash 全面领先。

此外,部分基准成绩尚未得到官方确认,候选视频文本也不完整。更稳妥的判断是:V4 系列可能呈现出明显的任务分工,Flash 偏向高频、低成本工作负载,Pro 则试图覆盖更复杂的任务,但两者的实际差距仍需可复现的独立测试验证。

来源证据

DeepSeek V4-Pro Review: GA, Pricing & Benchmarkscodersera.com · supporting

Independent numbers on the GA checkpoint (August 2026). The 80.6% below is DeepSeek-reported on the preview. On Vals' neutral harness, V4-Pro-0813 places 2nd on SWE-bench Verified at 96.40% (±0.83) — behind only Claude Opus 5 (97.00%) and ahead of GPT-5.6 Sol (96.20%) and Grok 4.6 (95.60%) — at $0.022 per test against Grok's $0.785 and Opus 5's $1.29. The verdict splits sharply elsewhere. On Terminal-Bench, DeepSeek claims 87.9% on its own unreleased harness; under the reference Terminus 2 harness V4-Pro scores 54.68%, a 33-point gap, and lands 12 points below its cheaper sibling V4-Flash (67.04%). Every lab loses 7–13 points moving to Terminus 2, so Pro's drop is a categorical outlier rather than normal harness variance. And on AA-Omniscience — which measures whether a model knows what [...] AA-Omniscience — which measures whether a model knows what it does not know — V4-Pro-0813 scores 0.83 against Claude Opus 5's 37.07, near the hallucination floor. Read V4-Pro as a coding-benchmark

DeepSeek V4 Pro 发力了,高强度全面测试!DeepSeek V4 Pro “发力了”,2.5折,这个价格就 - 掘金juejin.cn · supporting

Title: DeepSeek V4 Pro 发力了,高强度全面测试!DeepSeek V4 Pro “发力了”,2.5折,这个价格就 - 掘金 # DeepSeek V4 Pro 发力了,高强度全面测试!. DeepSeek V4 Pro “发力了”,2.5折,这个价格就很香了。. 昨天(前天了),DeepSeek V4 真的发布了。. ## 1、问答测试. 而且会和另外几个国内主流模型做一个简单的对比。比如 GLM5.1、Kimi K2.6、Doubao。. 分别是MimMax家最强模型M2.7,智谱家的最强模型GLM5.1 ,Kimi家的最强模型K2.6,以及火山的豆包编码模型。. ### 数字母. 没想到啊,这个时候,还有人数不清字母 e 的数量!. ### 比大小. 11.9 和 11.12 哪个数字大?. 5 个 AI,有三个认为是 11.9 比较大,有两个认为是 11.12 比较大。. GLM5.1说的就是你了:**因为 11.12 < 11.90,所以 11.12 更大,你是在说什么胡话?**. 测试首字最慢的是MiniMax M2.7,总耗时最长的是GLM5.1。Tokens 最多是DS。. ### 找正整数. ### 竹竿过门. 6 米长的竹竿能否通过 4 米高、3 米宽的门?. 从这次抽卡的结果来看只有GLM和Kimi错了,其他人都是对的。其实 MiniMax 和豆包也是猜的。. DS这次首字居然最快,GLM最慢,但是整体耗时 DeepSeek 就比较久了,MiniMax最久。DeepSeek的Tokens消耗最多。. ### 帽子逻辑推理. 有 5 个人排成一排,每人帽子颜色为红或蓝。他们可以看到前面的人的帽子,但看不到自己的。主持人宣布:"至少有一顶红帽子。"从最后一人开始,每人依次说"是"或"否"(表示是否知道自己帽子的颜色)。如果第 5 人说"否",第 4 人说"是",求所有可能的帽子颜色分布。. MiniMax 日常截断,其他全部正常。这个题目一般都是能答对的,就是需要消耗不少算力。. 这次DS的首字又是最快,GLM最慢,总耗时是火山最快,MiniMax最慢,Tokens 方面 DS和MinMax都消耗比较多。. ## 2、速度测试. 因为我在上一次测试的时候,发现DeepSeek V4 Pro消耗的时间还是比较久的,做一个网页,都能

DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住|flash|推理|GP|DeepSeek-V4|Token_新浪新闻k.sina.com.cn · supporting

Title: DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住|flash|推理|GP|DeepSeek-V4|Token_新浪新闻 ## 新浪网. # DeepSeek V4上线三天,第一批实测结果出来了:性价比确实够狠,但有些活它还接不住. ## 热点聚焦. ### 确定不再关注此人吗. 它的纸面数据很猛,参数量最高到了1.6万亿,上下文窗口拉到100万token,API价格比GPT-5.5便宜了一个数量级。但三天下来最让人意外的,不是顶配的Pro,而是最便宜的Flash。有人拿20个真实任务把V4的四个版本全测了一遍,结果Flash赢了7个,好几个编码任务里它用更少的token,做出了和贵几十倍的Pro一样甚至更好的结果。. 当然它也没强到可以闭眼吹。碰上复杂工程落地、精致前端、第一次就得成活的任务,GPT-5.5和Claude Opus 4.7仍然更稳。V4没有全面超车,但它正在把这场竞争从“谁最强”推向“谁最适合干哪种活”。. 但AI工程师Chew Loong Nian不这么想。他在DeepSeek V4发布后几小时内,就搭建了一个包含20个真实世界任务的测试框架,把V4家族的四个模式全部拉出来遛了一遍,分别是V4-Pro、V4-Pro-Max(最大推理努力)、V4-Flash,还有V4-Flash-Max。. 这里需要先理清这几个模式的区别。DeepSeek V4分成了Pro和Flash两条产品线。Pro是更大的选项,参数达到1.6万亿,面向更深度的推理、更难的编码任务、研究以及长上下文工作。Flash则是更小、更快的选项,总参数2840亿,仅13亿激活参数,专为速度、更低成本以及需要重复调用模型的智能体工作流而生。. 在这两个版本之上,用户还可以选择是否开启“深度思考”模式。开启之后,模型会花更多时间进行推理,在解决问题时展示出每一步思考过程,这通常会改善最终结果,但代价是响应速度变慢。. Chew Loong Nian的测试,就是把这四种组合并行投入实战。他的测试任务不是什么抽象基准,而是实打实的编码、Agent工作流、复杂推理和实际项目等场景。. 结果让人大跌眼镜。赢的不是参数最大、思考最深的Pro-Max,而是最便宜、最轻量的Flash。就是这个每百万token输入成本仅约0.14美元的模型,在20个任务中

DeepSeek V4好用吗?【秋芝的AI开箱】mp.weixin.qq.com · supporting

# DeepSeek V4好用吗?【秋芝的AI开箱】 1. 没有炸裂,但重回一线 DeepSeek V4 如果跟现在最顶尖的闭源模型(比如 Opus 4.6)比,按它们自己的说法还有3-6个月的差距,算是追平了上一代的Opus 4.5。 放在国产模型和开源模型里比,算是领先了,跟最新的GLM5.1、Kimi2.6比可以说略好一点,但也拉不开差距。 2. 百万上下文从顶配变成标配 这一点几乎是这次发布最重要的一点。100w原生上下文之前在开源领域、国内都是没有的,Claude也得用顶配的Opus才有, 而现在 Agent 时代,有效的长上下文可以说是太重要了,能把百万上下文做成更低成本,变成标配,属于是Agent能普惠到普通人的必备基建。所以龙虾也立马更新,把DeepSeek V4作为了龙虾的默认模型! 3. 价格看着微贵了,其实没有 这次从api价目表表面看,跟国产几家比,DeepSeek V4 Pro的api还微贵一点。 但我实际用下来居然不是这样的,同样的任务,GLM5.1干50块才做完,v4pro只花了10块,我找其他小伙伴也试了几次,也是如此。。 另外,flash版其实不是传统意义上的低配模型,它推理能力跟pro差不多,在普通任务上的表现基本没差,只是在复杂推理上flash差一点。 我昨天调错了api,把flash当pro用了半天我一直没发现,后来改回来一跑,发现也没啥大区别,比如这俩谁是pro谁是flash做的,你能分出来吗,但它们价格却差12倍, 然后这俩是Opus4.6和GLM5.1 , 所以flash承担普通任务,现在可能是性价比最好的,而且5月5号之前调用,是原价1/4的优惠 ~ 4. Agent能力强,可以用到你的Agent里 [...] 4. Agent能力强,可以用到你的Agent里 这次DS的各方面能力都提升了,其中比较突出的是Agent相关能力(工具使用)、世界知识、中文写作、办公任务、竞赛编程和数学。这些方面对标的是海外旗舰模型。 所以大家除了客户端日常免费用以外,还建议接入Claude Code、龙虾、Hermes这类Agent,官网买api,在这里拷贝Anthropic格式的base\_url,把key粘贴过去就好啦, 我已全线接入准备用几天试试,那如果大家要把推理强度拉到最高的话,记得这样设置~

DeepSeek V4降价75%:我接上Claude Code跑了几天,说说真实感受 | 卡码笔记|程序员面试题库,Java、C++、Go、Agent、大模型八股文notes.kamacoder.com · supporting

卡码笔记-最强八股文 # # DeepSeek V4降价75%:我接上Claude Code跑了几天,说说真实感受 KamaClaude 前几天DeepSeek V4发布那篇,卡哥写的时候还在吐槽:"V4-Pro输出24元/百万token,这不像DeepSeek的风格。" 结果文章发出去不到一天,DeepSeek官网直接挂了2.5折——输出砍到6元。 这操作真的很DeepSeek。 降价这几天我拿V4-Pro和V4-Flash接上Claude Code实跑了一些项目,说说真实感受,不吹不黑。 ## # V4-Flash:2块钱跑百万token,还要啥自行车 先说结论:V4-Flash才是这次降价里大多数录友应该关注的。 不是V4-Pro不好,是V4-Flash太便宜了。每百万token输出2元,缓存命中输入0.2元。这是什么概念?你在Claude Code里让V4-Flash读10个文件、改3处代码、跑一轮测试,算下来可能就几毛钱。同样的事用Claude Sonnet,轻松几块钱。 V4-Flash直接平替上一代`deepseek-chat`,性能更强,输出价格反而从3元降到2元。迁移零成本,改个模型名就行。 我这几天的用法:简单问答、文件搜索、内容生成、初版代码编写,全丢给V4-Flash。这些场景不需要最强推理,便宜够用就是王道。 有一点要注意:`deepseek-chat`和`deepseek-reasoner`将在7月24日后停用。V4-Flash的模型名是`deepseek-v4-flash`,尽早切过去。 ## # V4-Pro:便宜归便宜,Agent长任务还是差点意思 V4-Pro特惠价确实炸裂——输出6元/百万token,缓存命中输入0.25元。和Claude Opus 4.7的$25输出价相比,差了将近30倍。 [...] 但便宜不等于能替代。 我接上Claude Code跑了一个比较大的重构任务,让V4-Pro读整个项目、理解架构、重写一个模块。结果怎么说呢——单步能力没问题,多步连贯性差一截。 具体表现:第一步读文件、分析结构,做得很好。第二步改代码,也还行。到第三步发现要调整之前的改动,就开始"忘"之前做了什么,改着改着就跑偏了。 这不是V4独有的问题。在DeepSeek V4发布那篇里我们聊过,Termin

DeepSeek-V4 Flash与Pro的区别,哪个写代码更强?全面 ...ai-indeed.com · supporting

📈 SWE-bench表现:虽然V4在SWE-bench Verified上的具体得分官方尚未正式公布(早期非官方渠道披露的数据约为80.6%-83.7%,截至发文前官方未给出确切数字),但多家第三方机构的独立验证一致指向:V4-Pro在真实GitHub Issue修复能力上,与GPT-5.5、Claude Opus 4.6等顶级闭源模型处于同一竞争梯队。 🔍 注意力失焦的小问题:在长代码生成中,Pro版偶有概率随机丢弃一些实现细节,但好在经过提醒加自测一到两轮后,问题基本都能自动修复。对于复杂工程代码,Pro仍然是首选——因为它的“智力”足够高,出现问题后能自己修复,而不是反复在同一个错误上打转。 ### 三、Flash的实际定位:不止“够用”,而是“很强且极便宜” 如果你以为Flash只是个“便宜但凑合”的简配版,那就低估它了。 💡 智商相当,成本天壤之别:Flash的推理能力接近Pro,在简单Agent任务上与Pro表现相当。第三方评测显示,Flash版本的智商很强,基本和Kimi K2.6打平甚至更稳定,同时成本只有十分之一。Flash在Agentic Coding等评测中同样进入了开源第一梯队。 ⚡ 速度与效率:Flash的单token推理算力仅为V3.2的10%,KV缓存仅7%。这意味着同样的硬件,Flash可以处理更多请求,响应更快。 💰 价格对比:V4-Flash输出价格仅为2元/百万token,而GPT-5.5输出约为218元/百万token——Flash的成本仅为竞品的约1%。对于日常高频编程(生成函数、写测试、代码补全),Flash完全够用,而且账单不会让你心疼。 ### 四、竞品对比:V4系列在开源和闭源中的代码排名 [...] ### 一、核心区别速览:一张表看懂Pro与Flash的差异 | 对比维度 | V4-Pro | V4-Flash | --- | 总参数量 | 1.6T(万亿) | 284B(2840亿) | | 激活参数 | 49B | 13B | | 预训练数据 | 33万亿token | 32万亿token | | 上下文窗口 | 1M token | 1M token | | 核心定位 | 旗舰性能标杆,对标闭源顶级模型 | 高效经济之选,速度更快、成本更低 | | 推理性能 | 在数学、STE