DeepSeek-V4-Flash 正式版 API 开启公测,Agent 能力显著提升
DeepSeek-V4-Flash 正式版 API 已上线公测,开发者无需更改调用名称即可使用。官方数据显示,新版本在多项代码、工具调用和自动化基准上超过 V4-Pro-Preview,并新增 Responses API 与 Codex 适配。
DeepSeek 在更新日志中宣布,DeepSeek-V4-Flash 正式版 API 已于 7 月 31 日开启公测,模型名称仍为 deepseek-v4-flash,现有 API 调用方式无需调整。官方公布的成绩包括 Terminal Bench 2.1 82.7 分、NL2Repo 54.2 分、DeepSWE 54.4 分和 Toolathlon Verified 70.3 分,显示其在终端操作、代码任务及工具使用方面有明显提升。
该版本的模型架构和规模与 V4-Flash-Preview 保持一致,主要通过后训练增强 Agent、指令遵循和多步骤任务执行能力。正式版原生支持 Responses API,并针对 Codex 进行了适配;不过,V4-Pro API 以及 DeepSeek 的 APP 和网页端模型本次均未更新。官方资料支持性能提升,但尚不足以单独证明其价格已低到“人人都能用得起”的程度。
来源证据
更新日志api-docs.deepseek.com · supporting# 更新日志 ## 时间: 2026-07-31 ### DeepSeek-V4-Flash 更新 DeepSeek-V4-Flash 正式版 API 上线公测,API 调用方式不变,模型名设置为 `deepseek-v4-flash` 即可使用最新版本。 Agent 能力大幅增强,基准测试远超 V4-Pro-Preview: Terminal Bench 2.1: 82.7 NL2Repo: 54.2 Cybergym: 76.7 DeepSWE: 54.4 Toolathlon verified: 70.3 Agent Last Exam: 25.2 Automation Bench (Public): 25.1 DSBench-FullStack: 68.7 DSBench-Hard: 59.6 注1:对于公开基准测试集中的 Code Agent 任务,正式版 DeepSeek-V4-Flash 使用 DeepSeek Harness 极简模式(即将发布)作为框架进行测试,并使用 max 档位,topp=0.95,temperature=1.0 注2:DSBench-FullStack 是内部使用的全栈开发测试集,DSBench-Hard 是内部使用的 Coding Agent 难题测试集 [...] 正式版 V4-Flash 原生支持 Responses API 格式并针对性适配 Codex,具体配置方法请参考文档 DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-Preview 保持一致,仅重新进行了后训练。 注意:本次仅升级了 DeepSeek-V4-Flash 的 API 接口,DeepSeek-V4-Pro API 及 APP/WEB 端模型未做更改。 DeepSeek-V4-Pro 正式版将会尽快发布。 ## 时间: 2026-04-24 ### DeepSeek-V4 DeepSeek API 已支持 V4-Pro 与 V4-Flash,支持 OpenAI ChatCompletions 接口与 Anthropic 接口。访问新模型时,base\_url 不变, model 参数需要改为 `deepseek-v4-pr
DeepSeek V4正式版性能封神:Flash直追Opus 静待Pro斩杀四方|DeepSeek-V4-Flash|AI代码生成|模型|官方|编程_手机新浪网finance.sina.cn · supporting## 新浪科技 快科技7月31日消息,早上刚有传闻DeepSeek V4正式版会在8月3日发布,没想到中午DeepSeek就拿出了正式版,首先登场的是DeepSeek V4 Flash,Pro版还要等到8月初。 根据官方消息,DeepSeek-V4-Flash-0731 的模型结构、尺寸和 DeepSeek-V4-Flash-preview 保持一致,仅重新进行了后训练,Agent能力大幅增强,基准测试远超 V4-Pro-Preview。 ) 根据官方发布的对比,V4 Flash在多个AI编程能力测试中大幅提升,最夸张的一个是DeepSwe,从7.3分提升到了54.4分,性能暴涨6倍多,只能说明之前Flash在这个编程测试中表现确实不行。 官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8,Flash整体性能超过了GLM-5.2,比Opus 4.8差一些。 ) 还有网友让GPT整理了V4 Flash对比其他大模型的性能测试,可以看到跟国产的K3及GPT的旗舰Sol还有点差距。 ) 著名大模型测试员的结果显示性价比上Flash依然无敌,比降价后的GPT-5.6 Luna还要少一半的费用。 以上需要注意的是,V4 Flash只是个小参数模型,2840亿参数量,激活130亿而已,而GLM-5.2是7400多亿参数,K3是2.8万亿参数,5.6 Sol及Fable 5这样的美国顶级大模型虽然每公布参数量,但公认在4-5万亿级别,保守估计也是K3这种3万亿级别的。 可以说V4 Flash只用1/10到1/3的参数量就做到了前沿级性能,DeepSeek这一波真的是后训练仙人了,而V4 Pro是1.6万亿参数量,规模大了4倍以上,意味着性能还有更大的提升空间。 [...] 按照这个幅度来算,V4 Pro正式版的性能达到甚至超过K3、Opus 5、GPT-5.6 Sol或者Fable 5都是有可能的,此前网上流传的那些V4正式版测试果然不是骗人,DeepSeek无愧于AI斩杀线的美誉,比他强的大模型没奖励,但是比他弱的就麻烦了。 ) 【本文结束】如需转载请务必注明出处:快科技
DeepSeek V4正式版来了,但只来了一半news.ifeng.com · supportingDeepSeek V4正式版来了,但只来了一半 资讯 # DeepSeek V4正式版来了,但只来了一半 (文/连政 编辑/吕栋) DeepSeek-V4正式版终于来了。 7月31日,DeepSeek在API文档更新日志中宣布,DeepSeek-V4-Flash正式版API开启公测,模型版本更新为DeepSeek-V4-Flash-0731(下称V4-Flash-0731)。开发者可使用原有的“deepseek-v4-flash”名称调用,无需更换接口。 但是,同在4月更新的V4-Pro的API,以及APP和网页端模型均未做更改。DeepSeek表示,V4-Pro正式版将会“尽快发布”。 根据DeepSeek介绍,此次更新的V4-Flash-0731模型架构和参数规模与V4-Flash预览版保持一致,仅重新进行了后训练,主要改善代码修改、工具调用和多步骤任务执行等Agent能力。 官方在发布的评测数据中提到,V4-Flash-0731在九项智能体、代码和自动化基准中的成绩整体表现,已显著高于V4-Pro预览版。其中Terminal Bench 2.1得分为82.7,DeepSWE为54.4。 点击查看大图 点击查看大图 官方公布数据称,V4-Flash-0731的Agent“能力大增” 对此,海外模型评测机构Artificial Analysis在7月31日更新的智能指数测试中,给予V4-Flash-0731(最高推理档位)50分。在同类可比模型中明显高于平均水平,其可比模型的中位数为17分。 点击查看大图 点击查看大图 而Artificial Analysis在进行智能指数评测时,V4-Flash-0731共生成了2.1亿个Token,输出量明显偏高,可比模型的中位数则为6200万个Token。
DeepSeek-V4系列迎重大升级 性能追平旗舰模型 Agent能力大幅增强cls.cn · supporting关于我们网站声明联系方式用户反馈网站地图帮助 ## 首页## 电报## 话题## 盯盘## VIP## FM## 投研## 下载 DeepSeek-V4系列迎重大升级 性能追平旗舰模型 Agent能力大幅增强 原创 人工智能 2026-08-02 17:58 星期日 科创板日报 宋子乔 责编 姚辉 ``` ①DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,在此基础上,正式版仅重新进行了后训练,基准测试得分远超V4-Pro-Preview; ②机构称,DeepSeek-V4-Flash轻量模型追平旗舰性能,利好AI应用产业链。 ``` 《科创板日报》8月2日讯(编辑 宋子乔) DeepSeek-V4系列模型迎来重大升级。抢在7月最后一天(31日),DeepSeek-V4-Flash正式版上线。 根据官方消息,DeepSeek-V4-Flash正式版的模型架构、大小和与预览版相同,即MoE(混合专家)架构、2840亿总参数、130亿激活参数、1M上下文,在此基础上,正式版仅重新进行了后训练,Agent能力便大幅增强,基准测试得分远超V4-Pro-Preview。 官方性能对比的是国产编程代表GLM-5.2及美国的Opus 4.8。DeepSeek-V4-Flash正式版的整体性能超过了GLM-5.2,逼近Opus 4.8。相比对标模型,V4 Flash只是个小参数模型,GLM-5.2总参数高达7440亿,激活参数为400亿,均远高于V4 Flash。 [...] 具体来看官方给出的9项Agent基准测试得分,在考察终端操作能力的Terminal Bench2.1上,DeepSeek-V4-Flash正式版的得分从61.8涨到了82.7;在代码仓库理解与修改任务NL2Repo、DeepSWE上,分别得分54.2和54.4,而其前身Flash Preview在DeepSWE项目上的得分仅为7.3。 另外,其指向网络安全任务的Cybergym得分为76.7,反映工具调用能力的Toolathlon-Verified达到70.3。 在更综合的智能体评测中,DeepSeek-V4-Flash正式版在Agent Last Exam和 Automation Bench Public上的得分分别为25.2和25.1,这两个项目都是2026
DeepSeek V4 flash 正式版发布,有哪些亮点值得关注?zhihu.com · supportingImage 1) []( 关注推荐热榜专栏圈子AI Works Beta故事 直答 切换模式 登录/注册 []( # DeepSeek V4 flash 正式版发布,有哪些亮点值得关注? 关注问题写回答 登录/注册 科技 大模型 国产大模型DeepSeek # DeepSeek V4 flash 正式版发布,有哪些亮点值得关注? Image 2: 翔宇情 翔宇情 Image 3 摄影等 4 个话题下的优秀答主 圆桌收录 大模型卷一夏 时间: 2026-07-31DeepSeek-V4-Flash 更新DeepSeek-V4-Flash 正式版 API 上线公测 Agent 能力大幅…显示全部 关注者 982 被浏览 3,227,557 关注问题写回答 邀请回答 好问题 93 30 条评论 分享 #### 399 个回答 默认排序 Image 4: 小小将 小小将 Image 5 新知答主 关注 终于来了! 刚刚,DeepSeek-V4-Flash 正式版 API 上线(App和网页未更新),目前已开启公测。 相比 Preview 版本,正式版的模型结构和参数规模并没有变化,主要是重新进行了后训练。但从实际结果来看,这次升级非常明显,尤其是 Agent 能力大幅增强,多项基准测试成绩远超 V4-Pro-Preview。 在核心评测中,DeepSeek-V4-Flash 正式版的表现已经超过 GLM-5.2,并进一步逼近 Claude Opus 4.8。 Image 7 你们真的错怪梁圣了。(以后求大家多给DeepSeek一点耐心) Image 9 [...] Image 7 你们真的错怪梁圣了。(以后求大家多给DeepSeek一点耐心) Image 9 这次评测 Coding Agent 任务,正式版DeepSeek-V4-Flash也使用了自研的DeepSeek Harness,这套 Harness 也即将开源。(传言是真的。) 长期来看,自研Harness对于Agent迭代是非常有必要的,可以做到训推一致,这样适配程度更好。 此外,正式版V4-Flash也原生支持了Responses API格式,而且针对Codex进行了优化适配。
DeepSeek-V4-Flash正式版来了!zhuanlan.zhihu.com · supportingImage 1) []( 关注推荐热榜专栏圈子AI Works Beta故事 直答 切换模式 登录/注册 DeepSeek-V4-Flash正式版来了! 切换模式 Image 2: DeepSeek-V4-Flash正式版来了! # DeepSeek-V4-Flash正式版来了! Image 3: 机器之心 机器之心 Image 4 人工智能等 2 个话题下的优秀答主 27 人赞同了该文章 编辑 | 陈陈 终于还是拖到了 7 月的最后一天。 刚刚,DeepSeek-V4-Flash 迎来了一次更新,正式版 API 现已上线公测! 消息发布后,DeepSeek 很快冲上知乎热搜第一。 Image 5 根据官方文档显示,这个 Flash 正式版的各项测试成绩均大幅优于之前的 V4-Pro-Preview 版本,倒反天罡了属于是。 Image 6 新版本经过大量后训练工作,Agent 能力大幅增强,指令遵循能力大幅增强。对于开发等工作来说,V4 Flash 的实用性剧增,前几天大家还想找便宜且好用的新模型,现在看来根本不用找了。 具体而言,在考察终端操作能力的 Terminal Bench 2.1 上,模型得分达到 82.7;在代码仓库理解与修改任务 NL2Repo、DeepSWE 上,分别取得 54.2 和 54.4。 面向网络安全任务的 Cybergym 得分为 76.7,工具调用基准 Toolathlon Verified 达到 70.3。 [...] 在更综合的智能体评测中,DeepSeek-V4-Flash 在 Agent Last Exam 和 Automation Bench Public 上分别取得 25.2 和 25.1;在全栈开发基准 DSBench-FullStack 与难度更高的 DSBench-Hard 上,得分则达到 68.7 和 59.6。 从 Benchmark 成绩来看,DeepSeek-V4-Flash 正式版在多项 Agent 基准上的表现已经逼近 Opus 4.8。这还只是 284B 的 Flash 版,价格只有 Claude 的 1/90。大模型的门槛,现在被抬到了这个位置。 此外,新版本原生支持 Responses API,并已针对 Codex 进行了优化。 文档地