AI 快讯 编译自 marktechpost #模型发布#功能更新#行业分析

DeepSeek-V4-Flash-0731发布:Agentic与编程能力大幅提升,API公测开启

DeepSeek发布V4-Flash-0731,架构不变但通过重新后训练大幅提升Agentic和编程能力,API进入公测,价格仅为V4-Pro的三分之一。本文解析升级细节、性能对比及对国内开发者的部署建议。

编译发布 2026/07/31 原文发布 2026/07/31

一句话看懂

DeepSeek于2026年7月31日发布V4-Flash-0731,通过重新后训练而非新架构,大幅提升Agentic和编程能力,API进入公测,价格仅为V4-Pro的三分之一。

详细发生了什么

DeepSeek在Hugging Face上发布了DeepSeek-V4-Flash-0731,并将官方V4-Flash API转为公开测试版。模型卡明确表示,这是取代预览版的正式发布,架构和规模保持不变,性能提升完全来自重新后训练(re-post-training)。检查点附带DSpark投机解码模块,与DeepSeek-V4-Flash-DSpark结构一致。Hugging Face显示仓库总参数为304B,包含284B基础模型和草稿模块。

API方面,deepseek-v4-flash现在原生支持Responses API格式,并适配了Codex。V4-Pro API以及App和Web模型未更新。部署方式有两种:通过API,几乎任何人都可以部署,定价为每100万输入token(缓存未命中)$0.14,缓存命中$0.0028,每100万输出token $0.28,并发限制2500,约为V4-Pro输出价格($0.87)的三分之一。自托管门槛较高:权重采用MIT许可且无门控,但所有专家常驻内存,尽管每token仅激活13B。DeepSeek的vLLM示例在单个4×GB300节点上运行,Unsloth的动态GGUF提供无损8-bit版本(162GB)和3-bit版本(103GB),需要约110GB的RAM加VRAM。

架构上,V4-Flash是284B参数的MoE,每token激活13B,上下文窗口1M token。每个MoE层有1个共享专家和256个路由专家,中间维度2048,每token激活6个路由专家。前三个MoE层使用哈希路由。注意力机制混合了压缩稀疏注意力(CSA)和重度压缩注意力(HCA),并使用流形约束超连接(mHC)替代传统残差连接。预训练使用超过32T token和Muon优化器。论文中的效率数据(27%的单token推理FLOPs和10%的KV缓存)是针对V4-Pro而非Flash。

基准测试方面,DeepSeek报告的数据显示,V4-Flash-0731在多个Agentic基准上大幅超越预览版和V4-Pro,例如Terminal Bench 2.1得分82.7(预览版61.8),NL2Repo 54.2(预览版39.4),Cybergym 76.7(预览版38.7),DeepSWE 54.4(预览版7.3)。但所有数据均为DeepSeek自行报告,且使用了未发布的DeepSeek Harness最小模式,独立运行结果可能不同。

中文圈视角

国内开发者最关心的是能否用上。API方面,DeepSeek官方API在国内可直接访问,无需梯子,这比OpenAI等海外服务有优势。价格方面,$0.14/1M输入token(缓存未命中)和$0.28/1M输出token,对于个人开发者和初创团队非常友好,可以低成本运行Agent循环。但需要注意,API调用涉及数据出境,对于处理敏感数据的企业,建议使用自托管。

自托管方面,MIT许可且无门控,国内企业可以合规部署。但硬件要求较高,3-bit量化需要约110GB内存,普通工作站可能吃力,更适合有GPU集群的中大型企业。相比之下,国内同类产品如Kimi、智谱GLM在轻量化部署上可能更有优势,但DeepSeek在开源和成本上领先。对于中文用户,V4-Flash的编程能力提升意味着可以用更低的成本完成代码生成、仓库级任务,甚至自动化运维。不过,由于Agentic基准测试的harness未发布,建议国内团队先跑自己的评测再决定是否采用。

几条值得记住的细节

  • API定价:$0.14/1M输入token(缓存未命中),$0.0028缓存命中,$0.28/1M输出token,并发限制2500。
  • 自托管:MIT许可,无门控,但需要约110GB内存(3-bit量化)或4×GB300节点(全精度)。
  • 架构不变:284B MoE,13B激活,1M上下文,但通过重新后训练提升性能。
  • 基准提升:Terminal Bench 2.1从61.8升至82.7,DeepSWE从7.3升至54.4,但均为厂商自报。
  • 推理配置:DSpark投机解码,推荐temperature=1.0,top_p=0.95,支持最高384K输出token。

一句话总结

V4-Flash-0731以更低价格提供更强Agentic能力,国内开发者可低成本接入API或自托管,但需自行验证基准。