DeepSeek-V4-Flash正式版来了。

7月31日午后,API上线公测。
这次更新,释放了一个值得关注的信号。
阿里云服务器ECS 99元1年,续费同价: https://www.aliyun.com/minisite/goods
腾讯云轻量云服务器: https://cloud.tencent.com/act/cps/redirect?redirect=36719
京东轻量云服务器: https://3.cn/1YX-MxJv
Flash版在多项Agent基准测试中的表现,逼近甚至超越了三个月前V4-Pro预览版的水平。
能力有多强?
官方更新日志显示:
Terminal Bench 2.1:82.7分
NL2Repo:54.2分
Cybergym:76.7分
Toolathlon verified:70.3分
而V4-Pro预览版在Terminal Bench 2.0上的得分是67.9。
需要说明的是,2.0和2.1不是同一版本测试集,直接对比不完全公平。
但一个激活参数仅130亿的轻量版,跑出这个分数,已经说明问题了。
后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。
Flash和Pro差在哪?
V4-Flash:总参数2840亿,激活参数130亿。
V4-Pro:总参数1.6万亿,激活参数490亿。
两者规模差一个数量级。
如果Flash能通过后训练把Agent能力拉到接近Pro的水平,意味着对于特定任务来说,模型规模并非决定性因素。
训练方法和数据质量的权重,正在上升。
为什么说可能颠覆?
因为性价比。
Flash版如果Agent能力达到“够用甚至好用”的水平,性价比优势极具杀伤力。
Agent场景对推理速度和成本敏感度远高于纯对话。

一个需要反复调用工具、多轮推理的任务,用旗舰模型跑,成本可能是Flash的数倍甚至数十倍。
再加上DeepSeek原本就低的价格,这波把价格屠夫的刀架在了旗舰模型脖子上。
买Token Plan的建议
建议大家买各种Token Plan最好按月购买。
因为你不知道下个月又会是哪个模型领先。
而且价格还更划算。
这可是Flash版本啊,感觉能吊打一众旗舰模型。
DeepSeek-V4-Pro正式版也将尽快发布。
Agent大幕才刚刚拉开。
CLOUD技术博