DeepSeek-V4-Flash 正式版突然发布,可能带来颠覆性影响

DeepSeek-V4-Flash正式版来了。

图片

7月31日午后,API上线公测。

这次更新,释放了一个值得关注的信号。

阿里云服务器ECS 99元1年,续费同价: https://www.aliyun.com/minisite/goods
腾讯云轻量云服务器: https://cloud.tencent.com/act/cps/redirect?redirect=36719
京东轻量云服务器: https://3.cn/1YX-MxJv

Flash版在多项Agent基准测试中的表现,逼近甚至超越了三个月前V4-Pro预览版的水平。


能力有多强?

官方更新日志显示:

Terminal Bench 2.1:82.7分

NL2Repo:54.2分

Cybergym:76.7分

Toolathlon verified:70.3分

而V4-Pro预览版在Terminal Bench 2.0上的得分是67.9。

需要说明的是,2.0和2.1不是同一版本测试集,直接对比不完全公平。

但一个激活参数仅130亿的轻量版,跑出这个分数,已经说明问题了。

后训练阶段的优化空间,可能比单纯堆参数更具杠杆效应。


Flash和Pro差在哪?

V4-Flash:总参数2840亿,激活参数130亿。

V4-Pro:总参数1.6万亿,激活参数490亿。

两者规模差一个数量级。

如果Flash能通过后训练把Agent能力拉到接近Pro的水平,意味着对于特定任务来说,模型规模并非决定性因素

训练方法和数据质量的权重,正在上升。


为什么说可能颠覆?

因为性价比。

Flash版如果Agent能力达到“够用甚至好用”的水平,性价比优势极具杀伤力。

Agent场景对推理速度和成本敏感度远高于纯对话。

图片

一个需要反复调用工具、多轮推理的任务,用旗舰模型跑,成本可能是Flash的数倍甚至数十倍。

再加上DeepSeek原本就低的价格,这波把价格屠夫的刀架在了旗舰模型脖子上。


买Token Plan的建议

建议大家买各种Token Plan最好按月购买。

因为你不知道下个月又会是哪个模型领先。

而且价格还更划算。

这可是Flash版本啊,感觉能吊打一众旗舰模型。

DeepSeek-V4-Pro正式版也将尽快发布。

Agent大幕才刚刚拉开。

未经允许不得转载:CLOUD技术博 » DeepSeek-V4-Flash 正式版突然发布,可能带来颠覆性影响