DeepSeekV4Pro已经上架并且再次发布,但是真正值得一看的是测试成绩

温馨提示:本文为网络用户自主投稿,仅为项目信息交流展示,不构成任何投资建议、理财指导。所有项目均存在风险,涉及注册投资需谨慎,因此造成损失本站概不负责!

DeepSeek V4 Pro此次更新中,最引人注目的并不是它的性能提升,而是在于它上架的过程当中所发生的事情。

8月13日夜晚的时候,V4 Pro 0813版本就出现在了官网上,并且API名称也被更换成了`deepseek-v4-pro`. 正式版提示曾经出现过但是后来又被删除了。社区用户发现同样的任务,在不同的时间段执行时得到的结果不完全一样。服务完成切换之后,官方又重新确认了版本已经同步到了网页、APP以及API上。

d2b5ca33bd20260814153353

一晚上的时间完成了发布、异常、切换以及再确认的过程,但是这个过程并不稳定。但是如果只关注到这次上线出现的问题上,就会忽视掉V4 Pro本身值得探讨的内容了——即它是否适合融入到日常的工作流程当中去呢?

跑/分还可以,但是实际测试中的差别并没有想象中的那么大

DeepSeek之前把V4 Pro定位得很高,主要在Agent、推理以及代码方面下功夫。官方发布的Agent测试成绩里,Terminal Bench 2.1得分为87.9分,DeepSWE得分为62.7分,NL2Repo得分为61.5分。

d2b5ca33bd20260814153403

但是Artificial *ysis领先轮测试给V4 Pro打的是53分,给V4 Flash的是52分。两者的差距只有1分,V4 Pro更加昂贵而且速度较慢,所以用户就会质疑:既然各方面都差不多了,为什么还要选Pro呢?

这个事情不能用跑/分来作答。真正的使用者关心的是同一个任务能不能做完,要等多长时间,在过程中是否可以修改,并且最后花了多少钱。

一个网页开发测试就可以看出来不同之处了。用相同的简历资料、项目环境以及提示词来生成网站动效的话,V4 Pro所生成的效果会更加丰富多彩一些,并且整个的设计也会比较全面一些,但是一般要花上十几分钟甚至一个小时的时间才能完成,并且价格也就几十元钱左右。V4 Flash的速度只有Pro的一半左右,页面比较简单,但是视觉效果不错,并没有之前那种单调的蓝色或者紫色模板的感觉。

d2b5ca33bd20260814153414

因此,复杂的网站开发以及长时间的任务编写工作,Pro会比较安全一些。一般的页面、简单的修改以及快速原型都可以用Flash来完成。两者的并不是全部被替代的关系,而是在于任务难易程度不一样所导致的选择上的差异。

涨价之后,DeepSeek还便宜不便宜呢?

8月17日调价之后,V4 Flash高峰时段的输入价格由原来的每百万Token 1元上涨到了现在的3元,输出价格也由原来的2元提高到了现在的9元。V4 Pro的价格为输入3元、输出6元,现在是9元和27元。非高峰期的时候价格会便宜一半。

d2b5ca33bd20260814153424

涨幅虽然很大,但是和主流旗舰模型相比,V4 Pro仍然处在较低的价格段。按照每美元兑换7.2元人民b来算的话,涨价之后最高价格下输入成本还不到Opus 5、GPT-5.6 Sol的一半;输出成本则只有Opus 5的六点七分之一,Sol的八分之一。和同样重视性价比的Grok 4.6相比,V4 Pro的价格更低一些。

这就意味着DeepSeek除了价格低廉之外还有另外一个好处就是用户会更乐意把大批量的任务交由它来处理。但是不能简单的去比对“每一百万个Token值多少”。一个模型虽然便宜,但是错误率很高,需要人工修正的话,它的实际花费并不一定很低。要比较的是:谁可以更快地完成工作、谁返工较少。

把工作用的东西放进去之后,Flash就更加实用了

d2b5ca33bd20260814153432

目前V4Pro、V4Flash可以连接到Codex和WorkBuddy上。

Codex适合于网站开发、代码修改、角本执行、本地项目的分析与调试等用途。而WorkBuddy更适用于处理Word、Excel、PDF文件、办公文档、周报以及企业的协同工作平台中所涉及的数据。两种方式都可以连接到DeepSeek API上,并且在设置好之后就可以在不同的模型间进行转换了。

在对公众号阅读数据进行整理并做测试的时候,Flash、Pro所得到的数据以及结论基本上是一样的。Flash大概需要7分钟左右的时间来完成工作,而Pro则要花费将近两倍的时间。对于大部分的工作来说,Flash已经足够了,从速度到成本都是比较合适的。

d2b5ca33bd20260814153443

这也是人们常常忽视的一个地方:模型的能力再好,并不意味着所有的任务都必须用最昂贵的那个版本。整理资料、分类数据、生成分析页面,如果Flash能够正确地完成这些任务的话,就不用让Pro来做同样的事情了。

Agent接力,并不是只更换模型就可以的

原来的方案是先用Codex做一半的工作,然后再由WorkBuddy来完成剩下的部分。但是在实际的操作当中,模型是否能够顺利地衔接起来,则要看项目是否留有清楚的记录了。

d2b5ca33bd20260814153450

如果前面的模型没有记载已经做完的事情、目前存在的问题、改动的理由以及接下来要做的事情的话,那么后面的模型尽管技术再好也只能够从头开始来理解这个项目。模型不能够自己去了解没有被保存下来的过程。

比较简单的方法就是在项目的目录下创建一个名为`AGENTS.md`的文件,并且不断地添加有关的工作规范、重要的决定以及目前的状态等内容。对于复杂的项目可以分别在各个子目录里保存相应的文件,并且还要加上`log.md`之类的日志文件。这样换模型的时候,并不是接到了一地鸡毛的文件,而是一整个项目的状态。

另外,DeepSeek Harness也已推出。也可以看作是为DeepSeek而生的代码开发工具,开源并且更适合于DeepSeek的使用习惯。如果后期的实际体验可以保持稳定的话,那么就比单纯的把DeepSeek接入到其他的工具中要方便得多。

本次更新得出的结论很简单:日常办公、资料整理以及大批量的任务,先用Flash;复杂的编码、长长的涟条式的Agent以及容易被修改的项目,则可以考虑使用Pro。

模型一直在变,但是值得保留的是自己积累下来的数据、项目记录以及工作流程。

------本页内容已结束,喜欢请收藏------
© 版权声明
THE END
喜欢就支持一下吧
分享