7月17日,根据笔者帐号API的特征,确定已经被灰度测试DeepSeek-V4正式版,故模仿前期网络上的相关测试,使用简单prompt生成我的世界网页版游戏,测试该模型的“许愿式编程”和Plan-Build-Debug能力,验证网络上的测试是否为炒作。在文末,笔者将相关代码部署到了服务器,大家可以在浏览器进行试玩进行评价。
整体情况及配置#
- 环境: Claude Code 2.1.117 + DeepSeek-V4-Pro + max 思考强度
- 提示词:
为我还原一个网页版我的世界,越还原越好。如果有不确定的地方请进行联网搜索
- 手动操作: Plan环节接受所有“推荐”的建议,不进行额外输入
- 费用及Tokens:
- 费用总消耗:1.78RMB(实际可能更少,同时间笔者在进行其他科研任务,仍在使用缓存命中较低的预览版)
- Token(缓存命中-未命中-输出):56105280-329411-225048
- 缓存命中率:99.42%
测评体验#
- 思维链密度更高,整段内容更充实,多为”I’m doing”结构(这也是用来验证正式版API的一个标准),与之相比,预览版的提示词多为”Let me”结构,且段落较短;思维链不再像预览版在思维链写代码。
- 工具调用和Skill触发更多,在Plan阶段很快的触发了brainstorming和wrting-plans,执行阶段会开subagent(同时,有部分测试者反应执行阶段思维链会切换回”Let me”结构,但笔者测试没有出现,我认为为模型路由不稳定导致)
- 思维链返回会等待一轮思考结束完全返回,而非预览版一段一段返回,体现在Claude Code里就是thinking时间过长,一度让笔者以为卡了,不过最终思维过程输出很严谨
- 出现编译过程timeout的情况,不再像预览版多轮命令检查一直timeout,会主动检查环境配置和依赖问题,Debug能力增强
- 虽然思维链密度很大,但是没有出现雷霆大思考和左右脑互搏,后训练效果极佳
- 缓存命中率超级无敌高,单论本项目的缓存命中率,有可能接近99.7%,正式版上线调价后大概率价格还更低
注:在整个过程中,笔者进行过一次手动输入,那是因为笔者忘了我的世界怎么操作了,以为下面的物品框是空的是bug,最后DeepSeek为我加了一个操作说明
测试视频#
视频 1:测试生成视频
视频 2:游戏画面截图
试玩地址#
总结#
因为号被A畜封了,笔者无法给出与Opus 4.8的比较。但是,在“许愿式编程”的流畅实现上,DeepSeek-V4已经越来越近。同时,在笔者的科研任务(有很多软硬件的Debug)中,这版模型已经强于笔者使用过的所有模型。至于缓存命中率,已经无人可敌。也许低价高质的AI模型即将触手可及。
声明:本测评仅代表个人观点。