DUDuuu.studio

Back

7月17日,根据笔者帐号API的特征,确定已经被灰度测试DeepSeek-V4正式版,故模仿前期网络上的相关测试,使用简单prompt生成我的世界网页版游戏,测试该模型的“许愿式编程”和Plan-Build-Debug能力,验证网络上的测试是否为炒作。在文末,笔者将相关代码部署到了服务器,大家可以在浏览器进行试玩进行评价。

整体情况及配置#

  • 环境: Claude Code 2.1.117 + DeepSeek-V4-Pro + max 思考强度
  • 提示词:

    为我还原一个网页版我的世界,越还原越好。如果有不确定的地方请进行联网搜索

  • 手动操作: Plan环节接受所有“推荐”的建议,不进行额外输入
  • 费用及Tokens:
    • 费用总消耗:1.78RMB(实际可能更少,同时间笔者在进行其他科研任务,仍在使用缓存命中较低的预览版)
    • Token(缓存命中-未命中-输出):56105280-329411-225048
    • 缓存命中率:99.42%
Token消耗
图 1:Token消耗

测评体验#

  • 思维链密度更高,整段内容更充实,多为”I’m doing”结构(这也是用来验证正式版API的一个标准),与之相比,预览版的提示词多为”Let me”结构,且段落较短;思维链不再像预览版在思维链写代码。
  • 工具调用和Skill触发更多,在Plan阶段很快的触发了brainstorming和wrting-plans,执行阶段会开subagent(同时,有部分测试者反应执行阶段思维链会切换回”Let me”结构,但笔者测试没有出现,我认为为模型路由不稳定导致)
  • 思维链返回会等待一轮思考结束完全返回,而非预览版一段一段返回,体现在Claude Code里就是thinking时间过长,一度让笔者以为卡了,不过最终思维过程输出很严谨
  • 出现编译过程timeout的情况,不再像预览版多轮命令检查一直timeout,会主动检查环境配置和依赖问题,Debug能力增强
  • 虽然思维链密度很大,但是没有出现雷霆大思考和左右脑互搏,后训练效果极佳
  • 缓存命中率超级无敌高,单论本项目的缓存命中率,有可能接近99.7%,正式版上线调价后大概率价格还更低

注:在整个过程中,笔者进行过一次手动输入,那是因为笔者忘了我的世界怎么操作了,以为下面的物品框是空的是bug,最后DeepSeek为我加了一个操作说明

新版思维链速览
图 2:新版思维链速览

测试视频#

视频 1:测试生成视频

视频 2:游戏画面截图

试玩地址#

https://duduuu.xyz/mc/

总结#

因为号被A畜封了,笔者无法给出与Opus 4.8的比较。但是,在“许愿式编程”的流畅实现上,DeepSeek-V4已经越来越近。同时,在笔者的科研任务(有很多软硬件的Debug)中,这版模型已经强于笔者使用过的所有模型。至于缓存命中率,已经无人可敌。也许低价高质的AI模型即将触手可及。

声明:本测评仅代表个人观点。

[DeepSeek-V4正式版灰度测试]Claude Code中一句话生成网页版我的世界游戏
https://duduuu.xyz/zh/posts/deepseek-v4-minecraft
Author dudu
Published at 2026年7月18日
阅读
总访问