Grok 3、DeepSeek 六大 AI 模型挑战《沙丘 x 我的世界》游戏开发

AI达人Lisha用Grok 3、o1等六大模型挑战生成《沙丘×我的世界》3D沙盒游戏。o1综合表现最佳,可玩性强、画质流畅;Grok 3美学惊艳,香料采矿车设计出彩但功能不全;Sonnet 3.5玩法完整却缺乏沉浸感;DeepSeek难度失控,Gemini 2.0 Flash与Llama 4则未能生成可运行代码。

发布于2025年2月23日 15:01
编辑零重力瓦力
评论0
阅读42

现在,用 Grok 3、o1、DeepSeek 生成简单小游戏已经不足为奇,效果都还不错,难分伯仲。那么这些模型在生成复杂 3D 游戏上的表现如何呢?

AI 技术达人 Lisha,对 Grok 3、o1、Sonnet 3.5、Llama 4、DeepSeek 和 Gemini,6 款目前主流的 AI 模型进行了测试,生成一个 3D 《沙丘 x 我的世界》。

游戏生成提示词

Imagine a sandbox survival game set on a desert planet. Players mine ‘spice’ and must build defenses against roaming sandworms. Design the main gameplay loop, crafting system, and survival challenges in one complete description.
想象一个设定在沙漠星球上的沙盒生存游戏。玩家需要开采“香料”,同时建造防御工事,以抵御游荡的沙虫。请设计完整的核心玩法,包括循环、合成系统和生存挑战。

详细评测

1. o1
兼顾了美学和功能性。游戏可玩, 画面不错,操作流畅,能成功开采香料。

游戏地址:https://play.rosebud.ai/p/3d71be95-075f-4891-9cea-b9e4824f365b

2. Grok 3
美学表现惊艳! 尤其是沙丘风格的香料采矿车,视觉效果很棒。但缺乏完整性,可自由移动,但合成系统未实现,游戏性不足。

游戏地址:https://play.rosebud.ai/p/61385e4b-0ce4-44ba-87a4-fe8be5be692d

3. Sonnet 3.5
玩法比 Grok 3 更完整,可以开采香料。但整体氛围不如 o1 和 Grok 3,缺少沉浸感。

游戏地址:https://play.rosebud.ai/p/c3aaf9bd-bbe2-48aa-9626-2280a7c25bc8

4. DeepSeek
代码成功运行,但游戏难度极高,玩家几秒内就会失败。视觉效果较差,即使尝试优化,进步有限。

游戏地址:https://play.rosebud.ai/p/2fcac7de-2820-4b09-9851-f31f0f779dad

5. Gemini 2.0 Flash 和 LLaMA 4
排名垫底,它们在第一次尝试时都未能生成可运行的代码,而其他模型都能。尝试了多次,但仍然无法成功生成符合要求的游戏。

总结

最令人印象深刻的模型是 o1、Grok 3 和 Sonnet 3.5。Grok 在美学呈现上表现最佳(甚至生成了一个非常酷的香料采矿卡车),但游戏的可玩性较差。o1 综合表现最佳,既有功能性,又有视觉吸引力。Sonnet 3.5 紧随其后,虽然具有一定可玩性,但整体氛围不如前两者。

游戏部署及测试平台:Rosebud

Rosebud 支持一键部署,并且能够对项目代码进行迭代。

相关文章

Windsurf 2.0 拆解:Devin 被塞进编辑器,氛围编程终于有了“调度中心”
AI 编程开发
2026年6月2日
0 条评论
零重力瓦力

Windsurf 2.0 拆解:Devin 被塞进编辑器,氛围编程终于有了“调度中心”

Cognition 发布 Windsurf 2.0,深度整合 Devin 实现本地思考与云端执行分工。新版推出 Agent Command Center 支持多智能体可视化管理,搭载自研 SWE-1.5 模型大幅提升代码定位与编辑速度,并引入 Spaces 容器解决上下文延续问题。Pro 版调整为日配额制且包含 Devin 功能。相比 Cursor 3,Windsurf 2.0 凭借自研模型与云端执行能力,更适合处理陌生代码库及长任务自动化场景。

#智能体#AI 编程
阅读全文
Claude Opus 4.8 震撼发布,多智能体协同让开发效率翻倍
AI 新闻资讯
2026年6月1日
0 条评论
小创

Claude Opus 4.8 震撼发布,多智能体协同让开发效率翻倍

Anthropic 发布 Claude Opus 4.8,在基准测试中超越 ChatGPT 5.5,重夺编程领域领先地位。新版本核心亮点为动态工作流与 Ultracode 模式,通过多智能体协同大幅提升复杂任务开发效率,同时幻觉率降至四分之一。得益于算力扩充,其性能提升且价格下调,快速模式费用降至三分之一。建议开发者日常使用常规上下文模式并调高努力程度,大项目再开至最大。此外,AI 时代专注力仍是拉开差距的关键。

#Claude#AI 编程
阅读全文
告别套壳与适配:2026 开发者主流 LLM 聚合网关选型指南
AI 编程开发
2026年5月29日
0 条评论
零重力瓦力

告别套壳与适配:2026 开发者主流 LLM 聚合网关选型指南

针对 AI 应用开发中多模型适配难题,LLM 聚合 API 平台通过统一接口有效降低维护成本。海外平台如 OpenRouter、Portkey 生态完善且兼容性强。国内平台如硅基流动、阿里云百炼侧重合规与本土模型支持。自建方案 LiteLLM、One API 则适合追求自主可控与极致性价比的团队。开发者应根据业务阶段、预算及合规要求灵活选型,生产环境推荐采用“自建网关+多渠道分流”的混搭架构,以兼顾成本、稳定性与灵活性。

#模型 API
阅读全文
互动讨论

评论区

围绕《Grok 3、DeepSeek 六大 AI 模型挑战《沙丘 x 我的世界》游戏开发》展开交流,未登录用户可浏览评论,登录后可参与讨论。

评论数
0
登录后参与评论
支持发表观点与回复一级评论,互动后将同步到消息中心。
登录后评论
暂无评论,欢迎成为第一个参与讨论的人。