Grok 3、DeepSeek 六大 AI 模型挑战《沙丘 x 我的世界》游戏开发

AI达人Lisha用Grok 3、o1等六大模型挑战生成《沙丘×我的世界》3D沙盒游戏。o1综合表现最佳，可玩性强、画质流畅；Grok 3美学惊艳，香料采矿车设计出彩但功能不全；Sonnet 3.5玩法完整却缺乏沉浸感；DeepSeek难度失控，Gemini 2.0 Flash与Llama 4则未能生成可运行代码。

发布于2025年2月23日 15:01

编辑零重力瓦力

评论0 条

阅读70

#Grok #OpenAI #AI 编程

现在，用 Grok 3、o1、DeepSeek 生成简单小游戏已经不足为奇，效果都还不错，难分伯仲。那么这些模型在生成复杂 3D 游戏上的表现如何呢？

AI 技术达人 Lisha，对 Grok 3、o1、Sonnet 3.5、Llama 4、DeepSeek 和 Gemini，6 款目前主流的 AI 模型进行了测试，生成一个 3D 《沙丘 x 我的世界》。

游戏生成提示词

Imagine a sandbox survival game set on a desert planet. Players mine ‘spice’ and must build defenses against roaming sandworms. Design the main gameplay loop, crafting system, and survival challenges in one complete description.

想象一个设定在沙漠星球上的沙盒生存游戏。玩家需要开采“香料”，同时建造防御工事，以抵御游荡的沙虫。请设计完整的核心玩法，包括循环、合成系统和生存挑战。

详细评测

1. o1
兼顾了美学和功能性。游戏可玩，画面不错，操作流畅，能成功开采香料。

游戏地址：https://play.rosebud.ai/p/3d71be95-075f-4891-9cea-b9e4824f365b

2. Grok 3
美学表现惊艳！尤其是沙丘风格的香料采矿车，视觉效果很棒。但缺乏完整性，可自由移动，但合成系统未实现，游戏性不足。

游戏地址：https://play.rosebud.ai/p/61385e4b-0ce4-44ba-87a4-fe8be5be692d

3. Sonnet 3.5
玩法比 Grok 3 更完整，可以开采香料。但整体氛围不如 o1 和 Grok 3，缺少沉浸感。

游戏地址：https://play.rosebud.ai/p/c3aaf9bd-bbe2-48aa-9626-2280a7c25bc8

4. DeepSeek
代码成功运行，但游戏难度极高，玩家几秒内就会失败。视觉效果较差，即使尝试优化，进步有限。

游戏地址：https://play.rosebud.ai/p/2fcac7de-2820-4b09-9851-f31f0f779dad

5. Gemini 2.0 Flash 和 LLaMA 4
排名垫底，它们在第一次尝试时都未能生成可运行的代码，而其他模型都能。尝试了多次，但仍然无法成功生成符合要求的游戏。

总结

最令人印象深刻的模型是 o1、Grok 3 和 Sonnet 3.5。Grok 在美学呈现上表现最佳（甚至生成了一个非常酷的香料采矿卡车），但游戏的可玩性较差。o1 综合表现最佳，既有功能性，又有视觉吸引力。Sonnet 3.5 紧随其后，虽然具有一定可玩性，但整体氛围不如前两者。

游戏部署及测试平台：Rosebud

Rosebud 支持一键部署，并且能够对项目代码进行迭代。

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

OpenAI 旗下 GPT-5.6 Sol Ultra 通过 64 路并行 agent 在 1 小时内生成了图论 CDC 猜想的证明文本，成本不足 500 美元。该成果引发争议，因缺乏 Lean 机械化验证、未公开完整推理轨迹及受限于图论形式化库不成熟，数学界对其有效性存疑。此事表明 LLM 已具备启发式数学搜索能力，但验证基础设施滞后仍是瓶颈。未来“多路并行+防放弃 prompt”或成范式，而完善 Lean 工具链是确立 AI 证明可信度的关键。

一个人用 Claude 把 53 万行 Zig 重写成 Rust

Bun 开发者利用 Claude Fable 5 在 11 天内将 53.5 万行 Zig 代码重写为 Rust，以解决内存安全问题。项目采用 64 个 AI 实例并行及对抗性审查机制，耗资约 16.5 万美元。重写后二进制体积缩减 20%，性能提升 2% 至 5%。尽管存在 1.3 万个 unsafe 块和 19 个回归问题引发争议，但该项目验证了 AI 辅助大规模重构的可行性，其分离上下文与对抗审查等方法论具有重要参考价值。

GPT-5.6 正式发布：三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna，943 条评论里的真实声音

OpenAI 正式发布 GPT-5.6，推出 Sol、Terra、Luna 三档模型。Sol 在 Agent 评测中领先，但编码基准落后竞品且存在 token 过度消耗问题，Terra 性价比显著提升。新功能包括程序化工具调用、缓存优化及 Sol 自主训练 Luna。尽管安全围栏较严且知识截止日期存疑，该版本仍属扎实迭代。对于 Codex 用户建议升级，而 Claude Code 用户需权衡工作流兼容性，两大 AI 厂商竞争已趋白热化。

#ChatGPT#OpenAI

阅读全文

互动讨论

评论区

围绕《Grok 3、DeepSeek 六大 AI 模型挑战《沙丘 x 我的世界》游戏开发》展开交流，未登录用户可浏览评论，登录后可参与讨论。

评论数

登录后参与评论

支持发表观点与回复一级评论，互动后将同步到消息中心。

登录后评论

暂无评论，欢迎成为第一个参与讨论的人。

Grok 3、DeepSeek 六大 AI 模型挑战《沙丘 x 我的世界》游戏开发

游戏生成提示词

详细评测

总结

相关文章

GPT-5.6 Sol Ultra 1 小时证明 60 年未解的图论猜想

一个人用 Claude 把 53 万行 Zig 重写成 Rust

GPT-5.6 正式发布：三档定价、7.8% ARC-AGI-3、Sol 自主训练 Luna，943 条评论里的真实声音

评论区