OpenAI o1-preview 常识问题推理能力与主流模型的对比

2024-09-14 AI 工具文章 0 0 294 0

目前，大多数语言模型在常识问题的推理能力上相对较弱。在这段 OpenAI 最新发布的演示视频中，研究人员让 o1 解答一个常识性问题：“假设在地球的物理定律下，一个小草莓被放入一个普通杯子里，然后杯子倒扣在桌子上，接着有人将杯子放进微波炉，草莓在哪里？”

o1 给出了较为准确的结论，并详细阐述了推理过程：

初始放置：小草莓被放入一个普通的杯子中，此时草莓位于杯底。
杯子倒置：杯子被倒扣在桌子上，意味着杯子的开口端（草莓最初放置的地方）现在朝下，与桌面接触。因此，草莓被倒置的杯子盖住，位于桌子上。
拿走杯子：当有人将倒着的杯子放入微波炉时：

虽然视频没有显示 o1 给出的最终答案，但其推理过程是正确的。

同一个问题我用(GPT-4o、GPT-4o mini、Claude 3.5、Gemini-1.5-Pro、Llama3.1、豆包、文心一言、通义千问和 Kimi。) 这 9 个模型分别进行了测试。

测试结果

GPT-4o

GPT-4o mini

Claude 3.5

Gemini-1.5-Pro

Llama3.1

豆包

文心一言

通义千问

Kimi

回答正确

GPT-4o
Claude 3.5
Llama3.1

回答错误

GPT-4o mini
Gemini-1.5-Pro
豆包
文心一言
通义千问
Kimi

ChatGPT OpenAI OpenAI o1 语言模型

评论(0)

提示：请文明发言取消回复