OpenAIo3-mini挑战DeepSeekR1:AI弹跳球大比拼

AI 圈热议不断,DeepSeek 一举成为焦点长达十余天。然而,昨日 OpenAI 按捺不住,推出了全新推理模型系列 o3-mini。此举不仅首次向免费用户开放推理模型,而且与之前的 o1 系列相比,成本降低了15倍。

OpenAI 自称这是其推理模型系列中最新、最具成本效益的模型。新模型一经推出,便有网友迫不及待地将其与国产大模型 DeepSeek R1 进行对比。

近期,AI 社区热衷于用 DeepSeek R1 和其他推理模型进行弹跳球任务的比拼。任务要求编写一个 Python 脚本,使球在某个形状内弹跳,该形状缓慢旋转,并确保球停留在形状内。这是一个经典的编程挑战,相当于一个碰撞检测算法,需要模型识别两个物体(如球和形状的侧面)何时发生碰撞。编写不当的算法会出现明显的物理错误。

在微软、英伟达、亚马逊等美国云计算平台纷纷引进 DeepSeek R1 的同时,R1 在这个任务中成功击败了 OpenAI 的 o1 pro。对比 Claude 3.5 Sonnet 和谷歌的 Gemini 1.5 Pro 的生成结果,DeepSeek 的开源模型在性能上明显高出不止一个等级。

然而,随着 o3-mini 的上线,剧情似乎发生了反转。有帖子称 OpenAI o3-mini 击败了 DeepSeek R1,引发近400万网友围观。开发者使用的提示词是:“编写一个 Python 程序,展示球在旋转的六边形内弹跳。球应受到重力和摩擦力的影响,并真实地反弹到旋转的墙壁上。”

这个任务要求 o3-mini 和 DeepSeek R1 分别编写一个球在旋转六边形内弹跳的 Python 程序,小球跳动的过程中要遵循重力和摩擦力的影响。最终效果如下:

从效果来看,o3-mini 更好地展示了碰撞和弹跳效果。从对重力和摩擦力的理解来看,DeepSeek R1 版本的小球似乎有些失控,完全不受重力控制。

这并非个案。@hyperbolic_labs 联合创始人 Yuchen Jin 在此之前也发现了这个问题,他分别向 DeepSeek R1 和 o3-mini 输入了提示词:编写一个 Python 脚本,模拟球在四维超立方体内部弹跳。四维超立方体的每个顶点与四条棱相邻,每条棱连接两个立方体。四维空间内的几何图形超出了人类的直观感知范围,所以听着这些描述,我们可能很难想象出一个四维超立方体长什么样子。

而 o3mini 不仅展现出了稳定的几何结构,小球在四维空间内弹跳的运动轨迹也较为灵活,有撞到立方体侧面的打击感。

然而,DeepSeek R1 对四维超立方体的形状理解似乎还不够深入透彻。同时,小球在其中的运动轨迹也显得有些诡异,有一种“飘忽不定”的感觉。

据 Yuchen Jin 称,他试了很多次,所有用 DeepSeek R1 尝试都比一次性的 o3-mini 要差,比如下面这次就剩下球了。

机器之心也亲测了一把,同样是 Pass@1 测试,DeepSeek R1 这次是既有球又有几何外框了,甚至小球还会变换颜色,遗憾的是,它把四维超立方体简化成了三维空间坐标轴。

o3mini 的表现则有些“买家秀”的意味,明明和 Yuchen Jin 输入的是完全一样的提示词,为什么 o3mini 就不会了?得不到如上所示的“卖家秀”了呢?

看来,在生成小球在几何外框内跳动的程序这方面,DeepSeek R1 并不是完全是 o3mini 的手下败将。

AIGC 从业者 @myapdx 用了一个更加复杂的同类提示词来测试 o3mini 和 DeepSeek R1:编写一个 p5.js 脚本,模拟 100 个彩色小球在一个球体内部弹跳。每个小球都应留下一条逐渐消失的轨迹,显示其最近的路径。容器球体应缓慢旋转。请确保实现适当的碰撞检测,使小球保持在球体内部。

o3mini 的效果是这样的:

而 DeepSeek R1 的效果,好像也没差到哪里去:

至于为什么会出现这样的差异,Yuchen Jin 和 @myapdx 都在帖子中提到,这个任务对模型如何理解真实世界的物理规律有所反应。模型需要综合自己对语言、几何、物理和编程的理解,方能得出最后的模拟结果。从前两轮的结果看来,o3mini 有可能是物理学得最好的大模型。

与此同时,OpenAI 也在昨天的发布博客中强调过,在博士极科学问题方面 o3-mini-low 的表现优于 o1-mini。o3-mini-high 的表现与 o1 相当,在博士级生物学、化学和物理问题上都有显著进步。

对人类来说,理解小球跳动时的重力和摩擦力并不算困难,但在大语言模型领域,这种对物体物理状态的“世界模型”理解能力,直到最近才真正突破。

还有网友猜测,DeepSeek R1 的程序有时只有一个球,会不会是它想得太多了?不知是否有读者亲自体验过?欢迎讨论。

相关文章:
1. 5大免费使用满血版 DeepSeek-R1 的AI推理平台
2. 警惕!DeepSeek 数据库泄露:中国 AI 崛起背后的安全隐患
3. OpenAI 要开源 GPT 了?未来AI蓝图震撼曝光:GPT-5、Agent、定价策略全方位解读!
4. Trae、Cursor、Windsurf AI编程工具对比
5. AI写作工具如何帮助提升25%转化率

相关推荐

暂无评论

发表评论