苹果研究揭示AI大模型推理局限:模式匹配与记忆为主

苹果机器学习研究中心研究发现,现有AI大模型在复杂任务上的推理能力存在局限,依赖于模式匹配与记忆,而非真正的推理能力。

12效率工具AI研究推理模型机器学习苹果

研究背景

苹果机器学习研究中心于当地时间6月6日发表了一篇研究论文,指出现有AI模型并不具备真正的思维能力或推理能力,而是依赖于模式匹配与记忆。

研究方法

研究人员对现有前沿“大型推理模型”进行了系统评估,包括OpenAI o3-mini、DeepSeek-R1、Anthropic的Claude 3.7 Sonnet Thinking和谷歌Gemini Thinking等。

苹果最新研究:现有 AI 大模型“更像是在记忆,而非真正的推理”插图

研究结果

研究发现,尽管这些模型在中等复杂度任务上表现出优势,但当问题复杂度超过特定临界点时,模型性能会完全崩溃至“零准确率”。

苹果最新研究:现有 AI 大模型“更像是在记忆,而非真正的推理”插图1

研究意义

这项研究质疑了当前基于已建立数学基准的LRMs评估范式,强调了需要更加细致的实验设置来探索这些问题。

总结

研究团队提出,模型表现可分为三个阶段:低复杂度任务、中等复杂度任务和高复杂度任务。在低复杂度任务中,传统大模型表现更佳;在中等复杂度任务中,具备思维机制的大型推理模型更占优势;在高复杂度任务中,两类模型均陷入完全失效状态。