AI models flub these intelligence tests. Can you fare any better?

来源:MIT Technology Review · 2026-08-26
OpenAI

AI 摘要

一句话摘要: AI在谜题测试中进步迅速但仍有明显弱点,人类在空间推理等领域仍占优势。 关键事实: 2024年底最佳模型仅能解决18%纽约时报Connections谜题,2025年初部分模型近乎完美解决,哥伦比亚大学团队研究;谷歌与伊利诺伊大学2024年研究发现模型在Knights and Knaves变体谜题上因记忆训练数据而失误;模型在3D空间推理和ARC-AGI抽象视觉推理任务上表现糟糕。 涉及主体: 哥伦比亚大学, 谷歌, 伊利诺伊大学厄巴纳-香槟分校, 纽约时报, Arthur Samuel, ARC-AGI 可能影响: 揭示当前LLM在推理泛化与空间理解上的根本局限,推动未来模型训练更注重抽象规则提取与视觉-空间能力,而非单纯依赖记忆;同时为人类-AI协作场景提供边界参考。 是否值得继续跟踪: 是,因为谜题基准是衡量AI推理能力演进的关键指标,且弱点领域(空间、抽象视觉)可能成为下一代模型突破重点。 噪音/炒作风险: 低,文章基于具体研究数据和可复现的基准测试,非主观评论,且引用多来源学术成果。

阅读原文 →

← 更多文章