AI’s recursive self-improvement might not come so quickly after all
AI 摘要
一句话摘要: 新研究表明AI尚不具备开放式研究能力,递归自我改进可能不会很快实现。 关键事实: 普林斯顿团队用“影子评估”测试AI代理,要求其解答未发表论文的研究问题,结果两篇论文均被拒,AI能完成工程任务但缺乏创造力与判断力,测试中AI代理获得6天时间、3000美元API额度和GPU预算仍失败。 涉及主体: Peter Kirgis, Sayash Kapoor, 普林斯顿大学, Anthropic, Claude Opus 4.8, OpenClaw, NeurIPS 2026 可能影响: 挑战了AI快速自我改进的乐观预测,可能促使行业重新评估自动化AI研究的时间线,并推动开发更全面的评估方法,而非仅关注可验证的窄任务。 是否值得继续跟踪: 是,该研究提供了首个针对开放式AI研究的实证评估,若后续重复验证或扩展,将直接影响AI发展速度的预测模型。 噪音/炒作风险: 中,研究设计严谨但样本量小(仅两篇论文),且AI能力快速迭代,结论可能随时间迅速过时,需警惕过度泛化。