Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%

来源:Odaily 星球日报 · 2026-08-02
OpenAIAnthropicGoogle AI

AI 摘要

一句话摘要: Kimi开源视觉感知基准PerceptionBench,16款多模态大模型无一准确率超60%,GPT-5.6-Sol居首。 关键事实: PerceptionBench含3000道人工验证题,拆解10项原子级视觉能力,基于42个现有评测集失败案例构建,GPT-5.6-Sol以59.7%准确率排名第一,视觉幻觉是各模型最弱能力。 涉及主体: Kimi, GPT-5.6-Sol, Kimi K3, Claude-Fable-5, Gemini-3.1-Pro, GPT-5.5 可能影响: 该基准将推动多模态模型从综合评测转向细粒度能力诊断,明确视觉幻觉为行业瓶颈,或引导后续模型训练重点优化感知短板,而非仅追求推理或对话表现。 是否值得继续跟踪: 是,因基准开源且揭示无模型突破60%,后续模型迭代若在此基准上显著提升,将代表视觉感知实质进展,且幻觉问题解决可能成为差异化竞争点。 噪音/炒作风险: 低,该基准基于失败案例构建且人工验证,评测设计严谨,结果具有诊断价值,非营销性榜单,但需注意模型版本命名可能含非官方或测试性质。

阅读原文 →

← 更多文章