Kimi开源PerceptionBench视觉感知基准,GPT-5.6-Sol准确率居首但无模型突破60%
AI 摘要
一句话摘要: Kimi开源视觉感知基准PerceptionBench,16款模型无一准确率超60%,GPT-5.6-Sol居首。 关键事实: PerceptionBench将视觉感知拆解为10项原子能力,基于42个评测集构建3000道人工验证问题,16款前沿多模态大模型整体准确率均低于60%,GPT-5.6-Sol以59.7%排名第一。 涉及主体: Kimi, GPT-5.6-Sol, Claude-Fable-5, Gemini-3.1-Pro, GPT-5.5 可能影响: 该基准为多模态大模型视觉感知能力提供了更精细的评估标准,可能推动行业聚焦视觉幻觉等薄弱环节的改进,加速模型在真实场景的落地应用。 是否值得继续跟踪: 是,因为该基准揭示了当前模型的显著短板,后续模型迭代和基准扩展可能带来重要技术突破。 噪音/炒作风险: 低,该基准基于公开评测集和人工验证,结果客观且无模型突破60%,反映了真实技术瓶颈,非营销炒作。