OpenAI发布LifeSciBench:衡量AI系统在真实科研场景中的能力

来源:Odaily 星球日报 · 2026-06-19
OpenAI

AI 摘要

一句话摘要: OpenAI发布LifeSciBench基准,评估AI在真实科研场景中的复杂能力。 关键事实: LifeSciBench基于750道专家编写任务,覆盖7类科研工作流与7个生物学领域,超过79%任务需多步骤推理,平均每道题约4个推理步骤,包含1062个真实数据附件。 涉及主体: OpenAI 可能影响: 该基准可能推动AI在生物科技和制药领域的应用,提升科研效率,并成为评估AI科研能力的新标准。 是否值得继续跟踪: 是,因为LifeSciBench聚焦复杂科研能力,可能影响AI在真实科研场景中的落地和行业标准。 噪音/炒作风险: 低,因为基准基于专家任务和真实数据,具有实际评估价值,而非空泛概念。

阅读原文 →

← 更多文章