AI 快讯 编译自 marktechpost #模型评测#基准测试#生命科学

OpenAI 发布 LifeSciBench:750 项真实科研任务评测 AI,专家编写评分标准,最强模型仅通过 36%

OpenAI 推出 LifeSciBench,包含 750 个由 173 位博士科学家编写的真实生命科学研究任务,覆盖 7 大工作流和 7 个生物领域。评测采用 19020 条专家评分标准,而非简单答案比对。当前最强模型 GPT-Rosalind 通过率仅 36.1%,揭示 AI 在科研推理、工具使用和精确输出上的巨大差距。

编译发布 2026/06/18 原文发布 2026/06/18

一句话看懂

OpenAI 发布 LifeSciBench,一个包含 750 个真实科研任务的评测基准,由 173 位博士科学家编写评分标准,当前最强模型通过率仅 36.1%。

详细发生了什么

大多数生物学评测只问窄范围的事实性问题,答案明确。但真正的科研需要权衡不完美的证据并做出决策。OpenAI 发布的 LifeSciBench 直接瞄准这一缺口。

LifeSciBench 包含 750 个专家编写的任务,覆盖 7 个工作流(证据处理与分析、设计与优化、科学推理、验证与操作、转化、科学沟通等)和 7 个生物领域(基因组学、药物化学、临床与转化科学等)。每个任务包含提示、支持材料(artifact)和评分标准。任务以科学家向同事简报的方式编写,是自由回答而非选择题,约 79% 需要多步推理或决策,平均 4 步。

基准构建过程严谨:173 位拥有博士学位的专家编写任务,平均经过 6 轮自动审查和至少 2 轮专家审查。任务附带 1062 个材料,包括序列、图表、表格、PDF 和化学结构。另有 453 位评审员(97% 持有博士学位)验证质量,总体一致性超过 96%。

评分标准是核心:共 19020 条标准,每条对应一个具体属性(如特定事实、推理步骤或数值答案)。评测采用归一化得分和任务通过率(≥70% 得分)两个指标。当前最强模型 GPT-Rosalind 归一化得分 0.576,通过率 36.1%;GPT-5.5 通过率 25.7%;Gemini 3.1 Pro 通过率 23.6%;Grok 4.3 通过率 13.0%。

模型在结构化判断(翻译、科学沟通)上表现较好,但在设计优化、分析等复杂工作流上困难。使用材料(artifact)的任务通过率显著下降,GPT-Rosalind 从文本任务的 45.1% 降至 28.1%。精确输出(如序列、结构)最难,GPT-Rosalind 在生成/构造项目上的提升仅比 GPT-5.5 多 0.001。

中文圈视角

对国内科研用户意味着什么?

  1. 科研 AI 评测的范式转变:国内常用评测如 C-Eval、MMLU 侧重知识记忆,而 LifeSciBench 强调推理、决策和工具使用。这提示国内模型(如 DeepSeek、Qwen、Kimi)在科研场景的评测需要升级。目前国内缺乏类似的高质量、多步骤、带材料评测基准。

  2. 国产模型差距与机会:GPT-Rosalind 是 OpenAI 的领域专用模型,通过率仅 36%,说明通用模型在科研任务上远未成熟。国内模型在类似任务上可能表现更差,但这也意味着优化空间大。例如,DeepSeek 在数学推理上表现突出,但生命科学领域的多步推理和材料解析能力尚未被系统评测。

  3. 材料解析是瓶颈:53% 的任务需要解析图表、PDF、化学结构等材料,这正是国内模型相对薄弱的环节。Kimi 在长文档处理上有优势,但多模态材料解析(如 Visium 空间转录组数据)仍需提升。

  4. 合规与数据安全:LifeSciBench 任务涉及真实科研数据,国内用户若想复现评测,需注意数据出境和合规问题。ModelScope 等平台可考虑构建类似的中文科研评测集。

  5. 未讨论的盲点:LifeSciBench 是单轮评测,而真实科研是迭代过程。国内可关注多轮对话和工具调用(tool calling)在科研场景的评测,这可能是下一波竞争焦点。

几条值得记住的细节

  • LifeSciBench 包含 750 个任务,由 173 位博士科学家编写,平均每个任务 25 条评分标准。
  • 最强模型 GPT-Rosalind 通过率 36.1%,但仍有 171 个任务(22.8%)没有任何模型通过。
  • 使用材料(artifact)的任务通过率比纯文本任务低约 17 个百分点(GPT-Rosalind 从 45.1% 降至 28.1%)。
  • 精确输出(如序列、结构)最难,GPT-Rosalind 在生成/构造项目上的得分仅比 GPT-5.5 高 0.001。
  • 评测采用单轮设置,允许无限制互联网浏览,但实际科研需要多轮迭代。

一句话总结

LifeSciBench 表明,AI 在真实科研任务上远未达标,尤其是材料解析和精确输出,国产模型需加速补齐这些短板。