OpenAI于2026年6月17日发布了LifeSciBench,这是一个包含750项任务的评估体系,由173位博士级科学家共同构建,旨在测试AI能否处理真实生命科学研究的全部复杂性——测试结果量化了该技术仍有很长的路要走。表现最佳的模型GPT-Rosalind仅通过了36.1%的任务,其他所有测试模型的表现更差。近三分之二的研究级任务仍然使当前最强大的AI系统束手无策。
为什么标准生物学基准测试一直不是正确的测试方式
目前大多数生物学AI评估采用标准化考试的形式:多项选择题、清晰的参考答案、一个正确选项。这种形式与实际科研人员的工作几乎毫无共同之处。研究人员需要权衡不完整数据、调和相互矛盾的已发表结果、在不确定性下设计实验,并以适当的注意事项向监管或同行评审受众传达发现。LifeSciBench正是围绕这一差距构建的。
该基准测试与一篇技术预印本同时发布,涵盖七个科学工作流程——证据处理、分析、设计与优化、科学推理、验证与操作、翻译以及科学交流——以及七个生物领域,从基因组学到药物化学,再到临床和转化科学。每项任务都设计成自由回答的形式,就像科学家向知识渊博的同事简要说明一样,附带相关支持材料,并根据专家编写的详细评分标准进行评分。没有多项选择题,没有可匹配的参考字符串,只有一个需要模型像科学家那样进行推理并回应的问题。
LifeSciBench如何实际评分AI
评分架构使LifeSciBench在技术上区别于以往任何生命科学评估。每项任务都配有平均25项具体评分标准的评分表,不仅评估模型是否得出正确结论,还评估其是否以科学有效且操作实用的方式得出结论——包括适当的论证、正确的注意事项以及领域专家所期望的详细程度。
在全部750项任务中,这些评分表总计包含19,020项独立标准。模型满足每一项标准即可获得分数。任务通过阈值设定为可用评分点的70%——这一设计选择意味着模型可以累积部分分数而不通过任务,基准测试分别记录标准化分数和任务通过率。这种区分很重要:一个回答可能包含高质量的推理,但仍未能达到全部标准。
超过一半的任务(53%)要求模型解读或综合至少一个附加文件中的信息——图表、PDF、表格、基因组序列文件、化学结构文件或网络参考。完整的基准测试在750项任务中包含1,062个此类文件。这不是偶然的。科学研究本质上是多模态的,对实验数据图表或化学结构文件进行推理的能力与回答关于同一主题的基于文本的问题在性质上是不同的。
79%的任务需要多个推理或决策步骤,平均每项任务四个步骤,这反映了同样的原则:真正的科学判断是连续且有条件的,而不是单步检索。
每个前沿模型在AI生命科学基准测试中的表现
五种模型在单轮设置中接受了评估,每个模型只看到一次任务提示和任何附加文件,并允许不受限制的互联网浏览。
OpenAI的领域专用生命科学模型GPT-Rosalind以0.576的标准化分数和36.1%的任务通过率领先。该公司的通用前沿模型GPT-5.5紧随其后,分数为0.519,通过率为25.7%。Gemini 3.1 Pro排名第三,分数为0.515,通过率为23.6%;GPT-5.4的分数为0.479,通过率为20.7%;Grok 4.3的分数为0.399,通过率为13.0%。
排名仅讲述部分故事。GPT-Rosalind在750项任务中的386项任务上表现最佳——但Gemini 3.1 Pro在其中214项任务上表现最佳。总体分数可能掩盖了任务特定的优势:总体表现最差的模型在特定工作流程类别中仍可能优于领先者。值得注意的是,Anthropic的Claude模型未包含在此次评估中。
在所有五种模型中,前沿AI目前在结构化判断任务方面能力最强——科学交流、翻译和证据综合,这些任务的输出格式和期望相对稳定。在需要设计新事物或在约束条件下进行多步优化决策的类别中,AI表现最差:设计、优化和预测类任务中,GPT-Rosalind仅通过了30.7%的任务;分析类任务的通过率为30.3%。基准测试的作者指出,没有模型能通过171项任务(22.8%),而261项任务(34.8%)的最佳模型通过率低于20%——这意味着基准测试的很大一部分对当前AI构成了无法可靠应对的挑战。
文件处理问题:AI表现骤降的关键所在
基准测试数据中最明显的发现是,当任务需要解读文件时,性能会出现一致且大幅的下降。GPT-Rosalind在纯文本任务上的任务通过率从45.1%降至涉及至少一个附加文件的任务上的28.1%——下降了17个百分点。GPT-5.5也呈现同样的下降模式:纯文本任务通过率为29.9%,文件任务通过率为21.9%。
这不是一个微小的差异。这是基准测试关于前沿AI在成为可靠的研究合作者之前需要改进之处的最具体信号。在实际的药物发现工作流程中,实验数据几乎总是存在于图表、表格、检测输出文件和化学结构数据库中——而不仅仅存在于文本中。一个在基于文本的科学问题上表现良好,但在处理基因组序列文件或空间转录组数据集时表现显著下降的AI系统,在研究管道中最关键的部分存在功能性差距。
OpenAI评估自家模型是否产生利益冲突?
LifeSciBench是由同一家公司设计和管理的专有基准测试,该公司的模型——GPT-Rosalind——在排行榜上领先。将36.1%的声明解读为独立科学验证的读者应了解这种结构性关系。
这种担忧在更广泛的AI评估领域已有详细记录。2026年6月12日发表在《自然医学》上的一篇同行评议分析研究了OpenAI的HealthBench评估,结论是行业创建的基准测试可能系统性地偏爱其创建者开发的系统,并呼吁采用独立构建的评估工具。LifeSciBench发布后的早期社区反应包括对"专家选择不透明和针对竞争对手的框架"的类似反对意见。
OpenAI在设计LifeSciBench时采取了一些缓解措施。任务由公司外部的173位科学家编写,与专注于药物开发反馈循环的初创公司Tacit Labs合作完成。由453人组成的评审小组——其中97%拥有博士学位——在相关性、推理、依据和实用性方面达成了超过96%的一致性。每项任务在被接受前平均经过六次自动评审循环和至少两轮专家评审。每个领域要求达到90%的专家共识。
这些结构性保障措施是否能完全抵消自我管理基准测试的固有限制,仍然是评估界需要回答的一个开放性问题,随着独立研究人员检查预印本和任务集。OpenAI表示,计划将基准测试表现与实时研究环境中的部署研究联系起来,这将提供一个更易于外部验证的信号。
36%的AI药物发现通过率在实践中意味着什么
OpenAI将LifeSciBench视为一个测量计划的开始,而非终点。目标是将基准测试表现与实际研究工作流程中的部署研究联系起来——衡量AI系统是否加速发现将需要在更长时间范围内跟踪模型使用情况,并跨越多轮推理和实验跟进。
这种框架是适当的谨慎。PitchBook 2026年1月的分析发现,自2019年以来,已有超过170亿美元投资于AI药物发现,但尚无AI开发的药物进入大规模临床试验。AI在任何基准测试上的表现与AI对药物审批时间线的影响之间的差距是漫长、复杂且理解不足的。
在一个难度较大的基准测试上36.1%的通过率并不意味着AI已准备好作为自主研究伙伴发挥作用。OpenAI生命科学研究负责人焦悦(Joy Jiao)在2026年4月GPT-Rosalind发布时表示,该公司认为AI目前还不能独立创造新的疾病治疗方法。
基准测试结果确实确立了一个校准的基线:前沿AI目前失败的具体工作流程类别、文件类型和推理步骤,这些失败率使得在研究管道中无人监督的部署存在风险。这一校准对于研究主管、企业AI购买者和评估如何部署AI工具的制药组织来说是有用的信息——以及在哪里需要让人类科学家参与进来。
GPT-Rosalind目前通过OpenAI的可信访问计划向全球符合条件的组织提供研究预览版,该计划要求进行具有明确公共效益的合法科学研究,具备企业级治理和生物安全监督。OpenAI还接受希望为未来基准测试迭代做出贡献的科学家的申请。
常见问题解答
LifeSciBench是什么,它与现有AI基准测试有何不同?
LifeSciBench是针对生命科学研究中AI的750项任务评估,由OpenAI于2026年6月17日发布,并与来自生物技术和制药研究的173位博士级科学家共同开发。与使用多项选择题和清晰参考答案的现有AI生物学基准测试不同,LifeSciBench提供自由回答任务,由专家编写的评分标准进行评分,每项平均25个标准——总计19,020个标准——并要求模型解读包括基因组序列文件、化学结构文件和实验图表在内的科学文件。任务平均需要四个推理步骤;53%的任务需要文件综合。
为什么前沿AI模型在生命科学研究任务中表现如此吃力?
该基准测试确定文件处理是主要瓶颈。GPT-Rosalind在纯文本任务上的任务通过率从45.1%降至涉及附加数据文件的任务上的28.1%——下降了17个百分点。科学数据几乎总是存在于图表、检测输出和结构文件中,而不是纯文本中,这意味着AI最薄弱的环节也是实际研究工作流程中最常见的部分。设计、优化和多步分析任务也特别困难,GPT-Rosalind在设计类任务中仅通过了30.7%,在分析类任务中通过率为30.3%。
OpenAI构建测试其自身模型的基准测试是否引发任何担忧?
是的,这是一个公认的限制。2026年6月12日发表在《自然医学》上的一项同行评议研究发现,行业创建的基准测试可能系统性地偏爱其创建者开发的系统。OpenAI包含了结构性保障措施——外部科学家编写任务,453位独立评审员提供质量控制,且任务要求每个领域的评审员达成90%的一致性——但在将LifeSciBench分数视为完全客观验证之前,该领域仍需要将结果与外部构建的评估进行独立复制,这是该领域需要的标准。OpenAI承诺下一步将基准测试分数与实际研究环境中的部署研究联系起来。
AI今天能否帮助加速药物发现,研究组织应该现实地期望什么?
包括GPT-Rosalind在内的AI工具在证据综合、文献回顾、协议辅助和结构化通信任务方面最为可靠有用,LifeSciBench在这些方面表现最强。在专家设计的研究任务上36.1%的通过率意味着AI可以有意义地协助熟练的科学家,但不能取代安全解读其输出所需的判断。尽管自2019年以来已有超过170亿美元投资于AI药物发现,但尚无AI开发的药物进入大规模临床试验。在证据处理和实验规划阶段部署AI工具的研究组织——由科学家审查和验证输出——正在以符合当前基准测试能力的方式使用该技术。
2021年10月19日,在法国东部斯特拉斯堡的斯特拉斯堡生物医学研究中心(CRBS)实验室中拍摄的试管和其他设备
弗雷德里克·弗洛林/Getty Images
【全文结束】

