AI 快讯 编译自 ai_news #AI制药#生物数据#合作

GSK与Relation Therapeutics达成1.1亿美元合作,生物数据成AI药物发现关键

GSK与英国生物技术公司Relation Therapeutics达成最高1.1亿美元的研究合作,聚焦AI辅助药物发现。Relation将生成大规模人类细胞响应数据,用于训练AI模型识别药物靶点。本文解析合作细节、生物数据的重要性及对中文圈AI制药领域的启示。

编译发布 2026/08/03 原文发布 2026/08/03

一句话看懂

GSK与英国生物技术公司Relation Therapeutics达成最高1.1亿美元的研究合作,Relation将生成人类细胞响应数据,用于训练AI模型识别药物靶点,凸显生物数据在AI药物发现中的核心地位。

详细发生了什么

GSK与英国生物技术公司Relation Therapeutics宣布达成一项最高价值1.1亿美元的研究合作,扩展双方在AI辅助药物发现领域的现有工作。根据协议,Relation将生成大规模数据集,测量人类细胞对基因变化和药物干预的响应。这些数据将用于训练AI模型,以识别潜在药物靶点,包括Relation的MORGAN平台中的模型。

合作将生物数据生成与AI模型开发并重。Relation的研究方法将计算分析与产生人类细胞新信息的实验相结合。此前,双方已在纤维化疾病和骨关节炎领域有过合作,利用Relation的Lab-in-the-Loop平台进行观察性研究,创建两个功能性疾病数据集。早期工作结合了人类遗传学、单细胞多组学、功能分析和机器学习,以识别和验证潜在疾病靶点。

Relation的Lab-in-the-Loop方法结合了实验室实验和计算分析,包括组织分析、单细胞和空间转录组学、测序和靶点验证,同时使用机器学习进行靶点识别、优先级排序、验证和实验设计。公司还进行扰动实验,测量基因变化如何影响与疾病相关的细胞特征。

公共数据库仍是生物基础模型训练材料的重要来源,但跨研究整合数据存在技术挑战。2025年《实验与分子医学》综述指出,CZ CELLxGENE、人类细胞图谱和NCBI基因表达综合库等数据库提供了大量单细胞数据,其中CZ CELLxGENE提供超过1亿个标准化细胞。然而,不同研究的采样方法、测序协议、实验流程和处理流程存在差异,单细胞数据可能包含技术噪声,需要仔细筛选和质量控制。数据集重叠也是一个问题,同一或相似细胞可能出现在多个公共资源中,导致训练时权重过大,并存在数据泄漏风险。

2025年6月《自然·方法》发表的研究使用2220万个细胞语料库,训练了400个模型,评估了6400个实验,发现当前单细胞基础模型在仅使用部分语料库后便达到性能平台期,与大型语言模型不同,未显示清晰的数据扩展定律。模型容量、数据集大小和计算资源需要平衡,而非简单增加。另一项2025年《基因组生物学》研究评估了Geneformer和scGPT,发现它们并未持续优于简单方法,且存在批次效应问题。

制药公司正追求专门数据集。Relation已将其数据生成方法应用于Osteomics,一个专有的功能性单细胞骨图谱,结合患者样本、单细胞和空间组学、影像学、基因组学、蛋白质组学和临床表型数据,用于研究骨质疏松症的疾病生物学、治疗靶点和生物标志物。英国和澳大利亚的医院和研究伙伴参与其中。上月《自然·遗传学》发表的研究也利用单细胞分析、遗传数据和功能验证研究了骨骼疾病的细胞和遗传决定因素,部分Relation研究人员是作者。

2025年《自然·生物技术》对AI生物制药交易的分析指出,专门数据集提供商是近期合作趋势之一,其他趋势包括更大的预付款、新治疗模式和大型生物技术公司更多参与。高质量、疾病特异性数据集正成为因果和生成式机器学习模型的重要输入。分析引用了GSK与Ochre Bio的3750万美元数据许可协议,以及阿斯利康和Pathos AI与Tempus在2025年达成的2亿美元协议,后者将利用超过15万名患者的去标识化临床、基因组和影像数据开发肿瘤学基础模型。

获取足够高质量的数据仍是AI药物发现的瓶颈。《自然》关于联邦学习的研究亮点指出,缺乏合适训练数据是AI应用的主要瓶颈,公司也可能面临共享专有信息的限制。因此,AI生物制药协议在数据获取和计算能力方面各不相同,有的侧重于AI平台访问,有的涵盖联合开发、数据许可或新生物数据集创建。GSK与Relation的协议包括数据生成和模型开发。

中文圈视角

对中文圈而言,这一合作传递了几个重要信号。首先,生物数据在AI制药中的价值被再次确认,但国内AI制药公司往往更关注模型架构,而忽视高质量数据的生成。GSK与Relation的模式提示,自建数据生成能力(如Lab-in-the-Loop)可能是差异化竞争的关键。国内企业如晶泰科技、英矽智能等,可借鉴其“实验+计算”闭环,但需注意数据合规,尤其是涉及人类遗传资源时,需遵守《人类遗传资源管理条例》。其次,公共数据集的局限性(如批次效应、数据重叠)对国内研究同样适用,构建高质量、非冗余数据集比单纯堆数据更重要。最后,国内AI制药公司可关注与医院和科研机构的合作,以获取疾病特异性数据,但需平衡数据共享与隐私保护。

几条值得记住的细节

  • GSK与Relation的合作金额最高达1.1亿美元,扩展了双方在AI辅助药物发现领域的现有合作。
  • Relation将生成人类细胞响应数据,用于训练AI模型,包括其MORGAN平台中的模型。
  • 公共数据库如CZ CELLxGENE提供超过1亿个标准化细胞,但存在技术噪声和数据重叠问题。
  • 《自然·方法》研究发现,单细胞基础模型在训练数据达到一定量后性能趋于平台期,并非数据越多越好。
  • GSK还与Ochre Bio达成3750万美元的数据许可协议,涉及人类肝脏单细胞数据。

一句话总结

生物数据是AI制药的“燃料”,但质量比数量更重要,国内企业需重视数据生成与合规。