AI 快讯
编译自 aws_ml_blog #模型部署#工具评测#行业分析
用 Amazon Bedrock AgentCore 构建蛋白质研究助手:自然语言搜索相似肽段
本文介绍如何用 Amazon Bedrock AgentCore 和 Strands Agents SDK 构建一个对话式蛋白质研究助手,实现自然语言查询解析、基于 ESM-C 300M 的向量相似搜索和 AI 生成科学摘要。适合生物信息学开发者、AWS 用户及对 AI+生命科学感兴趣的技术人员。
一句话看懂
AWS 发布教程,用 Bedrock AgentCore + ESM-C 300M 蛋白语言模型,构建能通过自然语言搜索相似肽段的对话式研究助手。
详细发生了什么
蛋白质研究人员常需手动在数千条肽段序列中寻找结构相似的候选物,过程缓慢且易出错。AWS 这篇博客展示了如何用 Amazon Bedrock AgentCore 和 Strands Agents SDK 构建一个对话式助手,整合三大能力:
- 自然语言查询解析:将用户输入如“找 10 条与登革热病毒肽段 LPAIVREAI 相似的肽”转为结构化搜索参数。
- 向量相似搜索:使用 EvolutionaryScale 的 ESM-C 300M 模型生成 960 维蛋白嵌入,在 Amazon Aurora PostgreSQL 的 pgvector 扩展中执行余弦相似度搜索。
- AI 生成科学摘要:用另一个 LLM agent 分析搜索结果,生成简洁的科学总结和后续研究建议。
系统架构包括:Streamlit 前端(AWS Fargate 部署)、单个 Bedrock AgentCore runtime 内的 Strands agent(调用三个工具:解析器、搜索器、摘要器)、SageMaker AI serverless 端点部署的 ESM-C 300M、以及 Aurora PostgreSQL 存储嵌入向量。
部署需 AWS 账号、Python 3.12+、AWS CLI,以及 IEDB 病毒表位数据集,预计耗时 30-45 分钟。
中文圈视角
这个方案对国内用户有几点参考价值:
- 技术栈可迁移:核心组件(pgvector、SageMaker serverless、Strand Agents SDK)在国内云平台均有对应或替代方案。例如阿里云 AnalyticDB for PostgreSQL 支持 pgvector,华为云 ModelArts 可部署自定义模型。
- 国产模型平替:ESM-C 300M 是国外模型,国内有类似蛋白语言模型如百度 PaddleHelix、深势科技 Uni-Mol 等,可替换实现类似功能。
- 场景落地:国内生物医药公司(如药明康德、华大基因)的研发团队可直接参考此架构,构建内部肽段筛选工具,降低对专业数据库的依赖。
- 合规注意:若使用海外 AWS 服务处理国内生物数据,需注意数据出境合规要求;建议使用国内区域或国产云平台。
目前中文社区对此类“LLM + 蛋白嵌入”的工程化方案讨论较少,这篇博客提供了一个完整的端到端参考。
几条值得记住的细节
- ESM-C 300M 模型部署为 SageMaker AI serverless 端点,空闲时缩到零,不产生费用。
- 模型权重打包在部署包中,避免推理时从 HuggingFace 下载,降低冷启动延迟。
- Aurora PostgreSQL 使用 pgvector 的 ivfflat 索引(lists=100)加速余弦相似度搜索。
- 数据库通过 RDS Data API 访问,agent runtime 无需直接连接数据库。
- 初始数据加载从 IEDB 病毒表位数据集采样 1000 条线性肽,生成嵌入后插入数据库。
一句话总结
如果你想在云上快速搭建一个面向蛋白质序列的 AI 搜索工具,这篇 AWS 教程提供了可直接复用的架构和代码。