AI 快讯 编译自 aws_ml_blog #模型部署#主权AI#代理架构

OneAdvanced 如何在英国主权 AWS 上部署 50 多个 AI 代理:自托管 Llama 4 的实践

OneAdvanced 通过自托管 Llama 4 Maverick 和 Llama Guard 4 于 Amazon SageMaker AI,结合 pgvector RAG 和 Strands Agents SDK,在英国 AWS 上构建了主权 AI 平台,部署超 50 个代理。本文解析架构、关键决策及对中文用户的启示。

编译发布 2026/08/12 原文发布 2026/08/12

一句话看懂

OneAdvanced 在 AWS 伦敦区域自托管 Llama 4 模型,结合 RAG 和 50 多个代理,实现了数据不出英国的主权 AI 平台。

详细发生了什么

英国企业软件供应商 OneAdvanced 服务超过 10,000 家客户,覆盖医疗、法律等受监管行业。这些客户处理敏感数据,要求数据必须留在英国境内。当时,他们想要的 Llama 4 Maverick 和 Llama Guard 4 模型在英国区域尚无托管服务,因此 OneAdvanced 选择在自有 AWS 账户中自托管开源权重模型。

架构上,他们使用 vLLM 在 Amazon SageMaker AI 上部署 Llama 4 Maverick(FP8)和 Llama Guard 4,运行在伦敦区域(eu-west-2)的 p5.48xlarge 实例上。RAG 管道基于 Amazon Aurora PostgreSQL 的 pgvector 扩展,文档上传至 S3 后转换为 markdown、分块并嵌入向量库。超过 50 个代理运行在 Amazon ECS 上,每个代理有独立的 system prompt、工具配置和可选输入表单,配置存储在 DynamoDB 中。Llama Guard 4 在主模型之前串行运行,筛查用户输入中的有害内容。

OneAdvanced 最初用 Amazon Bedrock 原型验证,两周内实现了聊天、查询英国成文法的代理等功能,但为了满足主权要求,最终转向自托管。他们从 p4d.24xlarge 迁移到 p5.48xlarge,以支持 120K-128K token 的上下文长度,并利用预留实例折扣降低成本。代理框架评估了 LangChain、LangGraph 等,最终选择 Strands Agents SDK,因为它采用模型优先、无 rigid 工作流定义,支持轮转和访谈式交互。OneAdvanced 在短短三周内从第一个代理扩展到 50 多个,大多数代理在一天内构建完成。

中文圈视角

对中文用户而言,这个案例有几点值得关注:

  1. 数据主权与合规:国内用户同样面临数据出境和合规要求,尤其是金融、医疗等行业。OneAdvanced 的做法提供了一种参考:通过自托管开源模型(如 Llama 系列)在本地或私有云部署,确保数据不出域。国内已有类似实践,如 DeepSeek 的开源模型可私有化部署,但生态和工具链尚不如 AWS 成熟。

  2. 代理框架选择:Strands Agents SDK 可能对中文用户较陌生,国内更常用的是 Dify、Coze 等平台。但 Strands 的模型优先、无 rigid 工作流理念值得借鉴,尤其适合需要快速构建大量专用代理的场景。中文用户可关注类似框架,如 LangChain 的中文社区支持。

  3. GPU 成本与实例选择:p5.48xlarge 实例成本高昂,国内用户可考虑使用国产 GPU 云服务(如阿里云、华为云)或租用算力,但需注意模型兼容性。

几条值得记住的细节

  • 模型:Llama 4 Maverick 17B-128E-Instruct-FP8 和 Llama Guard 4 12B,均通过 Hugging Face 获取权重,需接受许可。
  • 实例:生产环境使用 p5.48xlarge,伦敦区域,支持 120K-128K token 上下文。
  • 代理数量:从 0 到 50+ 仅用三周,多数代理一天内完成。
  • 安全:Llama Guard 4 替换 Llama Guard 3,因后者误拒率过高。
  • 工具:RAG 使用 pgvector,代理配置存于 DynamoDB,工具层运行在 ECS。

一句话总结

数据主权要求下,自托管开源模型是可行路径,但需权衡成本与运维复杂度,中文用户可借鉴其架构思路。