AI 快讯 编译自 aws_ml_blog #技术方案#RAG#知识压缩

超越RAG:任务感知知识压缩(TAKC)在AWS上的企业AI实践

传统RAG在跨文档分析任务中遇到瓶颈。AWS博客介绍任务感知知识压缩(TAKC),通过预压缩知识库为任务特定表示、多级缓存和查询路由,实现8-64倍压缩,开源可部署。

编译发布 2026/07/27 原文发布 2026/07/27

一句话看懂

AWS 提出任务感知知识压缩(TAKC),将整个知识库预压缩为任务特定表示,按查询复杂度路由到不同压缩层级,解决 RAG 在跨文档分析中的瓶颈。

详细发生了什么

传统 RAG 在需要跨数百份文档的复杂分析任务(如财务尽职调查、合规审查)中表现不佳。相似性搜索只能找到相关片段,但无法捕捉文档间的关联。AWS 博客提出的 TAKC 方法,使用 LLM 对文档进行任务导向的压缩,不同任务生成不同摘要:财务分析压缩保留营收、利润率、现金流;合规审查压缩则关注监管引用和违规历史。压缩率从 8x 到 64x 不等,分为四个层级:轻量(8x,保留约12.5%上下文)、中等(16x)、高(32x)和超高(64x)。查询时,系统自动分析问题复杂度,将简单事实查询路由到超高层级缓存,复杂分析查询使用轻量级缓存。整个系统部署在 AWS 上,采用无服务器架构:S3 触发 Lambda 进行文档分块和压缩,ElastiCache Serverless 缓存压缩结果,API Gateway 和 Cognito 处理查询认证。开源实现可直接部署到用户账户。

中文圈视角

TAKC 的思路对国内企业用户很有参考价值,尤其是金融、法律等需要大量文档分析的行业。目前国内类似方案较少,但可借助国产模型(如 DeepSeek、Qwen)和云服务(阿里云函数计算、腾讯云 Serverless)实现类似架构。需要注意的是,TAKC 依赖 LLM 进行压缩,国内用户需考虑模型合规性和数据不出境要求。此外,TAKC 的多级缓存策略可降低推理成本,对预算敏感的中小企业尤其友好。不过,压缩质量验证需要针对具体任务和文档进行测试,国内用户可参考其提供的测试脚本。

几条值得记住的细节

  • 压缩率分四档:8x、16x、32x、64x,对应不同查询复杂度。
  • 文档分块为 256 token 段,50 token 重叠,防止边界信息丢失。
  • 缓存使用 24 小时 TTL,并备份到 S3,过期或驱逐后自动回填。
  • 查询复杂度分析器基于查询长度、问题类型和分析性语言进行路由。
  • 开源实现支持自定义任务类型提示词,并可通过版本化配置管理。

一句话总结

TAKC 为 RAG 的跨文档分析提供了可落地的压缩方案,国内用户可借鉴其架构,结合国产模型和云服务实现类似能力。