AI 快讯 编译自 marktechpost #模型优化#开源工具#提示工程

Cisco AI 开源 FAPO:用 Claude Code 自动优化多步 LLM 流水线,准确率提升最高 33.8 个百分点

Cisco Foundation AI 开源了 FAPO(全自动提示优化)系统,利用 Claude Code 自动诊断多步 LLM 流水线中的失败步骤,并逐级优化提示、参数和链结构。在 18 项模型-基准测试对比中,FAPO 击败了当前最先进的 GEPA 优化器,平均增益达 14.1 个百分点。本文详解其工作原理、性能数据和中文用户的实际应用价值。

编译发布 2026/06/20 原文发布 2026/06/20

一句话看懂

Cisco AI 开源了 FAPO,一个由 Claude Code 驱动的全自动提示优化系统,能自动诊断多步 LLM 流水线中的失败步骤,并逐级优化提示、参数和链结构,在 18 项测试中击败了当前最先进的 GEPA 优化器。

详细发生了什么

Cisco Foundation AI 团队开源了 FAPO(Fully Automated Prompt Optimization),这是一个基于 Claude Code 的自动化系统,旨在解决多步 LLM 流水线中提示优化的痛点。FAPO 的核心是一个闭环优化流程:先运行流水线并对每个测试用例评分,然后通过规则和 LLM 分析将失败归因到具体步骤(检索失败、级联失败、格式失败或推理失败),接着针对主要失败类型生成变体(提示文本、参数或链结构),再由独立审查者验证,最后与当前最佳结果比较,接受或拒绝变体。优化分三个等级:先尝试最低成本的提示编辑,然后调整参数(如 retrieval_k、temperature),最后才修改链拓扑(如添加自反思节点)。

在 Cisco 的评估中,FAPO 与当前最先进的提示优化方法 GEPA 进行了对比,覆盖 6 个基准测试和 3 个任务模型(GPT-4.1-mini、GPT-5.4-mini、Gemma 3-12B)。FAPO 在 18 个模型-基准组合中赢了 15 个,平均增益 +14.1 个百分点。在需要链结构变更的 HoVer 和 IFBench 上,FAPO 全胜,平均增益达 +33.8 个百分点。FAPO 采用 Apache 2.0 许可证开源,支持 Claude Code 和 Codex 作为优化代理,并内置了防过拟合机制(仅检查训练集、不可变变体文件、独立审查)。

中文圈视角

FAPO 对中文开发者来说是一个值得关注的工具,原因有三:

  1. 降低多步流水线的调试成本:目前国内很多团队在构建 RAG、多跳问答等复杂流水线时,仍然依赖手动调试每个步骤的提示。FAPO 的自动化归因和优化能大幅减少人工试错时间。虽然 FAPO 依赖 Claude Code(需要 API 访问),但同样支持 Codex,国内用户可以通过 OpenAI API 或 Azure OpenAI 服务使用。

  2. 国产模型的适配潜力:FAPO 的优化框架是模型无关的,理论上可以替换为 DeepSeek、Qwen、GLM 等国产模型。国内已有类似工具(如 ModelScope 的 Prompt Optimizer),但 FAPO 的链结构优化能力是独有优势。对于使用 LangGraph 构建流水线的团队,FAPO 可以直接集成。

  3. 中文场景的具体应用:在中文多跳问答、指令遵循(如 IFBench 的中文版)和分类任务中,FAPO 的 step-level 归因能有效识别是检索问题还是推理问题。例如,在中文法律文档问答中,如果检索到的段落不相关,FAPO 会自动建议调整检索参数或增加重排序节点。

需要注意的是,FAPO 的评估基准以英文为主,中文场景下的效果需要自行验证。另外,使用 Claude Code 作为优化代理时,数据会经过 Anthropic 的 API,涉及数据出境的合规问题,企业用户需谨慎。

几条值得记住的细节

  • FAPO 优化分三个等级:提示编辑 → 参数调整 → 链结构变更,逐级升级,避免不必要的开销。
  • 失败归因分为四类:检索失败、级联失败、格式失败、推理失败,前两类需要结构变更,后两类可通过提示优化解决。
  • 在 HoVer 和 IFBench 上,FAPO 通过链结构变更实现了 +33.8 个百分点的平均增益,远超仅提示优化的 GEPA。
  • FAPO 使用不可变变体文件和独立审查者来防止过拟合,每个变体都是新文件,从不原地修改。
  • 快速上手:只需提供 JSONL 格式的数据集和任务描述,Claude Code 可自动生成初始提示、链和评分器。

一句话总结

如果你正在构建多步 LLM 流水线并苦于手动调提示,FAPO 的开源方案能帮你自动化归因和优化,尤其适合 RAG、多跳问答等复杂场景。