Cisco AI 开源 FAPO:用 Claude Code 自动优化多步 LLM 流水线,准确率提升最高 33.8 个百分点
Cisco Foundation AI 开源了 FAPO(全自动提示优化)系统,利用 Claude Code 自动诊断多步 LLM 流水线中的失败步骤,并逐级优化提示、参数和链结构。在 18 项模型-基准测试对比中,FAPO 击败了当前最先进的 GEPA 优化器,平均增益达 14.1 个百分点。本文详解其工作原理、性能数据和中文用户的实际应用价值。
一句话看懂
Cisco AI 开源了 FAPO,一个由 Claude Code 驱动的全自动提示优化系统,能自动诊断多步 LLM 流水线中的失败步骤,并逐级优化提示、参数和链结构,在 18 项测试中击败了当前最先进的 GEPA 优化器。
详细发生了什么
Cisco Foundation AI 团队开源了 FAPO(Fully Automated Prompt Optimization),这是一个基于 Claude Code 的自动化系统,旨在解决多步 LLM 流水线中提示优化的痛点。FAPO 的核心是一个闭环优化流程:先运行流水线并对每个测试用例评分,然后通过规则和 LLM 分析将失败归因到具体步骤(检索失败、级联失败、格式失败或推理失败),接着针对主要失败类型生成变体(提示文本、参数或链结构),再由独立审查者验证,最后与当前最佳结果比较,接受或拒绝变体。优化分三个等级:先尝试最低成本的提示编辑,然后调整参数(如 retrieval_k、temperature),最后才修改链拓扑(如添加自反思节点)。
在 Cisco 的评估中,FAPO 与当前最先进的提示优化方法 GEPA 进行了对比,覆盖 6 个基准测试和 3 个任务模型(GPT-4.1-mini、GPT-5.4-mini、Gemma 3-12B)。FAPO 在 18 个模型-基准组合中赢了 15 个,平均增益 +14.1 个百分点。在需要链结构变更的 HoVer 和 IFBench 上,FAPO 全胜,平均增益达 +33.8 个百分点。FAPO 采用 Apache 2.0 许可证开源,支持 Claude Code 和 Codex 作为优化代理,并内置了防过拟合机制(仅检查训练集、不可变变体文件、独立审查)。
中文圈视角
FAPO 对中文开发者来说是一个值得关注的工具,原因有三:
-
降低多步流水线的调试成本:目前国内很多团队在构建 RAG、多跳问答等复杂流水线时,仍然依赖手动调试每个步骤的提示。FAPO 的自动化归因和优化能大幅减少人工试错时间。虽然 FAPO 依赖 Claude Code(需要 API 访问),但同样支持 Codex,国内用户可以通过 OpenAI API 或 Azure OpenAI 服务使用。
-
国产模型的适配潜力:FAPO 的优化框架是模型无关的,理论上可以替换为 DeepSeek、Qwen、GLM 等国产模型。国内已有类似工具(如 ModelScope 的 Prompt Optimizer),但 FAPO 的链结构优化能力是独有优势。对于使用 LangGraph 构建流水线的团队,FAPO 可以直接集成。
-
中文场景的具体应用:在中文多跳问答、指令遵循(如 IFBench 的中文版)和分类任务中,FAPO 的 step-level 归因能有效识别是检索问题还是推理问题。例如,在中文法律文档问答中,如果检索到的段落不相关,FAPO 会自动建议调整检索参数或增加重排序节点。
需要注意的是,FAPO 的评估基准以英文为主,中文场景下的效果需要自行验证。另外,使用 Claude Code 作为优化代理时,数据会经过 Anthropic 的 API,涉及数据出境的合规问题,企业用户需谨慎。
几条值得记住的细节
- FAPO 优化分三个等级:提示编辑 → 参数调整 → 链结构变更,逐级升级,避免不必要的开销。
- 失败归因分为四类:检索失败、级联失败、格式失败、推理失败,前两类需要结构变更,后两类可通过提示优化解决。
- 在 HoVer 和 IFBench 上,FAPO 通过链结构变更实现了 +33.8 个百分点的平均增益,远超仅提示优化的 GEPA。
- FAPO 使用不可变变体文件和独立审查者来防止过拟合,每个变体都是新文件,从不原地修改。
- 快速上手:只需提供 JSONL 格式的数据集和任务描述,Claude Code 可自动生成初始提示、链和评分器。
一句话总结
如果你正在构建多步 LLM 流水线并苦于手动调提示,FAPO 的开源方案能帮你自动化归因和优化,尤其适合 RAG、多跳问答等复杂场景。