AI 快讯 编译自 marktechpost #提示词优化#GEPA#小模型

GEPA 框架教程:多组件提示词优化与结构化反馈提升小模型算术能力

本文介绍 GEPA 反思式提示词进化框架,通过多组件提示词、结构化反馈和留出验证集,优化小语言模型解决多步算术应用题的能力。包含完整代码实现与中文用户视角分析。

编译发布 2026/06/07 原文发布 2026/06/07

一句话看懂

GEPA 是一个提示词进化框架,通过结构化反馈和多组件提示词协同进化,让 GPT-4o-mini 这样的小模型在算术题上准确率大幅提升,且优化效果能泛化到未见过的题目。

详细发生了什么

MarkTechPost 发布了一篇教程,演示如何使用 GEPA(一种反思式提示词进化框架)来优化小语言模型(SLM)解决多步算术应用题的能力。教程以 GPT-4o-mini 作为任务模型,GPT-4.1 作为反思模型,从一条弱种子提示词(“Solve the math problem.” + “Give the answer.”)出发,构建了一个包含折扣、旅行距离、钱包计算和链式运算四类共 18 道题的确定性基准数据集,其中 12 道用于训练优化,6 道作为留出验证集。

核心创新在于:1)多组件提示词结构——指令字段和输出格式规则字段同时进化;2)结构化评估器——不仅判断答案对错,还检查是否遵循 #### <integer> 格式要求,并返回可操作的反馈(如”答案正确但格式违规”或”多步推理出错”);3)留出验证——在未见过的题目上测试优化效果是否泛化。

教程完整展示了安装 GEPA 和 LiteLLM、构建数据集、定义评估器、配置 GEPAConfig 以及运行优化流程的代码。最终将基线提示词与优化后的提示词在验证集上对比,检查进化过程带来的性能提升。

中文圈视角

这个教程对中文 AI 开发者有直接参考价值,原因有三:

  1. 小模型优化是刚需:国内很多场景(如边缘设备、低成本 API 调用)依赖 GPT-4o-mini 级别的小模型。GEPA 框架通过自动优化提示词,让弱模型在特定任务上表现更好,相当于”免费”提升效果,无需微调。

  2. 多组件提示词设计思路可复用:国内提示词工程常只优化指令,忽略输出格式。教程中同时进化指令和格式规则,这种思路可以迁移到中文场景,比如要求模型输出 JSON 或特定格式时,让两个字段协同进化。

  3. 结构化反馈是亮点:国内很多提示词优化工具(如一些 AutoPrompt 实现)只返回分数,不告诉模型”为什么错”。GEPA 的反馈机制(区分”答案错”和”格式错”)更接近人类教师,值得国内开发者借鉴。

不过需要注意:GEPA 依赖 OpenAI API,国内用户需要自行解决网络问题。目前国内类似框架(如 ModelScope 上的 PromptAgent)功能类似,但生态成熟度稍逊。如果团队有预算,直接使用 GEPA 是最省力的方案。

几条值得记住的细节

  • 任务模型:GPT-4o-mini(openai/gpt-4o-mini),反思模型:GPT-4.1(openai/gpt-4.1),最大 metric 调用次数 100 次。
  • 数据集:18 道算术题,4 种类型(折扣、旅行、钱包、链式运算),12 道训练 + 6 道验证。
  • 评分规则:1.0 = 答案正确且格式正确(#### <integer>);0.5 = 答案正确但格式错误;0.0 = 答案错误。
  • 多组件进化:指令字段和输出格式规则字段同时进化,而非单独优化。
  • 留出验证:优化完成后,用验证集(6 道未见过的题)测试泛化能力,避免过拟合训练集。

一句话总结

如果你在用 GPT-4o-mini 等小模型做结构化输出任务,GEPA 的多组件提示词进化方法能帮你自动调优,效果可能比手动写提示词好得多。