AI 快讯 编译自 marktechpost #模型优化#开源工具#推理模型

Liquid AI 开源 Antidoom:用 FTPO 方法将推理模型死循环率从 22.9% 降至 1%

Liquid AI 开源了 Antidoom 方法,通过 Final Token Preference Optimization (FTPO) 精准修复推理模型中的死循环问题。在 LFM2.5-2.6B 和 Qwen3.5-4B 上,死循环率分别从 10.2% 和 22.9% 降至约 1%,评估分数全面提升。全套代码、检测工具和训练器均已开源,适合中小模型开发者快速集成。

编译发布 2026/07/07 原文发布 2026/07/07

一句话看懂

Liquid AI 开源了 Antidoom,一种通过训练首个循环 token 来消除推理模型死循环的方法,在多个模型上将循环率降至 1% 左右。

详细发生了什么

Liquid AI 发布了 Antidoom,一个针对推理模型死循环(doom loop)的开源解决方案。死循环是指模型在输出中不断重复某一段文本,直到耗尽 context window。小模型在长推理链和难题上更容易出现此问题。

Antidoom 的核心思路是:先检测出循环的起始 token,然后只在该位置用 Final Token Preference Optimization (FTPO) 进行训练,让模型倾向于选择多个合理的替代 token,而不是简单替换。训练数据生成约需 1 小时(8x MI325 GPU),训练约 1-2 小时(单 MI325 GPU)。

在 LFM2.5-2.6B 早期检查点上,死循环率从 10.2% 降至 1.4%;在 Qwen3.5-4B 上,从 22.9% 降至 1%。评估分数全面上升,改进完全归因于循环减少。Liquid AI 指出,一旦消除循环,接近贪婪采样(低温度)反而表现最好,这挑战了“高温度有助于推理”的常见认知。

中文圈视角

对国内开发者来说,Antidoom 有几点值得关注:

  1. 直接可用,无需梯子:代码和数据集已在 GitHub 开源(搜索 LiquidAI/antidoom),训练脚本基于常见框架,国内可直接下载使用。
  2. 对国产模型同样有效:论文中已验证了 Qwen3.5-4B 的效果,这意味着对 DeepSeek、Yi、ChatGLM 等中小规模模型同样适用。国内很多团队在微调小模型做垂直任务时,死循环是常见痛点,Antidoom 提供了一个轻量级修复方案。
  3. 与现有工具链兼容:基于 LoRA 训练,支持 Hugging Face Transformers,国内常用的 ModelScope 也可以直接适配。
  4. 潜在盲点:目前中文社区对死循环问题的讨论较少,多数团队仍在使用 repetition_penalty 等粗糙手段。Antidoom 的精准定位思路值得借鉴,但需注意其训练数据 mix 偏向英文,中文场景可能需要重新生成检测数据集。

几条值得记住的细节

  • 死循环检测规则:同一片段重复至少 4 次,且总长度 ≥60 字符。
  • 最常见的循环起始 token 包括“the”、“So”、“Alternatively”、“Wait”、“But”。
  • FTPO 与 DPO 类似,但训练仅针对序列末尾的单个 token,且每个样本支持多个 chosen token。
  • 训练使用 LoRA,rank 128-256,学习率 4e-6 到 2e-5,早停条件为 chosen_win=0.35。
  • 多轮训练可能暴露新循环,但单轮已能将循环率降至 1% 左右。

一句话总结

如果你的推理模型经常陷入重复输出,Antidoom 是一个低成本、高回报的开源修复方案,尤其适合中小规模模型。