AI 快讯 编译自 simon_willison #LLM#标签分类#向量嵌入

别分类,让模型“幻觉”:Simon Willison 分享用 LLM 生成标签的新思路

Simon Willison 介绍 Doug Turnbull 的“别分类,让模型幻觉”方法:让 LLM 自由生成标签,再用向量嵌入匹配现有标签体系,解决大规模标签分类难题。本文详解原理、示例提示词,并探讨对中文内容管理、电商分类等场景的启示。

编译发布 2026/08/14 原文发布 2026/08/14

一句话看懂

Simon Willison 分享 Doug Turnbull 的技巧:让 LLM 自由“幻觉”出标签,再用向量嵌入匹配现有标签体系,解决大规模内容分类难题。

详细发生了什么

Simon Willison 的博客有 1,856 个标签,旧内容一直没打标签。标签太多,没法一次性塞给 LLM 让它选。Doug Turnbull 提出反向思路:不告诉模型现有标签,让它自由生成“从未见过”的分类,然后用向量嵌入(vector embeddings)在现有标签库中找最接近的匹配。

示例提示词里,模型被要求为“brown coffee table”生成分类,并给出标签形状示例,比如“Furniture / Living Room Furniture / Coffee Tables & End Tables / Coffee Tables”。模型会输出类似“Furniture / Tables / Coffee Tables”的候选,再通过向量相似度匹配到实际标签。

这种方法绕开了大词汇表带来的 token 限制和选择困难,用 LLM 的生成能力和向量检索的精确性,实现高效、动态的标签推荐。

中文圈视角

对中文内容创作者和开发者,这个技巧同样适用。中文博客、电商平台、知识库常面临标签体系庞大、内容分类难的问题。比如,一个中文电商平台有数万商品分类,直接让 LLM 从全量分类里选不现实,但让模型生成“幻觉”分类,再用向量匹配(比如用 OpenAI Embedding 或国产模型如 text2vec)就能快速归类。

国内用户无需梯子就能用类似方法,因为向量嵌入和 LLM 生成都有国产替代方案,比如智谱的 embedding 模型、阿里的 DashScope。另外,中文标签的层级结构(如“家具/客厅家具/茶几”)同样适合这种模式,只需在提示词里提供示例形状。

要注意的是,这种方法依赖向量检索的质量,中文语料需要良好的分词和 embedding 模型,否则匹配精度可能下降。但整体思路对中文场景的降本增效很有价值。

几条值得记住的细节

  • Simon Willison 的博客有 1,856 个标签,远超 LLM 单次处理能力。
  • Doug Turnbull 的提示词示例要求模型生成“novel, never seen before”的分类,避免受限于已有词汇。
  • 向量嵌入用于将模型生成的标签与现有标签库匹配,找到最接近的实体。
  • 提示词中提供标签形状示例(如层级结构)能显著提高生成质量。
  • 该方法适用于搜索查询、商品分类、内容标签等场景,不限于博客。

一句话总结

让 LLM 自由发挥生成标签,再用向量匹配,是处理大规模分类问题的巧妙解法,值得一试。