Yahoo 用 Amazon Bedrock 升级搜索重定向广告,关键词扩展率提升 600 倍
Yahoo DSP 通过 Amazon Bedrock 和 Claude 3.5 Sonnet v2 改造搜索重定向(SRT)关键词扩展,解决传统 Word2Vec 方法词汇陈旧、语义不足问题。新系统将关键词扩展率提升 600 倍,可触达受众增长 5 倍,并引入相似度过滤和敏感词护栏确保质量。
一句话看懂
Yahoo DSP 用 Amazon Bedrock 上的 Claude 3.5 Sonnet v2 替代传统 Word2Vec,将搜索重定向广告的关键词扩展率提升 600 倍,可触达受众增长 5 倍。
详细发生了什么
Yahoo 的搜索重定向(SRT)是广告主根据用户历史搜索行为投放展示、视频和原生广告的核心工具。传统架构依赖 Word2Vec 嵌入模型配合局部敏感哈希(LSH)进行关键词扩展,但存在词汇陈旧、仅支持短语匹配、依赖句法相似性、有时甚至无法生成任何新关键词等问题。
Yahoo 团队用 Amazon Bedrock 上的生成式 AI 重构了这一流程。经过在 SageMaker Studio 中对 Amazon Titan、Meta Llama 和 Anthropic Claude 等模型的原型测试,最终选定 Claude 3.5 Sonnet v2。新流程中,LLM 基于种子关键词生成扩展词,然后通过嵌入相似度评分过滤掉语义偏离的词汇,同时加入敏感词护栏(推理前后双重过滤)。
结果:相比 LSH,新系统的中位扩展比提升 5 倍,最大扩展比翻倍,整体关键词扩展率提升高达 600 倍,可触达受众增长 5 倍。该功能已于 2025 年 Q1 上线。
中文圈视角
对国内广告技术从业者来说,这个案例有几点值得关注:
-
平替方案:国内广告平台(如巨量引擎、腾讯广告)的类似重定向功能目前多依赖规则或传统 ML 模型。如果想用 LLM 升级,可考虑阿里云百炼上的 Qwen 系列或智谱 GLM,但需注意国内大模型在广告场景的敏感词过滤和合规要求更严格。
-
技术细节可复制:Yahoo 的“LLM 生成 + 嵌入相似度过滤”架构很实用,能有效控制幻觉。国内团队可直接用开源模型(如 BGE 或 text2vec 做嵌入)复现,成本可控。
-
数据隐私差异:Yahoo 方案依赖用户搜索历史,国内受《个人信息保护法》约束,类似重定向需确保用户授权和匿名化处理,直接照搬可能有合规风险。
-
中文搜索场景:中文分词和语义理解比英文更复杂,LLM 在中文关键词扩展上的表现需要单独评估。国内已有厂商(如百度)尝试用文心大模型优化广告关键词,但公开数据较少。
几条值得记住的细节
- 传统 Word2Vec + LSH 方法有时无法生成任何新关键词(零扩展),而 LLM 方法可生成数百甚至数千个。
- 最终选型为 Anthropic Claude 3.5 Sonnet v2,通过 Amazon Bedrock 的 serverless 接口调用。
- 引入嵌入相似度阈值过滤,只有与原始关键词语义足够接近的扩展词才被保留。
- 敏感词过滤在推理前后各执行一次,避免扩展出违规内容。
- 新系统上线后,关键词扩展率提升 600 倍,可触达受众增长 5 倍。
一句话总结
广告关键词扩展从“猜词”升级为“理解语义”,Yahoo 用 LLM 让搜索重定向更精准、覆盖面更广,国内广告平台可借鉴其架构但需适配合规要求。