Onton发布神经符号搜索模型Ontology 1,电商搜索精度超谷歌和亚马逊2.7倍
旧金山初创公司Onton推出神经符号搜索模型Ontology 1,在90个查询基准测试中,其precision@10达0.630,远超Google Shopping和Amazon。本文解析其技术原理、性能对比及对中文电商和AI搜索的启示。
一句话看懂
Onton发布神经符号搜索模型Ontology 1,在电商搜索基准测试中精度比Google Shopping高2.7倍,且仅索引了对手1%的商品目录。
详细发生了什么
旧金山搜索与发现公司Onton发布了Ontology 1,这是一个面向复杂、对话式、多模态产品搜索的神经符号模型。在由三个独立LLM评委评分的90个查询基准测试中,Ontology 1的mean precision@10达到0.630,而Google Shopping为0.543,Amazon为0.469。值得注意的是,它仅索引了对手目录的约1%。
该模型并非以可下载权重形式提供,而是通过Onton.com面向终端用户开放,合作伙伴访问需逐案审批。目前没有公开API、定价层级或开放检查点。Onton表示,其方法可泛化到电商之外,几乎无需重新配置即可搜索非产品数据。
基准测试名为Subtext-Decor-90,Onton已公开代码和数据。三个多模态评委(Claude Opus 4.8、Gemini 3.1 Pro和GPT-5.5)对每个查询的顶部10个结果卡片进行评分。Onton在52个查询中直接获胜,Google 19个,Amazon 16个。不过,评委间的一致性(Krippendorff’s alpha)仅为0.465,表明绝对分数存在噪声,但所有评委对引擎排名一致。
Onton的失败案例集中在功能性规格查询上,例如“不会在凌晨3点吵醒伴侣的灯”(Onton 0.4,Amazon 0.9)和“适合奇怪深窗台的东西”(Onton 0.07,Amazon 0.67)。Onton将其归因于目录广度和单一垂直索引。
中文圈视角
对中文电商和AI搜索领域,Ontology 1的发布有几个值得关注的信号。首先,国内电商搜索(如淘宝、京东)长期依赖关键词匹配和用户行为数据,而Ontology 1的神经符号方法提供了一种可解释的推理路径,可能启发国产模型在复杂查询上的改进。然而,Onton目前仅索引家居装饰品类,且无公开API,国内用户无法直接使用,但可以关注其技术报告和基准数据。
其次,神经符号搜索对中文长尾查询(如“适合小户型的可拆洗沙发”)可能有效,但中文语义和商品属性差异大,直接迁移有难度。国内类似工作如阿里的淘宝搜索算法、京东的AI导购,更多基于深度学习,可解释性较弱。Onton的“可检查知识图谱”思路或许能推动中文电商搜索向更透明、更可解释的方向发展。
最后,监管角度,Onton的模型涉及商品数据推理,若进入中国市场,需符合数据安全法规。目前来看,中文用户更多是观察者,而非直接受益者。
几条值得记住的细节
- Ontology 1在Subtext-Decor-90基准上P@10为0.630,Google Shopping为0.543,Amazon为0.469。
- 模型仅索引约1%的竞争对手目录,却赢得52/90个查询。
- 架构为神经符号:可检查的知识图谱,将模糊谓词分解为可验证属性。
- 可用性:产品优先,Onton.com上可用,合作伙伴逐案审批,无开放权重或公开API。
- 基础设施基于Ograph自定义图数据库,单核吞吐量比SuiteSparse:GraphBLAS高约100倍。
一句话总结
Ontology 1展示了神经符号搜索在电商领域的潜力,但中文用户短期内无法直接使用,可关注其技术思路对国产搜索的启发。