AI 快讯 编译自 aws_ml_blog #多模态AI#航空影像#语义搜索

亚马逊多模态AI实现航空影像自然语言搜索:Nova Embeddings 性能最优

AWS 与 Vexcel 合作,利用多模态嵌入、LLM 描述和向量搜索,实现航空影像的自然语言语义搜索。本文详解架构、评估方法及实验结论,包括 Amazon Nova Multimodal Embeddings 在 F1 分数上的领先表现,并给出工程实践建议。

编译发布 2026/06/22 原文发布 2026/06/22

一句话看懂

AWS 与 Vexcel 合作,用多模态嵌入和向量搜索让航空影像支持自然语言查询,Amazon Nova 嵌入模型在基准测试中 F1 最高。

详细发生了什么

航空影像搜索一直是个难题:传统方法要么人工逐张检查,要么为每个新问题训练专门的计算机视觉模型,成本高且不灵活。AWS 与航空影像提供商 Vexcel 合作,利用多模态嵌入模型、大语言模型(LLM)描述生成和向量搜索,构建了一套可扩展的语义搜索系统。

Vexcel 拥有覆盖 45 多个国家和地区的航空影像库,每个地理位置包含 7 个视角:正射影像、四个方向的倾斜影像、数字表面模型(DSM)和数字地形模型(DTM)。系统将这些影像通过嵌入模型转为向量,存入 Amazon OpenSearch Serverless 向量数据库,用户可以用自然语言查询,如“带涂鸦的仓库”或“游泳池”。

AWS 与 Vexcel 共同设计了评估框架,使用 OpenStreetMap 作为自动标注的地面真值,并进行了四项实验:比较不同嵌入模型(Amazon Nova Multimodal Embeddings、Amazon Titan Multimodal Embeddings G1、Cohere Embed v4)、多视角融合策略(平均池化、最大池化、LLM 加权注意力等)、是否使用 LLM 生成的描述,以及搜索方法。结果显示,Amazon Nova Multimodal Embeddings 在两项基准查询中均取得最高 F1 分数。该工作已演变为 Vexcel Intelligence 产品,目前处于预览阶段。

中文圈视角

对于中文用户,这套方案有两个直接意义:

  1. 国内有类似需求但缺乏成熟产品:国内如高德、百度地图拥有大量遥感影像,但自然语言搜索功能尚未开放。Vexcel 的方案展示了技术可行性,但国内用户需注意数据出境问题——Vexcel 影像数据存储在 AWS 海外区域,国内企业可能需使用阿里云、华为云等国产云服务。国产模型如通义千问的多模态版本、智谱 GLM-4V 可作为嵌入模型的替代,但需自行构建向量数据库和评估流程。

  2. 应用场景广泛但门槛仍在:保险定损(识别屋顶损坏)、城市规划(查找绿地/停车场)、农业(监测作物)等场景均可受益。但中文用户需自行处理中文查询的语义理解,且 OpenStreetMap 在国内的标注质量不如高德/百度地图,可能影响评估效果。建议国内团队优先使用本地地图数据作为 ground truth。

此外,该方案未提及对视频流的处理,而国内无人机巡检数据常以视频形式存在,这是一个值得探索的盲点。

几条值得记住的细节

  • Vexcel 每个地理位置包含 7 个视角:1 张正射、4 张倾斜、2 张高程模型(DSM/DTM)。
  • 实验对比了 Amazon Nova、Amazon Titan 和 Cohere Embed v4 三种嵌入模型,Nova 在 F1 上最优。
  • 多视角融合策略中,简单平均池化效果已接近复杂方法,LLM 加权注意力提升有限。
  • LLM 生成的描述(caption)对搜索精度提升不明显,但增加了成本和延迟。
  • 评估使用 OpenStreetMap 作为自动 ground truth,解决了无标注数据的问题。

一句话总结

航空影像自然语言搜索从实验走向产品,国内用户可借鉴架构但需适配国产云服务和中文场景。