Amazon Quick 推出多数据集 Topics,统一语义层支持跨表自然语言查询
Amazon Quick 发布多数据集 Topics 公开预览版,允许用户在一个 Topic 中添加最多 12 个数据集并定义关系,AI 引擎自动跨表生成 SQL 查询。本文详解架构、工作流程及零售分析示例,对 BI 用户和数据分析师有直接参考价值。
一句话看懂
Amazon Quick 的多数据集 Topics 让用户在一个语义层中关联最多 12 个数据集,AI 自动跨表查询,无需手动合并数据。
详细发生了什么
Amazon Quick 是 AWS 推出的统一智能服务,其 BI 组件 Quick Sight 新增了多数据集 Topics 功能(公开预览版)。此前,每个 Topic 只能关联一个数据集,且分析中的每个可视化只能基于单一数据集。用户需要将多个表手动连接成一张扁平表,这种方式虽然性能好,但限制了数据模型的灵活性。
现在,用户可以在一个 Topic 中添加最多 12 个数据集,并通过 JSON 文件定义它们之间的关系(如外键关联)。当业务用户用自然语言提问时,AI 引擎会自动解析意图,识别涉及的数据集,根据定义的关系构建 SQL JOIN 查询,返回统一结果。
该功能支持 SPICE 数据集(公开预览版)以及 Direct Query 数据源,包括 Amazon Redshift、Athena、S3 Tables、Snowflake 和 Databricks。但注意,SPICE 和 Direct Query 数据集不能混用在同一个 Topic 中。每个数据集可以独立进行语义增强(列描述、同义词、语义类型等),提升 NLQ 准确率。
中文圈视角
对国内 BI 用户来说,这个功能直接对标的是传统“大宽表”模式。国内很多企业仍在使用手动 ETL 合并多表,维护成本高且灵活性差。多数据集 Topics 允许保持数据规范化,减少数据预处理工作。
不过,国内用户使用 Amazon Quick 需要 AWS 账号,且部分数据源(如 Snowflake、Databricks)在国内的普及度不如阿里云 MaxCompute 或华为云 GaussDB。目前国内云厂商如阿里云 Quick BI 也支持多表关联,但语义层和 NLQ 能力相对较弱。
对于使用 AWS 的国内企业,这个功能可以显著降低业务用户的数据查询门槛,尤其是零售、电商等需要跨订单、客户、门店分析的场景。但需要注意数据合规:如果数据存储在 AWS 海外区域,可能涉及数据出境问题,建议优先使用 AWS 中国区(北京/宁夏)服务。
几条值得记住的细节
- 一个 Topic 最多可添加 12 个数据集,关系通过 JSON 文件定义。
- 支持 SPICE(内存引擎)和 Direct Query(Redshift、Athena、Snowflake 等),但不能混用。
- 每个数据集可独立设置列描述、同义词、语义类型等元数据,提升 NLQ 准确率。
- 用户可查看 AI 生成的 SQL,验证查询逻辑是否正确。
- 权限分 Owner(可修改)和 Viewer(仅查询和使用)。
一句话总结
多数据集 Topics 让 BI 用户无需手动合并表,用自然语言就能跨表查询,数据治理更集中,查询更灵活。