跳到内容

联合航空打通 Redshift 与 Databricks,查询数据不用再复制

AWS Big Data·

AI 导读

联合航空通过 AWS Glue Data Catalog 联邦,让 Redshift Serverless 查询 Databricks Unity Catalog 管理的数据,不必再复制一份。

内容梳理

联合航空的数据平台同时用到 Databricks 和 Amazon Redshift。用户行为数据已经由 Unity Catalog 管理,但分析人员仍需要在 Redshift Serverless 里查询它。以前常见的做法是再复制一份数据,并维护一套同步链路。

这次案例的关键不是把数据搬过去,而是打通目录与权限。Unity Catalog 通过 Iceberg REST API 暴露表元数据;AWS Glue Data Catalog 的联邦目录和资源链接让 Redshift 找得到这些表,Lake Formation 管理访问权限,查询时直接读取 S3 上的数据。

AWS 与联合航空的文章称,首批已有 30 张表在生产环境联邦查询,还有 70 张在推进。这个案例让我想到很多数仓项目的痛点:跨平台并不必然等于多一份数据副本;先把元数据、权限和查询路径理顺,往往比再造一条 ETL 更有价值。

关键要点

  • 这个案例把 Redshift Serverless、AWS Glue Data Catalog 与 Databricks Unity Catalog 接了起来。
  • 重点是联邦查询:保留原有数据管理位置,同时让另一套分析引擎读到它。
  • 数据副本越少,口径同步和权限治理就越容易说清楚;实际效果仍取决于查询场景。