联合航空打通 Redshift 与 Databricks,查询数据不用再复制
AI 导读
联合航空通过 AWS Glue Data Catalog 联邦,让 Redshift Serverless 查询 Databricks Unity Catalog 管理的数据,不必再复制一份。
内容梳理
联合航空的数据平台同时用到 Databricks 和 Amazon Redshift。用户行为数据已经由 Unity Catalog 管理,但分析人员仍需要在 Redshift Serverless 里查询它。以前常见的做法是再复制一份数据,并维护一套同步链路。
这次案例的关键不是把数据搬过去,而是打通目录与权限。Unity Catalog 通过 Iceberg REST API 暴露表元数据;AWS Glue Data Catalog 的联邦目录和资源链接让 Redshift 找得到这些表,Lake Formation 管理访问权限,查询时直接读取 S3 上的数据。
AWS 与联合航空的文章称,首批已有 30 张表在生产环境联邦查询,还有 70 张在推进。这个案例让我想到很多数仓项目的痛点:跨平台并不必然等于多一份数据副本;先把元数据、权限和查询路径理顺,往往比再造一条 ETL 更有价值。
关键要点
- 这个案例把 Redshift Serverless、AWS Glue Data Catalog 与 Databricks Unity Catalog 接了起来。
- 重点是联邦查询:保留原有数据管理位置,同时让另一套分析引擎读到它。
- 数据副本越少,口径同步和权限治理就越容易说清楚;实际效果仍取决于查询场景。