Amazon MSK Express 代理现在将数据交付到 Apache Iceberg 的流式表
Amazon MSK Express 代理现在将数据交付到 Apache Iceberg 的流式表,这是一项新功能,可不断将 Apache Kafka 主题物化为 Amazon S3 表类数据存储服务上的 Apache Iceberg 表。Amazon MSK 数据交付到流式表的功能,与自行管理部署相比,可将 Apache Kafka 数据摄取并交付到 Amazon S3 表类数据存储服务的成本降低多达 60%,并将下游查询成本相比自行管理 Apache Kafka 部署降低多达 30%。
客户依靠 Apache Kafka 为欺诈检测和个性化等使用场景摄取实时数据,并越来越希望将这些数据与 Apache Iceberg 表统一以进行近实时分析,但集成二者迫使他们操作复杂的自定义管道、管理格式转换并应对小文件问题,即大量摄取会产生许多小的 Parquet 文件,从而降低下游查询速度并增加成本。借助此功能,智能内联压缩消除了小文件对性能的影响,并在不牺牲数据新鲜度的情况下保持查询性能可预测,同时内置协调机制可解决高吞吐量消费者之间的并发写入冲突。Amazon MSK 支持在交付到 Amazon S3 表类数据存储服务上的 Apache Iceberg 时吞吐量高达 10 GB/s,并且由于此原生功能不会增加代理出站吞吐量,客户可以避免扩展连接器管道带来的增量基础设施成本,并使容量与实际需求而非峰值相匹配。客户将数据交付到流式表,并使用任意选择的引擎(如 Apache Spark、Trino 或 Apache Flink)查询或转换这些数据。
要开始使用,客户可以打开 Amazon MSK 控制台,选择 Express 集群,只需几次点击即可启用此功能,或使用 MSK API 或 MCP 服务器。Amazon MSK 数据交付到流式表的功能现已在由光环新网运营的亚马逊云科技中国(北京)区域和由西云数据运营的亚马逊云科技中国(宁夏)区域推出。有关定价信息,请访问定价页面要了解更多信息,请访问 Amazon MSK 开发人员指南和 Amazon MSK AI 技能