TiDB Cloud Lake 中的数据集成功能提供了一个可视化、无代码的接口,用于将外部系统中的数据导入、同步或消费到 TiDB Cloud Lake 中。该功能围绕两个关键概念展开:数据源 和 集成任务。
| 概念 | 说明 |
|---|---|
| 数据源 | 可复用的连接设置或凭证,用于访问外部系统或发送通知,例如 AWS Access Key / Secret Key、MySQL hostname / username / password、SQS (S3) queue URL、Kafka broker addresses,或 FeiShu bot webhook。 |
| 集成任务 | 可执行的任务,用于定义数据来源、任务将数据写入到哪里或如何保存结果、使用哪些运行时参数,以及如何启动和监控任务。 |
数据源本身不会移动数据。它们仅存储访问外部系统所需的信息。集成任务才是实际执行导入、快照、持续同步或消息消费的单元。
运行数据集成任务会产生服务托管费用。TiDB Cloud Lake 会根据服务的实际运行时间按秒计费。详情请参见服务托管定价。
并非每个数据源都对应一个数据摄取任务。例如,FeiShuBot 用于通知,而不是将源数据加载到 TiDB Cloud Lake 中。
| 任务类型 | 说明 |
|---|---|
| Amazon S3 | 从 Amazon S3 导入 CSV、Parquet 或 NDJSON 文件,支持一次性或持续摄取。 |
| Amazon SQS (S3) (Beta) | 从 SQS 队列中消费 S3 对象创建事件,并将相应的对象数据写入 TiDB Cloud Lake。 |
| MySQL | 使用 Snapshot、CDC Only 或 Snapshot + CDC 模式同步 MySQL 中的表数据。 |
| PostgreSQL | 使用 Snapshot、CDC Only 或 Snapshot + CDC 模式同步 PostgreSQL 中的表数据。 |
| Kafka Consumer Integration Task (Beta) | 持续消费 Kafka topic 中的消息,并将消息内容保存到内部对象存储中。 |