📣
TiDB Cloud Premium 开放公测中。为企业级工作负载提供无限扩展、即时弹性伸缩和高级安全保障。此页面由 AI 自动翻译,英文原文请见此处。

数据集成概览



TiDB Cloud Lake 中的数据集成功能提供了一个可视化、无代码的接口,用于将外部系统中的数据导入、同步或消费到 TiDB Cloud Lake 中。该功能围绕两个关键概念展开:数据源 和 集成任务。

关键概念

概念说明
数据源可复用的连接设置或凭证,用于访问外部系统或发送通知,例如 AWS Access Key / Secret Key、MySQL hostname / username / password、SQS (S3) queue URL、Kafka broker addresses,或 FeiShu bot webhook。
集成任务可执行的任务,用于定义数据来源、任务将数据写入到哪里或如何保存结果、使用哪些运行时参数,以及如何启动和监控任务。

数据源本身不会移动数据。它们仅存储访问外部系统所需的信息。集成任务才是实际执行导入、快照、持续同步或消息消费的单元。

并非每个数据源都对应一个数据摄取任务。例如,FeiShuBot 用于通知,而不是将源数据加载到 TiDB Cloud Lake 中。

支持的集成任务类型

任务类型说明
Amazon S3从 Amazon S3 导入 CSV、Parquet 或 NDJSON 文件,支持一次性或持续摄取。
Amazon SQS (S3) (Beta)从 SQS 队列中消费 S3 对象创建事件,并将相应的对象数据写入 TiDB Cloud Lake。
MySQL使用 Snapshot、CDC Only 或 Snapshot + CDC 模式同步 MySQL 中的表数据。
PostgreSQL使用 Snapshot、CDC Only 或 Snapshot + CDC 模式同步 PostgreSQL 中的表数据。
Kafka Consumer Integration Task (Beta)持续消费 Kafka topic 中的消息,并将消息内容保存到内部对象存储中。
  1. 在数据源页面创建并测试可复用的连接设置。
  2. 在集成任务页面查看支持的任务类型及其适用场景。
  3. 阅读特定任务的指南,配置数据源、预览数据,并配置结果位置或结果查看方法。
  4. 使用任务管理页面启动任务、检查状态并排查执行问题。

文档内容是否有帮助?