- 文档中心
- 关于 TiDB
- 快速上手
- 部署标准集群
- 数据迁移
- 运维操作
- 监控与告警
- 故障诊断
- 性能调优
- 系统调优
- 软件调优
- SQL 性能调优
- SQL 性能调优概览
- 理解 TiDB 执行计划
- SQL 优化流程
- 控制执行计划
- 教程
- TiDB 工具
- 功能概览
- 适用场景
- 工具下载
- TiUP
- TiDB Operator
- Dumpling
- TiDB Lightning
- TiDB Data Migration
- Backup & Restore (BR)
- TiDB Binlog
- TiCDC
- TiUniManager
- sync-diff-inspector
- TiSpark
- 参考指南
- 架构
- 监控指标
- 安全加固
- 权限
- SQL
- SQL 语言结构和语法
- SQL 语句
ADD COLUMN
ADD INDEX
ADMIN
ADMIN CANCEL DDL
ADMIN CHECKSUM TABLE
ADMIN CHECK [TABLE|INDEX]
ADMIN SHOW DDL [JOBS|QUERIES]
ALTER DATABASE
ALTER INDEX
ALTER INSTANCE
ALTER TABLE
ALTER USER
ANALYZE TABLE
BACKUP
BEGIN
CHANGE COLUMN
CHANGE DRAINER
CHANGE PUMP
COMMIT
CREATE [GLOBAL|SESSION] BINDING
CREATE DATABASE
CREATE INDEX
CREATE ROLE
CREATE SEQUENCE
CREATE TABLE LIKE
CREATE TABLE
CREATE USER
CREATE VIEW
DEALLOCATE
DELETE
DESC
DESCRIBE
DO
DROP [GLOBAL|SESSION] BINDING
DROP COLUMN
DROP DATABASE
DROP INDEX
DROP ROLE
DROP SEQUENCE
DROP STATS
DROP TABLE
DROP USER
DROP VIEW
EXECUTE
EXPLAIN ANALYZE
EXPLAIN
FLASHBACK TABLE
FLUSH PRIVILEGES
FLUSH STATUS
FLUSH TABLES
GRANT <privileges>
GRANT <role>
INSERT
KILL [TIDB]
LOAD DATA
LOAD STATS
MODIFY COLUMN
PREPARE
RECOVER TABLE
RENAME INDEX
RENAME TABLE
REPLACE
RESTORE
REVOKE <privileges>
REVOKE <role>
ROLLBACK
SELECT
SET DEFAULT ROLE
SET [NAMES|CHARACTER SET]
SET PASSWORD
SET ROLE
SET TRANSACTION
SET [GLOBAL|SESSION] <variable>
SHOW [BACKUPS|RESTORES]
SHOW ANALYZE STATUS
SHOW [GLOBAL|SESSION] BINDINGS
SHOW BUILTINS
SHOW CHARACTER SET
SHOW COLLATION
SHOW [FULL] COLUMNS FROM
SHOW CONFIG
SHOW CREATE SEQUENCE
SHOW CREATE TABLE
SHOW CREATE USER
SHOW DATABASES
SHOW DRAINER STATUS
SHOW ENGINES
SHOW ERRORS
SHOW [FULL] FIELDS FROM
SHOW GRANTS
SHOW INDEX [FROM|IN]
SHOW INDEXES [FROM|IN]
SHOW KEYS [FROM|IN]
SHOW MASTER STATUS
SHOW PLUGINS
SHOW PRIVILEGES
SHOW [FULL] PROCESSSLIST
SHOW PROFILES
SHOW PUMP STATUS
SHOW SCHEMAS
SHOW STATS_HEALTHY
SHOW STATS_HISTOGRAMS
SHOW STATS_META
SHOW STATUS
SHOW TABLE NEXT_ROW_ID
SHOW TABLE REGIONS
SHOW TABLE STATUS
SHOW [FULL] TABLES
SHOW [GLOBAL|SESSION] VARIABLES
SHOW WARNINGS
SHUTDOWN
SPLIT REGION
START TRANSACTION
TABLE
TRACE
TRUNCATE
UPDATE
USE
- 数据类型
- 函数与操作符
- 聚簇索引
- 约束
- 生成列
- SQL 模式
- 事务
- 垃圾回收 (GC)
- 视图
- 分区表
- 字符集和排序规则
- 系统表
mysql
- INFORMATION_SCHEMA
- Overview
ANALYZE_STATUS
CLIENT_ERRORS_SUMMARY_BY_HOST
CLIENT_ERRORS_SUMMARY_BY_USER
CLIENT_ERRORS_SUMMARY_GLOBAL
CHARACTER_SETS
CLUSTER_CONFIG
CLUSTER_HARDWARE
CLUSTER_INFO
CLUSTER_LOAD
CLUSTER_LOG
CLUSTER_SYSTEMINFO
COLLATIONS
COLLATION_CHARACTER_SET_APPLICABILITY
COLUMNS
DDL_JOBS
ENGINES
INSPECTION_RESULT
INSPECTION_RULES
INSPECTION_SUMMARY
KEY_COLUMN_USAGE
METRICS_SUMMARY
METRICS_TABLES
PARTITIONS
PROCESSLIST
SCHEMATA
SEQUENCES
SESSION_VARIABLES
SLOW_QUERY
STATISTICS
TABLES
TABLE_CONSTRAINTS
TABLE_STORAGE_STATS
TIDB_HOT_REGIONS
TIDB_INDEXES
TIDB_SERVERS_INFO
TIFLASH_REPLICA
TIKV_REGION_PEERS
TIKV_REGION_STATUS
TIKV_STORE_STATUS
USER_PRIVILEGES
VIEWS
METRICS_SCHEMA
- UI
- CLI
- 命令行参数
- 配置文件参数
- 系统变量
- 存储引擎
- 遥测
- 错误码
- 通过拓扑 label 进行副本调度
- 常见问题解答 (FAQ)
- 版本发布历史
- 发布版本汇总
- v5.0
- v4.0
- v3.1
- v3.0
- v2.1
- v2.0
- v1.0
- 术语表
你正在查看 TiDB 数据库的较旧版本 (TiDB v5.0) 的文档。
TiCDC 集群监控报警规则
本文介绍了 TiCDC 组件的报警项及相应的报警规则。根据严重级别,报警项按照严重程度由高到低依次为:重要级别 (Critical)、警告级别 (Warning)。
重要级别报警项
对于重要级别的报警,需要密切关注异常指标。
cdc_checkpoint_high_delay
报警规则:
(time() - ticdc_processor_checkpoint_ts / 1000) > 600
规则描述:
TiCDC 某个同步任务延迟超过 10 分钟。
处理方法:
参考
TiCDC 同步任务出现中断
的处理方法。
cdc_resolvedts_high_delay
报警规则:
(time() - ticdc_processor_resolved_ts / 1000) > 300
规则描述:
TiCDC 某个同步任务的 resolved ts 延迟超过 10 分钟。
处理方法:
该告警与同步任务中断类似,可参考
TiCDC 同步任务出现中断
的处理方法。
ticdc_processor_exit_with_error_count
报警规则:
changes(ticdc_processor_exit_with_error_count[1m]) > 0
规则描述:
TiCDC 某个同步任务报错退出。
处理方法:
参考
TiCDC 同步任务出现中断
的处理方法。
警告级别报警项
警告级别的报警是对某一问题或错误的提醒。
cdc_multiple_owners
报警规则:
sum(rate(ticdc_owner_ownership_counter[30s])) >= 2
规则描述:
TiCDC 集群有多个 owner。
处理方法:
收集 TiCDC 日志,定位原因。
ticdc_mounter_unmarshal_and_mount_time_more_than_1s
报警规则:
histogram_quantile(0.9, rate(ticdc_mounter_unmarshal_and_mount_bucket[1m])) * 1000 > 1000
规则描述:
TiCDC 某一同步任务解码变更数据的耗时超过 1 秒。
处理方法:
收集 TiCDC 日志,定位原因。
cdc_sink_execute_duration_time_more_than_10s
报警规则:
histogram_quantile(0.9, rate(ticdc_sink_txn_exec_duration_bucket[1m])) > 10
规则描述:
TiCDC 某一同步任务写下游执行时间超过 10 秒。
处理方法:
检查下游是否出现问题。
cdc_processor_checkpoint_tso_no_change_for_1m
报警规则:
changes(ticdc_processor_checkpoint_ts[1m]) < 1
规则描述:
TiCDC 某一个同步任务进度超过 1 分钟没有推进。
处理方法:
参考
TiCDC 同步任务出现中断
的处理方法。
ticdc_puller_entry_sorter_sort_bucket
报警规则:
histogram_quantile(0.9, rate(ticdc_puller_entry_sorter_sort_bucket{}[1m])) > 1
规则描述:
TiCDC puller entry sorter 排序延迟太高。
处理方法:
收集 TiCDC 日志,定位原因。
ticdc_puller_entry_sorter_merge_bucket
报警规则:
histogram_quantile(0.9, rate(ticdc_puller_entry_sorter_merge_bucket{}[1m])) > 1
规则描述:
TiCDC puller entry sorter merge 延迟太高。
处理方法:
收集 TiCDC 日志,定位原因。
tikv_cdc_min_resolved_ts_no_change_for_1m
报警规则:
changes(tikv_cdc_min_resolved_ts[1m]) < 1 and ON (instance) tikv_cdc_region_resolve_status{status="resolved"} > 0
规则描述:
TiKV CDC 模块最小的 resolved ts 1 分钟没推进。
处理方法:
收集 TiKV 日志,定位原因。
tikv_cdc_scan_duration_seconds_more_than_10min
报警规则:
histogram_quantile(0.9, rate(tikv_cdc_scan_duration_seconds_bucket{}[1m])) > 600
规则描述:
TiKV CDC 模块的增量扫描耗时超过 10 分钟。
处理方法:
收集 TiCDC 监控和 TiKV 日志,定位原因。
ticdc_sink_mysql_execution_error
报警规则:
changes(ticdc_sink_mysql_execution_error[1m]) > 0
规则描述:
TiCDC 某一同步任务写下游 MySQL 时遇到错误。
处理方法:
MySQL 报错的情况较多,参考
TiCDC 常见问题和故障处理
。
ticdc_memory_abnormal
报警规则:
go_memstats_heap_alloc_bytes{job="ticdc"} > 1e+10
规则描述:
TiCDC 堆内存使用量超过 10 GiB。
处理方法:
收集 TiCDC 监控和 TiCDC 日志,定位原因。
- 重要级别报警项
- 警告级别报警项
- cdc_multiple_owners
- ticdc_mounter_unmarshal_and_mount_time_more_than_1s
- cdc_sink_execute_duration_time_more_than_10s
- cdc_processor_checkpoint_tso_no_change_for_1m
- ticdc_puller_entry_sorter_sort_bucket
- ticdc_puller_entry_sorter_merge_bucket
- tikv_cdc_min_resolved_ts_no_change_for_1m
- tikv_cdc_scan_duration_seconds_more_than_10min
- ticdc_sink_mysql_execution_error
- ticdc_memory_abnormal