数据集成
定义
本模块用于配置与执行数据集成(ETL)任务,支持多源数据的接入、转换与写出,是构建数据流、数据处理链路的核心组件。通过节点式图形化配置,用户可完成从数据读取、清洗、转换到落地的完整流程。
输入节点支持
- 🗄️ 关系型数据库表输入(MySQL、DM8、Oracle、SQL Server、KingBase8等);
- 🐝 分析型数据仓库 Doris 输入;
- 📁 HDFS 目录输入(支持 CSV、Excel等格式);
输出节点支持
- 🗄️ 表输出(写入关系型数据库);
转换节点支持(持续增强中)
- 已完成组件:转换组件、排序记录、字段派生器、去除重复记录、增加常量、字段选择、修改、值映射、数值范围、字符串操作、日期格式统一、保留小数位等
- 已规划组件:字段前后缀统一、正则表达式替换、超长字段截断、组合字段为空删除、字段值转大写、字段值转小写、枚举值映射标准化等(部分已完成 UI);
- 所有组件将持续适配主流数据库,保持与数据质量任务的转换能力一致。
特性增强
- 一、DataX(轻量级)
✅ 内置全类型数据源适配插件,兼容 MySQL/DM8 / 人大金仓 / Oracle/Doris 等多类国产、通用数据库,开箱即用无需额外驱动部署;
🔁 支持 JVM 内存、通道并发、字节 / 记录双层限流、脏数据阈值精细化管控,可灵活调节同步吞吐量,规避源库压力过载;
🧩 单机轻量化架构无集群依赖,启动速度快运维简单,适配千万级以内中小表全量 / 增量离线同步场景。 - 二、Spark(分布式)
✅ 分布式并行分片读取能力,突破单机算力内存瓶颈,支撑十亿级海量历史水文数据批处理同步;
🔁 同步与复杂计算一体化,内置多表关联、聚合、分区重写大数据算子,数据搬运同时完成数仓分层清洗加工;
🧩 复用大数据集群资源隔离调度,支持超大分区表、归档历史数据高效写入 Doris 数仓,适配大规模离线数仓建设场景。 - 三、Flink(流式,暂未上线)
✅ 支持实时流式 CDC 任务模式,在兼容离线全量初始化基础上实现流批一体数据集成,数据秒级同步至数仓;
🔁 具备状态持久化、断点续传与 Exactly-Once 数据一致性保障,长驻实时任务故障自动恢复,无数据丢失重复;
🧩 原生支持实时窗口聚合计算,同步链路中完成雨量、流量等实时指标汇总,直接支撑水雨情实时预警、在线大屏场景。
注意事项
请合理配置数据源权限及执行频率,避免对源系统产生过高负载。
作用范围
适用于结构化、半结构化及流式数据的集成处理场景,广泛应用于数据归集、数据治理、数据入湖入仓等关键链路中。适配多种数据源与目标端,支持规则驱动的数据转换及清洗。
1、数据集成页面
点击【数据研发】-> 【任务管理】下的【数据集成】,进入数据集成页面。页面采用左右布局:左侧以树形结构展示数据集成类目,右侧展示任务列表包含任务名称、任务描述、任务类目、任务状态、调度状态等字段。

2、新增数据集成任务-DataX(轻量级)
点击页面中【新增DATAX任务】按钮,在出现的弹出框内填写基础信息,执行配置中默认选择 DataX(轻量级),并点击【确定】按钮,完成新增数据集成任务新增。
3、新增数据集成任务-Spark(分布式)
点击页面中【新增Spark任务】按钮,在出现的弹出框内填写基础信息,执行配置中默认选择 Spark(分布式),并点击【确定】按钮,完成新增数据集成任务新增。
4、配置转化数据集成任务
选择需配置转化数据集成任务,在操作列中点击【配置转化】按钮,在出现的页面中编辑转换规则,并点击【保存】按钮,完成配置转化数据集成任务。

5、删除数据集成任务
选择需删除数据集成任务,点击操作列中的【更多】->【删除】按钮,并点击【确定】按钮,系统将删除该数据集成任务。

6、数据集成任务详情
选择需查看数据集成任务详情,点击操作列中的【详情】按钮,进行数据集成任务详情查看。

7、调度周期
选择需任务调度与执行的数据集成任务,点击操作列中的【更多】->【调度周期】按钮,在弹出框内填写相关信息,并点击【确定】按钮,系统将调度执行该数据集成任务。

8、任务状态
选择需上线/下线的任务状态,在状态列中点击【开关】按钮,即可完成上线/下线操作。

9、调度状态
选择需上线/下线的调度状态,在状态列中点击【开关】按钮,即可完成上线/下线操作。

10、运行实例
选择需查看运行实例的数据集成任务,点击操作列中的【更多】->【运行实例】按钮,在出现的弹出框内查看。

11、执行一次
选择需执行一次的数据集成任务,点击操作列中的【更多】->【执行一次】按钮,系统将执行一次该任务,并提示相关信息。

