编程 Apache Hop 上手:脱胎于 Kettle,跨引擎跑 Pipeline,安装前备好 Java 17

2026-09-04 22:05:52

Apache Hop 上手:脱胎于 Kettle,跨引擎跑 Pipeline,安装前备好 Java 17

Apache Hop 是一个开源的数据集成与工作流引擎,最初来自 Kettle(Pentaho Data Integration),并在 2020 年成为 Apache 软件基金会的顶级项目。下载页面:

核心功能:可视化、跨引擎、元数据驱动

  • 可视化开发:通过图形界面设计 workflow 和 pipeline,主要精力可以放在业务逻辑上,而不是代码实现。
  • 跨引擎支持:workflow/pipeline 支持用原生 Hop 引擎在本地或远程运行;pipeline 也可以交给 Apache Spark、Apache Flink、Google Dataflow 执行。
  • 生命周期管理:Hop Gui 内置项目、环境、运行时配置等管理功能。
  • 元数据驱动:对数据的操作、工作流编排、插件配置都通过元数据描述。

常用业务场景:

  • 大数据加载:配合云环境、集群和 MPP 能力把海量数据加载到数据库。
  • 数据仓库:利用内置 SCD、CDC、代理主键功能执行 ETL。
  • 数据集成:整合关系型数据库、文件系统、NoSQL 等异构数据源。
  • 数据迁移:完成不同数据库和系统之间的数据迁移。
  • 数据分析和数据清洗。

下载安装:解压即用,但要先确认 JVM

进入 Apache Hop 官方下载页:

初学者建议下载二进制的 Binaries 包,解压后就完成安装。

注意:Apache Hop 基于 Java 开发,当前版本需要 64 位 Java 17 以上。安装前先确认本机 JVM 版本。

启动 Hop Gui,加载自带 samples

Hop Gui 是主要的图形开发工具,在安装目录运行 hop-gui.bathop-gui.sh 启动。

界面默认英文。想换成中文的话,点击界面左侧的配置视图(⚙),打开 “Look & Feel” 页面,选择 “简体中文”。修改后需要重启 Apache Hop 才能生效。

Hop 自带了不少学习案例,位于安装目录下的 config\projects\samples 子目录。启动后在 “打开” 菜单中加载该目录即可。

Hop 里的概念和操作方式和 Kettle 很接近,后者的使用方法可以参考这篇文章

复制全文 生成海报 Apache Hop ETL 数据集成 Kettle 工作流

推荐文章

程序员茄子在线接单