Apache Spark 4.2.0 发布解读:原生地理空间、Change Data Capture 与 Arrow Python 默认启用
Apache Spark 于 2026 年 7 月 11 日发布 4.2.0,这是 Spark 4.x 线的第三个 release。本版本解决了 1700+ Jira 问题,核心亮点是地理空间支持、CDC 能力与 PySpark 性能。
核心亮点
原生地理空间支持(默认启用):新增 GEOMETRY 与 GEOGRAPHY 数据类型,配套 ST_* 函数、WKB/WKT 与 Parquet 读写、基于 PROJ 9.7.1 的完整 SRID 注册表;Hive/Thrift server 也支持地理结果集。
Change Data Capture(CDC):新增 SQL CHANGES 子句与 DataFrame、PySpark、Spark Connect API,可批量与流式读取行级变更;Spark Declarative Pipelines 内置 Auto CDC,声明式完成 SCD Type 1 upsert。
PySpark 性能:Arrow 优化的 Python UDF 与基于 Arrow 的 PySpark IPC 默认启用,降低 Python 执行开销。
数据源 V2(DSv2):新增事务管理(连接器可原子提交多个操作)、INSERT schema 演化、UPDATE/DELETE/INSERT 的操作指标(numUpdatedRows 等)、分区统计过滤增强。
SQL 语义层:路径式名称解析(SET PATH、限定名、CURRENT_PATH())与 metric views(CREATE VIEW ... WITH METRICS 声明式语义建模);新增 NEAREST BY top-K 排名连接、QUALIFY 子句、TABLESAMPLE SYSTEM、time_bucket 函数等。
运维与平台:现代化 Spark Web UI(暗色模式、可搜索/缩放/并排的 SQL plan 可视化);History Server 可扩展性提升;K8s 支持异构 executor 管理与资源管理 API;支持在 Java 25 上构建与运行。
适用场景
- 需要内置空间分析(地理围栏、轨迹分析)的数据平台可默认启用地理类型;
- 数据仓库同步/湖仓场景可用 CDC 与 Auto CDC 简化增量入湖;
- PySpark 重负载任务可直接受益于默认启用的 Arrow 执行路径。