程序员茄子
全部
编程
代码
资讯
案例
综合
联系我们
大数据 相关技术文章
php
mysql
shell
go
vue
css
api接口对接
支付接口对接
Apache Spark 4.2.0 发布解读:原生地理空间、Change Data Capture 与 Arrow Python 默认启用
编程
Apache Spark 4.2.0 发布解读:原生地理空间、Change Data Capture 与 Arrow Python 默认启用
2026-09-09 10:25:27
Apache Spark 4.2.0 发布:新增 GEOMETRY/GEOGRAPHY 地理空间类型并默认启用,引入 CDC 与 Auto CDC 增量入湖,Arrow Python UDF 默认开启,DSv2 事务管理与 INSERT schema 演化,支持 Java 25 并现代化 Spark Web UI。
Spark
大数据
数据工程
CDC
Dataflow 模型 11 年复盘:物理对了,接口错了
资讯
Dataflow 模型 11 年复盘:物理对了,接口错了
2026-09-08 02:10:00
VLDB Test of Time 奖作者 11 年后自评:事件时间与一致性判断正确;窗口/触发器/撤回接口设计失误,最大失察是数据库文献早有正确答案。
大数据
流处理
数据库
Hue 手记:功能范围、数据源列表与 Docker 快速启动
编程
Hue 手记:功能范围、数据源列表与 Docker 快速启动
2026-09-04 22:35:42
Hue(Hadoop User Experience)开源大数据查询工具手记:覆盖数据源列表(Hive/Impala/MySQL/Presto/Trino/ClickHouse 等)、SQL 编辑器、Dashboard、可视化、任务调度与分享等核心能力,并给出用 Docker 一条命令在 8888 端口快速跑起来的步骤与官方文档地址。
Hue
大数据
SQL
Docker
开源工具
用 Docker 跑起 DolphinScheduler 3.2.2 并创建第一个工作流
编程
用 Docker 跑起 DolphinScheduler 3.2.2 并创建第一个工作流
2026-09-04 22:15:21
用 Docker 单机跑起 Apache DolphinScheduler 3.2.2,讲解其 DAG 可视化工作流调度的核心特性,并手把手完成建项目、拖拽 Shell 任务、设置依赖与运行的第一个工作流。
DolphinScheduler
工作流调度
Docker
DAG
大数据
Apache Zeppelin 怎么跑起来:一个支持 Spark/Flink/Hive 的协作 Notebook
编程
Apache Zeppelin 怎么跑起来:一个支持 Spark/Flink/Hive 的协作 Notebook
2026-09-04 22:00:53
Apache Zeppelin 是基于 Web 的交互式数据分析 Notebook,类似 Jupyter,支持 SQL/Java/Scala/Python/R 以及 Spark、Flink、Hive、MongoDB 等后端。本文贴稿介绍其语言与数据源支持、JDK 8 + Ubuntu/macOS 安装前提、两种解释器安装包差异、Unix/Windows 启动命令与 localhost:8080 访问方式,并提示自带示例 notebook 与源码/Docker 安装选项。
Apache
Zeppelin
Notebook
大数据
数据分析
Spark
Flink
Kafka 从安装到收发消息:一次覆盖架构、功能与选型边界的记录
编程
Kafka 从安装到收发消息:一次覆盖架构、功能与选型边界的记录
2026-09-03 19:36:33
以工程师笔记视角梳理 Apache Kafka:核心架构(Producer/Broker/Topic/Partition/KRaft)、高吞吐的日志存储设计、核心功能与适用边界,并给出 3.x KRaft 安装启动命令和 kafka-python 收发消息示例,附 GitHub 项目地址。
Kafka
消息队列
大数据
事件流
中间件
Apache Iceberg V3 深度拆解:删除向量、行血缘与 Variant 类型,湖仓表格式的第三次范式转移
编程
Apache Iceberg V3 深度拆解:删除向量、行血缘与 Variant 类型,湖仓表格式的第三次范式转移
2026-08-02 01:39:04
Iceberg V3 规范深度拆解:从 V2 position delete 的读放大死穴讲起,逐字节剖析 Puffin 删除向量与 Roaring Bitmap 编码、行血缘的零开销 ID 分配算法、Variant 类型与 Shredding 打散机制。附手写 DV 解析器、增量物化视图、Compaction 决策脚本与踩坑清单。
Iceberg
数据湖
湖仓一体
大数据
Spark
开源
Apache Iceberg V3 深度拆解:Deletion Vectors、Row Lineage 与 Variant 类型,开放表格式如何终结数据湖的「文件散养」时代
编程
Apache Iceberg V3 深度拆解:Deletion Vectors、Row Lineage 与 Variant 类型,开放表格式如何终结数据湖的「文件散养」时代
2026-07-30 01:46:13
深度拆解 Apache Iceberg V3 规范三大核心改动:Binary Deletion Vectors 终结删除文件堆积、Row Lineage 行级血缘赋能增量计算与审计、Variant 半结构化类型落地,附 V2 升级实战与冷静的边界分析。
Iceberg
数据湖
Deletion Vectors
Row Lineage
Variant
表格式
Spark
Trino
大数据
开源
Venice 深度拆解:LinkedIn 如何用衍生数据平台承载每日 1.2PB 数据写入与万亿级特征服务
编程
Venice 深度拆解:LinkedIn 如何用衍生数据平台承载每日 1.2PB 数据写入与万亿级特征服务
2026-07-29 12:16:37
深度拆解 LinkedIn 开源的 Venice 衍生数据平台:1.2PB/日写入吞吐、CRDT多活、混合负载架构、Read Compute 向量计算,以及作为 Feature Store 在线存储层的独特价值。
Venice
LinkedIn
Feature Store
衍生数据平台
分布式系统
CRDT
多区域多活
Write Compute
Read Compute
大数据
Apache Arrow Flight SQL 深度实战:从零拷贝列式内存到跨语言高速数据传输——架构、协议与生产落地的工程全解(2026)
编程
Apache Arrow Flight SQL 深度实战:从零拷贝列式内存到跨语言高速数据传输——架构、协议与生产落地的工程全解(2026)
2026-07-22 07:19:06
深度解析 Apache Arrow Flight SQL:从零拷贝列式内存到跨语言高速数据传输。涵盖 Arrow 内存布局、Flight RPC 协议、Flight SQL 查询接口、Rust/Go/Python 实战代码、生产级部署架构与性能优化,实现 5-10x 性能提升。
Apache Arrow
Flight SQL
零拷贝
列式存储
gRPC
数据传输
大数据
DataFusion
性能优化
ClickHouse v26.2 深度拆解:当 OLAP 数据库进入全栈内嵌时代——从 ClickStack 可观测 UI 到向量搜索分布式化(2026)
编程
ClickHouse v26.2 深度拆解:当 OLAP 数据库进入全栈内嵌时代——从 ClickStack 可观测 UI 到向量搜索分布式化(2026)
2026-07-17 15:15:41
深度拆解 ClickHouse v26.2:ClickStack 可观测 UI、TOTP 原生认证、BigLake 集成、向量搜索分布式化、QBit 数据类型 GA、Insert 去重行为变更,配完整代码实战与生产升级指南。
ClickHouse
OLAP
向量数据库
数据库
大数据
实时分析
ClickStack
HNSW
Iceberg
Apache Iceberg 深度实战:当数据湖长出 ACID 与模式演进——从 Manifest 三层元数据到隐藏分区、时间旅行与生产级 Lakehouse 完全指南(2026)
编程
Apache Iceberg 深度实战:当数据湖长出 ACID 与模式演进——从 Manifest 三层元数据到隐藏分区、时间旅行与生产级 Lakehouse 完全指南(2026)
2026-07-09 04:48:40
从一次数据湖事故出发,深入拆解 Apache Iceberg 的四层元数据、隐藏分区、Schema/Partition 演进、时间旅行与行级更新,并给出可直接落地的 Spark/Trino/PyIceberg 代码与性能优化清单。
数据湖
Iceberg
Lakehouse
表格式
大数据
Polars vs Pandas 深度实战:列式存储、懒执行与多线程如何重构大数据处理范式
编程
Polars vs Pandas 深度实战:列式存储、懒执行与多线程如何重构大数据处理范式
2026-06-28 07:12:26
深入剖析 Polars 如何用 Apache Arrow 列式存储、声明式懒执行、Rust 多线程重写大数据处理范式,包含架构原理、性能基准、迁移指南与生产级代码实战。
Polars
Pandas
数据处理
Apache Arrow
Rust
Python
大数据
DataFrame
ClickHouse 2026 深度实战:当列式存储遇见 AI 时代——从 MergeTree 引擎到 PB 级实时分析,构建下一代数据基础设施的完全指南
编程
ClickHouse 2026 深度实战:当列式存储遇见 AI 时代——从 MergeTree 引擎到 PB 级实时分析,构建下一代数据基础设施的完全指南
2026-06-21 21:58:21
2026 年 ClickHouse 生产级完全指南:从列式存储、MergeTree 引擎、向量化执行到分布式架构、物化视图、Kafka 集成、性能优化与 AI 场景实战。
ClickHouse
OLAP
列式存储
MergeTree
实时分析
数据库
大数据
性能优化
物化视图
云原生
DuckLake v1.0 深度解析:用关系型数据库如何颠覆湖仓一体的"小文件地狱"
编程
DuckLake v1.0 深度解析:用关系型数据库如何颠覆湖仓一体的"小文件地狱"
2026-04-19 03:14:23
DuckDB团队发布DuckLake v1.0,用关系型数据库管理元数据,查询速度比Iceberg快926倍。深度解析数据内联、排序表、桶分区、VARIANT类型等核心特性。
DuckLake
DuckDB
湖仓一体
数据湖
大数据
10亿级数据高效写入MySQL:架构设计与实战优化
编程
10亿级数据高效写入MySQL:架构设计与实战优化
2025-03-29 15:24:44
本文探讨了在大数据时代如何高效地将10亿级数据写入MySQL的技术方案,包括架构设计、并行处理、批量写入、LOADDATAINFILE等优化技术。通过分库分表、数据分片、监控系统等策略,确保数据的高效存储与处理。同时,提供了实战案例分析和最佳实践建议,以帮助实现高效稳定的数据存储架构。
大数据
数据库
技术方案
数据存储
性能优化
shore-kafka是一个为Python开发者设计适用于大数据流处理
综合
shore-kafka是一个为Python开发者设计适用于大数据流处理
2024-11-19 02:00:32
shore-kafka是一个为Python开发者设计的库,简化了与ApacheKafka的交互,适用于大数据流处理。本文介绍了shore-kafka的安装、基本用法(创建生产者和消费者)、高级用法(自定义序列化器和消费者拦截器)以及实际使用案例(实时日志处理)。该库提供丰富功能,帮助开发者快速实现数据的实时传输与处理。
Python库
大数据
流处理
实时数据
Kafka
Elasticsearch 聚合和分析
编程
Elasticsearch 聚合和分析
2024-11-19 06:44:08
Elasticsearch是一个强大的搜索和分析引擎,其聚合功能允许用户深入分析数据。聚合分为桶聚合、度量聚合和管道聚合,支持复杂的数据统计和分组操作。通过示例,展示了如何在电商平台和社交媒体上应用聚合功能来分析销售数据和用户行为,从而提取有价值的信息,帮助做出更好的业务决策。
搜索引擎
数据分析
大数据
大家都在搜索什么?
devops
易支付
一个官网+多少钱
统一接受回调
统一回调
python
sub
node
宝塔日志
mysql
shell
ElasticSearch
css
vue
api接口对接
2025
支付接口对接
go
php
php回调