返回 AI 工具目录

Delta-Lake

自托管组件人工精选最近核验 2026年7月23日

Delta Lake 是一个开源的存储框架,用于在数据湖之上构建 Lakehouse(湖仓一体)架构,把数据仓库的可靠性带到数据湖的低成本存储上。它在对象存储的 Parquet 文件之上维护一份事务日志,为表提供 ACID 事务与可串行化的并发读写,支持数据版本与时间旅行、模式演进,并保持对 Delta 表的向后兼容。它面向多引擎:可与 Spark、Flink、Trino、PrestoDB、Hive 等计算引擎配合,提供 Scala、Java、Python、Rust 等多语言 API,还有供单机 Java 访问的 Delta Standalone。以 Apache 2.0 开源、由 delta-io 社区维护,适合作为大数据平台的表存储底座。

定价开源部署自托管国内可达国内可达许可Apache-2.0

解决什么问题

  • 在数据湖的对象存储上提供 ACID 事务与并发一致性
  • 通过事务日志支持数据版本、时间旅行与回溯
  • 统一批处理与流处理对同一张表的读写
  • 以多引擎、多语言 API 对接现有大数据栈

适合

  • 在数据湖上需要事务一致性与可靠的并发写入
  • 构建湖仓一体架构、统一 BI 与 AI 的数据底座
  • 已使用 Spark/Flink/Trino 等计算引擎
  • 需要数据版本、审计与可复现的数据处理

不适合

  • 数据量小、无并发写入需求时,直接用文件即可
  • 需要低延迟点查的在线业务,应选 OLTP 数据库
  • 团队无大数据引擎(如 Spark),接入成本较高
  • 仅做只读分析,可评估更轻量的表格式方案

如何接入

  • 在 S3/GCS/Azure/HDFS/本地等对象存储上创建 Delta 表
  • 通过 Spark、Flink、Trino、PrestoDB、Hive 等引擎读写
  • 提供 Scala/Java/Python/Rust API 与 Delta Standalone
  • 事务日志协议保证原子可见与互斥

已知限制

  • 依赖底层存储支持原子可见、互斥与一致列表
  • 完整能力多与 Spark 等引擎配套,存在栈依赖
  • 面向大数据批流场景,非低延迟点查
  • 不同引擎对新特性的支持进度可能不一致

接入与使用事实

部署方式
自托管
实现语言
Scala、Java、Python、Rust
中文界面
待确认
中文文档
待确认
定价方式
开源
许可证
Apache-2.0
国内可达性
国内可达
可达性观察
待补充

权限、依赖与维护信号

这些字段记录公开可见信号,不等同于安全审计结论。

权限信号

暂无公开信号。

依赖信号

暂无公开信号。

维护信号

暂无公开信号。

公开来源与证据

暂无可公开的来源链接。

访问官网