返回 AI 工具目录
Delta-Lake
自托管组件人工精选最近核验 2026年7月23日
Delta Lake 是一个开源的存储框架,用于在数据湖之上构建 Lakehouse(湖仓一体)架构,把数据仓库的可靠性带到数据湖的低成本存储上。它在对象存储的 Parquet 文件之上维护一份事务日志,为表提供 ACID 事务与可串行化的并发读写,支持数据版本与时间旅行、模式演进,并保持对 Delta 表的向后兼容。它面向多引擎:可与 Spark、Flink、Trino、PrestoDB、Hive 等计算引擎配合,提供 Scala、Java、Python、Rust 等多语言 API,还有供单机 Java 访问的 Delta Standalone。以 Apache 2.0 开源、由 delta-io 社区维护,适合作为大数据平台的表存储底座。
定价开源部署自托管国内可达国内可达许可Apache-2.0
解决什么问题
- 在数据湖的对象存储上提供 ACID 事务与并发一致性
- 通过事务日志支持数据版本、时间旅行与回溯
- 统一批处理与流处理对同一张表的读写
- 以多引擎、多语言 API 对接现有大数据栈
适合
- 在数据湖上需要事务一致性与可靠的并发写入
- 构建湖仓一体架构、统一 BI 与 AI 的数据底座
- 已使用 Spark/Flink/Trino 等计算引擎
- 需要数据版本、审计与可复现的数据处理
不适合
- 数据量小、无并发写入需求时,直接用文件即可
- 需要低延迟点查的在线业务,应选 OLTP 数据库
- 团队无大数据引擎(如 Spark),接入成本较高
- 仅做只读分析,可评估更轻量的表格式方案
如何接入
- 在 S3/GCS/Azure/HDFS/本地等对象存储上创建 Delta 表
- 通过 Spark、Flink、Trino、PrestoDB、Hive 等引擎读写
- 提供 Scala/Java/Python/Rust API 与 Delta Standalone
- 事务日志协议保证原子可见与互斥
已知限制
- 依赖底层存储支持原子可见、互斥与一致列表
- 完整能力多与 Spark 等引擎配套,存在栈依赖
- 面向大数据批流场景,非低延迟点查
- 不同引擎对新特性的支持进度可能不一致
接入与使用事实
- 部署方式
- 自托管
- 实现语言
- Scala、Java、Python、Rust
- 中文界面
- 待确认
- 中文文档
- 待确认
- 定价方式
- 开源
- 许可证
- Apache-2.0
- 国内可达性
- 国内可达
- 可达性观察
- 待补充
权限、依赖与维护信号
这些字段记录公开可见信号,不等同于安全审计结论。
权限信号
暂无公开信号。
依赖信号
暂无公开信号。
维护信号
暂无公开信号。
公开来源与证据
暂无可公开的来源链接。
