合作伙伴

Starburst (Trino)

基于 Trino 的企业级湖仓分析平台 — 无需移动数据,就地分析。以在开源 Trino 引擎之上叠加安全、治理、性能加速、运维自动化与 24×7 支持的 Starburst Enterprise,以及全托管 SaaS Galaxy,构建企业级分析环境。

Starburst 与 Trino 概览

Starburst 由 Trino(前 PrestoSQL)的创始人创立,是最大的 Trino 专家组织,2024 年贡献了约 84% 的 Trino 代码提交。它在开源 Trino 之上提供叠加企业级安全、治理、性能加速与运维能力的商业发行版,通过覆盖 Iceberg、Delta Lake、Hive 等开放表格式以及 RDBMS、NoSQL、SaaS 的 50 多个连接器,实现无需移动数据的单一 SQL 分析。

  • 基于 Trino 的 MPP 查询引擎:常驻协调器+工作节点架构,对 PB 级数据提供交互式响应
  • 数据联邦:Iceberg、Delta Lake、RDBMS、NoSQL、Kafka、SaaS 等 50+ 连接器,单一 SQL 打通
  • Warp Speed 加速:智能索引与缓存,查询最高提速 5 倍,CPU 最高节省 10 倍
  • 企业级治理:行/列级 RBAC·ABAC、动态脱敏、Ranger 集成、查询审计
最高 22 倍

TPC-DS 查询性能 (vs Hive)

50+

数据源连接器

84%

2024 年 Trino 提交贡献

24×7

支持 · 30 分钟 SLA · 专属 TAM

Trino 与 Starburst Enterprise 的关系

SEP 不是重写的 Trino,而是在 Trino 之上叠加企业级层的认证发行版。引擎完全相同。

Trino

开源分布式 MPP SQL 引擎(前 PrestoSQL)。常驻协调器+工作节点架构对 PB 级数据提供交互式响应,约每两周发布一个新版本。

Starburst

由 Trino 创始人创立的公司,2024 年贡献了约 84% 的 Trino 代码提交,是最大的 Trino 专家组织。

同一引擎

SEP N-e 与上游 Trino N 是同一引擎 — SQL 语义、基于成本的优化器(CBO)、连接器 SPI 完全一致。

扩展的能力面

在其之上叠加安全(BIAC·Ranger)、专属连接器、Warp Speed 加速、管理 UI·Insights、受支持的部署路径以及 24×7 支持合同。

SEP = Trino 引擎 + 企业级层

支持 · 发布24×7 支持 · 30 分钟 SLA · 专属 TAM · LTS/STS
运维 · 部署Insights · HA · 自动扩缩容 · K8s/OpenShift/Ansible
安全 · 治理BIAC · RBAC/ABAC · 脱敏 · 审计 · Data Products
性能 · 连接器Warp Speed · 表自动维护 · 专属连接器
Trino 引擎 (相同)ANSI SQL · CBO · MPP 协调器+工作节点

心智模型:Trino 是引擎,Starburst 是围绕引擎的平台 — 纯引擎性能相同,差异来自围绕引擎的各层。

单一查询引擎,多样数据源

无需移动数据,Starburst 直接访问各数据源执行分布式查询。一条 SQL 即可 JOIN 湖仓、数据库与 SaaS。

数据源
Federated Sources
Iceberg / Delta Lake
开放表格式
Object Storage
S3·ADLS·GCS·MinIO
RDBMS
Oracle·PostgreSQL·MySQL
NoSQL
MongoDB·Cassandra·Elastic
Streaming
Kafka·Pulsar
Cloud DW / SaaS
Snowflake·BigQuery·Salesforce
查询引擎
Starburst (Trino)
Coordinator + Worker MPP
Federated Query
无数据移动的多源 JOIN
Fault-Tolerant Execution
长时 ETL 查询自动恢复
Warp Speed
智能索引·缓存加速
RBAC + Ranger
行/列级安全策略·审计
使用场景
Analytics & AI
BI 工具
Tableau·Power BI·Superset
笔记本
Jupyter·Zeppelin
AI / ML
特征库·训练数据
数据应用
企业内部分析应用
部署选项
Starburst Enterprise
On-prem · Private VPC 自管理
Starburst Galaxy
AWS · Azure · GCP 托管 SaaS

Why Starburst — 四大核心价值

数据联邦

无需移动或复制数据,用单一 SQL JOIN 多个数据源 — 通过 ETL 预先集中数据的架构本身不再必要。

Iceberg 原生

完整支持隐藏分区、分区演进、时间旅行与 ACID,并自动化压缩、快照过期等表维护工作。

性能加速·稳定性

Warp Speed 智能索引与缓存带来查询最高 5 倍、CPU 10 倍的改善;容错执行(FTE)已针对最高 60TB 的批处理完成加固。

精细安全策略

行/列级 RBAC·ABAC、动态列脱敏、Apache Ranger 集成、查询审计 — 在平台层面满足受监管行业的要求。

连接器 — 覆盖企业数据的长尾

典型企业的数据往往存放在 Oracle、Teradata、SAP、Salesforce 等系统中。这正是 SEP 专属连接器占据许可价值相当大部分的原因。

SEP 专属连接器 (上游 Trino 没有)

Snowflake · Teradata · IBM Db2 · SAP HANA · Salesforce · Azure Synapse · Greenplum · Netezza · Cosmos DB · DynamoDB · Splunk · Neo4j · Generic JDBC · Stargate(跨集群联邦)

上游连接器的增强版

更强的下推、Warp Speed 集成、额外认证 — Hive · Iceberg · Delta Lake · Oracle · BigQuery · SQL Server · PostgreSQL · MySQL · MongoDB · Kafka · Elasticsearch · Redshift · ClickHouse 等

与上游 Trino 相同

DuckDB · Druid · Pinot · Prometheus · Redis · OpenSearch · Google Sheets 等全部社区连接器

判断标准:如果 "S3 + PostgreSQL 之上的 Trino" 就能覆盖需求,OSS 就足够了。当架构中出现 Snowflake、Oracle、Teradata、SAP、Salesforce 的那一刻,天平就倒向 SEP。

Apache Iceberg 湖仓 — 跨越分区之墙,运维亦自动化

Iceberg 是让对象存储上的文件堆像数据库表一样被使用的开放表格式。隐藏分区与分区演进是 Trino + Iceberg 的共同优势,SEP 则将其后剩余的运维课题(小文件、快照、统计信息)自动化。

Trino + Iceberg 的共同优势

  • 隐藏分区分区以列 transform(day·bucket·truncate)而非物理目录定义 — 仅凭原始列过滤即可自动裁剪,杜绝无意的全表扫描。
  • 分区演进无需重写数据即可变更分区策略 — 新旧规格并存时一条查询也能透明处理。
  • ACID · 时间旅行基于快照的事务、时点查询(FOR VERSION/TIMESTAMP AS OF)、模式演进,错误写入可通过快照回滚恢复。
  • 清单裁剪利用文件级 min/max 统计进行裁剪 — 无 RDBMS 元数据瓶颈,可扩展到数百万文件。

SEP 的增值 — 表自动维护

  • 自动压缩按计划自动执行 optimize(小文件合并)。
  • 快照 · 孤儿文件清理自动化 expire_snapshots · remove_orphan_files,防止元数据膨胀。
  • 统计信息自动收集保持 CBO 使用的表统计信息始终最新。
  • 流式摄取 · 文件加载器以托管方式提供从 Kafka 等到 Iceberg 表的持续加载 — 无需单独的 Spark/Flink 管道。

OSS Trino 也能手动或按计划执行相同命令,但运维责任落在平台团队身上。SEP 以托管·自动化方式提供这些能力,与 MinIO 等 S3 兼容对象存储结合即可构成完整的本地湖仓。

性能 — Warp Speed 与基准测试

由于引擎相同,关闭加速后数字与 OSS Trino 一致。有意义的性能差异正来自 Warp Speed 与架构转换。

5 倍

查询执行时间缩短 — Warp Speed (TPC-DS SF1000)

10 倍

CPU 时间节省 — Warp Speed

最高 22 倍

对比 Hive 的查询性能 (TPC-DS · Iceberg)

最高 12.7 倍

对比云数仓的成本效率

Warp Speed 效果 — 对比标准执行

标准执行 = 100 基准,越低越好 (TPC-DS SF1000 · Iceberg)

标准执行 (OSS Trino 引擎)
Warp Speed (SEP)
查询执行时间缩短 5 倍
100
20
CPU 时间节省 10 倍
100
10

引擎相同,关闭加速后数字与 OSS Trino 一致 — 差异正是 Warp Speed 的效果。

对比 Hive 的查询执行时间

秒,越低越好 — 1TB 源数据(S3·Parquet),Starburst 476-e vs Hive 3.1.3

Hive 3.1.3
Starburst (Trino)
TPC-H · Iceberg约 12 倍
9,191
742
TPC-H · Hive 表约 8 倍
7,880
1,026
TPC-DS · Iceberg约 22 倍
37,901
1,737
TPC-DS · Hive 表约 6 倍
15,535
2,493

来源:Concurrency Labs 基准测试报告 (2025-09) · TPC-H 9 节点 / TPC-DS 17 节点 (各 32 vCPU·128GB)

Warp Speed 智能索引·缓存

按块自动选择最优索引类型(bitmap·dictionary·tree),并将高频数据缓存到工作节点的 NVMe SSD — 无需人工索引设计即可加速重复性、选择性工作负载。

对比 Hive 最高 22 倍

TPC-DS·Iceberg 基准下 37,901 秒 → 1,737 秒(10.5 小时 → 29 分钟)。仅更换引擎即可获得 6~8 倍,迁移到 Iceberg 后可达 12~22 倍 — 无需大爆炸式切换即可逐步放大收益。

对比云数仓的价格性能

在开放表格式上执行 SQL 的基准下,查询最快提升 6.3 倍、成本最多降低 12.7 倍 — Runtime 与 Cost 同时处于最低区间的只有 Starburst。

容错执行 (FTE)

自动恢复长时批处理·ETL 查询,避免整体失败 — 已在最高 60TB 规模完成企业级验证。

性能数字基于 Starburst 公开基准测试,因工作负载而异 — 建议在采购前进行 PoC 验证。

安全与访问控制 — 受监管行业的基本功

认证方面 OSS Trino 已经足够。分水岭在于精细授权(Authorization)与审计 — 这正是金融、医疗、公共部门选择 SEP 的决定性原因。

Built-in Access Control (BIAC)

SEP 原生授权模型 — 以 UI 管理目录/模式/表/列/行级的基于角色(RBAC)与基于属性(ABAC)的权限。

列脱敏 · 行过滤

开箱即用的敏感列动态脱敏与行级过滤 — 满足个人信息、交易信息的保护要求。

Apache Ranger 集成

全局/目录/列/行级别 — 直接复用既有 Hive/HDFS 上的 Ranger 策略。

Credential Passthrough

Kerberos·密码凭证透传(含缓存) — 工作节点无需长期服务账号,以用户身份访问数据源。

认证集成

LDAP · OAuth2 · JWT · Kerberos 之外还包括 Okta 集成,并将用户模拟(Impersonation)普遍化。

Query Audit

持久记录谁在何时对哪个目录执行了什么查询 — 即时满足审计追踪要求。

实务效果:策略集中于一处(BIAC 或 Ranger),并统一应用到 SEP 暴露的所有连接器。

治理 · 运维 — 规模化运行后才显现的价值

这是纯查询引擎(Trino)与数据平台(SEP)差异最大的领域 — 在 OSS 中,以下每一项都需要拼接外部工具自行构建。

Data Products

在目录之上发布带有负责人、文档、SLO 与访问策略的精选数据集 — 数据网格架构的自助服务市场。

Starburst Insights

查询模式、资源使用量、慢查询分析仪表盘,以及数据血缘与 Apache Atlas 集成 — 回答"集群昨天凌晨 3 点在做什么"。

HA · 自动扩缩容

协调器高可用、不中断运行中查询的 Graceful Scaledown,以及自动暂停、闲置关停、集群调度带来的成本自动化。

质量 · 自动分类

提供数据质量规则、模式变更告警、自动数据分类(敏感信息检测)与跨源统一搜索。

Stargate

跨集群联邦 — 不复制数据即可跨区域、租户、国境路由查询,满足 GDPR 等数据主权要求。

受支持的部署路径

Kubernetes Helm Chart · Red Hat OpenShift · Starburst Admin(Ansible) · AWS/Azure/GCP Marketplace,并集成 CloudWatch·Stackdriver 可观测性。

OSS 能提供的止步于 JMX、日志与基础 UI — 其上的查询历史存储、尊重查询的自动扩缩器、指标管道都要自建。把工程时间折算成本后,"自建"占优的情况非常罕见。

OSS Trino vs Starburst Enterprise

引擎的新鲜度、开放性与成本上 OSS Trino 占优;安全、治理、性能加速、运维与支持 SLA 上 SEP 占优 — 越是受监管行业与企业级规模,SEP 越有利。

类别OSS TrinoStarburst Enterprise (SEP)判定
核心查询引擎完整的 Trino 引擎 — 最快获得最新特性经认证验证的同一引擎 + 前瞻补丁·向后移植相同
安全 · 授权文件/OPA 手动配置,无 RBAC UIBIAC(行/列 RBAC·ABAC) · 脱敏 · Ranger · 审计 UISEP 占优
治理 · 目录依赖外部工具(OpenMetadata 等)Data Products · 血缘 · 质量规则 · 探索门户SEP 占优
性能加速CBO · dynamic filtering+ Warp Speed(自动索引·缓存) · 工作负载管理SEP 占优
表维护optimize 等需自行调度压缩 · 快照过期 · 统计收集自动化SEP 占优
连接器50+ 社区连接器(质量参差)认证连接器 + 专属(Snowflake·SAP·Salesforce 等)SEP 占优
部署 · 运维Helm 自行管理HA/DR · 自动扩缩 · OpenShift · MarketplaceSEP 占优
支持社区 Slack · GitHub24×7 · 30 分钟 SLA · 专属 TAM · LTS 12 个月补丁SEP 占优
成本 · 许可Apache 2.0 免费 — 无厂商锁定商业订阅(按节点/算力)OSS 占优

如果 "S3 + PostgreSQL 之上的 Trino" 就能覆盖需求,OSS 就足够了 — 一旦出现安全、治理、支持 SLA 要求,请评估 SEP。

版本策略 — LTS / STS

Trino 约每两周发布一次。SEP 在其之上叠加可预测的发布节奏与 LTS 补丁生命周期,把节奏变成企业能够跟上的速度。版本号开头的整数始终对应上游 Trino 版本 — 有补丁后缀(-e.x)即 LTS,没有则为 STS。

项目LTSSTS
支持期限自发布起 12 个月至下一个 STS
补丁发布提供 (-e.0 → -e.1 → …)无 (并入下一版本)
发布节奏每季度最多 1 个 (2·5·8·11 月)跟随 Trino (频繁)
安全 (CVE) 修复以补丁向后移植仅在下一个 STS
生产适配度生产环境的默认选择特性驱动 · 贴近上游

推荐操作手册

每年一次从 LTS 到下一个 LTS 的受控升级 — 以剩余支持期 9~12 个月的版本线为目标,按版本线处理 breaking changes。

EOL 是硬性截止线

支持结束后不再提供 CVE 补丁 — 任何时点都有约 4 条 LTS 版本线重叠支持,保证升级跑道充足。

Starburst 产品家族

Starburst Enterprise

直接部署在客户基础设施(On-prem·Private VPC)上的自管理商业 Trino 发行版。在保有数据控制权的同时使用企业级安全与运维能力,适合数据引力、网络隔离与合规驻留要求。

Self-managedK8s · OpenShift · AnsibleLTS / STS数据主权 · 隔离网络

Starburst Galaxy

运行于 AWS、Azure、GCP 的全托管 SaaS。集群自动扩缩容、按查询付费与跨云联邦,让您在几乎零运维负担下立即开始分析。

Fully ManagedAuto-scalingMulti-cloudPay-per-query

以本地部署、私有环境为主的企业(尤其受监管行业)通常从 SEP 起步;云优先的组织则通常从 Galaxy 起步。

典型场景 — 传统 Hadoop / Hive 平台现代化

Hive 即席查询慢并非调优不足,而是把批处理引擎用于交互式场景的结构性错配。Starburst + Iceberg + 对象存储从架构层面消除了这一错配。

1

并行 (Coexist)

连接现有 Hive Metastore,从读取开始 — 数据移动为零

2

卸载 (Offload)

迁移繁重的即席/BI 查询 — 立刻感受性能提升

3

现代化 (Modernize)

将核心表转换为 Iceberg — 收益最大化

4

固化 (Consolidate)

收缩遗留系统,落地安全·治理·自动扩缩容

现有 Hive 数据可原样查询,因此无需大爆炸式切换,每个阶段都设置 KPI 与回滚点逐步迁移。

全球落地案例 — 以金融业为中心

从 Hive/Hadoop、Teradata、DB2 等遗留平台迁移或联邦到基于 Trino 的 Starburst 的真实案例。

HDFC Bank

印度最大民营银行 — 从遗留 DB2 转向开放架构,Azure AKS 与本地 OpenShift 并行运营。

云与本地统一治理 · 降低 DB2 成本

Crédit Mutuel Arkéa

法国 — 在保持本地部署的前提下,于 Hadoop 之上构建联邦查询引擎。

Hadoop 查询提速 10~20 倍 · 一年内 550+ 用户

Bank Hapoalim

以色列 — 将运行 20 年的 Teradata 迁往数据湖,在基准测试 Hive·Spark 后选择 Starburst。

高并发即席 + BI 查询性能最优

Banco Inter

巴西 — 从 Amazon Athena 迁移到 Starburst,将探索、治理、自助分析统一到单一平台。

洞察产出 days → seconds · 每月节省 $100K

全球投资银行

以 Starburst 替代 Hive — 无数据移动即可就地查询 100+ 个国家/地区,支撑 AML 分析。

遵守数据主权 · 降低监管罚款风险

全球银行集团 (62 国)

基于 Stargate 的跨境分析 — 不移动数据即可满足 GDPR·CCPA 的统一分析体系。

查询性能提升 20 倍 · 遵守数据主权

Starburst AI — 迈向 AI-Ready 数据平台的扩展

在应用了治理的单一访问点之上,将结构化与非结构化数据直接连接到 AI 工作负载的路线图。

AI Search

将结构化、非结构化数据以向量嵌入的形式存入 Iceberg 并检索 — 无需独立向量数据库即可在湖仓中实现语义搜索。

AI SQL Functions

在 SQL 中直接调用 prompt()、classify()、mask() 等 LLM 函数 — 分析师用熟悉的语言即可使用 AI。

AI Model Access Management

模型访问控制、用量监控、审计日志 — 用与数据相同的治理体系管理 AI 模型。

成熟度提示:Starburst AI 功能族中相当一部分仍处于预览阶段,可用性因 SEP 版本与时点而异 — 建议以"AI-Ready 基础 + 路线图"的视角看待,并在 PoC 时确认 GA 状态。

Data Dynamics 提供的服务

作为 Starburst 合作伙伴,我们支持从许可、实施、运维到培训的完整采用周期。

许可销售

支持 Starburst Enterprise·Galaxy 许可的报价与订购。

  • 按容量·节点测算
  • PoC 许可支持
  • 续订·扩容咨询

技术支持

提供覆盖实施到运维的 Starburst 全方位技术支持。

  • 安装·升级支持
  • 查询性能调优
  • 故障响应·升级处理

培训 · PoC

提供 Trino·Starburst 技术培训及定制化 PoC。

  • 管理员课程
  • 数据分析师培训
  • 定制 PoC 设计·执行

我们拥有基于 Trino·Iceberg·对象存储的湖仓建设与 Hive/Impala 迁移的实战经验,并在博客上持续公开相关技术资料。