파트너

Starburst (Trino)

Trino 기반 엔터프라이즈 레이크하우스 분석 플랫폼 — 데이터를 옮기지 않고, 있는 자리에서 분석합니다. 오픈소스 Trino 엔진에 보안·거버넌스·성능 가속·운영 자동화·24×7 지원을 더한 Starburst Enterprise와 완전 관리형 SaaS인 Galaxy로 엔터프라이즈 분석 환경을 구축합니다.

Starburst와 Trino 개요

Starburst는 Trino(이전 PrestoSQL) 창시자들이 설립한 회사로, 2024년 Trino 코드 커밋의 약 84%를 기여한 최대 Trino 전문가 조직입니다. 오픈소스 Trino에 엔터프라이즈 보안·거버넌스·성능 가속·운영 기능을 더한 상용 배포판을 제공하며, Iceberg·Delta Lake·Hive 등 오픈 테이블 포맷부터 RDBMS·NoSQL·SaaS까지 50개 이상의 커넥터로 데이터 이동 없이 단일 SQL 분석을 실현합니다.

  • Trino 기반 MPP 쿼리 엔진: 상시 코디네이터+워커 구조로 페타바이트급 데이터에 대화형 응답
  • 데이터 페더레이션: Iceberg·Delta Lake·RDBMS·NoSQL·Kafka·SaaS 등 50+ 커넥터를 단일 SQL로
  • Warp Speed 가속: 스마트 인덱싱·캐싱으로 쿼리 최대 5배, CPU 최대 10배 개선
  • 엔터프라이즈 거버넌스: 행/열 단위 RBAC·ABAC, 동적 마스킹, Ranger 연동, 쿼리 감사
최대 22배

TPC-DS 쿼리 성능 (vs Hive)

50+

데이터 소스 커넥터

84%

2024년 Trino 커밋 기여

24×7

지원 · 30분 SLA · 전담 TAM

Trino와 Starburst Enterprise의 관계

SEP는 Trino를 다시 만든 것이 아니라, Trino 위에 엔터프라이즈 레이어를 쌓은 인증 배포판입니다. 엔진은 동일합니다.

Trino

오픈소스 분산 MPP SQL 엔진(이전 PrestoSQL). 상시 코디네이터+워커 구조로 페타바이트급 데이터에 대화형 응답을 제공하며, 약 2주마다 새 버전을 릴리스합니다.

Starburst

Trino 창시자들이 설립한 회사로, 2024년 Trino 코드 커밋의 약 84%를 기여한 최대 Trino 전문가 조직입니다.

동일한 엔진

SEP N-e는 업스트림 Trino N과 동일한 엔진 — SQL 시맨틱, 비용 기반 옵티마이저(CBO), 커넥터 SPI가 모두 같습니다.

확장되는 표면적

그 위에 보안(BIAC·Ranger), 전용 커넥터, Warp Speed 가속, 관리 UI·Insights, 지원되는 배포 경로, 24×7 지원 계약이 얹힙니다.

SEP = Trino 엔진 + 엔터프라이즈 레이어

지원 · 릴리스24×7 지원 · 30분 SLA · 전담 TAM · LTS/STS
운영 · 배포Insights · HA · 오토스케일링 · K8s/OpenShift/Ansible
보안 · 거버넌스BIAC · RBAC/ABAC · 마스킹 · 감사 · Data Products
성능 · 커넥터Warp Speed · 자동 테이블 유지관리 · 전용 커넥터
Trino 엔진 (동일)ANSI SQL · CBO · MPP 코디네이터+워커

멘탈 모델: Trino는 엔진, Starburst는 그 엔진을 둘러싼 플랫폼 — 순수 엔진 성능은 같고, 차이는 엔진을 둘러싼 레이어에서 나옵니다.

단일 쿼리 엔진, 다양한 데이터 소스

데이터를 옮기지 않고 Starburst가 직접 각 소스에 접근하여 분산 쿼리를 수행합니다. 한 번의 SQL로 레이크하우스·데이터베이스·SaaS를 JOIN할 수 있습니다.

데이터 소스
Federated Sources
Iceberg / Delta Lake
오픈 테이블 포맷
Object Storage
S3·ADLS·GCS·MinIO
RDBMS
Oracle·PostgreSQL·MySQL
NoSQL
MongoDB·Cassandra·Elastic
Streaming
Kafka·Pulsar
Cloud DW / SaaS
Snowflake·BigQuery·Salesforce
쿼리 엔진
Starburst (Trino)
Coordinator + Worker MPP
Federated Query
데이터 이동 없이 멀티 소스 JOIN
Fault-Tolerant Execution
장시간 ETL 쿼리 자동 복구
Warp Speed
스마트 인덱싱·캐싱 가속
RBAC + Ranger
행/열 단위 보안 정책·감사
사용 영역
Analytics & AI
BI 도구
Tableau·Power BI·Superset
노트북
Jupyter·Zeppelin
AI / ML
Feature Store·학습 데이터
데이터 앱
사내 분석 애플리케이션
배포 옵션
Starburst Enterprise
On-prem · Private VPC 자가관리
Starburst Galaxy
AWS · Azure · GCP 관리형 SaaS

Why Starburst — 4가지 핵심 가치

데이터 페더레이션

데이터를 이동·복제하지 않고 여러 소스를 단일 SQL로 JOIN합니다. ETL로 미리 옮겨 모으는 구조 자체가 필요 없어집니다.

Iceberg 네이티브

히든 파티셔닝·파티션 진화·타임트래블·ACID를 완전 지원하고, 컴팩션·스냅샷 만료 등 테이블 유지관리를 자동화합니다.

성능 가속·안정성

Warp Speed 스마트 인덱싱·캐싱으로 쿼리 최대 5배·CPU 10배 개선, 내결함 실행(FTE)은 최대 60TB 배치까지 하드닝되어 있습니다.

세밀한 보안 정책

행/열 단위 RBAC·ABAC, 동적 컬럼 마스킹, Apache Ranger 통합, 쿼리 감사까지 — 규제 산업 요건을 플랫폼에서 충족합니다.

커넥터 — 엔터프라이즈 데이터의 긴 꼬리까지

일반적인 엔터프라이즈의 데이터는 Oracle·Teradata·SAP·Salesforce 같은 곳에 살아 있습니다. SEP 전용 커넥터가 라이선스 가치의 상당 부분을 차지하는 이유입니다.

SEP 전용 커넥터 (업스트림 Trino에 없음)

Snowflake · Teradata · IBM Db2 · SAP HANA · Salesforce · Azure Synapse · Greenplum · Netezza · Cosmos DB · DynamoDB · Splunk · Neo4j · Generic JDBC · Stargate(클러스터 간 페더레이션)

업스트림 커넥터의 개선판

푸시다운 강화·Warp Speed 통합·추가 인증 — Hive · Iceberg · Delta Lake · Oracle · BigQuery · SQL Server · PostgreSQL · MySQL · MongoDB · Kafka · Elasticsearch · Redshift · ClickHouse 외

업스트림 Trino와 동일

DuckDB · Druid · Pinot · Prometheus · Redis · OpenSearch · Google Sheets 등 커뮤니티 커넥터 전체

판단 기준: "S3 + PostgreSQL 위의 Trino"만으로 요건이 커버되면 OSS로 충분합니다. 아키텍처에 Snowflake·Oracle·Teradata·SAP·Salesforce가 등장하는 순간 저울은 SEP로 기웁니다.

Apache Iceberg 레이크하우스 — 파티션의 벽을 넘고, 운영까지 자동화

Iceberg는 오브젝트 스토리지 위의 파일 더미를 데이터베이스 테이블처럼 다루게 하는 개방형 테이블 포맷입니다. 히든 파티셔닝·파티션 진화는 Trino + Iceberg의 공통 이점이고, SEP는 그 이후 남는 운영 숙제(스몰파일·스냅샷·통계)를 자동화합니다.

Trino + Iceberg 공통 이점

  • 히든 파티셔닝파티션을 디렉터리가 아닌 컬럼 transform(day·bucket·truncate)으로 정의 — 원본 컬럼 필터만으로 자동 프루닝되어 무심코 풀스캔이 사라집니다.
  • 파티션 진화데이터 재작성 없이 파티션 전략 변경 — 구·신 스펙이 혼재해도 한 쿼리가 투명하게 처리합니다.
  • ACID · 타임트래블스냅샷 기반 트랜잭션, 시점 조회(FOR VERSION/TIMESTAMP AS OF), 스키마 진화, 잘못된 쓰기는 스냅샷 롤백으로 복구합니다.
  • 매니페스트 프루닝파일 단위 min/max 통계로 프루닝 — RDBMS 메타데이터 병목 없이 수백만 파일로 확장합니다.

SEP가 더하는 것 — 자동 테이블 유지관리

  • 자동 컴팩션optimize(스몰파일 병합)를 스케줄 기반으로 자동 실행합니다.
  • 스냅샷 · 오펀 파일 정리expire_snapshots · remove_orphan_files 자동화로 메타데이터 비대화를 방지합니다.
  • 통계 자동 수집CBO가 사용하는 테이블 통계를 최신으로 유지합니다.
  • 스트리밍 인제스트 · 파일 로더Kafka 등에서 Iceberg 테이블로의 연속 적재를 관리형으로 제공 — 별도 Spark/Flink 파이프라인이 필요 없습니다.

OSS Trino에서도 같은 명령을 수동/스케줄로 실행할 수 있지만, 운영 책임은 플랫폼 팀의 몫입니다. SEP는 이를 관리형·자동화로 제공하며, MinIO 등 S3 호환 오브젝트 스토리지와 결합하면 온프레미스 레이크하우스가 완성됩니다.

성능 — Warp Speed와 벤치마크

엔진이 같아서 가속을 끄면 OSS Trino와 숫자가 동일합니다. 의미 있는 성능 차이는 곧 Warp Speed와 아키텍처 전환에서 나옵니다.

5배

쿼리 실행 시간 단축 — Warp Speed (TPC-DS SF1000)

10배

CPU 시간 절감 — Warp Speed

최대 22배

Hive 대비 쿼리 성능 (TPC-DS · Iceberg)

최대 12.7배

클라우드 DW 대비 비용 효율

Warp Speed 효과 — 표준 실행 대비

표준 실행 = 100 기준, 낮을수록 좋음 (TPC-DS SF1000 · Iceberg)

표준 실행 (OSS Trino 엔진)
Warp Speed (SEP)
쿼리 실행 시간5배 단축
100
20
CPU 시간10배 절감
100
10

엔진이 같아 가속을 끄면 OSS Trino와 동일한 수치 — 차이는 곧 Warp Speed의 효과입니다.

Hive 대비 쿼리 실행 시간

초, 낮을수록 좋음 — 1TB 원본(S3·Parquet), Starburst 476-e vs Hive 3.1.3

Hive 3.1.3
Starburst (Trino)
TPC-H · Iceberg약 12배
9,191
742
TPC-H · Hive 테이블약 8배
7,880
1,026
TPC-DS · Iceberg약 22배
37,901
1,737
TPC-DS · Hive 테이블약 6배
15,535
2,493

출처: Concurrency Labs 벤치마크 리포트 (2025-09) · TPC-H 9노드 / TPC-DS 17노드 (각 32 vCPU·128GB)

Warp Speed 스마트 인덱싱·캐싱

블록 단위 최적 인덱스(bitmap·dictionary·tree)를 자동 선택하고 자주 접근하는 데이터를 워커의 NVMe SSD에 캐싱 — 수동 인덱스 설계 없이 반복적·선택적 워크로드를 가속합니다.

Hive 대비 최대 22배

TPC-DS·Iceberg 기준 37,901초 → 1,737초(10.5시간 → 29분). 엔진만 바꿔도 6~8배, Iceberg 이관까지 하면 12~22배 — 빅뱅 없이 단계적으로 이득을 키울 수 있습니다.

클라우드 DW 대비 가격·성능

오픈 테이블 포맷 위 SQL 실행 기준 최대 6.3배 빠른 쿼리와 최대 12.7배 비용 절감 — Runtime과 Cost가 모두 최하위권인 것은 Starburst뿐입니다.

내결함 실행 (FTE)

장시간 배치·ETL 쿼리가 통째로 실패하지 않도록 자동 복구 — 최대 60TB 규모까지 엔터프라이즈급으로 검증되어 있습니다.

성능 수치는 Starburst 공개 벤치마크 기준이며 워크로드에 따라 달라집니다 — 도입 전 PoC 검증을 권장합니다.

보안과 접근 제어 — 규제 산업의 기본기

인증은 OSS Trino도 충분합니다. 갈리는 곳은 세밀한 인가(Authorization)와 감사 — 금융·의료·공공에서 SEP가 결정적인 이유입니다.

Built-in Access Control (BIAC)

SEP 네이티브 인가 모델 — 카탈로그/스키마/테이블/컬럼/로우 단위 역할 기반(RBAC)·속성 기반(ABAC) 권한을 UI로 관리합니다.

컬럼 마스킹 · 로우 필터링

민감 컬럼 동적 마스킹과 행 단위 필터를 기본 제공 — 개인정보·거래정보 보호 요건을 충족합니다.

Apache Ranger 통합

글로벌/카탈로그/컬럼/로우 레벨 — 기존 Hive/HDFS에서 쓰던 Ranger 정책을 그대로 공유합니다.

Credential Passthrough

Kerberos·패스워드 자격 증명 전달(캐싱 포함) — 워커가 장수명 서비스 계정 없이 사용자 신원으로 소스에 접근합니다.

인증 통합

LDAP · OAuth2 · JWT · Kerberos에 더해 Okta 통합, 사용자 임퍼소네이션을 일반화합니다.

Query Audit

누가, 언제, 어떤 카탈로그에, 어떤 쿼리를 실행했는지 영속 기록 — 감사 추적 요건에 즉시 대응합니다.

실무 효과: 정책이 한 곳(BIAC 또는 Ranger)에 모이고, SEP가 노출하는 모든 커넥터에 균일하게 적용됩니다.

거버넌스 · 운영 — 규모 있게 돌려본 뒤에 보이는 가치

순수 쿼리 엔진(Trino)과 데이터 플랫폼(SEP)의 차이가 가장 크게 드러나는 영역 — OSS에서는 전부 별도 도구를 붙여 직접 구축해야 하는 항목입니다.

Data Products

오너·문서·SLO·액세스 정책이 부여된 큐레이션 데이터셋을 게시 — 데이터 메시 아키텍처의 셀프서비스 마켓플레이스입니다.

Starburst Insights

쿼리 패턴·자원 사용량·슬로우 쿼리 분석 대시보드와 데이터 리니지·Apache Atlas 통합 — "클러스터가 어제 새벽 3시에 뭘 했는가"에 답합니다.

HA · 오토스케일링

코디네이터 고가용성, 진행 중인 쿼리를 죽이지 않는 Graceful Scaledown, 자동 일시중지·유휴 종료·클러스터 스케줄링으로 비용을 자동화합니다.

품질 · 자동 분류

데이터 품질 규칙, 스키마 변경 알림, 자동 데이터 분류(민감정보 탐지), 소스 전반 통합 검색을 제공합니다.

Stargate

클러스터 간 페더레이션 — 데이터를 복제하지 않고 리전·테넌트·국경을 넘어 쿼리를 라우팅해 GDPR 등 데이터 주권 요건을 준수합니다.

지원되는 배포 경로

Kubernetes Helm 차트 · Red Hat OpenShift · Starburst Admin(Ansible) · AWS/Azure/GCP Marketplace, CloudWatch·Stackdriver 관측 통합.

OSS는 JMX·로그·기본 UI까지 — 그 위의 쿼리 이력 저장소, 쿼리를 존중하는 오토스케일러, 메트릭 파이프라인은 직접 만들어야 합니다. 엔지니어링 시간을 비용으로 환산하면 "직접 만들기"가 우세한 경우는 드뭅니다.

OSS Trino vs Starburst Enterprise

엔진의 최신성·개방성·비용은 OSS Trino, 보안·거버넌스·성능 가속·운영·지원 SLA는 SEP 우위 — 규제 산업과 엔터프라이즈 규모일수록 SEP가 유리합니다.

카테고리OSS TrinoStarburst Enterprise (SEP)판정
핵심 쿼리 엔진완전한 Trino 엔진 — 최신 기능 최선 반영인증·검증된 동일 엔진 + 선제 패치·백포트공통
보안 · 인가파일/OPA 수동 구성, RBAC UI 없음BIAC(행/열 RBAC·ABAC) · 마스킹 · Ranger · 감사 UISEP 우위
거버넌스 · 카탈로그외부 도구 의존(OpenMetadata 등)Data Products · 리니지 · 품질 규칙 · 탐색 포털SEP 우위
성능 가속CBO · dynamic filtering+ Warp Speed(자동 인덱싱·캐싱) · 워크로드 관리SEP 우위
테이블 유지관리optimize 등 직접 스케줄링컴팩션 · 스냅샷 만료 · 통계 수집 자동화SEP 우위
커넥터50+ 커뮤니티 커넥터(품질 편차)인증 커넥터 + 전용(Snowflake·SAP·Salesforce 등)SEP 우위
배포 · 운영Helm 자체 관리HA/DR · 오토스케일 · OpenShift · MarketplaceSEP 우위
지원커뮤니티 Slack · GitHub24×7 · 30분 SLA · 전담 TAM · LTS 12개월 패치SEP 우위
비용 · 라이선스Apache 2.0 무료 — 벤더 종속 없음상용 구독(노드/컴퓨트 기반)OSS 우위

"S3 + PostgreSQL 위의 Trino"만으로 요건이 커버되면 OSS로 충분합니다 — 보안·거버넌스·지원 SLA 요건이 등장하는 순간 SEP를 검토하십시오.

버전 정책 — LTS / STS

Trino는 약 2주마다 릴리스됩니다. SEP는 그 위에 예측 가능한 릴리스 주기와 LTS 패치 라이프사이클을 얹어, 엔터프라이즈가 따라갈 수 있는 속도로 바꿉니다. 버전 앞의 정수는 언제나 상위 Trino 버전 — 패치 접미사(-e.x)가 있으면 LTS, 없으면 STS입니다.

항목LTSSTS
지원 기간릴리스로부터 12개월다음 STS까지
패치 릴리스제공 (-e.0 → -e.1 → …)없음 (다음 릴리스에 반영)
릴리스 주기분기당 최대 1개 (2·5·8·11월)Trino를 따라감 (빈번)
보안(CVE) 수정패치로 백포트다음 STS에서만
운영 적합도운영 환경의 기본값기능 주도 · 업스트림 근접

권장 플레이북

1년에 한 번 LTS → 다음 LTS로 통제된 업그레이드 — 남은 지원 기간 9~12개월인 라인을 타깃으로, breaking changes를 라인 단위로 처리합니다.

EOL은 하드 데드라인

지원 종료 후에는 CVE 패치가 제공되지 않습니다 — 어느 시점이든 약 4개의 LTS 라인이 겹쳐 지원되어 업그레이드 활주로가 확보됩니다.

Starburst 제품군

Starburst Enterprise

고객 인프라(On-prem·Private VPC)에 직접 배포하는 자가관리형 상용 Trino 배포판. 데이터 통제권을 유지하면서 엔터프라이즈 보안·운영 기능을 활용할 수 있어, 데이터 중력·망분리·규제 거주 요건에 적합합니다.

Self-managedK8s · OpenShift · AnsibleLTS / STS데이터 주권 · 망분리

Starburst Galaxy

AWS·Azure·GCP에서 동작하는 완전 관리형 SaaS. 클러스터 자동 스케일링과 페이-퍼-쿼리, 크로스클라우드 페더레이션을 제공하여 운영 부담 없이 즉시 분석을 시작할 수 있습니다.

Fully ManagedAuto-scalingMulti-cloudPay-per-query

온프레미스·프라이빗 환경 중심의 국내 엔터프라이즈(특히 규제 산업)에는 SEP가, 클라우드 퍼스트 조직에는 Galaxy가 일반적인 출발점입니다.

대표 시나리오 — 레거시 Hadoop / Hive 플랫폼 현대화

Hive의 느린 adhoc 쿼리는 튜닝 부족이 아니라, 배치 엔진을 인터랙티브 용도로 쓰는 구조적 미스매치가 원인입니다. Starburst + Iceberg + 오브젝트 스토리지는 이를 아키텍처 차원에서 제거합니다.

1

병행 (Coexist)

기존 Hive 메타스토어에 연결해 읽기부터 시작 — 데이터 이동 0

2

오프로드 (Offload)

무거운 adhoc/BI 쿼리를 이관 — 즉시 성능 체감

3

현대화 (Modernize)

핵심 테이블을 Iceberg로 전환 — 이득 극대화

4

정착 (Consolidate)

레거시 축소, 보안·거버넌스·오토스케일 정착

기존 Hive 데이터를 그대로 질의할 수 있어 빅뱅 없이 단계마다 KPI·롤백 포인트를 두고 전환합니다.

글로벌 도입 사례 — 금융권을 중심으로

Hive/Hadoop·Teradata·DB2 등 레거시에서 Trino 기반 Starburst로 전환·페더레이션한 실제 사례입니다.

HDFC Bank

인도 최대 민간은행 — 레거시 DB2에서 개방형 아키텍처로 전환, Azure AKS·온프레미스 OpenShift 병행 운영.

클라우드·온프레 통합 거버넌스 · DB2 비용 절감

Crédit Mutuel Arkéa

프랑스 — 온프레미스를 유지한 채 Hadoop 위에 페더레이션 쿼리 엔진 구축.

Hadoop 쿼리 10~20배 향상 · 1년 내 550+ 사용자

Bank Hapoalim

이스라엘 — 20년 운영한 Teradata를 데이터레이크로 전환, Hive·Spark 벤치마크 후 Starburst 채택.

고동시성 ad-hoc + BI 쿼리 성능 최우수

Banco Inter

브라질 — Amazon Athena에서 Starburst로 전환, 탐색·거버넌스·셀프서비스 분석을 단일 플랫폼화.

인사이트 도출 days → seconds · 월 $100K 절감

글로벌 투자은행

Hive를 Starburst로 대체 — 데이터 이동 없이 100+개국 원위치(in-place) 쿼리로 AML 분석 수행.

데이터 주권 준수 · 규제 과징금 리스크 감소

글로벌 은행그룹 (62개국)

Stargate 기반 국경 간 분석 — 데이터 이동 없이 GDPR·CCPA를 준수하는 통합 분석 체계 구현.

쿼리 성능 20배 향상 · 데이터 주권 준수

Starburst AI — AI-Ready 데이터 플랫폼으로의 확장

거버넌스가 적용된 단일 액세스 포인트 위에서, 정형·비정형 데이터를 AI 워크로드에 바로 연결하는 방향의 로드맵입니다.

AI Search

정형·비정형 데이터를 벡터 임베딩으로 Iceberg에 저장·검색 — 별도 Vector DB 없이 레이크하우스에서 시맨틱 검색을 수행합니다.

AI SQL Functions

prompt() · classify() · mask() 등 LLM 함수를 SQL 안에서 직접 호출 — 분석가가 쓰던 언어 그대로 AI를 활용합니다.

AI Model Access Management

모델 접근 제어 · 사용량 모니터링 · 감사 로그 — 데이터와 같은 거버넌스 체계로 AI 모델을 관리합니다.

성숙도 주의: Starburst AI 기능군은 상당수가 프리뷰 단계이며 SEP 버전·시점에 따라 가용성이 다릅니다 — 즉시 프로덕션 기능이라기보다 "AI-Ready 기반 확보 + 로드맵" 관점으로 접근하고, PoC 시점에 GA 상태를 확인하는 것을 권장합니다.

Data Dynamics가 제공하는 서비스

Starburst 파트너로서 라이선스부터 구축·운영·교육까지, 도입 전 주기를 지원합니다.

라이선스 판매

Starburst Enterprise·Galaxy 라이선스 견적 및 발주를 지원합니다.

  • 용량·노드 기반 산정
  • PoC 라이선스 지원
  • 갱신·확장 컨설팅

기술지원

구축부터 운영까지 Starburst 전반에 대한 기술지원을 제공합니다.

  • 설치·업그레이드 지원
  • 쿼리 성능 튜닝
  • 장애 대응·에스컬레이션

교육·PoC

Trino·Starburst 기술 교육 및 맞춤 PoC를 수행합니다.

  • 관리자 과정
  • 데이터 분석가 교육
  • 맞춤 PoC 설계·수행

Trino·Iceberg·오브젝트 스토리지 기반 레이크하우스 구축과 Hive/Impala 마이그레이션 실무 경험을 보유하고 있으며, 관련 기술 자료를 블로그에 지속 공개하고 있습니다.