Solutions · Open Source

Argus Catalog

在单一目录中对数据、模型、API 与 AI 智能体进行治理的 AI·Data·API 一体化元数据平台。积极支持气隙(隔离网络)与本地部署,让企业无需将数据外发即可掌握全公司的数据主权。

Apache License 2.0 · 开源GitHub 仓库产品介绍手册

概念图

Argus Catalog Platform Architecture

特点与优势

01

数据·模型·API·AI 统一治理

将数据目录、ML 模型注册表、API 目录与 AI Agent 目录融为一体,实现全公司的单一可信数据源(SSOT)。

02

11 种数据源自动同步

自动采集 Hive、Impala、Kudu、Trino、StarRocks、Greenplum、Iceberg REST、PostgreSQL、MySQL、Oracle、MSSQL 的元数据,使模式、统计与血缘保持最新。

Enterprise
03

列级跨平台血缘

基于 SQL 解析自动追踪数据集与列级的端到端血缘,并通过 DDL 解析生成 ER 图。

Enterprise
04

气隙原生 + 本地 LLM

本地嵌入(sentence-transformers)、本地 LLM(Ollama)、OCI 模型引入与 HARVEST 联邦——以"无互联网也能全部运行"为设计前提,在数据不外流的隔离网络中同样实现完整的 AI 治理。

平台架构

Catalog UI、Server、Extensions、SDK 有机协同的端到端元数据平台。

Catalog UI
Next.js · React
统一搜索·语义搜索
数据集·血缘·ERD
数据标准·术语表·分类法
模型·OCI Hub·MLflow 文件
AI Agent·API 目录
联邦·变更管理·通知·权限
Catalog Server
FastAPI · PostgreSQL
REST API (v1)
pgvector 混合检索
数据质量引擎·画像分析
MLflow·OCI 模型注册表(S3/MinIO)
变更管理(Temporal)·通知·RBAC
AI 元数据生成·助手
Extensions
Enterprise
Sync · Plugins · Analyzer
元数据同步(11 种)
查询采集——Hive·Impala·Trino·StarRocks
SQL 解析(sqlglot·Impala 方言)
关系分析器——ERD 补强
源代码分析(Java/Python)
LDAP 用户同步·查询服务
SDK & CLI
Python SDK
argus-model CLI
基于 OCI 的模型 Push/Pull
HuggingFace 导入
气隙传输工作流
Presigned URL 上传
Manifest 管理
支持的数据源(11 种)
HiveImpalaKuduTrinoStarRocksGreenplumIceberg RESTPostgreSQLMySQLOracleMSSQL

核心功能

从数据目录与搜索到质量与治理、ML 模型注册表、AI,再到目录联邦——在单一平台提供企业元数据管理的七大支柱。

数据目录

发现、信任并治理数据集的目录核心。

基于 URN 的注册·标签·分类法·三类负责人角色
列级血缘与基于 DDL 的 ERD(可导出 Mermaid)
数据标准词典·术语表(形态素分析)·合规率度量
模式变更检测·提供 PySpark 访问代码片段

搜索与发现

以融合关键词与语义的混合搜索快速发现数据。

pgvector 关键词+语义混合检索
数据集·模型·API·AI 代理统一搜索
按标签·负责人·数据源·质量等级分面过滤
嵌入提供方——本地(离线)·OpenAI·Ollama

数据质量

直接剖析源数据库并以规则校验。

直连数据源画像分析(众数·列统计历史)
10 种规则校验——含 CUSTOM_SQL/CUSTOM_PYTHON
质量评分(GOOD/WARN/BAD)·趋势·沿血缘传播的告警
外部质量批处理(pandas/PySpark)·失败通知·Webhook

元数据治理

不止于数据,连 API 与 AI 智能体一并编目。

API 目录——OpenAPI 注册·版本 diff·规范检查
AI Agent 目录——工具/MCP·护栏(DLP·HITL·预算)·计量
变更管理(Temporal)——提交→审批→应用工作流
模式变更影响分析·通知·Webhook

ML 模型注册表

兼容 MLflow/OCI 的模型治理与气隙导入。

MLflow 集成与版本/阶段管理(STAGING/PRODUCTION)
指标对比与模型卡
OCI 模型中心(HuggingFace 风格浏览器)
argus-model CLI 与气隙导入

AI

用 LLM 自动生成元数据并查询目录。

AI 元数据生成(描述、标签、PII 检测,审批式)
tool-use AI 助手(调用目录/模式/质量/血缘工具)
基于真实数据的回答
集成 OpenAI、Anthropic 与 Ollama(本地 LLM)

目录联邦

将多个 Argus 实例联合为一体,实现统一检索与浏览;支持适合气隙环境的 HARVEST 镜像与本地提升。

LIVE / HARVEST / HYBRID 联邦模式
统一检索 · 浏览 · 跨实例血缘
HARVEST 镜像 · 中枢模型重嵌入 · 样本镜像
将镜像数据集提升(import)到本地
Enterprise

基于查询的血缘与关系采集

从运营 SQL 引擎的真实查询中自动采集血缘与关系。

采集 Hive、Impala、Trino、StarRocks 查询事件
自动提取列级运行时血缘
基于使用的列 JOIN 关系分析
多方言 SQL 解析器(含 Impala)
Enterprise

源代码静态分析

从应用源代码中提取数据库表映射以丰富血缘。

Java —— JPA、Hibernate、MyBatis、Spring JDBC
Python —— SQLAlchemy、Django ORM、DB-API
自动提取 ORM/SQL → 表映射
自动丰富目录血缘
Enterprise

企业连接器同步

自动批量同步各类数据源的元数据。

采集 11 种数据源元数据
支持 Greenplum、Iceberg REST、Kudu 等
同步模式、统计与 DDL
CLI/cron 批处理运营
Enterprise

LDAP/AD 用户同步

以企业目录为信息源自动管理目录用户。

集成 OpenLDAP 与 Active Directory
用户新增、停用、重新启用与部门更新
dry-run 预览与 cron 批处理
防止误停用本地账户

版本

用 Community 自由使用开源核心,需要扩展模块与专属技术支持时升级到 Enterprise——提供两种版本。

Community

Apache License 2.0 · 免费

不受限制地使用整个开源核心并自行运营。

推荐

Enterprise

企业客户支持

在 Community 全部功能之上,增加扩展模块与基于 SLA 的专属技术支持。

功能对比
Community
Enterprise
核心功能
数据目录 · 搜索与发现 · 数据质量
元数据治理(API · AI Agent)
ML 模型注册表 · AI 元数据/助手
11 种数据源元数据同步
目录联邦(实例联合 · 镜像 · 本地提升)
扩展模块(Enterprise)
基于查询的血缘与关系采集
Hive 查询采集器Impala 查询采集器Trino 查询采集器StarRocks 查询采集器查询采集与处理服务列关系分析器SQL 解析器Impala SQL 解析器
源代码静态分析
Java 源代码分析器Python 源代码分析器
企业连接器同步
元数据同步服务
LDAP/AD 用户同步
LDAP/AD 用户同步
支持与服务(Enterprise)
基于 SLA 的专属技术支持
热修复与安全补丁优先提供
安装、部署与迁移支持
培训、上手与架构咨询
气隙部署支持 · 路线图优先采纳
支持渠道
支持渠道
GitHub Issues
专属支持
Apache License 2.0 · 开源

已开源的元数据平台

Argus Catalog 已在 GitHub 上以 Apache License 2.0 全面开源。除元数据采集连接器外,后端、前端、SDK、AI 智能体、质量批处理等整个核心引擎均已公开,企业可直接验证代码、按自身环境扩展,并在不外泄数据的情况下运行。

  • 对商业使用无限制的 Apache 2.0
  • 可自行验证与扩展代码
  • 气隙·本地部署自主运行