Argus RAG Studio
一个开源自托管平台,在一处覆盖 RAG 全生命周期——构建(Build)、检索/生成(Retrieve & Generate)、评估(Evaluate)与运维/部署(Operate & Deploy)。它不是"跑通一次的 RAG 演示":内置以数字度量质量的评估工具链、自动探索最优设置的配置扫描、反馈闭环,以及基于代理的远程部署,可在本地化与气隙(隔离网)环境中运行。
什么是 RAG
LLM 独自作答时既没有最新信息,也没有依据。RAG 会先检索企业自有文档,仅在检索到的依据之上生成回答。

放入文档,得到有据可查的答案
直接导入内部规章、手册与合同,系统检索与问题匹配的依据,并生成带 [n] 引用的答案——每句话都可回溯到原文位置,业务人员可先核对依据再使用。

概念图
构建、检索/生成、评估/运维三个平面运行在同一数据平面上,推理服务器与部署通过标准接口分离连接。

特点与优势
测量 → 优化 → 改进闭环
用黄金集、Hit Rate/MRR 与三轴 LLM-as-Judge 以数字度量质量;配置扫描自动探索分块、检索模式与重排器的最优组合;用户 👍/👎 反馈回流为黄金集——多数自建 RAG 缺失的闭环在这里是内置功能。
混合检索+带引用答案
向量(pgvector)与词法(tsvector)结果经 RRF 融合,再由重排(LLM·进程内·cross-encoder)排序,答案带 [n] 引用并通过 SSE 流式输出。联邦查询可一次检索使用异构嵌入的多个知识库。
面向韩语·韩国文档的特化
HWP/HWPX 专用 Rust 解析器(rhwp)、kss 韩语分句、面向扫描件的 VLM·OCR(PaddleOCR)流水线,以及 AI-Hub 兼容标注——这是通用开源 RAG 框架不具备的能力轴。
气隙·代理远程部署
模型以包(pack)形式引入并在部署时自动安装;各主机的代理远程部署工作进程、嵌入、重排与 VLM 服务器。配合 zot 镜像仓库,连容器也完全离线——满足金融·公共·国防的网络隔离要求。
RAG 全流程,一图掌握
从采集到检索、生成、评估、运维与部署——无需拼接多种工具,在单一平台上管理。

文档路由 — 该进入哪个知识库
分类只说明文档是什么,并不决定它该去哪里。从文件名、路径、元数据到嵌入相似度与 LLM 判断,多个路由器组合成策略,在入库前确定目标,并记录每一次决策。

文档解析 — 从原始文件到文本
同样是 PDF,以表格承载信息的文档与扫描件需要用不同方式读取。可按文件类型与质量要求更换解析器,且无论走哪条路径,最终都汇聚为保留表格与标题的同一种 Markdown。

PII — 在索引之前抹除
个人信息在解析后立即脱敏,只有脱敏后的正文进入分块、嵌入与索引。正则无法覆盖之处,由校验位验证与沙箱中的自定义函数补足。

分块 — 检索命中的单位
分块是检索实际匹配的单位。过大则依据淹没在噪声中,过小则句子无法独立成义。每个知识库按文档特性选择合适的边界策略。

嵌入 — 转换为可检索的向量
嵌入配置决定知识库的向量空间。提供方、模型、维度与距离度量在创建知识库时即固定,之后变更需要重新索引。在隔离网络或 CI 中,无需嵌入服务器也能验证链路。

检索 — 如何找到依据
一个问题分为向量检索与词法检索两路,再通过 RRF 合并。整个过程中,知识库边界与元数据过滤强制约束可读取的范围,而向量存储可在不迁移内容的前提下更换。

重排序 — 广撒网,精挑选
一次检索以不遗漏为目标,因此广泛收集候选。重排序只针对这些候选做精细判断并重新排序。它是查询时配置,变更无需重新索引;即使重排序失败,检索仍会以融合顺序返回结果。

评估 — 用数字衡量质量
检索无需 LLM,直接以 Hit Rate 与 MRR 计算;回答则由 LLM 评审在忠实性、相关性、正确性三个维度打分。配置扫描按是否需要重新索引划分搜索空间,留出集与过拟合标记用于验证优胜配置。

平台架构
前端仪表盘、RAG 后端、推理服务器与数据存储/镜像仓库有机联动;推理与工作进程可经由代理分离部署,随规模分阶段扩展。
核心功能
从摄取、解析、分块到混合检索与生成,再到评估、配置扫描、检索微调、版本与可观测性、代理部署与气隙、标注与图像——在单一平台提供覆盖 RAG 全周期的十二大支柱。
构建 · Build
导入文档、解析、切分,并路由到正确的知识库

摄取流水线
多格式文档经异步工作进程完成上传→解析→分块→嵌入→索引。
5 种解析策略
按文档特性为每个集合选择解析策略(未安装时自动回退)。
8 种分块策略
分块决定检索质量的一半——从表格保留到语义边界都细致实现。
知识库设计——fail-closed 隔离
将集合设计为安全隔离边界,而不只是主题分组。
检索 · 生成 · Retrieve & Generate
找到能回答问题的依据,并生成带引用的答案

混合检索与生成
并行检索语义与关键词并融合,生成带引用的答案。
模型灵活性
按工作负载更换嵌入、重排器、生成 LLM、VLM 与 OCR。
评估 · 运维 · Evaluate & Operate
用数字衡量质量,并以版本进行管理

评估工具链
用黄金数据集与 LLM 评审以数字度量质量。
配置扫描与改进闭环
自动探索分块、检索模式、top-k 与重排器组合,并用排行榜比较。
流水线版本与可观测性
将检索、重排与生成设置作为可版本化资产管理,并对每次查询进行度量。
扩展 · 部署 · Extend & Deploy
面向领域微调,并部署到任何环境,包括隔离网
检索微调
针对领域术语与缩写微调嵌入与重排器。
代理远程部署与气隙
各主机的 Argus Agent 部署工作进程与推理服务器;隔离网以模型包引入。
标注与图像流水线
用 OCR 与 VLM 将文档内图像与扫描件知识化。
面向韩语文档的处理管线
HWP 合并表格、扫描版 PDF、脚注与多栏排版——通用 RAG 框架会悄悄丢失的文档,这里走专用路径。

- rhwp——面向 HWP/HWPX 的 Rust 解析器,保留合并表格结构
- kss 韩语分句——顾及助词与引号的边界
- VLM 与 PaddleOCR——从扫描件、图纸与图像中提取文字和说明
- 兼容 AI-Hub 的标注——bbox+文本标注的导入导出
可覆盖隔离网的部署
中央后端向各主机上的 Agent 远程部署,模型以离线包导入并在离线环境中提供服务,直接满足金融、公共与国防的网络隔离要求。

- servermgr → Agent :4501——远程安装、启动与停止工作节点、嵌入、重排、检测与 VLM
- GPU 变体自动选择——cpu、gpu(onnx)、gpu-torch
- zot OCI registry——容器镜像也可完全离线
- 模型注册表——导入离线包后,部署时自动安装到目标主机