Argus RAG Studio
RAG 파이프라인의 구축(Build) · 검색/생성(Retrieve & Generate) · 평가(Evaluate) · 운영/배포(Operate & Deploy)를 한곳에서 통합 관리가능한 RAG 플랫폼입니다. "한 번 동작하는 RAG 데모"가 아니라 — 품질을 숫자로 측정하는 평가 하니스, 최적 설정을 자동 탐색하는 스윕, 피드백 환류, 에이전트 기반 원격 배포까지 갖춰 온프레미스·에어갭(폐쇄망)에서 운영할 수 있습니다.
RAG 란 무엇인가
LLM 이 혼자 답하면 최신 정보도, 근거도 없습니다. RAG 는 답하기 전에 우리 문서를 먼저 검색하고, 찾아낸 근거 위에서만 답을 만듭니다.

문서를 넣으면, 근거를 포함한 답이 도출합니다
사내 규정·매뉴얼·계약서를 그대로 적재하면 질문에 맞는 근거를 검색해 [n] 인용이 추가된 답변을 생성합니다. 답변의 모든 문장은 원문 위치를 역추적할수 잇어서, 담당자가 근거를 확인한 뒤 업무에 사용합니다.

개념도
구축 · 검색/생성 · 평가/운영이 하나의 도구 위에서 돌아가고, 추론 서버와 배포는 표준 인터페이스로 연결됩니다.

특징 및 강점
측정 → 최적화 → 개선 루프
골든셋·Hit Rate/MRR·LLM-as-Judge 3축으로 품질을 숫자로 측정하고, 설정 스윕이 청킹·검색 모드·리랭커의 최적 조합을 자동 탐색하며, 사용자 피드백 👍/👎가 골든셋으로 환류됩니다 — 자체 구축 RAG가 대부분 빠뜨리는 루프가 기본 기능입니다.
하이브리드 검색 + 인용 답변
벡터(pgvector)와 렉시컬(tsvector)을 RRF로 융합하고 리랭킹(LLM·인프로세스·cross-encoder)으로 재정렬해, [n] 인용이 달린 답변을 SSE로 스트리밍합니다. 이종 임베딩 지식베이스도 페더레이션 질의로 한 번에 검색합니다.
한국어 · 한국 문서 특화
한글 HWP/HWPX 전용 Rust 파서(rhwp), kss 한국어 문장 분리, VLM·OCR(PaddleOCR) 스캔 문서 파이프라인, AI-Hub 호환 어노테이션까지 — 일반 오픈소스 RAG 프레임워크에 없는 축입니다.
에어갭 · 에이전트 원격 배포
모델을 팩(pack)으로 반입해 배포 시 자동 설치하고, 각 호스트의 에이전트가 워커·임베딩·리랭커·VLM 서버를 원격 배포합니다. zot 레지스트리로 컨테이너까지 완전 오프라인 — 금융·공공·국방의 망분리 요건에 대응합니다.
RAG 전 주기
수집부터 검색·생성·평가·운영·배포까지 하나의 플랫폼에서 관리합니다.

문서 라우팅
분류는 문서가 무엇인지 알려줄 뿐, 어느 지식베이스에 문서를 넣을지 정하지 못합니다. 파일명 · 경로 · 메타데이터부터 임베딩 유사도와 LLM 판단까지 라우터를 조합해 인제스천 전에 목적지를 정하고, 그 결정을 모두 기록합니다.

문서 파싱
같은 PDF라도 표가 핵심인 문서와 스캔본은 다르게 읽어야 합니다. 파일 유형과 품질 요구에 맞춰 파서를 교체하고, 어느 방법을 사용하든 표와 헤딩이 살아 있는 하나의 Markdown 으로 변환합니다.

PII
개인정보는 문서 파싱 직후에 마스킹되어, 마스킹된 본문만 청킹 · 임베딩 · 색인으로 넘어갑니다. 정규식으로 부족한 자리는 체크섬 검증과 샌드박스에서 실행하는 사용자 함수로 보완합니다.

청킹
청크는 검색이 실제로 매칭하는 단위입니다. 너무 크면 근거가 부족하고, 너무 작으면 문장이 자립하지 못합니다. 문서 성격에 맞는 경계 전략을 컬렉션마다 선택해야 합니다.

임베딩
임베딩 설정이 컬렉션의 벡터 공간을 정합니다. 프로바이더 · 모델 · 차원 · 거리 지표는 컬렉션을 만들 때 확정되고, 이후 변경하려면 재색인이 필요합니다.

검색
질문 하나가 벡터 검색과 렉시컬 검색으로 처리하고 RRF 로 다시 합쳐집니다.

리랭킹
1차 검색은 놓치지 않는 것이 목적이라 후보를 넓게 모읍니다. 리랭킹은 그 후보만 다시 정밀하게 보고 순서를 바꿉니다. 쿼리 시점 설정이라 바꿔도 재인덱싱이 없습니다.

평가
검색은 LLM 없이 Hit Rate · MRR 로 계산하고, 답변은 LLM 판정관이 충실성 · 관련성 · 정확성으로 평가를 합니다. 설정 변경은 재인덱싱이 필요한 것과 아닌 것으로 나눠 탐색하고, 홀드아웃과 과적합 플래그가 우승 설정을 검증합니다.

플랫폼 아키텍처
프런트엔드 대시보드 · RAG 백엔드 · 추론 서버 · 데이터 스토어/레지스트리가 유기적으로 연동되며, 추론·워커는 에이전트로 분리 배포해 규모에 따라 단계적으로 확장합니다.
핵심 기능
인제스천·파싱·청킹부터 하이브리드 검색·생성, 평가·설정 스윕·검색 파인튜닝, 버전·관측성, 에이전트 배포·에어갭, 어노테이션·이미지까지 — RAG 전 주기 12대 축을 단일 플랫폼에서 제공합니다.
구축 · Build
문서를 넣고, 읽고, 자르고, 제자리에 배정하는 단계

인제스천 파이프라인
멀티포맷 문서를 업로드→파싱→청킹→임베딩→색인까지 비동기 워커로 처리합니다.
파싱 전략 5종
문서 특성에 맞춰 파싱 전략을 컬렉션별로 선택합니다(미설치 시 자동 폴백).
청킹 전략 8종
검색 품질을 좌우하는 청킹을 표 보존·의미 경계까지 촘촘하게 구현했습니다.
지식베이스 설계 — fail-closed 격리
컬렉션을 주제 묶음이 아니라 보안 격리 경계로 설계했습니다.
검색 · 생성 · Retrieve & Generate
질문에 맞는 근거를 찾아 인용 답변을 만드는 단계

하이브리드 검색 & 생성
의미와 키워드를 병렬 검색해 융합하고, 인용이 달린 답변을 생성합니다.
모델 유연성
임베딩·리랭커·생성 LLM·VLM·OCR을 워크로드에 맞게 교체합니다.
평가 · 운영 · Evaluate & Operate
품질을 숫자로 재고, 버전으로 관리하는 단계

평가 하니스
골든 데이터셋과 LLM Judge로 품질을 숫자로 측정합니다.
설정 스윕 & 개선 루프
청킹·검색 모드·top-k·리랭커 조합을 자동 탐색하고 리더보드로 비교합니다.
파이프라인 버전 & 관측성
검색·리랭크·생성 설정을 버전 가능한 자산으로 다루고, 모든 질의를 계측합니다.
확장 · 배포 · Extend & Deploy
도메인에 맞춰 튜닝하고, 어디에든 배포하는 단계
검색 파인튜닝
도메인 용어·약어에 맞춰 임베딩·리랭커를 튜닝합니다.
에이전트 원격 배포 & 에어갭
각 호스트의 Argus Agent가 워커·추론 서버를 배포하고, 폐쇄망에는 모델 팩으로 반입합니다.
어노테이션 & 이미지 파이프라인
문서 속 이미지·스캔본을 OCR·VLM으로 지식화합니다.
한국 문서를 위한 파이프라인
HWP 병합 표, 스캔 PDF, 각주와 다단 편집 — 일반 RAG 프레임워크가 그대로 놓치는 문서를 전용 경로로 처리합니다.

- rhwp — HWP/HWPX 전용 Rust 파서로 병합 표 구조까지 보존
- kss 한국어 문장 분리 — 조사·인용부호를 고려한 경계
- VLM · PaddleOCR — 스캔본·도면·이미지에서 텍스트와 캡션 추출
- AI-Hub 호환 어노테이션 — bbox+텍스트 라벨링 입출력
에어갭까지 가는 배포
중앙 백엔드가 각 호스트의 에이전트에 원격 배포하고, 모델은 팩으로 반입해 오프라인에서 서빙합니다. 금융·공공·국방의 망분리 요건을 그대로 만족합니다.

- servermgr → Agent :4501 — 워커·임베딩·리랭커·검출·VLM 원격 설치·기동·중지
- GPU 변형 자동 선택 — cpu · gpu(onnx) · gpu-torch
- zot OCI 레지스트리 — 컨테이너 이미지까지 완전 오프라인
- 모델 레지스트리 — 팩 반입 후 배포 시 대상 서버에 자동 설치
오픈소스로 공개되는 RAG 플랫폼
Argus RAG Studio는 Apache License 2.0으로 GitHub에 공개됩니다. 백엔드(FastAPI)·프론트엔드(Next.js)·독립 임베딩/리랭커 서버까지 RAG 엔진 전체를 공개해, 기업이 코드를 직접 검증하고 자사 환경에 맞게 확장하며 데이터를 외부로 내보내지 않고 운영할 수 있습니다.
- 상용 활용 제약 없는 Apache 2.0
- 코드 직접 검증·확장 가능
- 에어갭·온프레미스 자체 운영