파서·청킹·임베딩의 결합 편향: 독립 최적화의 함정
법률 RAG에서 파서, 청킹, 임베딩을 따로 골라 이어 붙이면 조합에 따라 검색 성능이 갈리므로, 부품별 점수가 아니라 조합 단위로 검증해야 합니다.
초록 대규모 법률 및 규제 문서를 다루는 검색증강생성(RAG) 파이프라인은 통상 문서 파서, 청킹 전략, 임베딩 모델을 독립적으로 선택하여 결합하는 모듈식 설계를 취해왔습니다. 그러나 최근 인도 중앙정부 규제 문서를 대상으로 한 요인 실험 연구는 파서와 청커의 선택이 통계적으로 유의하게 상호작용하고, 어떤 검색기 계열도 모든 문서에서 앞서지 못한다고 보고합니다. 같은 연구에서 MPNet-base 는 일관되게 성능이 낮았고, 특히 표에서 나온 질문에서 심각한 실패 양상을 보였습니다. 본 칼럼에서는 이 결과를 조문과 별표 서식을 포함하는 법률 코퍼스에 옮겨 올 때, 파서의 구조 복원도와 청킹 경계, 임베딩 선택을 어떻게 함께 평가해야 하는지 살펴봅니다. 또한 선형 혼합효과 모델(LMM)을 도입하여 개별 문서 구조와 질의 유형에 종속된 무선 효과를 분리하고 최적의 컴포넌트 결합을 도출하는 방법론을 고찰합니다. 다만 이 연구의 코퍼스에서는 증거 보존 상한이 98%를 넘었고, 검색 성능 차이는 수집 단계의 정보 손실보다 주로 순위 품질에서 왔다고 보고된 점도 함께 짚습니다.
복잡한 법률 및 행정 규제 문서를 처리하는 엔지니어링 현장에서는 종종 기이한 성능 역전 현상을 마주하게 됩니다. 최신 고성능 임베딩 모델을 도입하고 정밀한 의미 기반 청킹 알고리즘을 적용했음에도 불구하고, 실제 복합 조문이나 별표 서식에서 근거 조항을 검색하지 못해 환각을 유발하는 사례가 빈번히 발생합니다. 대다수의 엔지니어링 팀은 파서, 청커, 임베딩 모델을 각각 독립적인 최적화 대상으로 간주하여 개별 벤치마크 점수가 가장 높은 모듈들을 단순히 직렬 연결하는 실수를 범합니다. 하지만 규제 문서는 고유의 계층 구조와 조·항·호의 상호참조 관계를 포함하고 있어 파서가 텍스트를 선형화하는 순간 이미 공간적 맥락의 손실이 시작됩니다. 여기에 고정 길이 청킹이나 규칙 기반 청킹이 개입하면서 법적 요건과 효과의 경계가 절단되고, 최종 임베딩 벡터 공간에서는 본래의 법률적 의미 좌표가 왜곡되는 연쇄 붕괴가 발생합니다. 최근 공개된 규제 문서 RAG 다인자 평가 연구(arXiv:2609.31660)는 파서 3종, 청킹 전략 3종, 임베딩 모델 5종의 조합을 엄밀히 교차 검증하며 컴포넌트 간 상호작용의 심각성을 수치로 확인해 주었습니다. 이제 우리는 RAG 시스템을 개별 부품의 단순 합이 아닌, 복합적인 상호작용이 지배하는 비선형 결합 시스템으로 재정의하고 평가 체계를 근본적으로 전환해야 합니다.
핵심 기술 개념
다인자 요인 실험(Factorial Experiment)
RAG 파이프라인을 구성하는 파서, 청킹 전략, 임베딩 모델 등 여러 독립변수의 모든 가능한 조합을 동시에 교차 테스트하여 개별 요인의 주효과뿐만 아니라 요인 간의 상호작용 효과까지 통계적으로 측정하는 실험 방법입니다.
선형 혼합효과 모델(Linear Mixed-Effects Model)
파서나 임베딩 같은 고정 요인의 효과를 추정하는 동시에, 문서별 구조적 차이나 개별 질의의 난이도처럼 데이터에 내재된 무작위 변동(Random Intercepts)을 분리하여 통계적 왜곡 없이 파이프라인의 진정한 기여도를 평가하는 회귀 모델입니다.
증거 스팬 정렬성(Evidence Span Alignment)
문서 파싱 및 청킹 과정에서 법률적 판단의 근거가 되는 원문 문장이나 조항이 쪼개지거나 다른 문맥과 뒤섞이지 않고 단일 청크 내에 완전한 형태로 보존되는 기하학적·의미적 일치도를 의미합니다.
기술 심층 분석
독립 컴포넌트 최적화의 통계적 맹점과 결합 편향
전통적인 RAG 아키텍처 설계는 모듈화 원칙에 기반하여 파서, 청커, 임베딩을 독립된 블랙박스로 취급해 왔습니다. 예컨대 텍스트 추출 정확도가 높은 파서를 선택하고, 텍스트 분할 벤치마크에서 우수한 청커를 고른 뒤, MTEB 리더보드 최상위의 밀집 임베딩 모델을 결합하면 최적의 파이프라인이 완성될 것이라 가정했습니다. 그러나 이 가정이 규제 및 법률 문서처럼 층위가 깊은 문서에서도 성립한다고 볼 근거는 없습니다. 파서가 다단 레이아웃이나 표 형식을 텍스트 스트림으로 변환할 때 삽입하는 개행 문자와 구분자 패턴은 청커의 분할 결정 경계(Splitting Boundary)를 직접적으로 왜곡합니다. 왜곡된 청크는 문맥적 연속성이 단절된 파편화된 토큰 시퀀스를 생성하며, 이는 사전학습 단계에서 자연스러운 장문 코퍼스를 학습한 고밀도 임베딩 모델의 어텐션 맵을 교란시킵니다. 실제로 앞의 연구에서는 어떤 검색기 계열도 네 문서 전반에서 우위를 보이지 못했고, 연구진은 짝을 맞춘 밀집 임베딩 구성과 희소 검색(BM25) 구성을 쌍으로 비교해 그 차이를 확인했습니다.
규제 문서 파싱의 구조적 맥락 손실 메커니즘
법령, 행정규칙, 지침 문서는 단순한 텍스트의 나열이 아니라 조문, 항, 호, 목으로 이어지는 엄격한 위계형 트리 구조를 지닙니다. 일반적인 OCR 기반 파서나 단순 텍스트 추출기는 시각적 위치 정보(Bounding Box)를 무시한 채 좌상단에서 우하단으로 이어지는 래스터 스캔 방식으로 텍스트를 읽어 들입니다. 이 과정에서 본문 조항과 우측 여백의 주석, 혹은 표 내부의 단서 조항이 뒤섞이며 구조적 토폴로지가 붕괴합니다. 파서가 구조를 보존하지 못하면 뒤이어 작동하는 청커는 의미적 완결성이 결여된 단편들을 묶어 하나의 청크로 조립하게 됩니다. 임베딩 모델은 이러한 조립체의 전반부와 후반부 간 어텐션을 계산하면서 정작 핵심이 되는 법률 요건(Prerequisite)과 법률 효과(Legal Effect) 간의 상관관계를 벡터 공간상에서 완전히 희석시킵니다. 다만 이 가설은 앞의 연구가 입증한 원인이 아닙니다. 그 연구의 코퍼스에서는 증거 보존 상한이 98%를 넘어, 검색 성능 차이가 수집 단계의 정보 손실보다 주로 순위 품질에서 왔다고 보고됩니다. 위계 정보의 압착은 구조가 더 복잡한 문서에서 따로 재어 봐야 할 위험이지, 규제 검색 실패의 일반적인 출발점으로 단정할 수 있는 것은 아닙니다.
청킹 입도와 밀집 임베딩 공간의 기하학적 충돌
청킹 전략은 정보의 국소화(Localization)와 광역 맥락(Global Context) 보존 사이의 정밀한 조율을 요구합니다. 고정 토큰 길이 청킹은 구현이 단순하지만 법률 조항의 핵심 문장을 중간에서 단절시켜 의미적 특이점을 파괴하는 치명적인 결함을 안고 있습니다. 반면 문단이나 조문 단위로 분할하는 의미론적 청킹은 청크 간 길이 편차가 지나치게 커져 밀집 임베딩 모델의 풀링(Pooling) 계층에 과도한 노이즈를 유발합니다. 특히 Mean Pooling 방식을 사용하는 다수의 최신 트랜스포머 임베딩 모델은 토큰 길이가 길어질수록 희귀 법률 용어나 핵심 수치 조건의 활성화 벡터가 일반적인 문맥 토큰들에 의해 평균화되어 사라지는 '벡터 평활화(Vector Smoothing)' 현상을 겪습니다. 따라서 고밀도 임베딩 모델의 어텐션 집중 영역과 청킹 알고리즘이 강제하는 텍스트 윈도우 크기가 완벽히 동기화되지 않으면, 질의와 관련된 핵심 증거 문자열이 청크 내에 물리적으로 존재하더라도 코사인 유사도 점수가 임계값 이하로 추락하게 됩니다.
선형 혼합효과 모델(LMM)을 통한 파이프라인 상호작용 검증
최신 RAG 벤치마킹 방법론은 단순 평균 점수 비교를 넘어 선형 혼합효과 모델(LMM)을 적용하는 방향으로 진화하고 있습니다. 파서 3종, 청킹 3종, 임베딩 5종의 조합을 검증할 때 각 조합의 성능은 테스트 문서의 구조적 복잡도와 질의의 성격에 따라 극심한 분산을 보입니다. 이 연구는 문서-질의 수준의 무선 절편(Random Intercepts)을 둔 선형 혼합효과 모델로 7만 2천 행의 결과를 분석하고, 54개 검색기 구성 전부에 군집 부트스트랩 신뢰구간을 보고했습니다. 분석 결과 통계적으로 유의한 상호작용으로 보고된 것은 파서와 청커 선택의 상호작용이며, 단일 검색기 계열이 모든 문서에서 앞서지는 않았습니다. 이는 엔지니어가 RAG 시스템을 튜닝할 때 특정 모듈을 교체하는 단발성 실험에 의존해서는 안 되며, 파이프라인 전반의 다인자 교차 적합도를 수학적으로 검증해야 함을 명확히 시사합니다.
기술적 트레이드오프
긴장 관계 파서와 청커를 법률 구조에 맞추어 고도로 특화하면 특정 법령 문서에서의 증거 회수 정밀도는 극대화되지만, 비정형 계약서나 판결문 등 이질적 문서 구조에 대한 범용 처리 유연성과 인제스천 처리 속도가 저하되는 긴장이 발생합니다.
실무적 해소 이를 해결하기 위해 문서 인제스천 진입점에 경량 구조 분류기를 배치하여 문서의 위계 밀도에 따라 적응형 파싱-청킹 경로를 동적으로 할당합니다. 고도로 정형화된 행정규칙 및 법령은 AST 기반 구조 보존 파서와 조문 단위 청킹을 강제하고, 비정형 판결문은 레이아웃 인지형 청킹과 후기 상호작용 임베딩을 결합하여 처리 비용과 도메인 적응성 간의 균형을 유지합니다.
이 주장이 틀리는 조건
반증 조건 서로 다른 구조를 가진 1,000건 이상의 법률·규제 문서 벤치마크 환경에서, 파서와 청킹 전략을 고정하고 밀집 임베딩 모델만 MTEB 상위 모델로 교체했을 때 증거 스팬 회수율(Top-5 Recall)이 문서 구조의 복잡도와 상관없이 일관되게 단조 증가하는 현상이 통계적 유의수준(p < 0.01) 하에서 관측된다면 본 칼럼의 결합 편향 주장은 기각됩니다. 또한 LMM 분석에서 파서-청킹-임베딩 간의 상호작용 항(Interaction Terms)에 대한 분산 기여도가 0에 수렴하고 개별 컴포넌트의 주효과 합만으로 전체 시스템 성능 분산의 95% 이상이 설명되는 경우에도 컴포넌트 독립성 가정이 타당한 것으로 판정되어 본 논증을 철회해야 합니다.
법마디 OS에 적용한다면
Lawmadi OS 는 조문을 PDF 에서 파싱하지 않고 국가법령정보센터(law.go.kr) API 에서 조·항 단위로 받아 오므로, 이 연구의 파서 축이 그대로 적용되는 자리는 크지 않습니다. 가져올 것은 평가 방법입니다. 검색 구성 요소를 바꿀 때 부품 하나의 벤치마크 점수로 판단하지 않고, 조합 단위로 문서·질의별 편차를 분리해 비교하는 방식을 검토하겠습니다. 이 연구가 공개한 800문항 벤치마크와 평가 하네스는 인도 중앙정부 규제 문서를 대상으로 한 것이어서 한국 법령에 그대로 쓸 수는 없고, 필수 증거 문자열을 원문과 자동 대조하고 일부를 사람이 검수하는 설계를 참고할 수 있습니다. 또한 이 연구가 성능 차이의 주된 원인을 순위 품질로 본 만큼, 수집 단계보다 순위 단계의 품질 지표를 먼저 재는 편이 우선순위에 맞습니다.
기술적 함의
- 단일 컴포넌트 벤치마크의 고득점 모델이 전체 RAG 시스템의 엔드투엔드 무결성을 결코 보장하지 못한다는 시스템적 한계가 명확해졌습니다.
- 이 연구의 코퍼스에서는 검색 성능 차이가 수집 단계의 정보 손실보다 주로 순위 품질에서 왔으므로, 파서 개선보다 순위 품질 측정을 먼저 볼 이유가 있습니다.
- 선형 혼합효과 모델과 다인자 요인 실험 설계를 인제스천 평가 파이프라인에 필수적인 통계적 검증 도구로 정착시켜야 합니다.
"최고의 부품들을 단순히 나열한다고 해서 가장 안전한 법률 엔진이 완성되는 것은 아니며, 진정한 시스템 무결성은 컴포넌트 사이의 보이지 않는 상호작용을 수학적으로 통제하는 데서 비롯됩니다."