빠른 판단의 비용: System-1 하네스 게이팅과 옵션 순서 편향
단일 순전파 System-1 모델을 에이전트 하네스의 의사결정 게이트로 도입할 때 발생하는 제로샷 라우팅 실패와 옵션 순서 민감도의 한계를 수리적으로 규명합니다.
초록 거대언어모델(LLM) 기반 다중 에이전트 하네스에서 호출 비용과 지연 시간을 줄이기 위해 단일 순전파(Single Forward Pass) 분류를 수행하는 경량 System-1 결정 모델의 도입이 가속화되고 있습니다. 최근 리(Jiawei Li, 2026)의 실증 연구에 따르면, 오픈웨이트 모델인 Laya와 호스팅 모델인 Jev를 비교한 11개 에이전트 결정 지점 평가에서 호스팅 모델이 9개 지점에서 통계적으로 유의미한 우위를 보였으나, 제로샷 모델 라우팅에서는 두 모델 모두 무작위 확률 수준을 넘지 못했습니다. 특히 Laya의 경우 옵션 제시 순서만 변경해도 전체 판정의 30%가 뒤바뀌는 극단적인 위치적 취약성을 드러냈습니다. 본 칼럼에서는 이러한 System-1 결정 모델의 확률 붕괴와 순서 편향 메커니즘을 어텐션 수렴 관점에서 분석합니다. 나아가 리걸테크 워크플로우에서 경량 분류기를 무비판적으로 도구 선택 및 게이팅에 투입할 때 발생하는 법률적 정합성 왜곡을 진단합니다. 궁극적으로 법률 AI 하네스 설계에서 결정 모델의 속도와 증거 검증의 완결성 사이에서 균형을 잡는 다층적 아키텍처 원칙을 제시합니다.
법률 AI 에이전트를 실무 환경에 배치할 때 엔지니어가 마주하는 가장 집요한 병목은 매 단계마다 발생하는 LLM 추론 비용과 응답 지연입니다. 질의가 들어올 때마다 어떤 특화 도구를 호출할지, 검색된 조문이 유관한지, 혹은 프롬프트 주입 공격이 포함되었는지를 판별하기 위해 매번 초거대 생성 모델을 호출하는 것은 운영 관점에서 막대한 연산 자원을 소모합니다. 이에 따라 업계에서는 단 한 번의 순전파로 클래스 확률을 산출하는 경량화된 System-1 결정 모델을 에이전트 하네스의 스위칭 게이트로 채택하는 흐름이 급부상했습니다. 그러나 최근 발표된 리(Jiawei Li, 2026)의 11개 에이전트 결정 지점 쌍체 평가(Paired Evaluation) 결과는 이러한 기계적 경량화에 치명적인 경고를 던집니다. 실험에 사용된 모델들은 7,283건의 기본 사례와 6,640건의 강건성 변형 테스트에서 모델 라우팅의 제로샷 판단에 실패했을 뿐만 아니라, 선택지 순서가 바뀌는 단순 섭동만으로도 응답의 30%를 번복하는 취약성을 보였습니다. 법률적 판단의 분기점마다 이러한 미세 붕괴가 누적되면 최종 인용과 사실 확정은 완전히 빗나가게 됩니다. 우리는 속도를 위해 하네스에 도입한 빠른 모델들이 증거를 얼마나 왜곡하고 있는지 그 메커니즘을 정밀하게 해부해야 합니다.
핵심 기술 개념
System-1 결정 모델 (System-1 Decision Model)
복잡한 자기회귀 생성(CoT 등)을 거치지 않고, 단일 순전파를 통해 클래스 확률과 결정 로짓을 즉각 출력하도록 경량화된 분류 전용 신경망 모델입니다.
옵션 순서 편향 (Option Order Sensitivity)
결정 모델에 제공되는 선택지의 나열 순서(순방향/역방향)가 달라질 때 내용의 변화가 없음에도 모델의 최종 선택 확률이 왜곡되는 위치적 편향 현상입니다.
에이전트 하네스 (Agent Harness)
LLM이 도구를 선택하고, 검색 증거의 유효성을 평가하며, 워크플로우를 진행하도록 제어 및 분기 결정을 내리는 오케스트레이션 프레임워크입니다.
기술 심층 분석
단일 순전파 게이팅의 확률 붕괴와 제로샷 라우팅 실패 메커니즘
경량 System-1 모델이 에이전트 하네스 내부에서 도구 선택과 모델 라우팅을 수행할 때 겪는 본질적인 문제는 소프트맥스 분포의 엔트로피 붕괴입니다. 대규모 생성 모델은 토큰별 어텐션 층을 거치며 문맥적 인과관계를 단계적으로 구성하지만, 단일 순전파 분류기는 입력 토큰 시퀀스의 표면적 임베딩 벡터를 고정된 선형 프로젝션 층에 직접 사영합니다. 리(Jiawei Li, 2026)의 연구에서 18개 공개 소스로부터 구축된 7,283건의 기준 케이스를 대상으로 Laya와 Jev를 측정한 결과, 두 모델 모두 제로샷 모델 라우팅에서 무작위 확률(Chance Level)을 상회하지 못했습니다. 이는 질의의 의미적 복합성과 도구 명세의 기능적 의미가 충분한 잠재적 다단계 추론 없이 단일 풀링 벡터로 압축되면서, 법률 요건 검토와 같은 복잡한 도메인 라우팅에 필요한 세밀한 분별 능력을 상실하기 때문입니다. 특히 RAG 연관성 게이팅(RAG Relevance Gating)에서도 오픈웨이트 모델과 호스팅 모델 간의 성능 차이가 동률로 수렴하는 현상은, 텍스트 표면 유사도에 의존하는 단일 순전파가 법적 인과관계나 소송 쟁점의 실질적 유효성을 식별하지 못함을 수학적으로 증명합니다.
30% 응답 번복을 초래하는 위치 편향과 토큰 어텐션 비대칭성
오픈웨이트 결정 모델인 Laya에서 발견된 가장 심각한 구조적 결함은 선택지 제시 순서를 바꿀 때 나타난 30%의 답변 번복률입니다. 트랜스포머 인코더 기반의 분류 모델은 자기주의(Self-Attention) 행렬을 계산할 때 위치 인코딩(Positional Encoding)의 감쇠 함수와 입력의 선행 토큰에 과도한 주의 가중치를 부여하는 프리픽스 편향(Prefix Bias)을 내재하고 있습니다. 법률 에이전트가 호출 가능한 도구 목록(예: 조문 조회, 판례 검색, 서식 생성)을 프롬프트 내에 열거할 때, 모델은 도구의 기능적 적합성보다 먼저 나열된 토큰의 로짓 값을 과대 추정하는 경향을 보입니다. 6,640건의 강건성 변형 데이터셋을 통한 바이트 단위 동일 입력 테스트에서 이러한 순서 민감도가 지속적으로 관측된 것은, 경량 결정 모델이 도메인 규칙을 학습한 것이 아니라 입력 템플릿의 위치적 아티팩트에 과적합되었음을 명백히 보여줍니다. 결국 하네스 엔지니어가 순서 셔플링이나 캘리브레이션 층을 명시적으로 두지 않는다면, 에이전트의 워크플로우 분기는 순수한 무작위 섭동에 의해 좌우되는 파국을 맞이하게 됩니다.
호스팅 전용 모델과 오픈웨이트 모델의 46.0%p 격차와 재현성 딜레마
리(2026)의 연구에서 호스팅 모델인 Jev는 11개 결정 지점 중 9개 지점에서 오픈웨이트 모델인 Laya 대비 최소 +10.8%p에서 최대 +46.0%p에 이르는 압도적인 정확도 우위를 기록했습니다. 이러한 격차는 대규모 사전학습 파라미터와 정교하게 정렬된 다중 작업 분류 헤드의 유무에서 비롯됩니다. 그러나 시스템 엔지니어링 관점에서 호스팅 전용 결정 모델을 하네스 게이트로 전면 채택하는 것은 중대한 재현성 및 지연 시간 트레이드오프를 발생시킵니다. 교차 하드웨어 및 교차 일자(Cross-Hardware and Cross-Day) 재현성 검증에서 나타나듯, 외부 API로 호스팅되는 블랙박스 모델은 백엔드 가중치 업데이트나 양자화 커널 변경에 따라 에이전트의 결정 경계가 예고 없이 표류할 위험을 안고 있습니다. 법률 AI와 같이 단 한 번의 잘못된 도구 라우팅으로도 판례 누락이나 오심을 초래할 수 있는 고위험 도메인에서는, 정확도가 다소 낮더라도 결정 경계를 온프레미스에서 결정론적으로 통제할 수 있는 오픈 모델과 강력한 사후 감사 체계의 결합이 더욱 절실합니다.
증거 없는 빠른 결정의 위험: 법률 RAG 게이팅에서의 연쇄 오류 증폭
에이전트 하네스에서 System-1 모델이 검색된 법률 증거의 적합성을 즉시 판단하는 '고속 게이트'로 작동할 때, 오류는 단일 분기점에서 끝나지 않고 전체 파이프라인으로 증폭됩니다. 법률 문서는 일반 자연어와 달리 조문의 항·호 구조, 적용 제외 단서 조항, 판결 이유와 주문의 엄격한 분리 등 고도의 논리적 계층성을 지닙니다. 경량 분류기가 단일 순전파를 통해 검색된 조문 블록을 '무관(Irrelevant)'으로 오분류하여 하네스에서 버리거나, 반대로 표면 어휘만 일치하는 폐기된 과거 판례를 '유관(Relevant)'으로 승인할 경우, 후속 LLM은 왜곡된 컨텍스트 위에서 법리를 전개하게 됩니다. 즉, '빠른 모델'이 내린 10밀리초 단위의 경솔한 결정이 '느린 증거'의 체계적 검토 기회를 원천 차단하는 것입니다. 따라서 하네스 내부의 단위 의사결정은 단일 분류기의 로짓에 전적으로 의존하는 구조를 탈피하여, 기호적 제약 조건과 상태 그래프 기반의 다층 검증 레이어로 보완되어야만 합니다.
기술적 트레이드오프
긴장 관계 하네스 내부 결정 지점에서 단일 순전파 System-1 모델을 사용하면 LLM 호출 대비 연산 비용과 지연 시간을 극적으로 단축할 수 있으나, 옵션 순서 편향과 낮은 제로샷 분별력으로 인해 에이전트 워크플로우의 무결성이 훼손되는 근본적 긴장이 발생합니다.
실무적 해소 이를 해결하기 위해 지연 시간에 민감한 단순 입력 주입 차단 등에는 경량 분류기를 배치하되, 도구 라우팅 및 법률 증거 적합성 판정에는 순서 불변성을 보장하는 양방향 순열 앙상블과 원문 대조 기반의 결정론적 검증 게이트를 결합하는 계층적 하이브리드 라우팅 방식을 채택합니다.
이 주장이 틀리는 조건
반증 조건 에이전트 하네스 내의 도구 선택 및 RAG 관련성 평가 지점에 단일 순전파 오픈웨이트 분류기를 단독 배치했을 때, 도구 옵션의 프롬프트 제시 순서를 역전(Reverse)시킨 변형 데이터셋에 대한 판단 일치율이 98% 이상으로 유지되고, 동시에 무작위 확률 대비 통계적으로 유의미한(+30%p 이상) 제로샷 분별력이 관측된다면 본 칼럼의 논지는 성립하지 않습니다. 또한 경량 결정 모델의 단독 게이팅을 거친 파이프라인의 최종 조문·판례 인용 무결성 통과율이 정밀한 LLM 다단계 추론 기반 하네스와 비교하여 오차범위 1% 이내로 동일함이 입증된다면 빠른 모델의 취약성에 대한 주장은 반증됩니다.
법마디 OS에 적용한다면
현재 Lawmadi OS는 60개 법률 분야별 AI 리더에게 사용자 질의를 배정하고, 복합 질의의 경우 리더 간 협의를 거치며, 최종 인용의 무결성은 국가법령정보센터(law.go.kr) API를 통한 원문 대조로 철저히 검증하고 있습니다. 또한 변호사시험 기출 답안 코퍼스와 판례·조문 조회 도구(MCP)를 안정적으로 제공하고 있습니다. 이번 리(Li, 2026)의 연구 결과를 바탕으로, 향후 Lawmadi OS의 에이전트 하네스 내부 라우팅 및 도구 호출 아키텍처에 순서 편향 차단 메커니즘을 단계적으로 도입하는 방안을 검토하겠습니다. 구체적으로는 질의가 60개 전문 분야 리더에게 배정되는 초기 디스패치 단계에서, 도구 명세나 리더 목록의 나열 순서에 따라 배정이 왜곡되지 않도록 순열 대칭화(Permutation Symmetry) 평가 로직을 하네스 레벨에 적용할 계획입니다. 경량 분류기를 통한 1차 라우팅 시 옵션을 정방향과 역방향으로 교차 주입하여 로짓 일관성을 측정하고, 30% 수준의 순서 민감도가 감지되는 경계 사례는 즉시 기각하여 상위 추론 하네스로 이관하는 안전장치를 설계하고자 합니다. 아울러 판례·조문 조회 도구(MCP) 호출 시 검색된 법령 후보의 유효성을 경량 게이트가 단독으로 쳐내지 못하도록, law.go.kr 원문 대조 엔진의 기호적 확인을 통과하기 전까지는 증거의 배제를 엄격히 금지하는 방침을 하네스 규칙으로 정착시킬 것입니다. 이러한 개선은 당사가 지향하는 타협 없는 법률 AI 무결성을 한층 더 견고하게 다지는 기술적 초석이 될 것입니다.
기술적 함의
- 하네스의 연산 효율을 높이기 위해 도입하는 경량 결정 모델은 옵션 순서 등 프롬프트 표면 섭동에 극도로 취약하므로 단독 의사결정자로 신뢰해서는 안 됩니다.
- 호스팅 전용 결정 모델의 높은 벤치마크 점수 이면에는 배포 환경의 비결정론적 드리프트 위험이 상존하므로, 감사 가능한 온프레미스 검증 체계 구축이 필수적입니다.
- 법률 도메인의 에이전틱 RAG는 고속 분류기의 성급한 가지치기를 지양하고, 공공 원문 원천 데이터와 연계된 결정론적 증거 보존 원칙을 고수해야 합니다.
"판단의 속도를 높이는 기술보다 더 중요한 것은, 그 빠른 판단이 법적 증거를 침묵시키지 않도록 하네스의 경계를 엄격히 통제하는 엔지니어링의 정직함입니다."
참고 자료
- arxiv.org EpiWorld: Grounding LLM Policy Agents in Epidemiological World Models
- arxiv.org Fast Models, Slow Evidence: A Paired and Self-Audited Evaluation of System-1 Decision Models for LLM Agent Harnesses
- news.mit.edu New tool lets users repair AI-generated 3D models, then fabricate them just the way they want
- spectrum.ieee.org How to Stop AI Agents From Secretly Collaborating
- arxiv.org Finding the Move Is Not Winning the Game: XiangqiBench for Closed-Loop Evaluation of LLM Agents
- arxiv.org DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents
- news.mit.edu MIT Transit Lab to develop an AI platform for public transit agencies
- arxiv.org Silent Dissent: LLM Agents That Yield to the Majority Still Represent Their Original Premise
- arxiv.org Right Order, Wrong Scale: Auditing LLM Judges for Occupational AI Measurement
- news.mit.edu This game-playing AI is the new champ at Stratego