평균 성공률의 착시와 24.4%p 일관성 격차의 해법
단일 실행 평균 성공률 뒤에 숨겨진 24.4%p의 일관성 격차를 규명하고, 법률 에이전트의 다회 반복 재현성을 보증하는 무결성 감사 체계를 논증합니다.
초록 현재 대다수 AI 에이전트 벤치마크는 단일 실행의 평균 성공률을 집계하여 시스템의 성능을 과대평가하는 경향이 있습니다. 최근 IBM Research의 실증 분석에 따르면 ReAct 기반 에이전트는 5회 반복 실행 시 평균 77.4%의 성공률을 기록했으나, 5회 모두 연속으로 성공한 과업은 53.0%에 불과하여 24.4%p에 달하는 심각한 일관성 격차(Consistency Gap)를 드러냈습니다. 계약서 검토나 법적 의무 대조와 같은 고위험 법률 업무에서 단 한 번의 비결정론적 실패는 치명적인 법적 책임을 초래합니다. 본 칼럼에서는 이러한 궤적 분기 현상의 구조적 원인을 소프트맥스 엔트로피와 도구 호출의 오차 누적 관점에서 분석합니다. 나아가 이를 해결하기 위해 결정론적 상태 체크포인팅, 궤적 불변성 감사, 그리고 앙상블 합의 기반의 실행 복원 메커니즘을 제안합니다. 궁극적으로 법률 인텔리전스는 단순한 1회성 정답률이 아니라 반복 실행에 대한 엄격한 재현성 메트릭으로 평가받아야 함을 증명합니다.
리허설에서는 완벽하게 판례와 조항을 대조하며 정답을 찾아낸 법률 에이전트가, 실제 배포 환경에서 완전히 동일한 사건을 처리할 때 엉뚱한 검색 쿼리를 던지며 완전히 실패하는 광경은 리걸테크 현장에서 드물지 않게 목격됩니다. 우리는 흔히 벤치마크 차트에서 70~80% 대의 높은 정답률을 확인하고 시스템이 안전하다고 믿지만, 이는 거대한 통계적 착시에 불과합니다. 단일 실행을 기준으로 계산된 평균 성공률은 비결정론적 언어 모델이 매 실행마다 선택하는 추론 경로의 극심한 분산과 무작위성을 은폐합니다. 특히 조항 누락이나 기한 계산 착오가 즉시 손해배상 청구로 이어질 수 있는 법률 영역에서는 '열 번 중 일곱 번 맞추는 AI'가 아니라 '동일한 사실관계에 대해 언제나 동일하게 안전한 결론을 도출하는 AI'가 필요합니다. 2026년 발표된 에이전트 반복 신뢰성 연구는 AppWorld 환경에서 GPT-4.1 기반 ReAct 에이전트가 보여준 24.4%p의 일관성 격차를 정량적으로 폭로하였습니다. 본 글에서는 에이전트의 추론 궤적이 왜 동일 입력에서조차 무작위로 분기하는지 그 메커니즘을 파헤치고, 법률 운영체제 관점에서 다회 실행 무결성을 강제하는 통제 아키텍처를 제시하고자 합니다.
핵심 기술 개념
일관성 격차 (Consistency Gap)
동일한 과업을 여러 번 반복 수행할 때 집계되는 평균 성공률과 모든 반복 회차에서 완벽히 성공한 과업 비율 사이의 편차를 의미합니다.
ReAct 에이전트 (Reasoning and Acting)
대형 언어 모델이 추론(Thought)과 행동(Action), 그리고 관찰(Observation)의 루프를 자율적으로 반복하며 외부 도구를 호출하여 복잡한 과업을 완수하는 아키텍처입니다.
궤적 엔트로피 (Trajectory Entropy)
에이전트가 다단계 의사결정을 거치는 동안 선택 가능한 도구 호출 경로와 중간 토큰 생성 확률 분포가 지닌 불확실성의 누적 총량을 뜻합니다.
기술 심층 분석
평균의 맹점: 단일 실행 성공률과 다회 완주율의 괴리
기존의 LLM 에이전트 평가는 대개 과업당 1회의 실행 결과 또는 여러 과업의 개별 시도 합산 평균인 Pass@1 지표에 의존해 왔습니다. 그러나 IBM Research의 연구진이 AppWorld 벤치마크 환경에서 정밀 측정한 결과, GPT-4.1 기반 ReAct 에이전트는 5회 반복 시도에서 평균 77.4%라는 준수한 성공률을 보였음에도 불구하고 5회 모두 성공한 과업 비율은 53.0%로 급락하였습니다. 이는 전체 과업 중 약 4분의 1에 해당하는 24.4%의 영역에서 시스템이 본질적인 실행 불안정성을 겪고 있음을 입증합니다. 법률 자문이나 소송 문서 분석과 같은 미션 크리티컬 워크플로우에서 사용자는 동일한 계약서를 검토할 때마다 다른 위험 조항을 통과시키는 불안정한 에이전트를 신뢰할 수 없습니다. 평균 성공률이라는 단일 차원의 스칼라 값 뒤에 숨은 분산(Variance)과 궤적 붕괴는 프로덕션 레벨의 법률 AI가 해결해야 할 가장 시급한 무결성 과제입니다.
오차 스노볼링과 어텐션 드리프트의 수리적 메커니즘
에이전트가 동일한 입력에 대해 서로 다른 경로를 택해 실패에 도달하는 근본적 이유는 생성 디코더의 소프트맥스 샘플링과 도구 관찰값(Observation)의 연쇄 결합에 있습니다. 언어 모델의 온도(Temperature) 파라미터가 0으로 고정되더라도, 부동소수점 연산 순서나 배치 처리 특성에 의해 발생하는 극미한 로짓 차이가 초기 도구 선택 토큰의 불일치를 유발합니다. 이로 인해 첫 번째 도구 호출의 쿼리가 단 몇 단어만 달라져도 외부 API나 법률 데이터베이스에서 반환되는 검색 컨텍스트의 순위와 내용이 완전히 왜곡됩니다. 컨텍스트 윈도우에 주입된 상이한 관찰값은 후속 추론 단계에서 자가 주의 집중(Self-Attention)의 가중치를 엉뚱한 방향으로 편향시키는 어텐션 드리프트(Attention Drift)를 촉발합니다. 결과적으로 초기 단계의 1% 미만의 확률적 미세 요동이 다단계 ReAct 루프를 통과하면서 기하급수적인 궤적 발산과 법률적 논리 파탄으로 증폭되는 것입니다.
결정론적 상태 그래프와 체크포인트 게이팅 아키텍처
이러한 궤적 분기를 억제하기 위해서는 에이전트의 완전 자율적 자유도를 제한하고, 엄격한 상태 전이 제약 조건을 부여하는 결정론적 제어 평면(Deterministic Control Plane)이 필수적입니다. 법률 과업의 수명주기를 사실관계 파악, 적용 조항 검색, 법리적 포섭, 결론 도출이라는 비가역적 단계로 분할하고 각 단계의 전이를 유한 상태 기계(FSM)로 강제해야 합니다. 각 상태의 종단에는 사전 정의된 검증 스키마를 충족해야만 다음 단계로의 토큰 생성을 허용하는 체크포인트 게이트를 배치합니다. 예를 들어 판례 검색 상태에서 반환된 판례 번호와 판시사항이 질의 요건과 100% 일치하지 않으면 에이전트가 임의로 법리 해석을 진행하지 못하도록 파이프라인 레벨에서 상태를 롤백합니다. 이를 통해 자유 텍스트 생성 기반의 무작위 도구 호출을 차단하고, 다회 실행 시에도 오차가 특정 임계 범위를 벗어나지 않도록 통제할 수 있습니다.
k-반복 앙상블 합의 디코딩과 안정 경로 추출
실행 시간의 비결정론을 극복하는 또 다른 고도화 전략은 단일 경로 생성을 포기하고 내부적으로 k개의 추론 경로를 병렬 생성하여 합의를 도출하는 다중 궤적 검증 기법입니다. 시스템은 사용자 질의에 대해 독립된 k개의 경량 에이전트 프로세스를 동시에 기동하여 각각 ReAct 루프를 수행하게 합니다. 이후 각 경로에서 산출된 최종 법률 판단과 인용 조문 집합을 기호적(Symbolic) 교집합 연산기로 대조하여 과반수 이상의 궤적이 완전히 일치하는 핵심 경로(Consensus Path)만을 채택합니다. 만약 k개의 경로가 서로 상충하는 법률 해석을 내놓거나 인용 판례가 분기할 경우 시스템은 즉시 불확실성 플래그를 발생시키고 실행을 보류합니다. 이는 단일 실행의 도박적 성공에 의존하지 않고, 24.4%p의 일관성 격차를 구조적으로 흡수하여 프로덕션 환경의 실제 신뢰도를 99% 이상으로 끌어올리는 연산적 안전장치로 기능합니다.
기술적 트레이드오프
긴장 관계 다회 반복 실행을 통한 일관성 감사와 앙상블 합의 메커니즘은 시스템의 재현성과 신뢰도를 극대화하지만, 그에 비례하여 LLM API 호출 비용과 종단 간 지연 시간(Latency)이 급증하는 치명적인 연산 비용의 트레이드오프를 수반합니다.
실무적 해소 이를 실무적으로 완화하기 위해 과업의 법적 위험도(Risk Profile)에 따라 반복 횟수를 동적으로 조절하는 적응형 티어링 파이프라인을 구축합니다. 단순 조문 조회나 정형 서식 작성은 단일 체크포인트 게이트만 적용하여 초저지연으로 처리하고, 복잡한 쟁점 분석 및 계약서 의무 위반 검토와 같은 고위험 과업에 한해서만 k-반복 앙상블과 엄격한 궤적 일관성 검사를 트리거하여 전체 시스템 연산 비용을 최적화합니다.
이 주장이 틀리는 조건
반증 조건 본 칼럼에서 제시한 궤적 통제 및 다회 반복 검증 아키텍처의 유효성은 명확한 벤치마크 지표를 통해 검증 가능합니다. 동일한 1,000건의 복합 법률 질의 세트에 대해 시스템을 5회 반복 실행했을 때, 상태 체크포인팅과 앙상블 게이트를 적용한 후에도 5회 완주 성공률과 단일 실행 성공률 사이의 일관성 격차가 여전히 20%p 이상으로 유지된다면 본 설계는 실패한 것입니다. 또한 궤적 분기를 억제하기 위해 도입한 상태 전이 제약으로 인해 단일 실행의 기준 정확도 자체가 15% 이상 하락하는 역효과가 관측될 경우, 본 시스템이 유연한 법률 추론 능력을 훼손했다는 반증으로 인정하고 아키텍처를 전면 재검토해야 합니다.
법마디 OS에 적용한다면
Lawmadi OS는 이번 일관성 격차 분석을 바탕으로 추론 엔진의 핵심 런타임에 '반복 무결성 보증 프로토콜(Repetition Integrity Assurance Protocol)'을 전격 도입합니다. 우선 모든 법률 상담 및 문서 검토 파이프라인의 회귀 테스트 스위트를 단일 실행 기반에서 '5-Pass Consistency Suite'로 전면 개편하여, 5회 연속 통과하지 못한 프롬프트 체인과 도구 인터페이스는 배포 파이프라인에서 자동 차단되도록 CI/CD를 강화합니다. 둘째로 ReAct 루프의 각 단계마다 도구 호출 인자와 반환 스키마를 강제하는 구조화 검증 레이어를 삽입하여 검색 쿼리의 무작위 변형을 원천 봉쇄합니다. 셋째로 핵심 법률 분석 모듈에 3중 병렬 궤적 디코딩을 기본 활성화하고, 판례 번호와 법조문 조항의 일치도가 100%에 도달한 궤적만을 필터링하여 사용자에게 응답을 스트리밍하도록 설계합니다. 마지막으로 관리자 대시보드에 실시간 '에이전트 일관성 지수(ACI)' 모니터링 패널을 신설하여 프로덕션 환경에서 발생하는 미세한 궤적 표류 현상을 즉각 감지하고 자동 격리하는 자율 방어 체계를 완성할 것입니다.
기술적 함의
- AI 에이전트의 벤치마크 평가 기준은 단일 성공률 평균에서 다회 반복 완주율과 일관성 격차 측정으로 전환되어야 합니다.
- 초기 도구 호출의 미세 오차가 거대한 법률적 오류로 증폭되는 것을 막기 위해 비결정론적 추론 궤적에 대한 강력한 상태 제약이 필수적입니다.
- 고위험 법률 인텔리전스의 무결성은 단 한 번의 우연한 정답이 아니라 언제나 동일한 결과를 도출하는 재현성 위에서만 성립합니다.
"단 한 번의 시연에서 보여준 화려한 성공보다, 수천 번의 실무 속에서 흔들림 없이 동일한 결론을 지켜내는 완벽한 재현성이야말로 법률 AI가 갖추어야 할 진정한 무결성의 척도입니다."
참고 자료
- blog.google New experts join Google’s AI & Economy team
- blog.google AI for Societal Impact
- blog.google Building AI to accelerate science and improve lives
- blog.google AI for everyone in every language
- huggingface.co Your Agent Aced the Task. Will It Do It Again?
- blog.google New insights from Google’s AI & Economy ATLAS
- blog.google Co-creating the future of fashion with Google
- blog.google Making global data easier to explore
- blog.google Watch astronaut Christina Koch and Google’s James Manyika discuss space, technology, and discovery.
- blog.google DevFest is back