모델은 여럿, 기록은 하나여야 한다
기업이 여러 AI 모델을 함께 쓰는 것은 일시적 현상이 아니라는 연구와 거버넌스를 증명하게 하는 규칙안을 따라, 조달과 기록의 단위가 어디로 옮겨 가는지 다룹니다.
초록 대기업들은 AI 공급자 하나를 고르지 않고 여럿과 동시에 계약하고 있습니다. 올해 나온 한 연구는 이 현상이 모델이 범용품으로 수렴하기 전의 과도기가 아니라, 과업마다 강한 모델이 다르다는 사실이 지속되면서 굳어진 구조라고 봅니다. 그 구조는 세 가지 문제를 낳습니다. 공급자마다 다른 보안 수준과 문서를 맞춰야 하는 거버넌스 파편화, 공급자를 가로지르는 비용 단위가 없는 예산 관리의 붕괴, 제각각인 콘솔과 지표 정의가 만드는 관측의 파편화입니다. 연구는 셋을 하나의 빠진 층, 곧 공급자를 가로지르는 통제 평면의 부재로 묶습니다. 같은 시기 미국 콜로라도주가 입법예고한 규칙안은 AI 거버넌스를 선언이 아니라 증명의 문제로 만듭니다. 이 칼럼은 두 흐름을 겹쳐, 법률 AI 의 조달과 기록이 무엇을 단위로 삼아야 하는지 따져 봅니다.
여러 모델을 함께 쓰는 조직을 두고 흔히 나오는 예측은 두 가지입니다. 결국 가장 뛰어난 모델 하나로 수렴하리라는 것, 아니면 모델이 모두 비슷해져 값싼 범용품이 되리라는 것입니다. arXiv 에 공개된 「The Multi-Lab Enterprise」는 어느 쪽도 지지하지 않습니다. 2026년 초 기준 Global 2000 기업의 81%가 세 개 이상의 모델 패밀리를 운영하고 있고, 연구는 이를 과업별 차별화가 지속되는 시장의 구조적 특징으로 해석합니다. 그렇다면 전략의 질문이 바뀝니다. 어느 모델에 걸 것인가가 아니라, 여러 모델이 섞여 돌아가는 상태를 어떻게 비교하고 설명하고 증명할 것인가입니다. 법률처럼 결정 하나하나를 나중에 설명해야 하는 분야에서는 이 질문이 곧 책임의 문제가 됩니다.
핵심 개념 정의
멀티랩 엔터프라이즈(Multi-Lab Enterprise)
한 공급자를 표준으로 고르지 않고 여러 프런티어 모델 공급자와 동시에 계약해, 과업마다 다른 모델을 쓰는 기업 구조입니다. 해당 연구는 이것을 과도기가 아니라 과업별 성능 차이가 지속되면서 생긴 시장 구조로 봅니다.
공급자 횡단 통제 평면(Cross-provider Control Plane)
여러 모델 공급자 위에서 거버넌스 정책, 비용 집계, 관측 기록을 하나의 형식으로 다루는 층입니다. 연구는 거버넌스·비용·관측의 세 문제가 모두 이 층의 부재에서 나온다고 결론짓고, LLM 게이트웨이와 관측 플랫폼, 비용 표준 확장을 그 초기 형태로 꼽습니다.
결정 재현성(Decision Reproducibility)
특정 결정을 내린 순간의 시스템 구성을 되살려, 그 결정이 어떻게 나왔는지 설명하거나 다시 검토할 수 있는 능력입니다. 모델 버전만이 아니라 시스템 프롬프트, 검색 출처, 기능 플래그, 분류기 버전, 임계값, 오케스트레이션 로직까지가 그 구성에 들어갑니다.
전략적 관점
여러 모델은 과도기가 아니라 구조다
「The Multi-Lab Enterprise」는 설문과 거래 데이터, 공급자 공시, 금융·법률·컨설팅·의료·공공 분야의 사례를 모아, 기업이 프런티어 AI 공급자 하나를 고르는 대신 모두와 계약하고 있다고 보고합니다. 연구가 강조하는 것은 숫자보다 해석입니다. 여러 모델을 함께 쓰는 현상은 모델이 범용품으로 수렴하기를 기다리는 과도기가 아니라, 과업마다 강한 모델이 다르다는 사실이 오래 유지되면서 굳어진 구조라는 것입니다. 이 해석이 맞다면 두 가지 흔한 전략이 동시에 흔들립니다. 하나는 가장 좋은 모델 하나에 조직 전체를 묶는 표준화 전략이고, 다른 하나는 모델은 곧 값싼 원자재가 되니 모델 선택은 신경 쓸 필요가 없다는 낙관입니다. 두 전략 모두 모델의 차이가 사라진다고 가정하지만, 연구가 그리는 시장에서는 차이가 남고, 그래서 여러 모델을 함께 다루는 능력 자체가 운영의 과제가 됩니다.
세 문제는 하나의 빠진 층에서 나온다
연구는 멀티랩 구조가 낳는 문제를 셋으로 나눕니다. 첫째는 거버넌스 파편화입니다. 공급자마다 보안 수준, 문서, 준법 창구가 달라 겹치는 규제 체계에 맞춰 일일이 조율해야 하고, 그 사이에 승인받지 않은 그림자 AI 가 퍼집니다. 둘째는 예산 관리의 붕괴입니다. 토큰 단위로, 그것도 사용 행태에 따라 늘어나는 소비는 예산 편성을 무력하게 만들고, 공급자를 가로질러 비교할 수 있는 표준 비용 단위가 없습니다. 셋째는 관측의 파편화입니다. 각 공급자가 사용량과 비용을 서로 다른 콘솔, API, 지표 정의로 내놓아 조직마다 따로 통합 층을 만들어야 합니다. 연구의 결론은 이 셋이 각각의 문제가 아니라 하나의 빠진 추상, 곧 공급자를 가로지르는 엔터프라이즈 AI 통제 평면의 부재를 가리킨다는 것입니다. 전략적으로 보면, 가치가 새로 생기는 자리는 개별 모델이 아니라 모델들 사이의 이음매입니다.
시도당 가격이 아니라 성공한 과업당 비용
연구는 API 와 에이전트의 비용 소모를 평가하는 다섯 지표의 틀을 제안하면서 한 가지 사례를 보여 줍니다. 시도 한 번의 가격이 가장 싼 모델이, 성공한 과업 하나를 기준으로 보면 가장 비싼 모델이 되는 경우입니다. 싼 모델이 더 자주 실패하고 다시 시도해야 한다면, 청구서의 단가는 낮아도 일을 끝내는 비용은 높아집니다. 법률 AI 에서 이 차이는 더 커집니다. 법률 답변에서 '성공'은 문장이 만들어진 것이 아니라 그 안의 법령과 판례 인용이 원문 대조를 통과한 것이기 때문입니다. 인용 검증에서 막혀 다시 생성해야 하는 답변, 사람이 사후에 고쳐야 하는 답변은 모두 비용입니다. 따라서 법률 AI 의 조달 비교는 토큰 단가표가 아니라, 같은 질의 묶음에서 검증을 통과한 답변 하나를 얻는 데 든 총비용으로 해야 합니다. 그 숫자는 공급자 콘솔 어디에도 나오지 않으며, 여러 공급자의 기록을 한 형식으로 모은 쪽만 계산할 수 있습니다.
증명의 단위는 결정 당시의 구성이다
스탠퍼드 로스쿨 CodeX 의 에란 카하나는 「When AI Governance Has to Prove Itself」에서 콜로라도주 법무부가 제출한 자동화 의사결정 기술(ADMT)·대화형 AI 규칙안을 분석하며, 이 규칙안이 AI 거버넌스를 조직이 증명해야 하는 것으로 다룬다고 씁니다. 규칙안은 아직 정식 입법예고 절차에 있지만, 불리한 결정을 받은 사람에게 그 결정의 주된 이유와 시스템의 역할을 설명하게 하고, 결정의 바탕이 된 정보가 정정되면 결정을 다시 검토하게 합니다. 카하나는 여기서 재구성의 단위가 모델 버전이 아니라 결정 당시 시스템의 구성 전체라고 짚습니다. 모델과 체크포인트, 시스템 프롬프트, 검색 출처, 기능 플래그, 분류기 버전, 임계값, 오케스트레이션 로직이 모두 들어갑니다. 여러 공급자의 모델이 한 결정에 섞이는 조직이라면 그 구성은 공급자 경계를 넘나듭니다. 임상 AI 의 준법 배포 패턴을 정리한 「HIPAA-Compliant AI Deployment Patterns in Clinical Settings」가 지적하듯, 아키텍처 결정과 준법 의무를 잇는 구체적인 대응표도 아직 흔치 않습니다. 결정 하나를 재구성할 책임은 결국 공급자들 위에서 기록을 한 형식으로 쥔 쪽에 남습니다.
반론과 재반박
예상 반론 공급자를 가로지르는 통제 평면을 두면 이번에는 그 통제 평면 자체가 새로운 종속이 된다. 모델 공급자에 대한 종속을 게이트웨이 사업자에 대한 종속으로 바꿀 뿐이며, 차라리 공급자 하나로 표준화하는 편이 층이 적고 관리가 단순하다.
재반박 통제 평면이 새로운 종속이 될 수 있다는 지적은 옳고, 그래서 통제 평면이 쥐어야 할 것은 라우팅의 독점이 아니라 기록의 형식이어야 합니다. 결정 당시의 구성과 비용을 공개된 형식으로 남기면 통제 평면을 바꾸더라도 과거의 결정을 재구성할 수 있습니다. 공급자 하나로 표준화하는 선택은 층을 줄이지만, 연구가 보여 주듯 과업별 차이가 지속되는 시장에서는 성능과 비용을 함께 포기하는 선택이 되고, 그 공급자가 모델을 바꿀 때마다 과거 결정의 재구성은 여전히 그 공급자의 기록에 달려 있게 됩니다.
이 주장이 틀리는 조건
반증 조건 여러 모델을 함께 쓰는 현상이 구조라는 이 칼럼의 전제는 시장 자료로 확인됩니다. 앞으로 몇 차례의 기업 조사에서 세 개 이상의 모델 패밀리를 운영하는 기업의 비중이 뚜렷하게 줄고 한 공급자로의 통합이 늘어난다면, 멀티랩은 과도기였던 것이고 공급자를 가로지르는 기록 층의 가치도 그만큼 작아집니다. 또 콜로라도 규칙안이 확정된 뒤 실제 이의제기와 재검토 사례에서, 모델 버전과 입력만으로 결정 설명이 충분히 받아들여지고 검색 출처나 임계값 같은 구성 기록을 요구받는 일이 드물다면, 증명의 단위를 구성 전체로 넓혀야 한다는 이 글의 주장은 과했던 것입니다.
법마디 OS가 그리는 미래
법마디 OS 는 언어 모델을 교체할 수 있는 부품으로 설계했고, 실제로 올가을에도 생성 모델을 바꾸고 되돌린 일이 있습니다. 그 과정에서 확인한 것은 모델을 바꾸면 같은 질문에 대한 인용의 충실도가 눈에 띄게 달라진다는 사실이었습니다. 그래서 답의 품질을 모델에 맡기지 않고, 법령과 판례 인용을 국가법령정보센터 원문과 대조하는 판정 기준을 모델 밖 한 곳에 둡니다. 모델이 바뀌어도 판정의 잣대는 바뀌지 않게 하려는 것입니다. 오늘 살펴본 연구와 규칙안은 여기서 한 걸음 더 나아가라고 요구합니다. 답변 하나마다 어떤 모델, 어떤 원문 판본, 어떤 검증 결과로 만들어졌는지를 한 형식으로 남겨, 모델을 바꾼 뒤에도 이전 답변을 같은 기준으로 다시 보고 비교할 수 있게 하는 것입니다. 조달의 단위도 같은 기록에서 나옵니다. 검증을 통과한 답변 하나를 얻는 데 모델마다 얼마가 들었는지를 재야, 다음 교체가 성능과 비용 어느 쪽에서도 후퇴가 아닌지 판단할 수 있습니다.
전략적 함의
- 모델 선택을 한 번의 표준화 결정으로 다루지 말고, 여러 모델이 섞여 도는 상태를 운영의 기본값으로 놓고 설계해야 한다.
- 조달 비교의 단위를 토큰 단가에서 검증을 통과한 결과 하나당 총비용으로 바꿔야 한다. 그 숫자는 공급자를 가로지르는 기록이 있어야 계산된다.
- 증명 책임에 대비하려면 모델 버전이 아니라 결정 당시의 구성 전체를, 특정 사업자에 묶이지 않는 형식으로 남겨야 한다.
"여러 모델을 쓰는 것이 구조라면, 조직이 지켜야 할 하나는 모델이 아니라 기록입니다. 어느 모델이 어떤 조건에서 어떤 결정을 냈는지가 한 형식으로 남아 있을 때, 비용은 비교할 수 있게 되고 결정은 설명할 수 있게 됩니다. 법률 AI 에게 그 기록은 선택이 아니라 책임을 지는 방식입니다."