메인으로
지유 · 최고기술책임자(CTO) · 오늘의 기술 칼럼

평균은 지켜지고 분포가 움직인다

4비트로 줄인 모델이 원본보다 높은 점수를 내는 시대가 됐습니다. 그런데 같은 표 안에서도 오르는 능력과 내려가는 능력이 갈립니다. 압축·양자화·교체된 모델을 받아들일 때 무엇을 단위로 삼아야 하는지를, 우리가 모델을 바꿨을 때 실제로 무너졌던 축과 함께 다룹니다.

초록 모델을 작게 만드는 기술이 빠르게 성숙하고 있습니다. llama.cpp 의 양자화 체크포인트를 transformers 에서 그대로 읽는 길이 열렸고, 블록을 통째로 지우는 가지치기는 조합 최적화 문제로 다시 풀리고 있으며, 구조를 줄인 뒤 4비트로 양자화한 모델이 자기 16비트 판을 대부분의 벤치마크에서 넘어서는 결과도 나왔습니다. 세 문서를 겹쳐 읽으면 공통된 사실이 하나 드러납니다. 압축은 평균을 지키는 데는 점점 능숙해지지만, 어느 능력이 오르고 어느 능력이 내려가는지는 벤치마크마다 다르게 움직입니다. 이 칼럼은 법률 AI 가 모델을 바꾸거나 줄인 판을 받아들일 때 왜 순위표가 아니라 자기 과제의 축으로 재야 하는지를, 우리가 생성 모델을 바꿨을 때 평균은 버텼는데 인용 귀속이 73% 에서 6.7% 로 무너졌던 기록과 함께 다룹니다.

모델을 바꾸는 일은 이제 드문 사건이 아닙니다. 같은 모델의 양자화 판을 골라 쓰고, 더 작은 모델로 옮기고, 공급자를 바꿉니다. 그때마다 우리가 묻는 질문은 대개 하나입니다 — 점수가 떨어졌는가. Hugging Face 는 2026년 9월 22일 transformers 가 llama.cpp 의 GGUF 체크포인트를 직접 읽는다고 알리면서, Qwen3.5-4B 의 BF16 판 8.42GB 가 Q4_K_M 판에서 2.74GB 로 줄어드는 표를 보여 주었습니다. 그런데 같은 글에서 저자들은 더 공격적인 양자화의 품질 트레이드오프는 모델과 과제에 달렸으니, 실제로 모델에게 시킬 일로 평가하라고 적었습니다. 이 한 문장이 오늘 글의 출발점입니다. 점수가 떨어졌는가를 묻는 순간 우리는 이미 누군가의 과제로 잰 평균을 받아들이고 있습니다. 그런데 법률 AI 에게 중요한 것은 평균이 아니라, 그 평균 아래에서 우리가 기대는 한 가지 능력이 그대로인가입니다.

핵심 기술 개념

양자화 판(quantized checkpoint)

가중치를 더 적은 비트로 표현해 메모리와 연산을 줄인 모델 파일입니다. GGUF 는 가중치와 토크나이저·대화 템플릿 같은 메타데이터를 한 파일에 담고, Q4_K_M 처럼 대부분의 가중치는 4비트로 두되 민감한 텐서는 더 높은 정밀도로 남기는 혼합 방식을 씁니다. 같은 이름의 모델이라도 양자화 수준이 다르면 서로 다른 모델이라는 점이 핵심입니다. Hugging Face 는 원본과 변환본을 transformers 에서 나란히 불러 양자화 오차를 감안하고도 변환이 맞는지 확인하는 용도를 이번 통합의 쓰임새로 꼽았습니다.

블록 제거의 결합(coupling)

트랜스포머 블록을 통째로 지우는 깊이 가지치기에서, 한 블록을 지운 영향이 다른 어떤 블록을 함께 지웠는지에 따라 달라지는 성질입니다. Multiverse Computing 은 2026년 9월 21일 글에서 블록마다 0과 1의 변수를 두고 손실을 2차까지 전개해, 대각 성분은 블록 하나의 중요도로, 비대각 성분은 블록 사이의 결합으로 읽었습니다. 블록을 하나씩 따로 채점해 덜 중요한 것부터 지우는 방식은 이 결합을 버리고, 많이 지울수록 그 손실이 커진다는 것이 이 글의 요지입니다.

양자화 인지 치유(QAH)

구조를 줄이고 양자화한 뒤 떨어진 능력을 되살리는 치유 단계를, 줄이기 전의 원본 모델을 교사로 삼아 출력 분포를 맞추는 증류로 하는 방법입니다. 2026년 8월 25일 글에서 120B 모델을 60B 로 줄이고 MXFP4 로 양자화한 판은 같은 60B 구조의 BF16 판을 9개 벤치마크 중 7개에서 넘어섰습니다. 동시에 MMLU-Pro 에서 0.2점, SciCode 에서 1.4점을 내주었습니다. 대부분에서 이기고 일부에서 지는 이 모양이 압축된 모델을 받아들일 때 우리가 마주하는 전형입니다.

기술 심층 분석

1

4비트가 16비트를 이기는 표 안에도 지는 칸이 있다

양자화 인지 치유의 결과표는 인상적입니다. 구조를 절반으로 줄이고 4비트로 양자화한 판이 긴 문맥 추론 벤치마크 AA-LCR 에서 7.4점, 수학 AIME 2025 에서 5.6점을 자기 16비트 판보다 더 받았습니다. 저자들은 압축이 보통 가장 크게 망가뜨리는 능력에서 가장 크게 올랐다고 적었습니다. 그런데 같은 표의 아래 두 줄은 MMLU-Pro 와 SciCode 에서 1.5점이 안 되는 차이로 진 칸입니다. 평균으로 보면 이 모델은 분명한 개선이고, 저자들의 결론도 그렇습니다. 문제는 우리 과제가 어느 칸에 가까운가입니다. 법령 조문의 번호와 내용을 정확히 짝짓는 능력은 추론보다 지식 회상에 가깝고, 지식 벤치마크가 진 칸에 있다는 사실은 평균이 오른 표 안에서도 우리에게 불리한 신호일 수 있습니다. 표는 거짓말을 하지 않습니다. 다만 그 표가 무엇을 평균했는지를 우리가 대신 결정해 주지는 않습니다.

2

가장 낮은 에너지가 가장 좋은 모델은 아니었다

블록 제거를 이징 유리 문제로 푼 글은 한 가지 계산을 반복해서 강조합니다. 결합 행렬을 작은 보정 데이터에서 한 번 구하면, 어떤 조합으로 블록을 지웠을 때의 에너지를 모델을 돌리지 않고도 싸게 셀 수 있고, 그 에너지는 가지친 모델의 벤치마크 점수를 잘 대신합니다. Llama-3.3-70B 의 80블록 중 40블록을 재학습 없이 지웠을 때 이 방법은 MMLU 76.9 를 지켰고, 가장 강한 기존 방법은 54.0 으로 떨어졌습니다. 원본은 82.2 였습니다. 그런데 저자들은 이 대리 지표가 완벽하지 않다는 점을 숨기지 않습니다. Llama-3.1-8B 에서 32블록 중 16블록을 지운 실험에서는 에너지가 17번째로 낮은 들뜬 상태가, 가벼운 재학습 뒤 가장 낮은 바닥 상태를 여러 벤치마크에서 이겼습니다. 그래서 이들은 바닥 상태 하나가 아니라 낮은 에너지의 후보 여럿을 뽑아 시험해 보라고 권합니다. 대리 지표가 아무리 좋아도 마지막 판정은 실제 과제에서 해야 한다는 뜻이고, 이것은 압축의 문제만이 아니라 모든 교체의 문제입니다.

3

같은 이름, 다른 모델 — 변환 검증이 첫 쓰임새로 꼽힌 이유

transformers 의 GGUF 통합 글은 이 기능으로 할 수 있는 일을 다섯 가지 꼽는데, 그중 하나가 원본 체크포인트와 그 GGUF 변환본을 transformers 에서 함께 불러 양자화 오차를 감안하고도 가중치가 올바르게 변환됐는지 확인하는 일입니다. 개발자 자신이 변환의 동일성을 따로 검증해야 한다고 적은 것입니다. 같은 글에는 실행 경로가 조용히 바뀌는 자리도 적혀 있습니다. 호환되는 양자화 커널을 받지 못하면 로더는 모델을 역양자화해 더 많은 메모리를 쓰고, 어텐션 커널을 받지 못하면 경고와 함께 sdpa 로 떨어집니다. 속도 비교표에 대해서도 transformers 쪽 측정은 프리필을 포함하고 llama-bench 는 디코드만 재므로 같은 조건이 아니라고 밝혔습니다. 세 대목이 가리키는 것은 하나입니다. 모델의 이름이 같아도 비트 수, 커널, 측정 조건이 달라지면 우리가 받아 쓰는 것은 다른 시스템입니다. 그 차이는 이름표가 아니라 우리가 직접 돌려 본 결과에서만 보입니다.

4

우리가 모델을 바꿨을 때 평균은 버텼고 인용 귀속은 무너졌다

이 이야기를 남의 벤치마크로만 할 수는 없습니다. 법마디 OS 는 2026년 9월 4일 생성 경로를 다른 모델로 옮긴 적이 있고, 그 기록이 저장소에 남아 있습니다. 답변 축에서는 그 선택이 버텼습니다. 9월 12일 라이브 12건의 평균 점수는 83.8 이었고 국가법령정보센터에서 확인되지 않은 인용은 0건이었습니다. 그런데 콘텐츠 생성 축에서는 같은 프롬프트와 같은 게이트로 발행 당시의 글을 전수 비교했더니, 인용된 조문 번호에 그 조문의 내용이 제대로 붙은 비율이 이전 모델 시대 137쌍 중 97쌍인 73% 에서 새 모델 시대 31쌍 중 2쌍인 6.7% 로 떨어져 있었습니다. 조문은 모두 실재했기 때문에 실존만 확인하던 게이트는 이 붕괴를 하나도 잡지 못했습니다. 평균 점수라는 한 축은 버텼고, 우리가 가장 기대는 다른 한 축은 무너졌던 것입니다. 그 뒤 조문 원문 재대조 축을 발행 경로에 넣었고, 결국 콘텐츠 생성 모델을 되돌렸습니다.

5

받아들이는 단위는 순위표가 아니라 우리 과제의 축이다

세 문서와 우리 기록을 겹치면 받아들이는 기준을 이렇게 세울 수 있습니다. 첫째, 모델을 바꾸거나 줄인 판을 들일 때 공개 벤치마크의 평균은 출발점일 뿐이고, 판정은 우리 과제에서 뽑은 고정 입력으로 합니다. 둘째, 그 고정 입력은 평균 하나가 아니라 축별로 봅니다. 법률 AI 라면 조문의 실존, 조문 번호와 내용의 귀속, 시점의 정합이 서로 다른 축이고, 하나가 버틴다고 다른 하나가 버틴다는 보장이 없습니다. 셋째, 가지치기 글이 바닥 상태 하나 대신 후보 여럿을 시험하라고 권했듯이, 교체 후보도 하나로 정하기 전에 두세 판을 같은 축으로 나란히 잽니다. 넷째, 치유 글이 보여 준 것처럼 개선된 표 안에도 지는 칸이 있으므로, 우리 과제와 가장 가까운 칸이 어디인지를 미리 정해 두고 그 칸의 하락을 거부 사유로 삼습니다. 이 네 가지는 새 기술이 아니라 측정의 순서입니다.

기술적 트레이드오프

긴장 관계 압축된 판과 작은 모델은 비용을 크게 줄여 준다. 치유 글의 모델은 16비트 판보다 가중치 메모리를 약 네 배 덜 쓰고, 양자화 판은 노트북에서도 돈다. 그런데 교체 때마다 우리 과제의 축으로 전수 측정을 하면 그 측정 자체가 비용이 되고, 측정을 줄이면 평균 아래에서 무너진 축을 놓친다.

실무적 해소 측정을 매번 전수로 하지 않고 두 층으로 나눕니다. 아래층은 교체와 무관하게 늘 도는 결정론 게이트입니다 — 조문의 실존과 조문 번호·내용의 귀속을 원문과 대조하는 축은 어떤 모델이 썼든 같은 비용으로 매 발행마다 돌고, 모델이 바뀌어 무너지면 그날의 발행을 막습니다. 위층은 교체 순간에만 도는 비교 측정입니다 — 우리 과제에서 뽑은 고정 입력을 옛 판과 새 판에 나란히 넣어 축별로 차이를 보고, 가장 기대는 축의 하락은 평균이 올라도 거부 사유로 삼습니다. 이렇게 하면 평소 비용은 아래층만큼이고, 교체의 위험은 위층이 한 번에 드러냅니다. 비용을 아끼려고 건너뛸 수 있는 층은 위층뿐이고, 아래층이 남아 있는 한 붕괴는 결번으로라도 드러납니다.

이 주장이 틀리는 조건

반증 조건 이 글은 검사할 수 있는 예측을 답니다. 첫째, 압축·양자화된 판을 우리 과제의 고정 입력으로 축별로 쟀을 때 공개 벤치마크 평균이 오른 판에서 조문 귀속 축이 한 번도 떨어지지 않는다면, 평균 아래에서 분포가 움직인다는 이 글의 읽기는 우리 과제에서는 과한 경계입니다. 둘째, 원문 재대조 같은 결정론 게이트를 둔 뒤에도 모델 교체 때마다 사람이 발행면을 전수로 다시 읽어야만 붕괴가 드러난다면, 두 층으로 나눈 측정은 비용을 줄이지 못한 것입니다. 셋째, 교체 후보 두세 판을 같은 축으로 나란히 잰 결과가 공개 순위표의 순서와 늘 같다면, 후보를 여럿 시험하라는 권고는 우리에게 추가 정보를 주지 않습니다.

법마디 OS에 적용한다면

법마디 OS 는 답변의 품질이 모델이 아니라 검증 계층에서 나온다는 전제로 만들어졌습니다. 이 전제는 모델을 바꿀 수 있다는 약속이면서, 동시에 바꿀 때 무엇을 재야 하는지에 대한 약속이기도 합니다. 9월에 생성 모델을 옮겼을 때 우리가 배운 것은 그 약속의 두 번째 절반이었습니다. 답변 축의 평균은 83.8 로 버텼지만, 콘텐츠 생성 축에서는 조문 번호에 그 조문의 내용이 제대로 붙은 비율이 73% 에서 6.7% 로 떨어져 있었고, 실존만 확인하던 게이트는 그것을 보지 못했습니다. 그래서 지금은 두 층으로 잽니다. 아래층에서는 발행되는 모든 글의 핵심 법령이 국가법령정보센터 원문과 번호뿐 아니라 내용까지 대조되고, 어긋나면 그날이 결번이 됩니다. 위층에서는 모델을 바꾸기 전에 고정 입력을 옛 판과 새 판에 나란히 넣어 축별로 봅니다. 양자화 판이든 더 작은 모델이든 다른 공급자든, 들이는 기준은 순위표의 평균이 아니라 이 두 층을 통과하는가입니다.

기술적 함의

"모델을 작게 만드는 기술은 평균을 지키는 데 점점 능숙해지고 있습니다. 그것은 좋은 소식입니다. 다만 평균이 지켜졌다는 사실은 우리가 기대는 한 가지가 지켜졌다는 사실과 다릅니다. 모델을 바꿀 수 있는 시스템은 모델을 바꿀 때 무엇을 재야 하는지를 먼저 알고 있는 시스템입니다."

참고 자료

칼럼니스트

지유

지유

최고기술책임자 (CTO · Chief Technology Officer)

실리콘밸리 유니콘 창업 멤버급 / AI 무결성 검증 분야 세계적 석학급

법마디 OS 무료로 경험하기
본 칼럼은 법마디 OS 기술팀의 관점이며, 특정 제품·기술에 대한 보증이나 법률 자문이 아닙니다.