arrow_back 설계로그 목록
ADR-0013
법의학 AI
설계중
법의학 하위 분야별 증거 등급 — 자동화가 타당성을 만들지 않는다
작성 2026-07-25 · 최종 갱신 2026-07-25
ADR-0012 가 프로파일링에 적용한 등급 구분을 법의학에 적용한다. PCAST(2016)는 분야별로 전혀 다른 결론을 냈다. 기초적 타당성이 확인되지 않은 분야에는 AI 도구를 얹지 않는다. 자동화는 틀린 결론을 더 빠르고 더 일관되게 만들 뿐이다.
info이 문서는 연구·설계 기록이며, 현재 제공 중인 서비스가 아닙니다. 각 항목의 상태 표기를 함께 확인해 주세요.
help맥락
ADR-0004 는 법의학 AI 의 지위를 정하고 ADR-0005 는 자료의 수명을 정했다. 그러나 어느 감정 분야에 먼저 적용할지는 정하지 않았다.
법의학도 프로파일링과 같다. 한 덩어리가 아니다. PCAST(2016)는 특징비교 방법들을 분야별로 검토해 서로 다른 결론에 이르렀고, 같은 '법과학'이라는 이름 아래 기초적 타당성이 확립된 분야와 확립되지 않은 분야가 함께 있다.
여기서 흔한 오해가 생긴다. 사람이 하던 판단이 주관적이니 기계로 바꾸면 객관적이 된다는 것이다. 그러나 방법 자체의 타당성이 확인되지 않았다면, 그 방법을 자동화해도 타당해지지 않는다. 달라지는 것은 속도와 일관성뿐이다.
일관성이 오히려 위험할 수 있다. 사람이 제각각 틀릴 때는 불일치가 드러나지만, 기계가 일관되게 틀리면 그 일관성이 신뢰의 근거로 오독된다.
alt_route검토한 대안
대안 A기각
기술적으로 구현 가능한 분야부터 착수한다.
구현 난이도와 방법의 타당성은 무관하다. 오히려 특징이 단순해 구현하기 쉬운 분야일수록 타당성 연구가 부족한 경우가 있다. 구현 가능성을 기준으로 삼으면 가장 위험한 곳부터 손대게 된다.
대안 B기각
수요가 큰 분야부터 착수한다.
수요는 그 분야가 실무에서 많이 쓰인다는 뜻이지 그 방법이 타당하다는 뜻이 아니다. 타당성이 낮은데 수요가 큰 조합이 가장 많은 피해를 만든다.
대안 C채택
기초적 타당성 평가에 따라 등급을 나누고 등급별 허용 범위를 고정한다.
무엇에 손대도 되는지가 문헌 상태에 연동된다. ADR-0012 가 프로파일링에 적용한 것과 같은 구조이며, 두 트랙에 같은 원칙을 쓴다.
gavel결정
- 하위 분야를 세 등급으로 나눈다. A등급은 기초적 타당성이 확립된 분야다. PCAST 는 단일출처 및 2인 단순혼합 시료의 DNA 분석을 '기초적으로 타당함이 확립된 객관적 방법'으로 평가했다(Finding 2).
- B등급은 타당하되 오류율이 실질적인 분야다. PCAST 는 잠재지문 분석을 '기초적으로 타당한 주관적 방법'으로 보면서도 '위양성률이 실질적이며 지문 분석의 무오류성에 관한 오래된 주장에 근거해 많은 배심원이 기대하는 것보다 높을 가능성이 크다'고 했다(Finding 5). B등급에는 오류율 고지를 산출 조건으로 둔다.
- C등급은 기초적 타당성이 확립되지 않은 분야다. PCAST 는 교흔 분석이 기준을 '충족하지 못하며 충족과는 거리가 멀다'고 했고(Finding 4), CPI 기반 복합혼합 DNA 분석을 '불충분하게 규정된 주관적 방법으로 오류를 낳을 수 있어 기초적으로 타당하지 않다'고 했으며(Finding 3), 총기 분석은 '적절히 설계된 연구가 한 건뿐이어서 현재로서는 기준에 미치지 못한다'고 했고(Finding 6), 족적 분석의 특정 식별표지 기반 결론은 '뒷받침하는 적절한 실증 연구가 없다'고 했다(Finding 7).
- C등급 분야에는 AI 도구를 얹지 않는다. 타당성이 확인되지 않은 방법의 자동화는 이 트랙의 산출물로 인정하지 않는다.
- 등급은 국외 평가에 기반하므로 국내 감정 실무·표준과 대조해 재확인한다. 재확인 전에는 국외 등급을 국내 결론으로 그대로 쓰지 않으며, 국내에서 다르게 평가될 여지를 기록에 남긴다.
- 등급이 낮은데 수요가 큰 조합을 별도로 표시해 관리한다. 그 조합은 착수 우선순위가 아니라 배제 우선순위다.
- ADR-0012 결정 6 을 이 트랙에도 동일하게 적용한다. 기초적 타당성이 확립된 분야라도 그 감정에 필요한 자료를 우리가 적법하게 다룰 수 있는지 별도로 확인하며, 확인 전에는 착수 대상으로 표시하지 않는다.
menu_book근거
- 결정 4 가 이 기록의 핵심이다. 「형사소송법」 제171조 제3항은 감정 결과에 판단의 이유를 명시하도록 하는데, 방법 자체의 타당성이 확립되지 않았다면 그 방법으로 도출한 결론에는 명시할 이유가 없다. 자동화는 그 공백을 메우지 못한다.
- PCAST 가 총기 분석을 미충족으로 본 이유는 결과가 나빴기 때문이 아니라 '적절히 설계된 연구가 한 건뿐'이어서 재현성이 입증되지 않았기 때문이다(Finding 6). 기준이 요구하는 것은 좋은 결과가 아니라 재현된 결과다. ADR-0010 이 착수 전에 측정을 요구하는 것과 같은 논리다.
- 잠재지문의 사례는 A등급과 B등급을 나눠야 하는 이유를 보여 준다. 타당한 방법이어도 위양성률이 실질적일 수 있고, 그 수치가 듣는 사람의 기대와 다를 수 있다(Finding 5). 타당성 확인과 오류율 고지는 별개의 요구이며, 전자를 근거로 후자를 생략할 수 없다. ADR-0004 결정 5 의 분야별 적용이 결정 2 다.
- A등급 분야에도 적용상 타당성 문제는 남는다. DNA 해석에서도 인지편향과 인적 요인이 시스템 차원의 문제로 다루어지고 있으므로(NISTIR 8503, 2024), 등급이 높다고 해서 ADR-0003 의 개입 설계나 ADR-0009 의 설명 요구가 완화되지 않는다.
- 총기 분야에 관한 지적은 PCAST 이전에도 있었다. 국립연구위원회는 2009년 보고서에서 그 분야에 관해 신뢰성과 재현성을 이해하기에 충분한 연구가 이루어지지 않았다고 결론지었고 PCAST 가 이를 인용한다(National Research Council, 2009).
- PCAST 이후의 재검토도 같은 방향이다. 미국 국립표준기술연구소는 2023년 교흔 분석에 관해 '법과학적 교흔 분석은 이 분야의 세 가지 핵심 전제가 데이터로 뒷받침되지 않기 때문에 충분한 과학적 기초를 결여한다'고 결론지었고, '교흔 분석이 어떤 사람을 그 흔적의 출처로 정확히 배제하거나 배제하지 않을 수 있는 능력은 뒷받침되지 않는다'고 했다(NIST IR 8352, 2023). 손상이 사람의 교흔인지, 개별 치아 흔적이 구별되는지 등 세 가지 판단 질문 전체에서 90% 일치에 도달한 사건은 8%에 그쳤다. 2016년 평가가 7년 뒤 독립적으로 재확인된 셈이며, 교흔의 C등급은 낡은 근거에 묶인 것이 아니다.
- B등급의 오류율이 어느 정도인지도 원 연구에서 확인된다. 잠재지문 검사자 169명이 각각 약 100쌍을 비교한 연구에서 전체 위양성률은 0.1%, 위음성률은 7.5%였다(Ulery 외, 2011). 두 오류의 크기가 75배 차이 난다는 사실 자체가 ADR-0010 결정 3(위양성과 위음성을 분리해 보고하고 위양성 상한을 먼저 정한다)의 근거다. 하나의 정확도 수치로 뭉뚱그렸다면 이 비대칭은 보이지 않는다.
- 같은 연구는 설계에 직접 쓸 수 있는 결과도 남겼다. 서로 다른 참가자가 동일한 비교를 독립적으로 수행한 경우 이 연구의 위양성이 모두 검출되었고 위음성도 대부분 검출되었다(Ulery 외, 2011). 사람을 한 명 더 두는 것이 아니라 앞선 결론을 모르는 상태에서 독립적으로 다시 보게 하는 것이 오류를 잡는다는 뜻이며, 이는 ADR-0003 이 사후 승인형 개입을 기각한 이유와 같은 방향이다. 다만 이 결과를 우리 산출 조건으로 옮기는 것은 별도의 결정이 필요하므로 여기서는 근거로만 기록한다.
warning이 결정이 만드는 한계
- 이 등급표는 2016년 평가에 기초한다. 이후 새로운 연구로 평가가 달라졌을 수 있으므로, 갱신하지 않으면 낡은 등급으로 결정을 묶어 두게 된다. ADR-0012 와 같은 부담을 진다.
- PCAST 의 평가에는 이견이 있다. 미국 법무부는 casework 오류율을 PCAST 의 실험설계 기준만으로 정할 수 없다는 입장을 냈다. 이 기록은 그 논쟁의 승패를 판정하지 않으며, 다만 이견이 있는 영역에서는 더 보수적인 쪽을 택한다는 뜻으로 등급을 쓴다.
- 결정 4 는 사업 기회를 좁힌다. 실무 수요가 큰 분야 중 상당수가 C등급에 들어 있으므로, 수요가 있는 곳에 공급하지 않는 구간이 생긴다. 이 손실은 결정의 내용이다.
- 국내 재현 요구(결정 5)는 시간과 자료를 요구한다. 국내 표본으로 타당성을 확인할 수 없는 분야는 등급을 확정하지 못한 채 남으며, 그 상태에서는 착수하지 않는다.
- 이 트랙에도 같은 역전이 있을 수 있다. A등급인 단일출처 DNA 분석은 타당성이 가장 확립된 분야이지만 그 자료는 민감정보이자 「디엔에이신원확인정보의 이용 및 보호에 관한 법률」의 규율 대상이며(ADR-0005), 민간이 보유할 수 있는 자료가 아니다. 등급이 높다는 것과 우리가 착수할 수 있다는 것은 별개다.
event_repeat폐기 조건
- PCAST 이후의 새로운 타당성 연구로 특정 분야의 평가가 달라질 때 — 해당 등급을 개정한다.
- 국내 감정 실무·표준과의 대조 결과가 나올 때 — 국내 기준으로 등급표를 다시 쓴다.
- C등급 분야에서 기초적 타당성이 확립될 때 — 그 분야에 한해 결정 4 의 적용을 해제한다.
balance근거자료
인용 법령
참고자료
- Forensic Science in Criminal Courts: Ensuring Scientific Validity of Feature-Comparison MethodsPresident's Council of Advisors on Science and Technology (PCAST), Executive Office of the President · 2016-09 — Finding 2~7 에서 분야별로 다른 결론을 낸다. 2026-07-25 원문 PDF 를 내려받아 각 Finding 문장을 직접 추출해 대조했다. 아래 등급표의 인용문은 모두 이 보고서 본문 그대로다.
- Strengthening Forensic Science in the United States: A Path ForwardNational Research Council (National Academies) · 2009 — 총기 분석에 관해 '신뢰성과 재현성을 이해하기에 충분한 연구가 이루어지지 않았다'고 결론지었고 PCAST 가 이를 인용한다. 2026-07-25 발행처 페이지 및 PCAST 본문 인용 확인.
- NISTIR 8503 — Forensic DNA Interpretation and Human Factors: Improving Practice Through a Systems Approach미국 국립표준기술연구소(NIST) · 2024-05 — DNA 해석에서 인지편향과 인적 요인을 시스템 문제로 다룬다. A등급 분야에도 적용상 타당성 문제가 남는다는 근거. 2026-07-25 원문 확인.
- NIST IR 8352 — Bitemark Analysis: A NIST Scientific Foundation ReviewSauerwein K., Butler J. M., Reczek K. K., Reed C. — 미국 국립표준기술연구소(NIST) · 2023 — 42쪽. 400편 이상의 자료를 검토. 본문 verbatim: 'Forensic bitemark analysis lacks a sufficient scientific foundation because the three key premises of the field are not supported by the data.' 및 'the ability of bitemark analysis to accurately exclude or not exclude individuals as a source of the mark is not supported.' 세 가지 판단 질문 전체에서 90% 일치에 도달한 사건은 8%에 그쳤다. 2026-07-25 원문 PDF 를 내려받아 직접 추출·대조.
- Accuracy and reliability of forensic latent fingerprint decisionsUlery B. T., Hicklin R. A., Buscaglia J., Roberts M. A. — Proceedings of the National Academy of Sciences (PNAS) · 2011 — 잠재지문 검사자 169명이 각각 약 100쌍을 비교한 대규모 연구. 초록 verbatim: 전체 위양성률 0.1%, 위음성률 7.5%(검사자의 85%가 최소 1건의 위음성). 서로 다른 참가자에 의한 독립 검토는 이 연구의 위양성을 모두 검출했고 위음성도 대부분 검출했다. 2026-07-25 CrossRef 초록 확인.
- NIST IR 8351 — DNA Mixture Interpretation: A NIST Scientific Foundation ReviewButler J. M., Iyer H., Press R., Taylor M. C., Vallone P. M., Willis S. — 미국 국립표준기술연구소(NIST) · 2024 — DNA 혼합시료 해석에 관한 과학적 기초 재검토. 우도비 체계와 확률적 유전자형 소프트웨어를 다룬다. 2026-07-25 CrossRef 초록으로 보고서의 범위와 구성을 확인(결론 부분은 본문 대조를 하지 않아 범위 수준으로만 참조).
history개정 이력
- 2026-07-25PCAST 이후 문헌 3건을 추가하고 근거 3개 문단을 신설. 교흔 C등급의 2023년 재확인, 잠재지문의 실측 오류율(위양성 0.1%·위음성 7.5%), 독립 재검토의 오류 검출 결과.최초 작성 시 근거가 2016년 평가에 묶여 있었고 그 한계를 스스로 기록해 두었다. PCAST 이후 재검토를 찾아 교흔 등급이 갱신되지 않은 근거에 의존하지 않음을 확인했고, B등급의 오류율을 실제 수치로 확보했다. 등급 자체는 바뀌지 않았다. 독립 재검토를 산출 조건으로 삼을지는 별도 결정 사항으로 남겼다.
- 2026-07-25결정 5(데이터 가용성 확인)를 추가하고, A등급 분야에도 같은 역전이 있을 수 있음을 한계에 기록.ADR-0012 에서 발견한 결함이 이 기록에도 동일하게 있었다. PCAST 평가를 근거로 등급을 매겼을 뿐 그 분야의 자료를 우리가 다룰 수 있는지는 확인하지 않았다. 프로파일링에서만 고치고 법의학을 두면 같은 실수가 남는다.
hub담당 리더
마디L60
시스템 총괄 · Master API Gateway
대한민국 변호사급 / 법원행정처 전산정보국장 출신급
설계로그는 특정 법률 분야가 아니라 시스템 전체의 설계 결정을 다룬다. 개별 도메인 리더가 아니라 60명 리더 시스템의 운영·품질을 총괄하는 리더가 담당한다.
리더 프로필 보기 arrow_forward