설계로그 목록
ADR-0011 프로파일링 AI (수사 지원) 설계중

되먹임 차단 — 우리 산출물이 만든 결과를 다시 학습하지 않는다

작성 2026-07-25 · 최종 갱신 2026-07-25

프로파일링 문헌 조사에서 기존 기록이 다루지 않은 위험이 확인됐다. 예측이 수사 자원의 배치를 바꾸고 그 배치가 다시 데이터를 만들면, 시스템은 자기가 만든 결과를 근거로 자기 예측을 강화한다. 산출물이 유도한 사건을 학습·평가에서 분리하고, 분리할 수 없으면 그 자료를 쓰지 않는다.

이 문서는 연구·설계 기록이며, 현재 제공 중인 서비스가 아닙니다. 각 항목의 상태 표기를 함께 확인해 주세요.

맥락

ADR-0002 는 판결문 데이터의 생존 편향을 다뤘다. 그것은 데이터가 이미 기울어져 있다는 문제다. 되먹임은 다른 문제다. 시스템이 가동된 뒤 우리가 데이터를 기울인다.

구조는 단순하다. 산출물이 어떤 방향을 가리키면 그 방향에 수사 자원이 더 배치되고, 자원이 더 간 곳에서 사건이 더 많이 확인된다. 그 결과가 다시 자료로 쌓이면 시스템은 자기 예측이 맞았다고 학습한다.

예측 치안 영역에서는 이 되먹임이 실증적으로 분석되어 있다. 실제 범죄율과 무관하게 같은 지역으로 반복 배치가 일어나는 현상이 보고되었고, 지역 간 실제 격차가 클수록 되먹임이 심해진다는 점도 함께 제시되었다(Ensign 외, 2017). 편향된 데이터로 학습된 예측 치안 시스템의 사회적 결과 역시 별도로 다루어져 있다(Lum & Isaac, 2016).

이 위험은 앞선 어느 기록에도 없다. ADR-0010 이 평가 기준을 정했지만, 평가 표본 자체가 시스템에 의해 오염되면 그 기준은 무의미해진다.

검토한 대안

대안 A기각

운용 중 축적되는 사건 자료를 그대로 학습·평가에 사용한다.

시스템이 유도한 결과가 시스템의 근거가 된다. 정확도가 올라가는 것처럼 보이지만 측정하는 것은 예측력이 아니라 자기 일관성이다. ADR-0010 의 기준선 비교가 성립하지 않는다.

대안 B보류

되먹임 보정 기법을 적용해 오염된 자료를 그대로 쓴다.

입력을 조정해 되먹임을 막는 방법이 제시되어 있으나(Ensign 외, 2017), 그 효과는 가정에 의존한다. 보정이 실제로 작동했는지 확인하려면 오염되지 않은 비교군이 필요하고, 그 비교군을 만드는 것이 결정 1 이다. 순서상 뒤에 온다.

대안 C채택

산출물이 유도한 사건을 표시해 분리하고, 분리 불가한 자료는 쓰지 않는다.

되먹임을 사후에 보정하는 대신 애초에 섞이지 않게 한다. 표시는 운용 시점에만 할 수 있으므로 설계 단계에서 정해 두어야 한다.

결정

  1. 산출물이 어떤 형태로든 관여한 사건에는 그 사실을 기록한다. 시스템이 제시한 가설이 채택되었는지 여부와 무관하게, 산출물이 열람되었다는 사실 자체를 표시한다.
  2. 표시된 사건은 학습 데이터에서 제외한다. 시스템이 만든 결과로 시스템을 학습시키지 않는다.
  3. ADR-0010 의 성능 평가에서도 표시된 사건을 제외한다. 제외 후 남은 표본이 평가에 부족하면 평가 불가로 보고하고, 부족한 표본으로 산출한 수치를 제시하지 않는다.
  4. 표시가 불가능한 자료는 학습·평가 어디에도 쓰지 않는다. 출처를 구분할 수 없는 자료는 오염 여부를 알 수 없으므로 오염된 것으로 취급한다.
  5. G1 단계는 확정 판결문만 쓰므로 되먹임이 발생하지 않는다. 이 결정은 G2 진입 전에 구현되어 있어야 하며, 구현 없이 G2 로 올리지 않는다.

근거

이 결정이 만드는 한계

폐기 조건

근거자료

인용 법령

참고자료

담당 리더

마디 리더

마디L60

시스템 총괄 · Master API Gateway

대한민국 변호사급 / 법원행정처 전산정보국장 출신급

설계로그는 특정 법률 분야가 아니라 시스템 전체의 설계 결정을 다룬다. 개별 도메인 리더가 아니라 60명 리더 시스템의 운영·품질을 총괄하는 리더가 담당한다.

리더 프로필 보기

관련 기록

ADR-0002ADR-0008ADR-0010