
AI가 추천했고, 담당자가 승인했습니다. 그렇다면 결정은 누가 내렸을까요?
대출 심사 AI가 한 고객을 "거절"로 분류했다고 가정해 보겠습니다.
담당자는 화면에 뜬 결과를 확인하고 승인 버튼을 누릅니다.
서류에는 사람이 검토했다고 기록됩니다.
하지만 담당자가 거절 이유를 모른다면, 그 승인은 도장을 찍은 행위에 가깝습니다.
MIT 슬론 매니지먼트 리뷰와 BCG는 이런 상황을 러버 스탬핑이라고 부릅니다.
내용을 따지지 않고 형식적으로 도장만 찍는다는 뜻입니다.
에그코드도 서비스를 개발하면서 AI가 제안한 코드를 매일 검토합니다.
그래서 이 연구가 짚은 AI거버넌스 문제를 남의 일로 넘기기 어려웠습니다.

감독만으로는 설명을 대신할 수 없습니다
AI의 판단 과정에 사람을 넣는 방식을 휴먼인더루프(HITL)라고 합니다.
그렇다면 사람이 감독하기만 하면, AI가 이유를 설명하지 못해도 괜찮을까요?
연구진이 AI 전문가 30명에게 이 질문을 던졌습니다.
77%가 반대했고, 동의한 사람은 3%에 그쳤습니다.
AI와 판단이 엇갈려도, 이유를 모르는 감독자는 무엇이 옳은지 가릴 수 없습니다.
AI거버넌스에서 설명이 빠진 감독은 감독의 형식만 갖춘 절차입니다.

원칙 1. 근거를 보여주도록 설계합니다
거버넌스는 조직이 결정을 내리고 그 결정에 책임지는 체계를 뜻합니다.
AI거버넌스는 사람이 검토할 재료를 시스템이 먼저 내놓는 데서 출발합니다.
결과와 함께 그 결과를 뒷받침하는 근거와 반대 근거를 보여줘야 합니다.
신뢰도 점수, 감사 로그(변경 이력), 사람에게 넘길 조건도 여기에 속합니다.
연 매출 1억 달러 이상 기업의 임원 1,221명에게도 물었습니다.
이런 설계를 감독 수단으로 꼽은 비율은 28%였습니다.
이유를 볼 수 없는 AI블랙박스 앞에서는 누구도 제대로 검토할 수 없습니다.

원칙 2. AI의 한계를 아는 사람이 검토합니다
업무를 잘 아는 것만으로는 충분하지 않습니다.
검토자는 AI가 어디서 자주 틀리고 어떤 편향을 보이는지도 알아야 합니다.
같은 조사에서 기업들이 가장 많이 꼽은 감독 수단도 사용자 교육(54%)이었습니다.
AI의 한계를 모르면, 그럴듯한 오답을 걸러내기 어렵습니다.
원칙 3. 검토의 깊이를 결정마다 다르게 정합니다
모든 추천을 똑같이 깊게 검토할 수는 없습니다.
예상과 다른 의료 진단처럼 무거운 결정은 매번 설명을 확인해야 합니다.
재고나 가격 추천처럼 영향이 작은 결정은 주기적으로 점검해도 됩니다.
연구진은 이 과정에서 보여주기용 설명을 경계하라고 강조합니다.

원칙 4. 통제하고 있다는 착각을 피합니다
설명 자료가 있어도 검토자가 이해하지 못하면 달라지는 것이 없습니다.
승인 기록은 남지만, 실제로 판단한 사람은 없는 상태가 됩니다.
반대로 설명하기 어려운 모델에 설명만 과하게 요구해도 통제한다는 착각이 생깁니다.
그래서 연구진은 형식을 갖췄는지보다 실제 현장에서 작동하는지를 보라고 권합니다.

마치며: 어디서 멈출지 먼저 정해 두세요
사람이 모든 AI 결정을 완벽하게 이해할 수는 없습니다.
그래서 반드시 멈추고 이유를 확인할 결정이 무엇인지 미리 정해 둬야 합니다.
좋은 AI거버넌스는 두꺼운 규정집보다 이 기준 하나에서 시작합니다.
개발을 맡길 때도 마찬가지입니다.
AI로 만든 기획안이나 견적도 항목마다 이유를 듣고 승인하세요.
이해하지 못한 채 승인했다면, 그것은 결정이 아니라 서명입니다.
원문: MIT Sloan Management Review × BCG, "AI Explainability: How to Avoid Rubber-Stamping Recommendations"
함께 읽어보세요 — 대화가 길어질수록 AI가 헛소리하는 3가지 이유 · AI 코딩 보안, 해킹당하는 진짜 이유 5가지 · AI 에이전트부터 시작하는 AX 구축 5단계 로드맵