"사용자가 이걸 보면 뭐라고 할까?"
문제는 AI가 결과물을 다 만들고 나서야 사용자가 잘못을 발견하고 화를 낸다는 것이었습니다. 그래서 harsh-critic(가혹한 비평가라는 뜻의 점검 도구)을 만들었습니다. 사용자가 실제로 화낸 메시지에서 뽑은 분노 패턴을 체크리스트(점검 목록)로 만들고, 결과물이 사용자에게 가기 전에 그 목록으로 먼저 검사해 걸러냅니다. 이 도구는 하네스(harness, AI가 다 했다고 거짓말 못 하게 증거를 강제하는 감시 장치)의 한 부품입니다.
AI가 결과물을 제출합니다 → 사용자가 확인합니다 → 문제를 발견합니다 → 화를 냅니다 → 다시 하라고 지시합니다. 이 순서가 매번 반복됩니다. 같은 실수가 되풀이되고, 사용자의 신뢰는 떨어집니다.
AI가 결과물을 완성합니다 → harsh-critic이 사용자 눈으로 미리 읽어 봅니다(사용자 관점 시뮬레이션) → 문제를 미리 발견합니다 → 자동으로 고칩니다 → 사용자는 깨끗한 결과만 봅니다.
지어낸 상황이 아닙니다. 사용자의 실제 불만 메시지를 자동으로 모으는 스크립트(정해진 일을 대신 해 주는 작은 프로그램)가 있습니다. 그 분노 패턴을 거꾸로 뜯어보며 점검 목록을 만듭니다. 아래 따옴표 안은 실제 메시지이고, 화살표 뒤는 거기서 뽑아낸 점검 항목과 위험 등급입니다.
EXTREME
BLOCKBLOCKBLOCKHIGH
FAILFAILFAILFAILFAILFAILMEDIUM
WARNINGWARNINGWARNINGWARNINGFINDING 0 → PASSharsh-critic은 스스로 발전하는 이 하네스 시스템의 세 겹 방어선 가운데 하나입니다. 아래 순서로는 두 번째 층을 맡습니다.
코드에 나타나는 위험한 패턴을 막습니다. hook(정해진 시점마다 자동으로 실행되는 검사 스크립트)이 이 일을 합니다. 잘못된 파일 구조, 품질 미달 코드, 금지된 저장 방식 같은 문제를 자동 검사 스크립트 12개가 발견하면 작업을 강제로 멈춥니다. 이것은 코드 수준의 방어입니다.
일하는 방식에서 나오는 문제를 막습니다. "확인해주세요"라며 사용자에게 떠넘기기, 검증 건너뛰기, 요청 범위 잘못 이해하기가 여기에 해당합니다. 이것은 행동 수준의 방어입니다. 앞의 코드 검사로는 잡히지 않는 영역입니다.
Claude가 미처 못 본 곳을 채웁니다. 다른 회사의 코딩 AI인 Codex(모델은 GPT-5.4)가 놓친 보안 허점이나 드물게 터지는 예외 상황을 찾아냅니다. 이것은 모델 수준의 방어입니다.
harsh-critic의 점검 목록은 고정돼 있지 않습니다. 사용자가 새로운 방식으로 불만을 드러낼 때마다 목록이 스스로 늘어납니다.
불만 감지 스크립트가 "왜이래", "안돼", "또" 같은 표현을 자동으로 잡아냅니다. 이어서 자가개선 절차(AI가 자기 작업 방식을 스스로 고치는 정기 점검)가 그 패턴을 분석하고, harsh-critic 점검 목록에 새 항목을 자동으로 더합니다.