이름은 비슷한데 하는 일이 다른 자율 최적화 도구가 셋 있어, 어느 것을 골라야 할지 헷갈리기 쉽습니다. 자율 최적화(autoresearch)란 AI가 스스로 코드를 고쳐 보고, 좋아지면 남기고 나빠지면 되돌리는 반복 실험입니다. 세 도구의 이름은 karpathy/autoresearch, /autoresearch, autoresearch-skill입니다. karpathy/autoresearch는 유명 AI 연구자 안드레이 카파시가 공개한 도구입니다. /autoresearch는 Claude Code 안에서 /로 불러 쓰는 명령입니다. autoresearch-skill은 스킬(AI에게 특정 작업 방법을 알려 주는 지시문)만 다듬는 도구입니다. 이 글은 셋이 무엇을 고치는지, 좋아졌는지를 어떻게 재는지, 실험을 어떻게 반복하는지를 나란히 놓고 비교합니다. 결론부터 말하면 셋은 고치는 대상과 판단 잣대, 필요한 장비가 다릅니다.
유명 AI 연구자 안드레이 카파시가 공개한 자율 최적화 도구입니다. 고치는 대상은 AI 모델을 학습시키는 코드 한 파일입니다. 그 파일의 이름이 train.py입니다. AI가 이 파일을 스스로 고쳐 가며 실험을 반복합니다. 나아졌는지는 모델이 다음 글자를 얼마나 잘 맞히는지 재는 점수(val_bpb)로 확인합니다. 이 점수는 낮을수록 좋습니다. 대신 대규모 연산 장비(GPU)가 반드시 필요합니다.
TSVClaude Code 안에서 /를 붙여 부르는 명령입니다. 머신러닝, 웹, 플러터, 자바 등 프로젝트 종류를 스스로 알아봅니다. 무엇을 기준으로 좋아졌다고 볼지, 즉 메트릭(판단 잣대)을 직접 정할 수 있습니다. 실험마다 코드를 따로 담아 두는 작업 가지(브랜치)를 자동으로 만듭니다. 어떤 실험을 했는지 작업 이력도 함께 남깁니다.
TSV+
Claude Code의 '스킬'(AI에게 특정 작업 방법을 알려주는 지시문)만 다듬는 도구입니다. 스킬이 담긴 파일 SKILL.md를 조금씩 고쳐 가며 실험을 반복합니다. 나아졌는지는 됐다/안 됐다 두 갈래로만 매기는 점검 항목 3~6개로 확인합니다. 결과를 한눈에 보는 화면(대시보드)도 자동으로 만들어 줍니다.
| 항목 | karpathy/autoresearch | /autoresearch | autoresearch-skill |
|---|---|---|---|
| 고치는 대상 | AI 학습 코드만train.py 라는 학습 코드 파일 하나를 직접 고침 |
모든 종류의 프로젝트 머신러닝, 웹, 플러터, 자바, 직접 설정 |
스킬 지시문만SKILL.md 지시문 파일 하나만 고침 |
| 잘됐는지 판단 | val_bpb (bits-per-byte)다음 글자를 맞히는 데 든 비트 수를 잰 점수. 이어지는 숫자라 아주 작은 향상도 잡아냄 |
기준을 직접 정함 종류에 맞춰 자동 + 직접 지정 |
예·아니오 점검표 확인 항목 3~6개 |
| 실험 반복 | 한 번에 약 5분 고성능 장비(GPU) 필수 |
종류에 맞춰 자동 설정 여러 실험 동시 진행 |
지시문을 빠르게 반복 수정 고성능 장비 불필요 |
| 기록 방식 | results.tsv실험 번호·설명·점수를 탭으로 나눈 표 파일에 기록 |
results.tsv + experiments.jsonl표 파일에 더해 실험마다 한 줄씩 쌓는 기록 파일을 작업 이력과 연결해 저장 |
changelog.md + dashboard.html무엇을 바꿨는지 적는 변경 이력 파일과 결과 화면을 자동 생성 |
| 쓰임새 범위 | 학습 전용 | 어디에나 | 스킬 전용 |
| 버전 관리 연동 | 사람이 직접 저장 | 작업 가지(브랜치) 자동 생성autoresearch/exp-{id} |
변경 이력만 남김 |
| 가장 잘하는 것 | AI 연구 최적화에 특화 많은 사용자에게 검증됨(GitHub 별 43.7k) |
어떤 프로젝트에서든 바로 쓸 수 있음 |
지시문 다듬기 전용 작업 흐름 |
| 시작 난이도 | 높음, 고성능 장비(GPU)가 있어야 함 | 낮음, 알아서 설정함 | 낮음, 글자 파일만 고치면 됨 |
karpathy는 AI 학습 과정에만 완전히 맞춰져 있습니다. /autoresearch는 프로젝트 종류를 스스로 알아보고 어디서든 작동합니다. autoresearch-skill은 스킬 파일 하나만 집중해서 다듬습니다. 다루는 범위가 다르니, 각각 어울리는 상황도 달라집니다.
karpathy가 쓰는 글자 맞히기 점수(val_bpb)는 이어지는 숫자라서 아주 작은 향상도 잡아냅니다. /autoresearch는 프로젝트에 맞춰 판단 잣대를 그때그때 정합니다. autoresearch-skill의 예·아니오 채점은 분명하지만 미세한 차이는 가리기 어렵습니다. 이 잣대를 어떻게 잡느냐가 실험의 질을 좌우합니다.
karpathy는 고성능 연산 장비(GPU) 없이는 실험조차 할 수 없습니다. /autoresearch는 Claude Code만 있으면 어디서든 돌아갑니다. autoresearch-skill은 글자 파일만 고치면 되니 필요한 것이 가장 적습니다. 시작이 쉬울수록 적용 범위는 좁아지는 맞교환 관계입니다.