Comparative Analysis · 3 Approaches to Autonomous Optimization

Autoresearch 세 도구는
고치는 대상부터
다르다

이름은 비슷한데 하는 일이 다른 자율 최적화 도구가 셋 있어, 어느 것을 골라야 할지 헷갈리기 쉽습니다. 자율 최적화(autoresearch)란 AI가 스스로 코드를 고쳐 보고, 좋아지면 남기고 나빠지면 되돌리는 반복 실험입니다. 세 도구의 이름은 karpathy/autoresearch, /autoresearch, autoresearch-skill입니다. karpathy/autoresearch는 유명 AI 연구자 안드레이 카파시가 공개한 도구입니다. /autoresearch는 Claude Code 안에서 /로 불러 쓰는 명령입니다. autoresearch-skill은 스킬(AI에게 특정 작업 방법을 알려 주는 지시문)만 다듬는 도구입니다. 이 글은 셋이 무엇을 고치는지, 좋아졌는지를 어떻게 재는지, 실험을 어떻게 반복하는지를 나란히 놓고 비교합니다. 결론부터 말하면 셋은 고치는 대상과 판단 잣대, 필요한 장비가 다릅니다.

세 가지 접근법
karpathy/autoresearch

AI 학습 코드에 특화

유명 AI 연구자 안드레이 카파시가 공개한 자율 최적화 도구입니다. 고치는 대상은 AI 모델을 학습시키는 코드 한 파일입니다. 그 파일의 이름이 train.py입니다. AI가 이 파일을 스스로 고쳐 가며 실험을 반복합니다. 나아졌는지는 모델이 다음 글자를 얼마나 잘 맞히는지 재는 점수(val_bpb)로 확인합니다. 이 점수는 낮을수록 좋습니다. 대신 대규모 연산 장비(GPU)가 반드시 필요합니다.

43.7k
GitHub Stars
5min
실험 한 번 시간
TSV
결과 형식(탭으로 나눈 표 파일)
/autoresearch

어떤 프로젝트에나 적용

Claude Code 안에서 /를 붙여 부르는 명령입니다. 머신러닝, 웹, 플러터, 자바 등 프로젝트 종류를 스스로 알아봅니다. 무엇을 기준으로 좋아졌다고 볼지, 즉 메트릭(판단 잣대)을 직접 정할 수 있습니다. 실험마다 코드를 따로 담아 두는 작업 가지(브랜치)를 자동으로 만듭니다. 어떤 실험을 했는지 작업 이력도 함께 남깁니다.

Auto
종류 자동 감지
TSV+
실험 기록(표 파일과 이력)
Git
작업 가지(브랜치) 자동
autoresearch-skill

스킬 지시문 다듬기

Claude Code의 '스킬'(AI에게 특정 작업 방법을 알려주는 지시문)만 다듬는 도구입니다. 스킬이 담긴 파일 SKILL.md를 조금씩 고쳐 가며 실험을 반복합니다. 나아졌는지는 됐다/안 됐다 두 갈래로만 매기는 점검 항목 3~6개로 확인합니다. 결과를 한눈에 보는 화면(대시보드)도 자동으로 만들어 줍니다.

3~6
평가 기준
yes/no
예·아니오 평가
HTML
결과 화면(웹 페이지 파일)
상세 비교표
항목 karpathy/autoresearch /autoresearch autoresearch-skill
고치는 대상 AI 학습 코드만
train.py 라는 학습 코드 파일 하나를 직접 고침
모든 종류의 프로젝트
머신러닝, 웹, 플러터, 자바, 직접 설정
스킬 지시문만
SKILL.md 지시문 파일 하나만 고침
잘됐는지 판단 val_bpb (bits-per-byte)
다음 글자를 맞히는 데 든 비트 수를 잰 점수. 이어지는 숫자라 아주 작은 향상도 잡아냄
기준을 직접 정함
종류에 맞춰 자동 + 직접 지정
예·아니오 점검표
확인 항목 3~6개
실험 반복 한 번에 약 5분
고성능 장비(GPU) 필수
종류에 맞춰 자동 설정
여러 실험 동시 진행
지시문을 빠르게 반복 수정
고성능 장비 불필요
기록 방식 results.tsv
실험 번호·설명·점수를 탭으로 나눈 표 파일에 기록
results.tsv + experiments.jsonl
표 파일에 더해 실험마다 한 줄씩 쌓는 기록 파일을 작업 이력과 연결해 저장
changelog.md + dashboard.html
무엇을 바꿨는지 적는 변경 이력 파일과 결과 화면을 자동 생성
쓰임새 범위 학습 전용 어디에나 스킬 전용
버전 관리 연동 사람이 직접 저장 작업 가지(브랜치) 자동 생성
autoresearch/exp-{id}
변경 이력만 남김
가장 잘하는 것 AI 연구 최적화에 특화
많은 사용자에게 검증됨(GitHub 별 43.7k)
어떤 프로젝트에서든
바로 쓸 수 있음
지시문 다듬기
전용 작업 흐름
시작 난이도 높음, 고성능 장비(GPU)가 있어야 함 낮음, 알아서 설정함 낮음, 글자 파일만 고치면 됨
실험이 도는 순서
karpathy/autoresearch
1
아이디어 내기
AI가 '이렇게 바꾸면 좋아질까' 가설을 냄
2
학습 코드(train.py) 고치기
떠올린 아이디어를 학습 코드 파일에 옮김
3
GPU로 학습 돌리기
실험 한 번에 약 5분
4
점수(val_bpb) 재기
다음 글자를 얼마나 잘 맞히는지 확인(낮을수록 좋음)
5
결과표(results.tsv)에 기록
실험 번호와 점수를 표 파일에 저장
6
다음 실험 고르기
지난 결과를 보고 다음 실험 결정
/autoresearch
1
프로젝트 종류 파악
머신러닝·웹·플러터·자바 구분
2
판단 기준 정하기
종류에 맞는 '좋음'의 잣대 결정
3
작업 가지(브랜치) 만들기
autoresearch/exp-{id}
4
코드 변경 적용
자동으로 빌드하고 검사
5
결과를 파일로 기록
작업 이력과 함께 저장
6
남길지 버릴지 결정
기준으로 비교해 좋으면 반영
autoresearch-skill
1
스킬 지시문 파일(SKILL.md) 열기
지금 지시문이 어떻게 적혀 있는지 살펴봄
2
채점 기준 정하기
예·아니오 항목 3~6개
3
고친 지시문 여러 개 만들기
서로 다른 개선안 생성
4
예·아니오로 채점
항목마다 됐다/안 됐다 판정
5
변경 이력(changelog.md) 갱신
무엇을 바꿨는지 변경 이력 파일에 자동 저장
6
결과 화면 만들기
결과를 한눈에 보게 자동 갱신
핵심 차이 3가지
01

무엇을 고치느냐

karpathy는 AI 학습 과정에만 완전히 맞춰져 있습니다. /autoresearch는 프로젝트 종류를 스스로 알아보고 어디서든 작동합니다. autoresearch-skill은 스킬 파일 하나만 집중해서 다듬습니다. 다루는 범위가 다르니, 각각 어울리는 상황도 달라집니다.

02

좋아졌는지 재는 방식

karpathy가 쓰는 글자 맞히기 점수(val_bpb)는 이어지는 숫자라서 아주 작은 향상도 잡아냅니다. /autoresearch는 프로젝트에 맞춰 판단 잣대를 그때그때 정합니다. autoresearch-skill의 예·아니오 채점은 분명하지만 미세한 차이는 가리기 어렵습니다. 이 잣대를 어떻게 잡느냐가 실험의 질을 좌우합니다.

03

장비가 얼마나 필요한가

karpathy는 고성능 연산 장비(GPU) 없이는 실험조차 할 수 없습니다. /autoresearch는 Claude Code만 있으면 어디서든 돌아갑니다. autoresearch-skill은 글자 파일만 고치면 되니 필요한 것이 가장 적습니다. 시작이 쉬울수록 적용 범위는 좁아지는 맞교환 관계입니다.

GitHub 링크