AI에게 일을 맡기는 방식은 크게 두 갈래로 갈립니다. 여러 AI를 모아 회사처럼 굴릴 것인가, AI 하나를 실수에서 배우게 해 점점 강하게 키울 것인가. 문제는 두 길이 실제로 무엇에 강하고 무엇에 약한지, 겉으로 봐서는 알 수 없었다는 점입니다. 그래서 각 길의 대표 시스템을 하나씩 골라 같은 기준 위에 나란히 놓고 비교했습니다. 결론부터 말하면 스스로 개선하기와 품질 검사(QA, 만든 것이 제대로 동작하는지 확인하는 검사)는 루프에라가 앞서고, 여러 AI 지휘와 비용 관리는 Paperclip이 앞섭니다. Paperclip은 여러 AI 일꾼(에이전트, 사람 대신 작업을 맡아 도구를 부리는 AI)을 모아 회사처럼 굴리는 오픈소스 도구입니다. 루프에라는 제 개인 개발 셋업(저장소 이름은 cc-sync)으로, 코딩 AI 한 명이 실수에서 배워 스스로 더 똑똑해지게 만든 구성입니다. 비교 기준은 스스로 개선하기, 품질 검사, 여러 AI 지휘하기, 오류 복구, 기억력, 통제 장치, 이렇게 6가지입니다.
| 항목 | Paperclip | 루프에라 (개인 셋업 cc-sync) |
|---|---|---|
| 한 줄 구호 | "Zero-human companies" | "AI가 스스로 개선하는 시대" |
| 목표 | AI 일꾼들로 회사 전체를 굴리기 | AI 개발 도우미가 스스로 진화하는 작업 흐름 |
| 규모 | GitHub 별 4만5천+ 개. 코드 전체가 한 저장소에 모인 모노레포(monorepo) 방식의 TypeScript 프로젝트. 오픈소스(라이선스는 누구나 자유롭게 가져다 쓰고 고쳐도 되는 MIT) |
개인 개발 환경. 터미널에서 쓰는 코딩용 AI인 Claude Code 위에서 동작 |
| 접근 방식 | 아래에서 위로 쌓기. AI 일꾼을 다루는 도구 위에 '조직' 층을 얹음 | 겪으며 쌓기. 실수를 겪을 때마다 규칙을 스스로 만들어 냄 |
핵심 차이: Paperclip은 여러 AI를 회사처럼 지휘하는 '관제탑'입니다. 루프에라는 AI 하나가 스스로를 고쳐 가며 점점 혼자 알아서 하게 되는 '성장 라인'입니다. 여기서 라인이란 한 작업이 끝나면 다음 작업이 자동으로 이어지는 처리 흐름을 말합니다.
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 작동 방식 | 평가(evals, AI의 답을 미리 정한 기준과 대조해 점수를 매기는 검사)로 회귀(regression, 예전에 되던 기능이 다시 망가지는 것)가 없는지 확인. 평가 도구로는 promptfoo를 씀 | 버그 수정 기록을 감지하면 → 그 실수를 막는 규칙을 자동으로 새로 씀 | 루프에라 |
| 배움의 단서 | AI 행동 평가(evals) 결과 | 4가지 (버그 수정 기록, 사용자 불만 표현, 기억 저장소에 쌓인 사실, 재시도 흔적) | 루프에라 |
| 자동 실행 | 평가를 사람이 직접 돌림 | 스스로 켜짐. 작업을 끝내면 다음 작업을 시작할 때 알아서 돎 | 루프에라 |
| 말뿐인 규칙 → 강제 규칙 승격 (권고 문장을 코드가 직접 막는 규칙으로 올리기) | 없음 | 같은 실수가 2번 넘게 나오면 자동으로 강제 규칙이 됨 | 루프에라 |
| 여러 프로젝트에 걸친 학습 | 없음 (회사끼리 서로 분리돼 있음) | 2개 이상 프로젝트에서 겹치는 규칙 → 전체 공용 규칙으로 올림 | 루프에라 |
스스로 개선하는 능력은 루프에라가 크게 앞섭니다. Paperclip에는 '실수에서 배워 규칙을 스스로 강화하는' 반복 고리(루프, 실수가 규칙이 되고 그 규칙이 다음 실수를 막는 순환)가 없습니다. Paperclip의 평가(evals)는 예전 기능이 망가지지 않게 지키는 용도일 뿐, 스스로 진화하기 위한 것은 아닙니다.
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 관문의 강도 | 코드를 올릴 때마다 서버에서 타입 검사+테스트+빌드를 자동으로 돌리는 검사 라인(지속적 통합, 줄여서 CI) |
강제 차단 장치인 훅(hook, 코드를 올리는 순간처럼 정해진 시점에 자동으로 끼어드는 검사 프로그램). 서버 검사를 기다리지 않고 내 컴퓨터에서 바로 막음 | 루프에라 |
| 코드 올리기 차단 | 변경 제안(PR) 단계에서 자동 검사가 실패할 때 | 코드 올리는 행위 자체를 내 컴퓨터에서 막음 | 루프에라 |
화면(브라우저) 테스트. 사용자가 하듯 화면을 처음부터 끝까지 눌러 보는 검사로, 보통 Playwright 같은 화면 자동 조작 도구로 돌림(영어 약자로 E2E) |
Playwright E2E (CI) |
검사 도구 3개로 교차 확인 (화면 검사 + 요소 확인 + 자율 테스트) | 루프에라 |
| 두 번 교차 검토 | 없음 (자동 검사 한 번뿐) | Claude가 검사하고, 다른 회사의 AI인 Codex(GPT-5.4)가 한 번 더 교차 검토 | 루프에라 |
| 품질 검사 자동화 | '완료 기준' 문서 (사람이 지켜야 할 규칙) | 사용자 역할을 맡은 AI(user-proxy)가 결과물을 직접 써 보는 대리 검사를 자동으로 반복. 훅(hook)이 강제로 돌림 | 루프에라 |
| AI 행동 검증 | AI 행동 평가(evals) 도구 promptfoo | 없음 (AI 행동 평가가 없음) | Paperclip |
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 지휘 구조 | 회사 조직도처럼 계층 (대표→기술책임자→개발자) | 일 규모에 따라 지휘자(1인 관리 / 팀)를 자동 선택 | Paperclip |
| AI 종류의 다양성 | 7종 AI 연결 (Claude, Codex, Cursor, Gemini 등) | Claude Code가 중심 + Codex가 보조 | Paperclip |
| 동시 작업 충돌 방지 | 한 번에 하나씩 꺼내 쓰기 + 잠금 | 보조 AI가 건드릴 영역을 검사 스크립트(자동으로 도는 작은 검사 프로그램)로 나눔 | Paperclip |
| 비용 관리 | AI마다 한 달 예산 배정 + 넘으면 자동 정지 | 없음 | Paperclip |
| 목표와 연결 | 작업 → 목표 → 회사 사명으로 거슬러 추적 | 없음 (작업 하나하나만 봄) | Paperclip |
| 정기 깨우기(하트비트) | 정해진 시간마다 AI를 자동으로 깨움 | 없음 (한 작업 안에서 순서대로 실행) | Paperclip |
| 여러 회사 분리 | 여러 회사를 서로 완전히 따로 운영 | 사용자 한 명 전용 | Paperclip |
여러 AI를 지휘하는 능력은 Paperclip이 크게 앞섭니다. '회사'를 굴리기 위한 뼈대인 조직도, 예산, 통제 규칙이 처음부터 핵심으로 들어가 있습니다. 반대로 루프에라는 개인 개발자 한 명의 작업 흐름에 맞춰져 있습니다.
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 자동 재시도 | 없음 (사람이 직접 복구) | 방법을 바꿔 가며 4번 재시도 (직접 수정→구조 바꾸기→다른 AI에 구조 요청→처음부터 다시) | 루프에라 |
| 막히면 다른 AI로 전환 | 없음 | 3번째 시도에서 GPT-5.4로 바꿈 | 루프에라 |
| 사람에게 넘기기 | 관리자 AI에게 다시 맡김 | 텔레그램으로 사람에게 알림 | 동등 |
| AI 상태 추적 (쉬는 중, 일하는 중, 오류, 이렇게 AI가 지금 어떤 상태인지 기록) | idle→running→error→idle |
없음 (AI가 지금 무슨 상태인지 추적 안 함) | Paperclip |
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 작업 이어가기 (끊긴 작업을 어디까지 했는지 저장해 두었다가 그 자리에서 다시 시작) | 작업 기록을 저장하는 데이터베이스 표(agentTaskSessions) | session-state-save/restore hook |
동등 |
| 오래 남는 기억 (세션이 끝나도 사라지지 않는 장기 기억. 예를 들어 대화에서 뽑은 사실(facts)을 파일 하나짜리 데이터베이스인 SQLite에 쌓아 두는 식) | 2단 기억 구조 (아직 설계 단계) | memory-bank (2,623 facts, SQLite) |
루프에라 (이미 완성) |
| 맥락 이어붙이기 (대화가 길어져 AI 머릿속을 압축할 때 중요한 내용을 잃지 않게 붙드는 장치. 압축 직전·직후에 자동으로 끼어드는 훅을 각각 PreCompact·PostCompact 훅이라 부름) | 주기적으로 맥락 갱신 + 어디까지 읽었는지 표시 | PreCompact/PostCompact hook |
Paperclip |
| 지난 작업 다시 찾기 | 없음 (1버전 기준) | 지난 기억을 뜻이 비슷한 것끼리 찾아 주는 의미 검색(지난 세션의 일화를 되짚는 도구 episodic-memory) |
루프에라 |
| 항목 | Paperclip | 루프에라 | 승자 |
|---|---|---|---|
| 사람이 개입하는 지점 | 경영진 승인 관문 (채용·전략 결정 때) | 사용자 대리 AI가 자동 판단 + 필요하면 텔레그램으로 사람 호출 | 설계 철학 차이 |
| 기록 추적(감사·audit, 나중에 누가 무엇을 했는지 되짚을 수 있는 기록) | 모든 AI 행동을 한 줄씩 덧붙이기만 하고 한 번 쓰면 고칠 수 없는(append-only) 활동 기록 표(activity_log) |
기억 저장소 + 한 줄에 기록 하나씩 쌓는 줄 단위 로그(형식은 JSONL) |
Paperclip |
| 권한 관리 | AI마다 예산 + 역할 부여 | 보조 AI의 작업 영역을 스크립트로 제한 | Paperclip |
조직도·예산·통제·기록 추적이 핵심입니다. 수십~수백 개의 AI와 여러 프로젝트를 동시에 굴리는 것을 전제로 만든 도구입니다.
강점: 규모를 키우기 쉬움, 비용 통제, 여러 회사 분리 운영
'실수 → 규칙 만들기 → 훅(hook, 자동 감시 장치) → 다음엔 차단' 흐름이 핵심입니다. 개발자 한 명이 여러 프로젝트를 다루며 스스로 진화하는 처리 라인입니다.
강점: 스스로 진화, 강한 품질 강제, 여러 프로젝트에 걸친 학습
지금은 전체 토큰(AI가 주고받는 글자 단위) 사용량만 봅니다. AI마다 예산을 정해 두는 개념은 없습니다. 지휘 AI가 실무 AI를 끝없이 재시도시키면 비용이 폭발할 수 있습니다.
Atomic Checkout이란 작업 하나를 한 번에 한 AI만 꺼내 가도록 잠그는 방식입니다(atomic은 '중간에 끼어들 수 없는 한 번의 동작'이라는 뜻). 여러 AI를 팀으로 굴릴 때, 두 실무 AI가 같은 파일을 동시에 고칠 위험이 있습니다. 루프에라에는 이렇게 작업을 잠가서 같은 파일을 두 AI가 동시에 고치지 못하게 막는 장치가 없습니다.
Claude·Codex 말고 Cursor, Gemini 같은 다른 AI까지 일꾼으로 쓰면 더 다양한 시각을 얻습니다.
각 작업이 상위 목표까지 거슬러 연결되면, '왜 이 일을 하는지' 맥락을 잃지 않습니다.
루프에라는 지금 한 줄에 기록 하나씩 덧붙이는 줄 단위 로그로 AI 행동을 남깁니다. 그보다 더 정돈된 activity_log 라는 표로 모든 AI 행동을 기록·추적할 수 있습니다. 한 번 쓰면 고칠 수 없는 표라서 나중에 되짚기(감사)에 좋습니다. 참고로 루프에라가 쓰는 줄 단위 로그의 파일 형식 이름은 JSONL.
평가 도구(promptfoo)로 기능·지시문을 바꿀 때 AI 행동이 예전보다 나빠지지 않았는지 검사합니다. 스스로 규칙을 바꿀 때 생기는 부작용을 잡아냅니다.
Paperclip에는 AI가 실수에서 자동으로 배우는 장치가 없습니다. 평가(evals)는 기능이 나빠지지 않게 막을 뿐, 스스로 진화하는 것은 아닙니다.
말로 쓴 규칙이 자꾸 안 지켜지면, 코드가 아예 막아 버리는 강제 규칙으로 자동 올립니다. Paperclip의 '완료 기준'은 늘 권고 수준(말뿐)에 머뭅니다.
Claude와 GPT 두 AI가 함께 검증해 한 AI가 놓치는 사각지대를 메웁니다. Paperclip은 자동 검사 하나에만 기댑니다.
서버 검사가 돌기도 전에, 내 컴퓨터에서 코드 올리는 것 자체를 막습니다. Paperclip은 변경 제안(PR) 단계에서만 막습니다.
feedback-detector.sh라는 작은 검사 프로그램(셸 스크립트)이 대화 속 사용자의 불만 표현을 자동으로 잡아내, 개선에 쓸 데이터로 바꿉니다.
서로 다른 4가지 전략으로 자동 재시도하고, 안 되면 다른 AI로 갈아탑니다. Paperclip은 사람이 직접 복구해야 합니다.
여러 프로젝트에서 반복되는 패턴을 전체 공용 규칙으로 자동 통합합니다. 조직 전체가 함께 배우는 데도 쓸 수 있습니다.
| 항목 | Paperclip | 루프에라 |
|---|---|---|
| 스스로 개선하기 |
★★☆☆☆
|
★★★★★
|
| 품질 검사·강제력 |
★★★☆☆
|
★★★★★
|
| 여러 AI 지휘 |
★★★★★
|
★★★☆☆
|
| 오류 복구 |
★★☆☆☆
|
★★★★☆
|
| 기억·맥락 |
★★★☆☆
|
★★★★☆
|
| 비용 관리 |
★★★★★
|
★☆☆☆☆
|
| 규모 확장 (여러 AI) |
★★★★★
|
★★☆☆☆
|
| 통제·감사 |
★★★★★
|
★★★☆☆
|
'AI 회사 운영'에 맞춘 기반 도구입니다. 조직 구조·비용·통제가 강점입니다. 다만 스스로 개선하는 기능이 없어, AI가 같은 실수를 반복할 수 있습니다.
'AI 개발 도우미의 진화'에 맞춘 자가강화 시스템입니다. '실수 → 학습 → 규칙 → 훅(hook, 자동 감시 장치)' 순환이 강점입니다. 다만 조직 확장, 비용 관리, 여러 AI 지휘는 약점입니다.
Paperclip의 조직 구조에 루프에라의 '스스로 개선하는 반복 고리'를 합치면, '실수에서 자동으로 배우면서 비용까지 관리하는 AI 회사'가 됩니다. Paperclip의 평가 도구(evals)에 루프에라의 권고 규칙 → 강제 규칙 승격 방식을 붙이는 것이 가장 큰 시너지를 낼 것입니다.