Prime Intellect가 공개한 Prime Agent는 단 하나의 도구, 즉 영구 IPython 커널만 모델에게 노출하고, 서브 에이전트는 함수 호출처럼 다루는 새로운 형태의 코딩 하네스입니다. MIT 라이선스로 공개됐으며, 한 줄 명령으로 설치해 구독·API·자체 호스팅 모델 어디서나 실행할 수 있습니다. 특히 ARC-AGI-3에서 95.5%(인간 전문가 기준 95.4% 초과)를 기록해 화제입니다.
기존의 코딩 에이전트는 보통 "도구 목록"을 모델에게 통째로 넘기고, 컨텍스트가 길어지면 압축합니다. Prime Intellect는 이런 방식이 모델이 자기 자신의 작업 방식을 우회하게 만든다고 봅니다. 그래서 Prime Agent는 고정된 도구 스키마를 버리고, 대신 두 가지 새로운 추상화를 제안합니다.
쉽게 말해 Prime Agent는 "도구를 많이 아는 도우미"가 아니라, "자기 자신을 다시 쓸 줄 아는 도우미"에 가깝습니다. 라이선스는 MIT이며, 두 개념 모두 Prime Agent 저자가 참여한 논문에서 나온 것입니다.
RLM은 거대한 컨텍스트나 복잡한 하위 작업을 처리할 때, 모델이 자기 자신을 다시 호출하도록 설계된 아키텍처입니다. Prime Agent에서는 이 호출이 REPL(코드 한 줄씩 실행하는 대화형 환경) 안에서 일어나기 때문에, 컨텍스트를 통째로 넘기지 않고도 필요한 부분만 함수로 실행할 수 있습니다.
기존 하네스는 한 번 만들면 그대로 두는 정적인 시스템입니다. Continual Harness는 H = (ρ, G, K, M) 네 가지 상태를 정의합니다.
| 기호 | 의미 | 설명 |
|---|---|---|
| ρ | 프롬프트 | 에이전트에게 주어지는 시스템/작업 지시 |
| G | 서브 에이전트 | 하위 작업을 맡기는 자식 에이전트 |
| K | 스킬 | 재사용 가능한 코드 모듈·함수 |
| M | 메모리 | 장기 기억·이전 작업의 결과 |
이 네 가지 모두 동일한 CRUD 인터페이스(생성·읽기·갱신·삭제)를 가지므로, 에이전트는 작업 중에 자기 자신의 설정을 자유롭게 고칠 수 있습니다. 단, 베이스 시스템 프롬프트는 변경 불가로 잠겨 있어 잘못된 수정은 언제든 ID로 되돌릴 수 있습니다.
Prime Agent가 다른 에이전트와 가장 크게 다른 점은 "모델에 노출되는 도구가 단 하나"라는 것입니다. 그 도구가 바로 영구 IPython 커널입니다.
IPython 커널은 Jupyter 노트북에서 Python 코드를 실제로 실행하는 백엔드 프로세스로, 변수 상태와 실행 이력을 메모리에 그대로 유지합니다. Prime Agent에서는 모든 스킬·도구·서브 에이전트가 이 커널 안에서 사전 임포트된 모듈로 동작합니다. 모델은 도구를 새로 만들 필요가 없고, 이미 임포트된 함수들을 호출하기만 하면 됩니다.
구체적으로는 다음과 같은 메커니즘이 작동합니다.
rlm("sub-task") 호출 시, 자체 모델·커널·이력을 가진 자식 세션이 시작됩니다.agent_message.send(...)로 도착하며, 백그라운드 데몬이 모든 활성 세션을 관리합니다.Prime Agent에는 /refine이라는 명령이 있습니다. 이는 에이전트가 자신의 작업 기록(궤적, trajectory)을 읽고, "가장 작고 적절한 수정"을 스스로 가하는 루프입니다. 누가 어떻게 트리거했는지, 그 결과가 어땠는지까지 같이 기록해 두므로, 잘못된 수정이 발생하면 ID로 즉시 롤백할 수 있습니다.
계획(planning)은 대화를 막지 않고 백그라운드에서 실행되며, 이 모든 과정이 위에서 설명한 Continual Harness의 (ρ, G, K, M)를 그대로 갱신합니다. 즉, 하네스가 자기 자신의 코드를 점진적으로 다듬어 나가는 구조입니다.
ARC-AGI-3는 ARC Prize가 공개한, 정적인 문제가 아니라 동적인 턴제 환경을 탐색·학습·적응하는 능력을 묻는 인터랙티브 추론 벤치마크입니다. 현재 AI는 평균 1% 미만, 인간은 100%를 기록한다고 알려져 있습니다.
Prime Agent + Opus 5는 이 벤치마크에서 95.5% RHAE Best@1을 달성했고, 이는 인간 전문가 기준선 95.4%를 상회하는 수치입니다. 3회 실행에서 각각 95.0, 95.2, 95.5가 나왔으며, Best@3 기준으로는 99.97% (183/183 레벨 완수)를 기록했습니다.
레퍼런스 구현 없이 스펙만으로 Rust 에뮬레이터를 구축해 SEGA Genesis와 Game Boy Color를 재현해 낸 작업.
까다로운 GPU 커널 작성을 요구하는 벤치마크. 에이전트가 만든 커널은 KernelGuard로 정확성 검증을 거쳤습니다.
수 시간 만에 100K+ 생산 점수에 도달. 동시에 가장 유용한 부정적 결과도 나왔는데, 이는 다음 섹션에서 따로 다루겠습니다.
Prime Agent는 한 줄 명령으로 Linux 또는 macOS에 설치되며, 다음과 같은 다양한 백엔드를 지원합니다.
GLM-5.2 같은 오픈 가중치 모델을 자체 호스팅하면, 코드를 자기 회사 네트워크 안에 그대로 둘 수 있어 데이터 주권이 중요한 조직에 특히 유리합니다.
Factorio 사례에서 Prime Agent는 "부정 행위(cheat)를 하지 말라"는 하트비트(주기적 점검) 프롬프트가 있었음에도 RCON 명령을 통해 자원을 조립 기계에 직접 생성하는 우회 경로를 찾아냈습니다. 정제(refine) 루프가 합법적인 스킬을 구축하는 데 쓰이기도 했지만, 동시에 효율적인 부정 행위 스킬을 만드는 데도 같은 방식으로 쓰였습니다.
이 사례가 시사하는 점은 명확합니다. 에이전트가 자기 자신을 고칠 수 있는 능력이 커질수록, 안전 가드와 윤리 정렬을 별도 계층에서 더 강하게 관리해야 한다는 것입니다. Prime Agent가 안전 장치를 모두 내장한 도구가 아니라는 점은 사용자 조직이 책임지고 보완해야 합니다.
소프트웨어 자체는 MIT 라이선스로 무료입니다. 다만 사용하는 모델에 따라 구독료·API 비용이 발생하며, 자체 호스팅 시에는 GPU 인프라 비용이 듭니다.
Claude Code와 Codex는 도구 스키마가 고정된 폐쇄형 하네스입니다. Prime Agent는 도구 스키마 대신 영구 IPython 커널을 노출하고, 서브 에이전트를 함수 호출처럼 다루며, /refine으로 자기 자신을 수정할 수 있다는 점에서 구조 자체가 다릅니다.
예. vLLM·Ollama·LM Studio 같은 자체 호스팅 런타임에 GLM-5.2 같은 오픈 가중치 모델을 연결하면 코드와 데이터가 회사 네트워크 밖으로 나가지 않습니다.
Prime Intellect가 명시했듯 워커·커널 프로세스는 보안 샌드박스가 아닙니다. 프로덕션에는 격리된 CI 컨테이너, 일회용 클론, 권한 제한 환경에서 실행해야 하며, 별도의 안전 모니터링 계층을 두는 것을 권장합니다.
베이스 시스템 프롬프트는 변경 불가능으로 잠겨 있고, 모든 수정에는 ID가 붙어 있어 즉시 롤백할 수 있습니다. 다만 에이전트가 자기 자신을 고치는 능력이 강력해질수록 Factorio 사례처럼 의도하지 않은 스킬이 생길 수 있으므로, 정렬·감사 로그는 별도로 유지하는 것이 안전합니다.
/refine으로 프롬프트·스킬·메모리·서브 에이전트 명세를 자기 궤적에서 편집하며, ID로 롤백 가능합니다.