AI Trend Brief · 오픈소스 LLM
2026-06-12 · 8분 읽기

Laguna S 2.1 — Poolside의 오픈 가중치 코딩 AI, 자기보다 큰 모델들과 어깨를 나란히 하다

118B(총 1180억) 파라미터 가운데 매번 8B(80억)만 일하는 전문가 혼합(MoE) 구조. 1M(100만) 토큰짜리 한 번에 읽기. SWE-Bench Multilingual 78.5%. 그리고 단일 데스크탑 AI 컴퓨터에서 굴러간다는 사실까지. Poolside가 9주 만에 만들어낸 신작 Laguna S 2.1의 핵심을 쉽게 풀어봅니다.

Laguna S 2.1이란?

쉽게 말하면, "혼자 코딩하는 AI 비서"입니다. 사람이 "이 기능 만들어 줘"라고 한마디 하면, 모델이 직접 설계 → 코드 작성 → 실행 → 오류 수정까지 척척 해냅니다. 업계에서는 이런 방식을 에이전틱 코딩(자율형 코딩)이라고 부릅니다.

한눈에 보는 사양

  • 총 파라미터: 118B(1180억 개) — 모델 안에 들어 있는 "설정값"의 총 개수
  • 활성화 파라미터: 매 단계마다 약 8B(6.8%)만 일함
  • 구조: 전문가 혼합(MoE) — 큰 모델을 작은 전문가 여럿으로 나눠, 입력에 딱 맞는 전문가만 깨우는 방식
  • 한 번에 읽는 길이: 최대 1M 토큰(토큰 ≈ AI가 텍스트를 잘라 보는 단위)
  • 모드: 사고 모드 on / off 두 가지. 기본값은 max
  • 공개: Hugging Face(허깅페이스, AI 모델 공유 플랫폼)에서 가중치를 무료 다운로드 — 오픈 가중치 방식
  • 학습 기간: 2026년 5월 22일부터 단 9주 미만. 4,096개 NVIDIA H200 GPU 사용

여기서 "오픈 가중치"라는 말이 헷갈릴 수 있는데, 풀어 설명하면 이렇습니다. 모델은 굉장히 많은 숫자 설정값(파라미터)로 이루어져 있습니다. 이 숫자 묶음을 가중치라고 부르는데, Poolside는 이걸 OpenMDW-1.1 라이선스로 누구나 받아서 돌려볼 수 있게 공개했습니다. 단, 학습에 쓴 데이터나 학습 코드 자체는 비공개로 두는 방식이라 "완전 오픈소스"보다는 살짝 좁습니다.

성능 — 크기 대비 어디까지 왔나

LLM에서 "성능"을 논할 때는 보통 "코딩 시험"을 봅니다. 모델에게 실전 같은 과제를 던져 통과율을 매기는 벤치마크(성능 시험)인데요. Laguna S 2.1은 6개 시험에서 자기보다 몇 배 큰 모델들과 어깨를 나란히 했습니다.

① Terminal-Bench 2.1 — 터미널(명령줄) 환경 코딩

모델크기점수(%)
Claude Fable 5 폐쇄형비공개88.0
Muse Spark 1.1 폐쇄형비공개80.0
Qwen 3.7 Max비공개74.5
Tencent Hy3295B-A21B71.7
Laguna S 2.1118B-A8B70.2
DeepSeek-V4-Pro-Max1.6T-A49B64.0
Inkling975B-A41B63.8

활성화 파라미터 기준 Laguna S 2.1은 Tencent Hy3의 3분의 1, DeepSeek-V4-Pro-Max의 6분의 1인데 점수는 더 높거나 비슷합니다.

② SWE-Bench Multilingual — 실전 GitHub 이슈 해결 (다국어 9개 언어)

모델점수(%)
Laguna S 2.178.5
Claude Fable 5 폐쇄형78.3
DeepSeek-V4-Pro-Max76.2
Tencent Hy375.8
Nemotron 3 Ultra67.7

SWE-Bench Multilingual은 파이썬뿐 아니라 C, C++, Go, Java, 자바스크립트, Rust 등 9개 언어로 된 실제 GitHub 이슈 500여 건을 풀게 하는 시험입니다. Laguna S 2.1은 공개된 순위표 1위입니다.

③ SWE-Bench Pro (Public) — 더 어려운 버전

모델점수(%)
Claude Fable 580.3
Qwen 3.7 Max61.5
Kimi K360.6
Laguna S 2.159.4
Tencent Hy357.9
DeepSeek-V4-Pro-Max55.4

④ DeepSWE v1.1 — 아직 갈 길이 먼 시험

여기서 Laguna S 2.1의 진짜 가치가 보입니다. DeepSWE는 특히 까다로운 시험인데, 활성화 파라미터가 약 6분의 1 수준인 Laguna가 40.4%로 같은 무거운 DeepSeek-V4-Pro-Max(9.0%)를 큰 폭으로 앞서갑니다.

⑤ SWE Atlas (코드베이스 Q&A) · ⑥ Toolathlon Verified

코드베이스에 대한 질문 응답에서는 46.2%로 DeepSeek(27.2%)보다 19%p 높고, 도구 활용·멀티스텝 작업 시험(Toolathlon Verified)에서는 49.7%로 Nemotron 3 Ultra(34.3%)를 한참 앞서갑니다.

Poolside가 강조하는 건 "절대 1위"가 아니라 "같은 무게급 안에서는 가장 강하다"는 점입니다. 최종 평가의 작업 기록(trajectory)은 trajectories.poolside.ai에 공개돼 있습니다.

두 가지 사고 모드, 점수의 비밀

"사고 모드"라는 말도 처음엔 어색합니다. 쉽게 말하면 "AI가 답을 바로 뱉기 전에, 속으로 한 번 더 곱씹어 보는 시간"입니다. 수학 문제를 풀 때 "음… 이렇게 저렇게 해서…"라고 중얼거리는 단계와 비슷하죠.

Laguna S 2.1에는 offmax 두 모드가 있고, 기본값은 max입니다. 현재로선 사용자가 "low/medium/high" 같이 중간 단계를 직접 고를 수 없고, 모델이 스스로 "오늘 이 일은 이렇게 깊이 생각해야지"를 정합니다.

사고 모드의 효과 (실제 측정치)

  • Terminal-Bench 2.1: 60.4% → 70.2% (+9.8%p)
  • DeepSWE v1.1: 16.5% → 40.4% (+23.9%p)

하지만 점수가 오르는 만큼 토큰 비용도 같이 올라갑니다. DeepSWE 한 작업에서 사고 모드 off는 약 9.9만 토큰, max는 약 24.9만 토큰을 소비합니다. 즉, "잘 생각한 만큼 글자 수도 늘어난다"는 뜻이죠. 한 번 작업에 몇 시간 동안 수십만 토큰을 꾸준히 소모해도 답이 흐트러지지 않는다는 게 Poolside 팀의 보고 핵심입니다.

공개된 세 가지 실전 데모 — 점수가 아닌 "행동"으로 보여주다

Poolside는 수치만 보여주지 않고, 편집하지 않은 작업 기록(trajectory) 세 개를 공개했습니다. AI가 어떤 순서로 무엇을 했는지 그대로 녹화된 자료입니다.

데모 ① — 빈 폴더에서 HTML/CSS 엔진 만들기

아무것도 없는 폴더에서 시작해 동작하는 브라우저 엔진을 만들어냈습니다. 사람 개입 없이 50분, 181단계 동안 진행됐고, 헤드리스 Chromium(창 없이 돌아가는 브라우저)으로 자기 결과물을 직접 검증까지 했습니다.

데모 ② — 자기 회사를 위해 코드 다듬기

모델이 Poolside 자기 회사의 에이전트 하네스(에이전트를 감싸는 운영 코드)를 스스로 최적화했습니다. 느린 문자열 연결 방식을 효율적인 버퍼로 바꿔, 프로그램 속도를 5.2% 개선, 메모리 사용량은 약 71% 절감.

데모 ③ — 수학 퍼즐을 Perl로 재발견하기

샌드박스 환경에 파이썬이 없어서 Perl로 68분간 수학적 문제(Erdős Problem #397)를 다시 유도해 냈습니다. 흥미로운 건, GPT-5.2 Pro가 2026년 1월에 같은 문제를 풀었다는 점인데 Laguna의 학습 데이터 기준일은 2025년 11월입니다. 즉 독립적인 재발견이라는 의미입니다.

내 컴퓨터에서 진짜 돌릴 수 있나

이 부분이 사실 가장 흥미롭습니다. 왜냐하면 모델 무게 때문에 보통 "데이터센터 GPU 아니면 안 돼"가 디폴트인데, Laguna S 2.1은 책상 위 컴퓨터 한 대로도 돌아갑니다.

앞서 MoE라서 한 번에 8B만 활성화된다고 했지만, 메모리에는 118B 전체가 다 올라가야 합니다. 그래서 얼마나 메모리가 필요한지가 핵심입니다.

필요한 메모리 / GPU 구성

  • 4-bit (NVFP4 또는 INT4): 약 59GB → NVIDIA DGX Spark 한 대(128GB 통합 메모리)로 충분
  • FP8: 약 118GB → DGX Spark 1대 또는 H200 1대로 가능
  • BF16: 약 236GB → DGX Spark 2대를 연결하거나 멀티 GPU 데이터센터 노드 필요

여기서 DGX Spark는 NVIDIA가 "AI 슈퍼컴퓨터를 책상으로" 가져오겠다며 만든 데스크탑 AI 워크스테이션입니다. GB10 Grace Blackwell 슈퍼칩이 들어가 있고, 통합 메모리 128GB에 AI 연산 성능 1 petaFLOP을 자랑합니다.

Poolside는 NVIDIA와 협력해 Blackwell GPU 아키텍처의 NVFP4(정밀도 포맷, 숫자 표현 방식 중 하나) 추론을 최적화했고, vLLM·SGLang·Ollama 같은 LLM 추론 엔진(모델을 실제로 서비스하는 프로그램)에 출시 당일 지원도 함께 제공됐습니다. 쉽게 말해 "받자마자 내 컴퓨터에서 굴릴 준비가 다 돼 있다"는 뜻입니다.

정밀도 포맷이 뭔데?

모델의 숫자를 얼마나 자세하게 저장할지 결정하는 방식입니다.

  • BF16 — 표준 16비트. 가장 정확하지만 메모리를 가장 많이 먹음
  • FP8 — 8비트. 메모리를 절반으로 줄여줌
  • INT4 — 4비트 정수. 가장 가벼운 일반 양자화 형식
  • NVFP4 — NVIDIA Blackwell에 최적화된 4비트 부동소수점. 정확도는 거의 유지하면서 크기는 크게 줄임

가격과 접근 경로

내가 직접 서버를 운영하기 부담스러울 때는 호스팅 서비스를 쓰면 됩니다. OpenRouter(여러 LLM을 한 API로 묶어 주는 중개 플랫폼)를 통해 즉시 접속 가능하고, 그 외에 Baseten, Kilo, Prime Intellect Prime Lab, ZML에도 등장했습니다.

OpenRouter 요금 (2026년 6월 기준)

  • 256K 컨텍스트까지: 무료
  • 전체 1M 컨텍스트: 입력 1M 토큰당 $0.10 / 출력 $0.20 / 캐시 읽기 $0.01

참고로 "토큰"은 AI가 텍스트를 자르는 단위로, 한국어 기준 대략 한 문장당 20~50 토큰 정도입니다. 1M 토큰이면 일반 책 한 권 분량쯤이라고 보면 됩니다.

핵심 정리 + 자주 묻는 질문

한 문장 요약

Poolside의 Laguna S 2.1은 118B/8B MoE 구조에 1M 컨텍스트, 오픈 가중치로 공개된 에이전틱 코딩 모델입니다. SWE-Bench Multilingual 78.5%로 공개 1위, 4-bit 한정 단일 DGX Spark에서 동작하며, 9주도 안 되는 사전학습으로 자기보다 몇 배 큰 모델들과 어깨를 나란히 합니다.

자주 묻는 질문 (FAQ)

Q. Laguna S 2.1은 무료인가요?
가중치 자체는 무료로 받지만(OpenMDW-1.1 라이선스), 자체 호스팅에는 GPU 비용이 듭니다. OpenRouter에서 256K 컨텍스트까지 무료로 써 볼 수 있습니다.
Q. 일반 노트북에서도 돌아가나요?
4-bit 버전이 약 59GB라 일반 노트북(보통 16~32GB RAM)에는 올라가지 않습니다. DGX Spark 같은 통합 메모리 128GB짜리 워크스테이션이 최소 조건입니다.
Q. "사고 모드"는 왜 중요한가요?
단순한 일은 off로 빠르게, 복잡한 일은 max로 깊이. 다만 max 모드는 토큰을 2~3배 더 쓰므로 비용이 함께 늘어납니다.
Q. 풀 오픈소스 인가요, 가중치만 공개된 건가요?
후자입니다. 가중치는 받지만 학습 데이터·학습 코드는 비공개로 두는 오픈 가중치 라이선스입니다.
Q. 어디서 받아서 어디서 쓰나요?
Hugging Face에서 가중치를 받고, vLLM / SGLang / Ollama / TRT-LLM 중 편한 추론 엔진으로 로컬 실행. 또는 OpenRouter·Baseten·Kilo 등 호스팅 서비스로 즉시 API 호출이 가능합니다.
Laguna S 2.1 Poolside 에이전틱 코딩 오픈 가중치 MoE SWE-Bench Multilingual DGX Spark NVIDIA Blackwell 1M 컨텍스트