LLM · 오픈 웨이트 · 2026

Muse Glimmer — 소비자용 GPU 한 대로 돌아가는 300억 파라미터 오픈 웨이트 에이전트 모델

Meta가 공개한 Muse Glimmer는 30B(300억) 파라미터의 멀티모달 오픈 웨이트 모델입니다. 4비트 양자화와 블록 단위 투기적 디코딩을 통해 24GB VRAM GPU 한 대, 또는 M시리즈 Mac에서도 네트워크 없이 동작합니다. 클라우드 호출을 피해야 하는 의료·법률·금융·국방·제조 분야를 위해 만들어진, "에이전트형 AI"의 새로운 기준점입니다.

한눈에 보기 (TL;DR)

  • 규모: 300억 파라미터, Apache 2.0 오픈 웨이트 (상용·수정·재배포 자유)
  • 핵심 기술: 4비트 양자화 + DFlash 투기적 디코딩으로 소비자용 GPU 구동
  • 속도: RTX 5090에서 74.9 → 233.4 tok/s, 약 3.1배 향상
  • 강점: 에이전트 오케스트레이션·장문 추론 (MCP Atlas 75.5점)
  • 약점: 컴퓨터 사용·터미널 작업은 Qwen3.6-27B에 비해 약간 뒤처짐

1. Muse Glimmer란 무엇인가요?

쉽게 말하면 "내 컴퓨터에서 혼자 굴러다니는 AI 비서"입니다. Meta가 같은 계열의 더 큰 모델 Muse Spark에서 지식 증류(distillation)로 압축해 만든 모델로, 텍스트와 이미지를 모두 이해하면서 텍스트로 답합니다. 소리(오디오)는 아직 지원하지 않고, 영상은 한 프레임씩 이미지로 처리합니다.

가장 큰 차별점은 로컬 실행입니다. 보통 300억 파라미터 모델은 그대로 돌리면 55GB가 넘는 메모리가 필요한데, Muse Glimmer는 4비트까지 압축해 약 20GB로 줄였습니다. 즉, 24GB显存 한 장의 일반 소비자용 GPU, 또는 Apple M4/M5 Max 노트북에서도 돌릴 수 있습니다. 데이터가 밖으로 나가지 않기 때문에 병원·법무법인·제조현장처럼 클라우드를 못 쓰는 환경에서도 안심하고 쓸 수 있습니다.

참고 Meta는 이 모델이 자사의 "Frontier AI(최전선 AI)" 기준을 충족하지 않는다고 밝히고 있습니다. 즉 생명과학·사이버 등 초고위험 영역에 단독 투입하기보다는, 시스템 레벨의 안전장치(가드레일)를 함께 설계해 사용하길 권장합니다.

2. 어디에, 어떻게 쓸 수 있나요?

주요 활용 시나리오

추천 사용자군

1인 개발자
24GB GPU 1장 또는 M4/M5 Max
스타트업
토큰 과금 없는 자체 호스팅
중견기업
온프레미스 추론 인프라
규제 산업
네트워크 분리 에어갭 에이전트

3. 300억 파라미터를 어떻게 한 GPU에 담았을까?

두 가지 핵심 기술이 결합되었습니다. 하나는 4비트 양자화, 다른 하나는 DFlash 블록 투기적 디코딩입니다.

① 4비트 양자화 — 숫자를 줄여서 용량을 압축

보통 AI 모델은 숫자를 16비트나 32비트로 표현합니다. 4비트는 숫자 하나당 메모리를 약 1/4에서 1/8로 줄이는 기법입니다. 당연히 약간의 정확도 손실이 생기는데, Muse Glimmer는 두 가지 빌드를 출시했습니다.

K-Quant-Dynamic32GB GPU에서 평균 0.2% 성능 손실
K-Quant-17GB24GB GPU에서 평균 1.0% 성능 손실

여기서 성능 손실은 15개 일반 벤치마크의 정확도 평균을 의미합니다. 일상적인 사용에서는 1% 정도의 차이를 거의 느끼기 어렵습니다.

② DFlash — 한 번에 16개 토큰을 예측

투기적 디코딩(Speculative Decoding)이란 작은 모델이 미리 "이렇게 쓰지 않을까?" 하고 단어 후보를 던져주면, 큰 모델이 한꺼번에 확인하는 방식입니다. 마치 동료에게 여러 문장 후보를 동시에 보여주고 한 번에 검토받는 것과 비슷합니다.

DFlash는 이 후보 생성 단계를 블록 단위 디퓨전으로 강화한 드래프터입니다. 한 번의 포워드 패스로 16개 토큰을 제안하고, 메인 모델이 병렬로 검증합니다. 이 덕분에 RTX 5090에서 처리량이 3.1배로 뛰었습니다.

실측 속도 (K-Quant-17GB, 배치 1, 그리디 디코딩 기준)
  • RTX 5090: 74.9 → 233.4 tok/s (3.1배)
  • Apple M5 Max: 26.6 → 50.2 tok/s
  • Apple M4 Max: 23.7 → 37.8 tok/s

4. 모델 구조 — 한 줄 요약 사전

기술 용어가 낯설 수 있으니, 이번 기사에 자주 등장하는 핵심 개념을 짧게 정리했습니다.

에이전트형 AI 모델 (Agentic Model)
스스로 목표를 세우고, 도구를 호출하고, 행동을 취하는 AI. 사람 개입 없이 여러 단계를 스스로 진행합니다.
Agentic Model — goal-directed AI that uses tools and acts autonomously
오픈 웨이트 (Open-Weights)
모델의 파라미터(가중치)는 공개하지만, 학습 데이터나 학습 코드는 비공개일 수 있는 공개 방식. 누구나 다운로드해 직접 실행·수정 가능하지만, 학습 과정까지 공개하는 오픈소스와는 구분됩니다.
Open-Weights — public release of parameters, not necessarily training data/code
투기적 디코딩 (Speculative Decoding)
작은 모델이 미리 토큰 후보를 제안하면 큰 모델이 한 번에 검증하는 추론 가속 기법. 보통 2~3배 빨라집니다.
Speculative Decoding — draft-then-verify LLM inference, ~2–3× speedup
4비트 양자화 (4-bit Quantization)
각 파라미터를 4비트로 표현해 모델 크기를 대폭 줄이는 기법. 약간의 정확도 손실이 따르지만, 메모리·전력 사용이 크게 줄어 소비자 하드웨어에서 실행 가능해집니다.
4-bit Quantization — compress each weight to 4 bits
KV 캐시 (KV Cache)
추론 중 이미 계산한 키·값 벡터를 저장해두는 메모리 버퍼. 매 토큰마다 반복 계산을 피해 속도를 높입니다.
KV Cache — saves K/V vectors to avoid recomputation
그룹 쿼리 어텐션 · GQA (Grouped-Query Attention)
여러 어텐션 헤드가 키·값 쌍을 그룹 단위로 공유하는 구조. 메모리는 줄이고 속도는 높이는 요즘 표준 기법입니다.
GQA — attention heads share K/V pairs in groups
로터리 위치 임베딩 · RoPE (Rotary Position Embedding)
회전 행렬로 토큰의 위치 정보를 인코딩하는 방식. 긴 문맥에서도 상대적 위치 관계를 안정적으로 학습합니다.
RoPE — rotary matrices for relative position encoding
로짓 증류 (Logit Distillation)
큰 교사 모델의 "부드러운 출력(로짓)"을 작은 학생 모델이 모방하도록 학습시키는 지식 전달 기법. 이번에는 Muse Spark → Muse Glimmer에 사용되었습니다.
Logit Distillation — student matches teacher's soft outputs
강화학습 (Reinforcement Learning)
에이전트가 환경과 상호작용하며 보상을 최대화하도록 학습하는 방식. Muse Glimmer의 사후 학습 단계에서 사용되었습니다.
RL — learn by interaction, maximize reward signal
디퓨전 모델 (Diffusion Model)
노이즈를 점진적으로 더했다가 다시 제거하는 과정을 학습해 새로운 데이터를 생성하는 모델군. DFlash의 드래프터가 이 아이디어를 토큰 생성에 응용한 형태입니다.
Diffusion Model — generate by denoising from noise

5. 모델 구조 핵심 스펙

총 파라미터약 300억 (비전 타워 포함)
아키텍처밀집 인과 트랜스포머 + 전용 인식 인코더
비전 인코더ViT-G/14, 약 18억 파라미터, 이미지당 최대 4,096 토큰
어텐션GQA (쿼리 32 / KV 헤드 2), 슬라이딩 윈도우 2,048
컨텍스트 길이131,072 토큰 이상
어휘202,048 토큰
지식 컷오프2026년 1월 4일
입력 / 출력텍스트·이미지 입력 → 텍스트 출력

6. 학습은 어떻게 단계적으로 진행됐나?

  1. 사전 학습: Muse Spark의 출력을 모방하는 로짓 증류로 시작
  2. 중간 학습: 긴 문맥과 에이전트 데이터에 풍부한 추론 흔적을 주입
  3. 사후 학습: 일반·추론·코딩·에이전틱 영역에서 지도학습 + 온-폴리시 증류 + 강화학습을 결합

특히 사후 학습에서 온-폴리시(On-Policy) 증류가 들어간 점이 흥미롭습니다. 학생 모델이 지금 내뱉은 출력 분포 위에서 교사 모델의 도움을 받기 때문에, 배포 환경과 실제 사용 환경의 분포 차이를 줄이는 효과가 있습니다.

7. 벤치마크 — 어디서 강하고 어디서 약한가?

Meta는 사고(Reasoning) 모드에서 Muse Glimmer를 Gemma4-31B, Qwen3.6-27B와 비교했습니다. 결과는 일관된 패턴을 보입니다.

에이전트·추론 (Muse Glimmer 우세)

MCP Atlas75.5 vs 54.2 / 62.5
DeepSearch QA74.6
Gaia243.3
SWE-Bench Pro51.2
AIME 202694.7
IFBench77.0
AA-LCR80.0

컴퓨터 사용·터미널 (Qwen3.6-27B 우세)

OSWorld-Verified65.9 vs 75.6
TerminalBench 2.160.7 vs ?
SWE-Bench Verified77.2 vs ?

"장기 추론과 에이전트 오케스트레이션에서는 Muse Glimmer가 앞서지만, 화면을 보며 마우스·키보드를 조작하는 컴퓨터 사용 영역에서는 Qwen3.6-27B에 비해 한 발 물러선다."

8. 안전성 — 어디까지 믿고 쓸 수 있나?

Siren AgentDojo 공격 성공률은 28.4%로 보고되었습니다. 동시에 유틸리티 점수 94.2를 기록해, 정상 사용에서는 성능 손실이 거의 없으면서도 적대적 공격에 어느 정도 저항함을 의미합니다. 다만 Meta 스스로 "이 모델은 Frontier AI 기준을 충족하지 않는다"고 못박았기 때문에, 화학·생물무기·사이버 공격 같은 영역에 단독 배치하지 말고, 시스템 레벨 가드레일(권한 통제, 입력 검증, 사람 검수)을 함께 설계해야 합니다.

9. 핵심 요약 — 5줄 정리

  • 300억 파라미터 오픈 웨이트 에이전트 모델, Apache 2.0, Muse Spark에서 증류
  • 4비트 양자화로 24GB GPU에서 약 1.0% 손실만으로 구동
  • DFlash의 16토큰 블록 투기적 디코딩이 RTX 5090에서 3.1배 속도 향상
  • MCP Atlas·DeepSearch QA·SWE-Bench Pro에서 동급 모델을 능가
  • OSWorld-Verified·TerminalBench 2.1에서는 Qwen3.6-27B에 약간 뒤처짐

10. 그래서 이 모델이 중요한 이유

단순히 "또 다른 오픈 모델 출시"가 아닙니다. Muse Glimmer는 다음 세 가지 흐름을 동시에 보여줍니다.

Hugging Face 컬렉션에는 BF16 가중치, GGUF k-quants, ExecuTorch 빌드, DFlash 드래프터가 함께 공개되어 출시 첫날부터 자체 호스팅이 가능합니다. 관심이 있다면 Meta 공식 블로그와 HF 모델 카드를 함께 확인해 보길 권합니다.