›  AI 모델 뉴스  ›  LFM2.5-2.6B

Liquid AI LFM2.5-2.6B 공개 — 온디바이스에서 동작하는 128K 컨텍스트 에이전트 AI 모델

· 카테고리: 오픈소스 LLM · 추정 학습 시간 6분

Liquid AI가 공개한 LFM2.5-2.6B는 스마트폰·노트북·로봇 같은 디바이스에서 온디바이스로 동작하면서도 128K 토큰의 긴 컨텍스트를 기억하고 외부 도구를 스스로 호출하는 에이전트 AI 모델입니다. 모델 크기는 약 26.9억 개 파라미터로, 비슷한 크기 대비 훨씬 큰 모델들과 비슷한 성능을 내는 것이 특징입니다.

한 줄 요약: 2.6B짜리 작은 모델이 9B 모델급 성능을 보여주며, 내 손 안의 디바이스에서 데이터 유출 없이 AI 에이전트를 돌릴 수 있게 됐습니다.

LFM2.5-2.6B가 뭔가요?

LFM2.5-2.6B는 미국 AI 스타트업 Liquid AI가 2026년 8월 공개한 에이전트형(agentic) 오픈소스 언어 모델입니다. 이름에서 알 수 있듯 파라미터(모델이 학습으로 얻은 숫자값) 수가 약 26.9억 개(2.69B)이며, 디바이스 한 대에서 완전하게 동작하도록 설계됐습니다. 즉, 인터넷에 연결하지 않고도 내 노트북·스마트폰·로봇 위에서 바로 돌아갑니다.

파라미터약 26.9억 개 (2.69B)
레이어 수30개
컨텍스트 길이131,072 토큰 (≈128K)
어휘(vocab) 크기128,000
사전학습 토큰약 34조 (34T)
지원 언어16개 언어 / 텍스트 전용
라이선스lfm1.0 (오픈 웨이트)
디바이스 메모리2.5GB 미만
#LFM2.5-2.6B#LiquidAI#온디바이스AI#오픈웨이트#에이전트모델#도구호출

왜 "온디바이스 에이전트"가 중요한가요?

기존의 챗봇은 질문을 받으면 텍스트를 "생성"하는 데 그쳤습니다. 반면 에이전트 모델① 목표를 스스로 계획하고 ② 외부 도구(API, 함수)를 호출하며 ③ 여러 단계를 거쳐 결과를 만들어내는 AI를 말합니다. 우리가 흔히 말하는 "AI 비서"가 실제로 캘린더에 일정을 등록하거나, 송장 PDF에서 금액을 뽑아 ERP에 입력하려면 이 능력이 필수입니다.

그런데 지금까지 에이전트 모델은 대부분 거대한 클라우드 API(예: GPT-4, Claude)로만 돌렸습니다. 데이터가 외부 서버로 나가야 하고, 호출 1회당 비용이 발생하며, 네트워크가 끊기면 멈춥니다. LFM2.5-2.6B는 이 문제를 정면으로 풉니다.

핵심 가치 3가지:
  • 프라이버시: 데이터가 디바이스 밖으로 절대 나가지 않음 (의료·국방·금융에 결정적)
  • 비용: 한계 비용이 거의 0 — API 요금 걱정 없이 백그라운드에서 계속 실행 가능
  • 오프라인 동작: 에어갭(air-gapped, 네트워크가 물리적으로 분리된) 환경에서도 작동

누구에게 유용한 모델인가요?

개인 개발자·스타트업

이미 가지고 있는 M5 Max 노트북 한 대로 파일럿 테스트가 가능합니다. Liquid AI 측 측정에서 메모리 2.5GB 미만, 초당 220 토큰 속도로 디코딩됩니다. 스마트폰에서는 초당 30 토큰 수준으로 동작합니다.

중견기업 — 자체 호스팅

NVIDIA H100 SXM5 GPU 한 장으로 하루 약 13억(1.3B) 토큰을 처리할 수 있습니다. 월 수만 달러의 외부 API 비용을 단일 GPU 1대 운영으로 대체할 수 있다는 뜻입니다.

대기업·OEM

차량, 가전, 산업용 로봇 등 디바이스 fleet(수만~수십만 대)에 동일한 가중치를 그대로 배포할 수 있습니다. 모델 튜닝이 필요하면 LoRA(저순위 적응) 기법으로 TRL·Unsloth를 통해 가볍게 미세조정할 수 있습니다.

주요 적용 산업

어떤 작업에 쓰면 좋을까요?

Liquid AI는 이 모델을 다음과 같은 워크로드에 권장한다고 명시했습니다.

주의: Liquid AI는 에이전트 코딩(코딩 에이전트)이나 지식 집약적인 Q&A에는 이 모델을 권장하지 않습니다. 코드 작업에는 더 큰 모델이 여전히 우위를 보입니다.

내부 구조 — 어떻게 만들었나?

LFM2.5-2.6B는 30개 레이어로 구성된 하이브리드(hybrid) 아키텍처입니다. 단순한 트랜스포머가 아니라 두 종류의 블록을 섞어 썼습니다.

사전학습에는 약 34조(34T) 토큰이 사용됐고, 기존 토크나이저를 처음부터 다시 학습시키지 않고 어휘만 64K에서 128K로 확장했습니다. 이후 별도의 중간 학습(mid-training) 단계를 거쳐 컨텍스트 길이를 128K로 늘렸습니다. 텍스트 전용이며 16개 언어를 지원합니다.

4단계 사후학습(post-training)

베이스 체크포인트는 단순한 텍스트 생성 모델로 시작해서, 다음 4단계를 거쳐 진짜 "에이전트"가 됩니다.

  1. 지도 미세조정(SFT) 2라운드 — 사용량 데이터 혼합 규모가 기존 LFM2.5-8B-A1B의 약 7배.
  2. 교사 특화(teacher specialization) — 도메인별 전문가를 검증 가능한 보상(reward)을 주는 강화학습으로 따로 학습.
  3. 다중 도메인 온폴리시(on-policy) 증류 — 학생 모델이 스스로 응답을 만들고, 같은 도메인 교사가 그 답을 평가·수정.
  4. GRPO 에이전트 강화학습 — Hermes Agent·OpenClaw 같은 실제 하네스(에이전트 실행 환경) 안에서 마지막 단계로 강화학습.

벤치마크 성능 — 진짜 잘하나요?

Liquid AI는 gemma-4-E2B-it(5.1B), gemma-4-E4B-it(8B), Qwen3.5-4B(4.7B), Qwen3.5-9B(9.7B)와 직접 비교했습니다. 2.6B 모델이 8~9B 모델을 이기는지가 핵심이죠.

벤치마크LFM2.5-2.6Bgemma-4-E4B-it (8B)Qwen3.5-9B (9.7B)
ToolSandbox (도구 사용)77.8365.0076.44
Multi-IF (지시 따르기)80.0777.3562.55
IFStruct (구조화 지시)85.4976.6578.50
IFBench (복합 지시)59.1739.2456.47
BFCLv4 (함수 호출)56.8846.3960.13

보고된 거의 모든 지시 따르기·도구 사용 벤치마크에서 1위를 차지했습니다. BFCLv4(함수 호출)에서는 Qwen3.5-9B에 살짝 뒤질 뿐입니다. 다만 코딩 성능은 LiveCodeBenchv6에서 Qwen3.5-9B의 69.86점 대비 59.41점으로, 여전히 큰 모델이 유리한 영역입니다.

설치·실행은 어떻게 하나요?

두 체크포인트가 공개됐습니다.

가중치는 네이티브(native)·GGUF·MLX·ONNX 네 가지 포맷으로 제공되며, llama.cpp·vLLM·SGLang·LM Studio에서 출시 첫날부터 지원됩니다. Hugging Face에서 lfm1.0 라이선스 하에 받을 수 있습니다.

용어 한눈에 보기

자주 묻는 질문 (FAQ)

Q. LFM2.5-2.6B는 무료인가요?

A. 네. 오픈 웨이트(open weights)로 공개되어 lfm1.0 라이선스 하에 누구나 다운로드·상용 배포가 가능합니다. 가중치 파일만 공개되며 학습 코드는 비공개인 점이 완전한 오픈소스와는 다릅니다.

Q. 데스크톱이나 노트북에서 직접 돌릴 수 있나요?

A. 가능합니다. M5 Max 칩에서 2.5GB 미만 메모리, 220 토큰/초로 동작합니다. Windows·Linux면 llama.cpp 또는 LM Studio에 GGUF 파일을 넣으면 됩니다.

Q. 코딩 에이전트로 써도 되나요?

A. 권장되지 않습니다. LiveCodeBenchv6 점수가 59.41로, 9B급 Qwen3.5(69.86)보다 낮습니다. 코딩은 더 큰 모델이 여전히 우위를 보입니다.

Q. 128K 컨텍스트가 왜 중요한가요?

A. 컨텍스트 윈도우는 모델이 한 번에 기억·처리할 수 있는 토큰 수입니다. 128K면 책 한 권 분량의 텍스트를 한 번에 입력할 수 있어, 긴 문서 요약·계약서 분석·대화 히스토리 유지에 유리합니다.

Q. 데이터가 정말 외부로 안 나가나요?

A. 추론이 디바이스 안에서 완결되므로 프롬프트·응답 모두 외부 API에 도달하지 않습니다. 의료·금융·국방처럼 규제로 외부 전송이 금지된 환경에서 가장 큰 장점입니다.

정리 — 핵심 요약

  • 모델 크기 26.9억 파라미터, 30 레이어(22 컨볼루션 + 8 GQA), 128K 컨텍스트, 34T 토큰 사전학습.
  • 성능 ToolSandbox·Multi-IF·IFStruct에서 8~9B급 모델을 능가. BFCLv4만 Qwen3.5-9B에 소폭 뒤짐.
  • 속도·메모리 M5 Max에서 220 tok/s · 메모리 2.5GB 미만. 스마트폰에서도 30 tok/s로 동작.
  • 배포 lfm1.0 오픈 웨이트, 출시 첫날부터 GGUF·MLX·ONNX 지원, llama.cpp·vLLM·SGLang·LM Studio 호환.
  • 핵심 가치 데이터가 디바이스 밖으로 나가지 않는 프라이버시 우선 에이전트 — 의료·국방·금융·OEM에 적합.