2026년 7월 AI 최신 뉴스 총정리 — 라구나, 제미나이, 코스모스, 메타, 알리바바 한눈에 보기
1. 라구나 S 2.1 — 풀(Pools) 기능 업데이트
풀(Pools)이란?
풀(Pools)은 쉽게 말해 연결이나 자원을 미리 모아두는 창고입니다. 예를 들어 식당에서 손님이 올 때마다 그릇을 새로 사지 않고 미리 준비해두는 것처럼, 풀은 데이터베이스 연결처럼 자주 쓰는 자원을 미리 만들어두고 재사용해서 속도를 높이고 비용을 아끼는 기술입니다.
이번 라구나 S 2.1 업데이트에서는 이 풀 기능이 한 단계 더 강화되어, 대규모 트래픽이 몰리는 상황에서도 자원 낭비 없이 안정적으로 동작하도록 개선되었습니다.
2. 단 657MB! 노트북에서도 돌아가는 초소형 로컬 추론 AI
로컬 추론(Local Inference)이란?
로컬 추론은 내 노트북, 내 폰처럼 내가 가진 기기 안에서 직접 AI를 실행하는 것입니다. 클라우드(원격 서버)에 데이터를 보내지 않기 때문에 속도가 빠르고, 개인정보가 안전합니다.
이번에 공개된 모델은 단 657MB 용량입니다. 일반적인 고성능 AI 모델이 수십 GB인 것과 비교하면 정말 작은 크기인데, 이 정도면 일반 노트북이나 고성능 스마트폰에서도 가볍게 실행할 수 있습니다. 즉, 인터넷 없이도 AI를 쓸 수 있는 시대가 점점 가까워지고 있습니다.
출처: 게시판 #9 (2026.07.21)
3. Feyn AI의 SQRL — AI 시대의 데이터베이스 도구
SQRL이 뭐예요?
SQRL은 Structured Query & Relational Language의 약자로, 쉽게 말해 AI가 데이터베이스를 더 똑똑하게 다룰 수 있게 해주는 언어/도구입니다.
기존의 SQL은 사람이 직접 질의(query)를 작성해야 했지만, SQRL은 AI가 자연스러운 명령을 이해하고 자동으로 데이터베이스 구조를 파악해서 작업할 수 있도록 도와줍니다. Feyn AI는 이를 통해 AI 기반 데이터 분석을 훨씬 쉽게 만드는 것을 목표로 하고 있습니다.
출처: 게시판 #8 (2026.07.21)
4. 알리바바 통이 랩, 16개 언어 AI 모델 공개
통이(Tongyi) 랩은 어디예요?
알리바바 통이(通义) 랩은 중국 알리바바 그룹이 운영하는 AI 연구 조직입니다. 이번에 공개한 모델은 한국어, 영어, 중국어, 일본어, 아랍어, 힌디어 등을 포함해 총 16개 언어를 지원합니다.
전 세계 인구의 대부분이 모국어로 인터넷을 사용하지만, AI는 영어 중심으로 학습되어 왔습니다. 16개 언어를 네이티브 수준으로 지원하는 모델은 영어권이 아닌 국가에서도 AI 혜택을 고르게 누릴 수 있도록 만들어줍니다.
출처: 게시판 #7 (2026.07.21)
5. NVIDIA Cosmos 3 Edge — 400억 파라미터 엣지(Edge) AI
파라미터가 뭔가요?
파라미터(parameter)는 AI 모델이 학습한 지식의 양을 나타내는 숫자입니다. 파라미터가 많을수록 일반적으로 더 똑똑한 경향이 있지만, 그만큼 연산 자원과 메모리가 많이 필요합니다.
엣지(Edge)는 클라우드(원격 서버)가 아니라 로봇·자동차·카메라 같은 현장 기기에서 직접 실행되는 환경을 말합니다.
이번 Cosmos 3 Edge는 400억 개(40 billion) 파라미터 규모로, NVIDIA가 밀고 있는 Physical AI(현실 세계를 이해하는 AI) 플랫폼의 신제품입니다. 로봇·자율주행·스마트 공장 같은 곳에서 바로 쓸 수 있도록 만들어졌습니다.
출처: 게시판 #6 (2026.07.21)
6. NVIDIA srt-slurm — 클러스터에서 LLM 추론 속도 테스트하기
슬러름(SLURM)이 뭔가요?
슬러름(SLURM)은 슈퍼컴퓨터처럼 여러 대의 서버가 묶인 클러스터에서 작업을 골고루 분배해주는 스케줄러입니다. 대학·연구기관·대기업이 GPU 자원을 효율적으로 쓰기 위해 흔히 사용합니다.
srt-slurm은 뭐예요?
srt-slurm은 NVIDIA가 만든 명령줄(커맨드라인) 도구입니다. 슬러름 클러스터 위에서 LLM(대규모 언어 모델) 추론 성능을 자동으로 측정할 수 있도록 도와줍니다. TensorRT LLM, SGLang, vLLM 같은 주요 추론 엔진을 한 번에 벤치마크할 수 있어, 연구자와 엔지니어가 "우리 클러스터에 어떤 엔진이 가장 빠를까?"를 쉽게 비교할 수 있습니다.
출처: 게시판 #5 (2026.07.21)
7. Meta, Astryx를 오픈소스로 공개
오픈소스란?
오픈소스(Open Source)는 소스코드를 누구나 무료로 보고, 사용하고, 수정할 수 있게 공개한 소프트웨어를 말합니다. Meta(구 페이스북 모회사)는 이번에 Astryx(아스트릭스)라는 새 프로젝트를 오픈소스로 풀어, 누구나 함께 발전에 기여할 수 있도록 했습니다.
메타는 이미 PyTorch, Llama 같은 영향력 있는 AI 프로젝트를 오픈소스로 공개해 온 회사이기 때문에, Astryx도 오픈소스 생태계에서 빠르게 주목받을 것으로 기대됩니다.
출처: 게시판 #3, #4 (2026.07.21)
8. Google Gemini 3.6 Flash — 더 빠르고 더 가벼운 AI
제미나이(Gemini)란?
제미나이(Gemini)는 구글이 만든 대표 멀티모달 AI 모델입니다. 텍스트뿐 아니라 이미지·음성·영상도 이해할 수 있습니다.
플래시(Flash) 라인업은?
플래시(Flash)는 제미나이 라인업 중에서도 응답 속도가 빠르고 비용이 낮은 경량 모델을 가리킵니다. 이번에 나온 3.6 Flash는 이전 3.5 Flash 대비 출력 토큰(생성하는 글자 수) 기준 약 17% 절감 효과가 있다고 알려져, 같은 답변을 더 적은 비용으로 만들 수 있게 되었습니다.
출처: 게시판 #1, #2 (2026.07.21)
한눈에 보는 8가지 소식 비교표
| 회사/주체 | 소식 | 한 줄 요약 |
|---|---|---|
| Laguna | S 2.1 풀 기능 | 자원 풀(Pools) 기능 강화 |
| 커뮤니티 | 657MB 로컬 AI | 내 기기에서 직접 추론 가능 |
| Feyn AI | SQRL 공개 | AI 시대 데이터베이스 도구 |
| 알리바바 통이 랩 | 16개 언어 AI | 다국어 네이티브 지원 모델 |
| NVIDIA | Cosmos 3 Edge | 400억 파라미터 엣지 AI |
| NVIDIA | srt-slurm | 클러스터 LLM 추론 벤치마크 |
| Meta | Astryx 오픈소스 | 새 오픈소스 프로젝트 공개 |
| Gemini 3.6 Flash | 더 빠르고 가벼운 LLM |
자주 묻는 질문 (FAQ)
Q. 일반 사용자도 이 뉴스들을 어떻게 활용할 수 있나요?
가장 직접적으로 체감할 수 있는 변화는 657MB 로컬 추론 AI와 Google Gemini 3.6 Flash입니다. 로컬 추론 AI는 인터넷 없이도 내 기기에서 AI를 쓸 수 있게 해주고, Flash 모델은 응답 속도가 빨라 일상에 더 자연스럽게 녹아들 수 있습니다.
Q. 개발자라면 어떤 소식을 주목해야 하나요?
개발자라면 NVIDIA srt-slurm으로 클러스터 환경에서 추론 엔진을 벤치마크하고, Meta Astryx와 Feyn AI SQRL 같은 새 오픈소스/도구를 살펴보시는 것을 추천드립니다. AI 서비스 비용과 성능을 동시에 개선할 단서를 얻을 수 있습니다.
Q. 엣지(Edge) AI가 중요한 이유는 무엇인가요?
엣지 AI는 데이터를 외부 서버로 보내지 않고 현장 기기에서 바로 처리하기 때문에, 프라이버시 보호, 저지연(빠른 응답), 인터넷 미사용 환경 대응에 강합니다. 로봇·자율주행·의료기기처럼 안정성이 중요한 분야에서 특히 각광받고 있습니다.
마무리 — 2026년 7월, AI는 '작아지고, 빨라지고, 열려가고' 있다
이번 달의 흐름을 한 문장으로 요약하면 "AI는 점점 더 작고, 더 빠르며, 더 다양한 언어를 지원하고, 더 많은 사람에게 열려가고 있다"입니다.
- 🤏 작아짐: 657MB 로컬 추론 AI, Gemini 3.6 Flash 같은 경량 모델
- ⚡ 빠라짐: 풀(Pools) 자원 재사용, srt-slurm 같은 효율적 벤치마크
- 🌍 열림: 16개 언어 AI, Meta Astryx 같은 오픈소스 공개
- 🧠 현실로: Cosmos 3 Edge로 대표되는 Physical AI
앞으로도 AI 생태계의 빠른 변화를 꾸준히 정리해 드리겠습니다. 관심 있는 주제가 있다면 댓글로 알려주세요.