Google Gemini 3.6 Flash·Flash-Lite·Flash Cyber 출시: AI 에이전트를 위한 저비용·고효율 라인업 총정리
Google이 Gemini 3.6 Flash, Gemini 3.5 Flash-Lite, Gemini 3.5 Flash Cyber 세 모델을 동시에 공개했습니다. 모두 "Flash 티어"로 분류되며, 깊은 추론보다는 속도·저비용·대규모 에이전틱 워크로드에 맞춰 설계됐습니다. 출력 토큰을 최대 65% 절감한 모델, 초당 350 토큰을 찍는 모델, 멀티에이전트로 버그를 잡는 모델까지 라인업이 풍부해졌습니다.
왜 에이전틱 워크로드에 특화된 모델이 필요한가?
에이전틱 워크로드(Agentic Workloads)란 AI 에이전트가 도구를 스스로 호출하고, 계획을 세우고, 여러 단계를 거쳐 작업을 끝내는 다단계 작업 부하를 말합니다. 예컨대 "웹사이트에서 데이터를 긁어와 보고서를 작성하라" 같은 흐름입니다. 이런 작업에서는 토큰 효율성(Token Efficiency)이 곧 비용입니다. 같은 품질의 답을 더 적은 토큰으로 뽑을수록 1건당 비용이 크게 떨어지기 때문입니다. Flash 티어는 정확히 이 지점을 노립니다.
신규 모델 3종 한눈에 보기
| 모델 | 포지셔닝 | 입력 단가 | 출력 단가 | 핵심 강점 |
|---|---|---|---|---|
| Gemini 3.6 Flash | 기본 워크호스 | $1.50 / 1M | $7.50 / 1M | 코딩·멀티모달 품질 ↑, 출력 17%↓ |
| Gemini 3.5 Flash-Lite | 최고 속도 | $0.30 / 1M | $2.50 / 1M | 초당 350 토큰, 저지연·고처리량 |
| Gemini 3.5 Flash Cyber | 보안 특화 | 파일럿 한정 | 파일럿 한정 | 취약점 탐지 멀티에이전트 |
Gemini 3.6 Flash: 기본 워크호스 모델
3.6 Flash는 Flash 라인의 새로운 주력 모델입니다. 코딩, 지식 작업, 멀티모달을 두루 다루며 키워드는 "효율성"입니다.
품질도 함께 올랐습니다
- DeepSWE: 37% → 49%
- MLE Bench: 49.7% → 63.9%
- OSWorld-Verified: 78.4% → 83.0%
여기에 컴퓨터 사용(Computer Use) 기능이 Gemini API와 Gemini Enterprise에 내장 도구로 추가됐습니다. 에이전트가 화면을 보고 클릭·타이핑·스크롤을 스스로 결정해 브라우저·모바일·데스크톱 작업을 자동화하는 기능입니다. Hebbia, Harvey 같은 초기 고객은 문서 파싱, 차트 분석, 보고서 작성에서 성과를 보고했습니다.
Gemini 3.5 Flash-Lite: 가장 빠른 모델
Flash-Lite는 저지연·고처리량 작업의 정답입니다. Artificial Analysis 측정 기준 초당 350 토큰을 뽑아내며, 가격은 1M 토큰당 입력 $0.30, 출력 $2.50입니다. 에이전틱 검색, 대량 문서 처리에 특히 어울립니다.
구형 3 Flash도 이겼습니다
- Terminal-Bench 2.1: 31% → 54%
- GDM-MRCR v2(장문 맥락): 60.1% → 72.2%
- SWE-Bench Pro: 49.6% → 54.2% (vs 구형 3 Flash)
- OSWorld-Verified: 65.1% → 74.0% (vs 구형 3 Flash)
개발자는 작업 성격에 따라 사고(thinking) 단계를 최소(minimal) · 낮음(low) · 높음(higher) 사이에서 자유롭게 조절할 수 있습니다. 대량 작업은 저비용으로 빠르게, 다단계 서브에이전트 흐름은 더 높은 사고 단계로 정확하게 돌릴 수 있습니다.
Gemini 3.5 Flash Cyber: 버그 헌터 멀티에이전트
3.5 Flash Cyber는 이번 출시 중 가장 특화된 모델입니다. 3.5 Flash를 기반으로 소프트웨어 취약점을 찾고, 검증하고, 패치하도록 파인튜닝(Fine-tuning)된 보안 특화 버전입니다.
"탐색 공간" 문제와 멀티에이전트의 등장
깊은 결함을 찾는다는 건 방대한 실행 탐색 공간(search space)을 뒤지는 일입니다. 거대 모델을 한 번만 부르는 방식은 병목이 됩니다. 그래서 Google은 저렴한 모델을 여러 번 병렬로 호출하는 전략을 택했습니다.
Google의 코드 보안 에이전트 CodeMender 내부에서는 여러 개의 3.5 Flash Cyber 에이전트가 병렬로 실행됩니다. 최대 5회 호출 후 서브에이전트들의 결과를 하나의 보고서로 병합합니다.
V8 JavaScript 엔진에서의 실전 성과
Google의 Big Sleep 평가 결과:
- 🛡️ Gemini 3.5 Flash Cyber: 55개 고유 확인 이슈 발견
- 📊 메인라인 3.5 Flash: 47개
- 🤖 Claude Opus 4.6: 36개
다른 두 모델이 놓친 10개의 이슈를 추가로 잡아냈습니다. 실제 테스트에서 Google의 Cloud Vulnerability Research 팀은 이를 활용해 공개 API의 원격 코드 실행(RCE) 결함을 2시간 안에 찾아내는 데 성공했습니다.
커뮤니티 반응과 이중 용도 논쟁
개발자 커뮤니티 반응은 갈렸습니다. 빌더들은 가격 인하와 토큰 효율성 개선을 환영했고, Hacker News에서는 "플래그십 모델 출시가 너무 느리다"는 비판과 함께 "안정적으로 공급 가능한 용량을 과잉 판매한다는" 우려도 제기됐습니다. 한편 통제 출고된 Flash Cyber는 "자동화된 익스플로잇 탐지 도구를 누가 가져야 하는가"라는 이중 용도 논쟁을 다시 불러왔습니다.
누가 어디서 쓸 수 있나?
| 채널 | 3.6 Flash | 3.5 Flash-Lite | 3.5 Flash Cyber |
|---|---|---|---|
| Gemini API (Google AI Studio) | ✅ 오늘부터 | ✅ 오늘부터 | 파일럿 |
| Android Studio | ✅ | ✅ | — |
| Google Antigravity | ✅ | — | — |
| GitHub Copilot | 순차 배포 | — | — |
| Gemini Enterprise Agent Platform | ✅ | ✅ | — |
| Gemini Enterprise 앱 | ✅ | — | — |
| Gemini 앱 (일반 사용자) | ✅ | — | — |
| Google 검색 | — | 순차 배포 | — |
자주 묻는 질문 (FAQ)
Q1. 에이전틱 워크로드(Agentic Workloads)가 정확히 뭔가요?
AI 에이전트가 도구를 스스로 호출하고, 계획을 세우고, 여러 단계를 거쳐 작업을 끝내는 다단계 작업 흐름을 말합니다. 검색 → 데이터 추출 → 보고서 작성 같은 시퀀스가 대표적입니다.
Q2. 토큰 효율성이 중요한 이유는?
같은 답을 더 적은 토큰으로 뽑을수록 1건당 비용이 크게 떨어지기 때문입니다. 에이전틱 워크로드는 호출 횟수가 많아 토큰 효율 차이가 곧 비용 차이로 직결됩니다.
Q3. SWE-Bench가 뭔가요?
AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 벤치마크입니다. GitHub의 실제 이슈와 코드베이스를 활용해 모델이 버그를 얼마나 자동으로 고치는지 측정합니다.
Q4. 멀티에이전트 시스템은 왜 더 효율적인가요?
방대한 탐색 공간을 한 번에 뒤지는 대신, 작은 모델 여러 개가 병렬로 각자 다른 영역을 뒤지고 결과를 합치는 편이 비용 대비 효율이 좋기 때문입니다. Flash Cyber가 5회 호출 후 서브에이전트 결과를 병합하는 방식이 그 사례입니다.
Q5. 일반 개발자도 Flash Cyber를 쓸 수 있나요?
아직은 아닙니다. 이중 용도 위험 때문에 정부 기관과 신뢰받는 파트너로 한정된 제한 접근 파일럿으로만 운영됩니다.
핵심 요약
- Gemini 3.6 Flash: 출력 토큰 17%↓(DeepSWE 기준 최대 65%↓), 출력 단가 $9.00 → $7.50 / 1M 인하.
- Gemini 3.5 Flash-Lite: 입력 $0.30 / 출력 $2.50 / 1M, 초당 350 토큰, SWE-Bench Pro·OSWorld-Verified에서 구형 3 Flash를 능가.
- Gemini 3.5 Flash Cyber: CodeMender 내부 멀티에이전트 스캔으로 V8에서 55개 이슈 발견(메인라인 Flash 47, Opus 4.6 36 대비).
- Flash Cyber는 이중 용도 위험으로 정부·신뢰파트너 한정 파일럿으로만 제공.
핵심 용어 모음
- 에이전틱 워크로드 (Agentic Workloads)
- LLM 에이전트가 도구를 동적으로 호출해 자율적으로 계획을 세우고 작업을 실행하는 다단계 계산 파이프라인.
- 토큰 효율성 (Token Efficiency)
- 소비한 총 토큰 대비 유용한 출력의 비율. 최소한의 컨텍스트와 연산으로 고품질 답을 얻는 능력.
- 컴퓨터 사용 (Computer Use)
- 에이전트가 스크린샷으로 화면을 보고 클릭·타이핑·스크롤을 결정해 브라우저·데스크톱 작업을 자동화하는 Gemini API 내장 도구.
- 프론티어 안전성 (Frontier Safety)
- Google DeepMind의 안전 프레임워크. 강력한 AI의 위험을 사전에 식별·평가·완화하기 위한 프로토콜.
- 멀티에이전트 시스템 (Multi-agent System)
- 여러 자율적 에이전트가 역할을 분담해 협력해 복잡한 작업을 수행하는 계산 시스템.
- 서브에이전트 (Subagent)
- 부모 에이전트의 지시에 따라 더 큰 작업의 특정 부분을 자율적으로 처리하는 특화 AI 에이전트.
- 이중 용도 위험 (Dual-use Risk)
- 동일 AI 응용이 적법 용도와 악의적 용도 모두에 사용될 수 있어 발생하는 위험.
- CBRN
- 화학·생물·방사선·핵. AI가 관련 무기 지식·설계를 생성하지 못하도록 막는 보호 장치를 의미.
- 파인튜닝 (Fine-tuning)
- 사전 학습된 모델을 특정 작업·도메인에 맞춰 추가로 학습시켜 성능을 최적화하는 과정.
- SWE-Bench
- AI 모델의 소프트웨어 엔지니어링 능력을 평가하는 표준 학술 벤치마크.