Gemma 4 출시: 스마트폰에서 돌아가는 31B 오픈소스 모델, AI 판도 바꿀까

구글이 AI 모델 4개를 한꺼번에 풀었음. 그런데 벤치마크 숫자보다 중요한 게 하나 있음. Gemma 4 오픈소스 AI 모델의 라이선스가 Apache 2.0이라는 것임.

2026년 4월 2일, 구글이 Gemma 4를 공개했음. 스마트폰용 23억 파라미터 모델부터 프론티어급 310억 파라미터 Dense 모델까지 4종임 (Google Blog).

수학 벤치마크 AIME 2026에서 89.2%를 찍었음. 전세대가 약 45%였으니 2배 넘는 점프임.

진짜 이야기는 벤치마크가 아님. Apache 2.0 — 사용자 수 제한 없음, 사용 정책 변경권 없음, 법적 회색지대 없음. 구글 AI 모델 중 최초임 (VentureBeat).

Meta의 Llama는 여전히 월간 활성 사용자(MAU) 7억 명 제한이 걸려 있음. Gemma 4는 그 천장 자체를 없앤 것임.

핵심 질문은 하나임. Gemma 4, Qwen 3.6, Llama 4 — 기업이 실제로 선택해야 할 Gemma 4 오픈소스 AI 모델 비교 분석을 해보겠음.

TL;DR — Apache 2.0 라이선스가 Gemma 4의 진짜 혁신

  • 구글 최초 제한 없는 오픈소스 AI — 스마트폰부터 데이터센터까지 4개 모델
  • 수학 벤치마크 2배 도약(89.2%), MoE 변형은 85% 적은 파라미터로 Dense의 97% 성능
  • Gemma 4 vs Qwen 3.6 vs Llama 4, 선택 기준은 라이선스 리스크·컨텍스트 길이·온디바이스 필요

Gemma 4 오픈소스 AI 모델 비교: 4개 모델, 하나의 라이선스

Gemma 4는 4가지 변형으로 출시됨. 쉽게 말해 식당 메뉴와 비슷함 — 간편식(E2B)부터 풀코스(31B Dense)까지 한 번에 깔아놓은 것임.

E2B (23억 파라미터) — 주머니 속 모델

스마트폰, 라즈베리 파이, 엔비디아 젯슨 보드에서 오프라인 실행이 가능함. 클라우드 지연(Latency)을 용납할 수 없는 환경용임.

E4B (45억 파라미터) — 중간급 폰 모델

멀티턴 대화와 기본적인 에이전트 작업이 가능하면서 안드로이드 AICore 런타임에서 돌아감.

MoE 26B (활성 38억 파라미터) — 효율의 핵심

전체 260억 파라미터 중 38억만 활성화하는 혼합 전문가(Mixture-of-Experts) 구조임. 비유하면 종합병원에서 모든 의사가 모든 환자를 보는 게 아니라, 환자를 해당 전문의에게 배정하는 방식임 (Google Blog, ai.rs).

31B Dense — 플래그십

수학·코딩·추론 전 영역에서 프론티어급 성능을 보여주는 모델임.

4개 모두 동일한 Apache 2.0 라이선스임. 모델 크기에 따른 차등 제한이 없음.


FIG. 01 — GEMMA 4 핵심 지표


89.2%


AIME 2026 수학 전세대 대비 +97%


4억+


누적 다운로드


10만+


파생 모델

출처: Google Blog, 2026년 4월

벤치마크: Gemma 4 오픈소스 AI 모델 비교

벤치마크 숫자를 직접 비교해보면 그림이 선명해짐.

벤치마크Gemma 4 31BQwen 3.6 PlusLlama 4 Scout측정 항목
AIME 2026 (수학)89.2%~82%~75%고급 수학 추론
LiveCodeBench v680.0%~74%~71%실전 코딩
GPQA Diamond84.3%~80%~76%대학원급 과학 QA
τ2-bench (에이전트)86.4%~78%~80%다단계 도구 사용
컨텍스트 윈도우256K128K10M최대 입력 길이
라이선스Apache 2.0Apache 2.0Community (MAU 7억 제한)

Gemma 4가 순수 추론 벤치마크에서 이김. 그런데 표가 보여주는 더 중요한 사실이 있음. 각 모델의 킬러 피처가 다르다는 것임.

Llama 4 Scout의 컨텍스트 윈도우는 1,000만 토큰임. Gemma 4의 256K보다 39배 큼. 코드베이스 전체를 한 번에 분석하거나 수백 페이지 문서를 처리해야 한다면 무시하기 어려운 차이임 (DigitalApplied).

Qwen 3.6 Plus는 201개 언어를 지원하고, API 가격이 100만 토큰당 $0.5임. Claude의 $18과 비교하면 36배 저렴함. 다국어 서비스를 운영하는 기업에겐 압도적인 비용 우위인 것임 (Constellation Research).

MoE 효율성의 비밀

MoE 26B 모델은 따로 짚을 가치가 있음. 쿼리 하나당 260억 중 38억 파라미터만 깨어남. 나머지 85%는 대기 상태임 — 이게 설계 의도임.

결과는 명확함. 31B Dense 정확도의 97%를 활성 연산량 7분의 1로 달성함. 기업 배포 시 GPU 비용과 추론 속도에 직접 연결되는 수치임 (Google Blog).

모바일에서는 차이가 더 극적임. 구글에 따르면 이전 세대 온디바이스 모델 대비 4배 빠른 추론, 60% 배터리 절감을 달성했음. 안드로이드 AICore 통합 덕분임 (Google Developers Blog).

온디바이스 AI: 조용한 파괴

클라우드 AI가 주목을 받지만, 실제 파괴력은 온디바이스 추론에 있을 수 있음.

E2B(23억)와 E4B(45억) 모델은 인터넷 없이 디바이스에서 완전히 돌아감. 클라우드 AI가 절대 서빙할 수 없는 영역이 열리는 것임 — 오지의 의료 기기, 비행 모드 산업용 센서, 데이터가 디바이스를 떠나면 안 되는 프라이버시 민감 앱.

구글이 Arm, 엔비디아와 파트너십을 맺어서 Gemma 4 E 시리즈는 출시 첫날부터 Arm Cortex-A와 엔비디아 젯슨 하드웨어에 최적화되어 있음.

안드로이드 AICore 개발자 프리뷰가 핵심임. 이전에는 개발자마다 모델 로딩 파이프라인을 직접 구축해야 했음. 이제는 카메라나 GPS 접근하듯 시스템 서비스를 호출하면 됨. 이런 표준화 흐름은 AI 개발 도구 전체 판도를 바꾸고 있음.


FIG. 02 — 오픈소스 AI 라이선스 비교


라이선스
MAU 제한
AUP
특허

Gemma 4

Apache 2.0

없음
없음
명시적


Qwen 3.6

Apache 2.0

없음
없음
명시적


Llama 4

Community

7억
Meta
제한적

출처: VentureBeat, Interconnects — 2026년 4월

에이전트 네이티브 설계

Gemma 4는 프롬프트 엔지니어링으로 함수 호출을 억지로 시키는 모델이 아님. 처음부터 에이전트 워크플로우용으로 설계된 것임.

구조화된 JSON 출력, 멀티스텝 플래닝, 에러 복구가 포함된 함수 호출, 행동 전 추론 과정을 보여주는 Extended Thinking 모드가 기본 탑재임 (Google Blog).

τ2-bench(다단계 도구 사용 측정) 86.4%는 Qwen 3.6과 Llama 4 모두를 앞섬.

기업이 AI 에이전트 시스템을 구축할 때 래퍼 라이브러리를 줄이고, 프롬프트 엔지니어링 오버헤드를 낮추고, 도구 사용 안정성을 높일 수 있다는 뜻임. 이미 비즈니스 케이스를 증명한 기업들의 사례는 AI 에이전트 기업 도입 ROI 분석에서 확인할 수 있음.

라이선스 전쟁: Gemma 4 오픈소스 AI 모델 비교의 핵심

실질적 차이는 이것임. Gemma 4나 Qwen 3.6으로 만든 제품이 MAU 7억을 넘겨도 누구에게도 재협상할 필요가 없음. Llama는 그래야 함 (VentureBeat).

이론적인 이야기가 아님. 스포티파이(6.26억 MAU), 왓츠앱(20억+ MAU), 틱톡(15억+ MAU) — 모두 Llama 기준을 초과함. Apache 2.0은 그 천장 자체를 없애는 것임.

숨겨진 비용의 함정

오픈소스 AI 모델은 비용을 86% 절감할 수 있음. 프로프라이어터리 API 대비 압도적인 수치임 (Swfte AI).

그런데 반직관적인 현실이 있음. AI 워크로드 중 오픈소스 비율이 오히려 하락했음 — 19%에서 13%로.

이유가 있음. 파인튜닝 엔지니어 인건비, 자체 호스팅 GPU 인프라, 유지보수, 보안 패치 비용이 연간 $125K(약 1.8억 원)에서 $12M(약 170억 원)까지 들어감.

공식은 단순함. ML 엔지니어링 역량이 있고 추론 볼륨이 전용 GPU 인프라를 정당화할 수준이면 오픈소스가 절약됨. 월 API 호출 10만 건 미만이면 OpenAI나 Anthropic의 프로프라이어터리 API가 총소유비용(TCO) 기준으로 오히려 저렴할 수 있음.

Gemma 생태계: 4억 다운로드의 의미

Gemma는 신생 모델이 아님. Gemma 패밀리 전체가 누적 4억 회 이상 다운로드되었고, 10만 개 넘는 파생 모델이 만들어졌음 — 구글이 “Gemmaverse”라고 부르는 생태계임 (Google Blog).

출시 첫날부터 Hugging Face, Ollama, Kaggle, LM Studio, Docker 5개 플랫폼에서 바로 사용 가능함.

생태계 깊이가 중요한 이유는 플라이휠 효과 때문임. 사용자 증가 → 파인튜닝 변형 증가 → 커뮤니티 도구 증가 → 다시 사용자 증가. Llama도 비슷한 역학이 있지만, Gemma의 Apache 2.0 라이선스가 고성장 스타트업이 느끼는 마찰을 제거하는 것임.

한국 시장에 던지는 질문

한국 테크 기업은 독특한 셈법에 직면해 있음. 네이버(HyperCLOVA X)와 카카오(Kanana)가 자체 한국어 모델에 대규모 투자를 해왔는데, Gemma 4의 다국어 성능 개선이 그 전략에 압박을 가하는 것임.

자체 모델을 훈련할 여력이 없는 중견 기업에게는 Gemma 4의 온디바이스 기능이 새로운 길을 열어줌. 유통 체인이 매장 내 태블릿에 E4B를 배포해서 고객 서비스를 돌릴 수 있음 — 한국어로, 완전 오프라인으로, API 비용 0원으로 (ZDNet Korea).

한 가지 공백이 있음. Gemma 4의 256K 컨텍스트 윈도우는 한국어 문서 처리에서 제약이 될 수 있음. 한국어 텍스트는 영어보다 글자당 토큰 수가 많아 실질적인 처리 용량이 줄어듦. 한국 법률·규제 문서 분석에는 Llama 4의 1,000만 토큰 컨텍스트가 더 실용적일 수 있음.

CTO 의사결정 프레임워크

오픈소스 AI 모델을 기업 배포용으로 평가하고 있다면, 세 가지를 점검하면 됨.

1. 라이선스 리스크 감사

제품이 3년 안에 MAU 7억을 넘길 가능성이 있다면 Llama를 후보에서 제외하면 됨. Apache 2.0 모델(Gemma 4 또는 Qwen 3.6)이 그 리스크를 제거함.

2. 모델-워크로드 매칭

온디바이스 추론이 필요하면 Gemma 4 E 시리즈. 대규모 컨텍스트 윈도우가 필요하면 Llama 4 Scout. 초저가 다국어 API가 필요하면 Qwen 3.6 Plus.

3. 총소유비용(TCO) 계산

오픈소스 86% 절감 효과는 자체 호스팅을 지원할 엔지니어링 팀이 있을 때만 실현됨. 인프라와 유지보수에 최소 연간 $125K(약 1.8억 원)을 예산에 잡아야 함.


INSIGHT

오픈소스 AI 모델 전쟁은 더 이상 벤치마크 싸움이 아님. 법적 확실성 싸움임. 구글이 Gemma 4에 Apache 2.0을 건 것은 “오픈”의 새로운 기준선을 만든 것임.


ACTION

AI 인프라를 평가하는 엔지니어나 프로덕트 매니저라면, 리더보드가 아니라 라이선스부터 보면 됨. 오늘 선택한 모델은 제품에 수년간 박혀 있게 됨. 벤치마크 5% 차이는 사용자 1,000만 명 시점에 라이선스 변경이 마이그레이션을 강제하면 아무 의미 없음.

참고 자료

  1. Gemma 4 — Google Blog
  2. Apache 2.0 라이선스 의미 — VentureBeat
  3. Gemma 4 vs Qwen vs Llama 벤치마크 — ai.rs
  4. 오픈소스 AI 판도 2026 — DigitalApplied
  5. Gemma 4 엣지 배포 — Google Developers
  6. NVIDIA Gemma 4 — NVIDIA Blog
  7. Android AICore — Android Developers
  8. Qwen 3.6 Plus — Constellation Research
  9. 오픈소스 86% 절감 — Swfte AI
  10. 구글 젬마4 — ZDNet Korea
  11. Gemma 4 커뮤니티 — PyTorchKR
  12. Gemma 4 오픈모델 분석 — Interconnects
  13. Gemma 4 Arm — Arm Newsroom
  14. Gemmaverse Apache 2.0 — Google OSS Blog

자주 묻는 질문 (FAQ)

Gemma 4 오픈소스 AI 모델과 Llama 4의 가장 큰 차이는 무엇인가요?

가장 큰 차이는 라이선스입니다. Gemma 4는 Apache 2.0으로 사용 제한이 전혀 없고, Llama 4는 월간 활성 사용자 7억 명 제한과 Meta의 사용 정책이 적용됩니다. Gemma 4가 수학·코딩 벤치마크에서 앞서지만, Llama 4는 1,000만 토큰 컨텍스트 윈도우를 제공합니다.

Gemma 4 오픈소스 AI 모델을 인터넷 없이 스마트폰에서 실행할 수 있나요?

가능합니다. E2B(23억 파라미터)와 E4B(45억 파라미터) 변형이 완전한 오프라인 온디바이스 추론용으로 설계되었습니다. 안드로이드 AICore 런타임과 Arm 프로세서에 최적화되어 이전 세대 대비 4배 빠른 추론과 60% 배터리 절감을 달성합니다.

MoE 모델이 Dense 모델 성능의 97%를 달성하는 원리는 무엇인가요?

혼합 전문가(MoE) 아키텍처가 쿼리마다 260억 전체 파라미터 중 38억만 활성화하여 전문화된 하위 네트워크로 입력을 라우팅합니다. 연산량의 약 7분의 1만 사용하면서 벤치마크 전반에서 플래그십에 가까운 정확도를 유지합니다.

한국 기업이 Gemma 4 오픈소스 AI 모델을 도입할 때 주의할 점은 무엇인가요?

256K 컨텍스트 윈도우가 한국어 문서 처리에서 제약이 될 수 있습니다. 한국어는 영어보다 글자당 토큰 수가 많아 실질 처리 용량이 줄어듭니다. 또한 자체 호스팅 비용이 연간 1.8억~170억 원 수준이므로 총소유비용(TCO) 계산이 필수입니다.

면책 조항: 이 글은 정보 제공 목적이며 투자 조언이 아닙니다. 기술 사양과 벤치마크는 2026년 4월 기준 공개 데이터를 반영하며 변경될 수 있습니다. 기술 도입 결정 전 자체 실사를 수행하는 것을 권장합니다.

이 글이 도움이 되셨나요?

☕ Buy me a coffee