Gemma 4 12B 개발자 가이드, 로컬 멀티모달 AI를 강조
Gemma 4 12B는 기본 오디오, 비전, 텍스트를 갖춘 로컬 멀티모달 AI를 제공합니다 16GB 노트북에서 실행하고 Google의 새로운 추론 도구로 속도를 높이세요
구글은 로컬 사용을 위해 설계된 밀집형 멀티모달 모델 Gemma 4 12B를 출시했으며, 이에 대한 세부 내용은 2026년 6월 3일 새 개발자 가이드에 공개됐다. 회사는 이 모델이 비전, 오디오, 텍스트를 언어 모델 백본에 직접 전달하는 통합형 인코더 없는 아키텍처를 사용한다고 밝혔다.
가이드에 따르면 Gemma 4 12B는 Gemma 제품군에서 네이티브 오디오 입력을 지원하는 최초의 중간 규모 모델이며, 16GB VRAM 또는 통합 메모리가 있는 노트북에서 실행되도록 설계됐다. 구글은 또한 로컬 추론 속도를 향상시키기 위한 별도의 멀티 토큰 예측 모델도 제공된다고 밝혔다.
이 게시물은 이 아키텍처가 지연 시간을 줄이고 메모리 사용을 단순화하기 위해 별도의 비전 및 오디오 인코더를 제거하는 방식을 설명한다. 또한 macOS 앱, LiteRTLM을 통한 로컬 OpenAI 호환 API 서버, 그리고 LM Studio, Ollama, Hugging Face Transformers, llama.cpp, MLX, SGLang, vLLM과 같은 도구 지원을 포함한 새로운 데스크톱 및 온디바이스 개발자 통합 기능도 설명한다.