DiffusionGemma 개발자 가이드는 병렬 텍스트 생성을 설명합니다

DiffusionGemma는 병렬 정제와 더 낮은 메모리 사용으로 텍스트 생성을 가속화합니다 Google의 가이드, 코드, 파인튜닝 도구를 사용해 더 빠르게 테스트하고 배포하세요

Google이 Gemma 4 백본을 기반으로 구축된 실험적 모델인 DiffusionGemma에 대한 개발자 가이드를 공개했습니다. 이 게시물은 이 모델이 확산 기반 생성을 사용해 텍스트를 병렬로 정교화하는 방식을 설명하며, 지원되는 GPU에서 더 빠른 토큰 생성과 기존의 자기회귀 모델보다 더 낮은 메모리 요구 사항을 제공한다고 주장합니다. 이 가이드는 양방향 어텐션, 256토큰 캔버스, 그리고 더 긴 출력을 위한 블록 자기회귀 접근 방식을 포함한 모델의 아키텍처를 설명합니다. 게시물에 따르면 이러한 설계 선택은 속도를 높이고, 생성 중 자기 수정 기능을 지원하며, vLLM과 같은 서빙 프레임워크에서 배포를 더 쉽게 만들기 위한 것입니다. 모델을 어떻게 맞춤 설정할 수 있는지 보여주기 위해, Google은 Hackable Diffusion 연구 툴박스를 사용한 스도쿠 파인튜닝 예시를 강조합니다. 회사는 이렇게 조정된 모델이 해당 작업의 정확도를 높이고 필요한 추론 단계 수를 줄인다고 말합니다. 이 게시물은 또한 코드를 예시, 모델 가중치, 그리고 시스템을 테스트하거나 파인튜닝하려는 개발자를 위한 지원 도구 및 문서 링크를 포함한 배포 및 학습 자료도 제공합니다.