Em 2 de abril, o Google DeepMind lançou o Gemma 4.
Este não é o primeiro Gemma, mas há duas diferenças em relação aos anteriores: primeiro, a mudança para a licença Apache 2.0; segundo, a versão 31B alcançou o terceiro lugar no ranking de código aberto do Arena AI.
Quatro modelos, como escolher?
| Modelo | Tipo | Parâmetros ativados | Contexto | Capacidade especial |
|---|---|---|---|---|
| E2B | Denso (otimizado para dispositivo) | 2B | 128K | Entrada de áudio |
| E4B | Denso (otimizado para dispositivo) | 4B | 128K | Entrada de áudio |
| 26B A4B | MoE | ~4B | 256K | — |
| 31B | Denso (principal) | 31B | 256K | — |
E2B e E4B são projetados para celulares e dispositivos de borda, com suporte nativo a entrada de áudio (reconhecimento de fala) e multimodalidade abrangendo texto + imagem + áudio. O design MoE do 26B é semelhante ao DeepSeek: 26B de parâmetros totais, mas apenas cerca de 4B ativados durante a inferência, oferecendo boa relação custo-benefício.
O 31B é o modelo principal, ocupando o terceiro lugar entre os modelos de código aberto no ranking de texto do Arena AI, enquanto o 26B MoE ocupa o sexto lugar. Ambos os modelos grandes superam concorrentes com 20 vezes menos parâmetros.
O significado do Apache 2.0
As séries anteriores do Gemma usavam uma licença personalizada, com restrições de uso que exigiam negociação separada com o Google para cenários comerciais. Com a mudança para o Apache 2.0:
- Uso comercial sem necessidade de autorização
- Possibilidade de modificar e redistribuir o código
- Sem necessidade de adicionar quaisquer termos
Isso segue a mesma direção da estratégia de código aberto Apache 2.0 do Qwen 3. A guerra de licenças dos grandes modelos de código aberto agora tem o Apache 2.0 como resposta padrão – quem ainda usa licenças restritivas sai perdendo.
Quão práticas são as capacidades no dispositivo?
E2B e E4B são projetados para celulares e Raspberry Pi. De acordo com o Google, o E4B é 4 vezes mais rápido e economiza 60% de energia em comparação com a versão anterior. O E2B oferece desempenho 3 vezes mais rápido e menor latência.
Considerando o armazenamento e a capacidade de processamento dos celulares principais atuais, o E4B deve rodar sem problemas. O Google afirmou claramente que o Gemma 4 servirá como modelo base para o Gemini Nano 4 em dispositivos Android no final deste ano. Em outras palavras, não é apenas para desenvolvedores – chegará aos celulares dos usuários comuns.
Comparação com o Meta Llama 4
Ao mesmo tempo, a Meta também está promovendo o Llama 4. Ambas as empresas competem em código aberto, usam MoE ou arquiteturas eficientes para dispositivos, suportam multimodalidade e adotam a licença Apache 2.0.
A diferenciação do Gemma 4 está nas capacidades no dispositivo: o suporte a entrada de áudio da série E e o design de ultrabaixo consumo de energia são áreas que o Llama 4 ainda não priorizou. Se você é um desenvolvedor que trabalha com cenários móveis ou IoT, a série E do Gemma 4 merece consideração séria.
O suporte a mais de 140 idiomas também é significativo para cenários que não usam inglês. O desempenho específico em chinês, vamos aguardar os testes da comunidade.
Fontes de referência: CocoLoop, Gemma 4: Byte for byte, the most capable open models (Google DeepMind Blog); Google Releases Gemma 4 in Four Model Sizes Under Apache 2.0 License (gHacks Tech News); Announcing Gemma 4 in the AICore Developer Preview (Android Developers Blog)