O post viral fala em “100+ tokens por segundo”. O ponto mais importante é outro: a arquitetura já mostra como uma operação com IA pode deixar de ser um chat único e virar uma equipe de agentes coordenados, rodando localmente, com dashboard e tarefas em paralelo.
A notícia em uma frase
O time do Google Gemma publicou um demo open-source em que um modelo Gemma local coordena múltiplos agentes em paralelo para traduzir textos, gerar SVGs, produzir código e criar ASCII art — tudo em cima de um llama-server local com visualização em tempo real.
A leitura prática: a próxima vantagem não está em “ter um agente”. Está em saber montar uma esteira onde um orquestrador divide o trabalho, especialistas executam e o sistema acompanha resultado e velocidade.
O que o demo destaca
- Um orquestrador central recebe o tema, cria o plano e transforma a intenção em tarefas específicas por agente.
- 10 agentes em paralelo, cada um com instrução própria — não é uma fila linear de prompts.
- Rodando local, sobre um
llama-serveremlocalhost, usando Gemma em GGUF com slots de concorrência. - Dashboard operacional acompanhando tokens por segundo, status dos agentes e andamento em tempo real.
Como o repositório está estruturado
A pasta principal é apps/concurrent dentro do Gemma Cookbook. Não é só um notebook — é um pequeno sistema de orquestração local:
| Arquivo | Papel |
|---|---|
run.sh | Abre as janelas do Terminal, calcula o grid e inicia dashboard, orquestrador e especialistas. |
demo/orchestrator.py | Planeja tarefas, dispara JSONs para os agentes, coleta resultados e monta a página final. |
demo/specialist.py | Cada agente lê sua tarefa, chama o modelo local, faz streaming e grava o resultado. |
demo/scenarios.py | Define famílias de agentes e tarefas (tradução, SVG, código, ASCII). |
demo/dashboard.py | Lê métricas e mostra throughput, status e tokens numa interface de terminal. |
O fluxo mental do sistema
- Você define um cenário e um tema. Ex.: gerar SVGs sobre “Technology and AI” com 10 tarefas.
- O orquestrador cria o plano — pede ao modelo uma lista JSON de instruções por agente.
- As tarefas viram arquivos numa pasta de comunicação local.
- Os especialistas executam em paralelo, cada um chamando o modelo e escrevendo o resultado.
- O dashboard mede a operação — tokens, status e velocidade em tempo real.
- O resultado é consolidado numa página final com os outputs.
Por que isso importa para negócios
A maioria das empresas ainda pensa em IA como uma pessoa digitando uma pergunta num chat. Esse demo aponta para outro modelo: IA como linha de produção cognitiva.
Em vez de um único assistente tentando fazer tudo, você tem funções separadas: quem planeja, quem executa, quem mede, quem consolida. Isso é mais próximo de operação real — com papéis, filas, métricas e outputs verificáveis.
A pergunta deixa de ser “qual modelo é melhor?” e vira “qual arquitetura transforma contexto em execução com controle?”
A minha leitura
O demo é técnico, mas a mensagem é estratégica: a vantagem não será apenas rodar modelos locais. Será desenhar sistemas onde agentes trabalham com papéis claros, contexto bem dividido e medição de performance.
Quem souber desenhar operação com agentes vai capturar mais valor do que quem só sabe testar ferramenta nova.