iaia-gratis9routeropencodellm
IAs gratuitas pra programar: os modelos que funcionam de verdade
Toda vez que eu publico um vídeo sobre IA gratuita pra programar, aparece o mesmo comentário: "cara, a NVIDIA não funciona mais", "o teu tutorial tá quebrado", "aqui dá erro". Eu entendo a frustração, mas quase sempre o diagnóstico tá errado.
O provider funciona. O que morreu foi o modelo que eu mostrei naquele vídeo.
Essa página existe pra resolver isso de uma vez. Ela é viva: eu atualizo conforme as coisas mudam. Se você chegou aqui por um vídeo antigo, o que vale é o que tá escrito aqui, não o que tá no vídeo.
Última revisão: 1 de setembro de 2026.
Antes de tudo: as 4 camadas
Noventa por cento da confusão vem de misturar quatro coisas que são diferentes:
| Camada | O que é | Exemplo |
|---|---|---|
| Modelo | o cérebro em si, tem nome e versão | gpt-oss-120b, codestral-latest |
| Provider | a empresa que roda esse modelo e te dá um endpoint | Cloudflare, NVIDIA, Mistral |
| Roteador | o que fica no meio e escolhe pra qual provider mandar | 9Router, OmniRoute |
| Cliente | o programa onde você digita | OpenCode, Claude Code, Cursor |
Um modelo pode morrer sem o provider morrer. É o caso mais comum, e é exatamente o que aconteceu com a NVIDIA: o z-ai/glm-5.2 que eu usei no vídeo do 9Router foi aposentado em 21 de agosto de 2026 e devolve erro de "end of life". A NVIDIA tá de pé, o catálogo dela tá gigante, só aquele modelo que sumiu.
Então quando der erro, a primeira pergunta é: é o provider ou é o modelo? Tem uma seção no fim ensinando a descobrir isso em dez segundos.
A tabela rápida: o que funciona hoje
Tudo aqui foi testado por mim via 9Router, com request real: um "diga OK", uma chamada de ferramenta, busca de agulha no palheiro em 8 mil e 48 mil tokens de contexto, e geração de código em Python medindo tokens por segundo.
| Fonte | Modelo que funciona | Velocidade medida | Cota grátis |
|---|---|---|---|
| Cloudflare Workers AI | @cf/openai/gpt-oss-120b | 1,8s, 98 tok/s | 10.000 Neurons/dia, zera todo dia |
| Google Gemini (AI Studio) | gemini-2.5-flash | 0,8s, 82 tok/s | Google não publica mais, só logado |
| Mistral | codestral-latest | 0,4s, 119 tok/s | US$ 10/mês de crédito, sem cartão |
| Ollama Cloud | gpt-oss:120b | 0,8s, 104 tok/s | "uso leve", 1 modelo por vez |
| Kilo Gateway | kilo-auto/free | 2,6s, 46 tok/s | 200 req/h por IP, sem conta |
| OpenCode Free | big-pickle | 0,8s | ~200/dia, sem chave |
| NVIDIA Build | deepseek-ai/deepseek-v4-flash-0731 | 24s, oscila até 89s | 40 RPM, trial |
| OpenRouter | minimax/minimax-m3:free | 1,2s, 92 tok/s | 50 req/dia |
| Z.ai | glm-4.5-flash e glm-4.7-flash | 30 a 45s, quando responde | free permanente, 1 por vez |
Os cavalos de verdade são quatro: Codestral, os dois gpt-oss (Cloudflare e Ollama) e o Gemini Flash. O resto entra como rede de segurança, e eu explico o porquê logo abaixo.
Fonte por fonte, com as pegadinhas
Cloudflare Workers AI
A mais generosa. São 10 mil Neurons por dia que zeram todo dia, e quando acaba ela simplesmente bloqueia, sem te cobrar nada.
- Usa:
@cf/openai/gpt-oss-120b(e o-20bse quiser algo mais leve), Llama 3.3 70B,@cf/zai-org/glm-4.7-flash. - Não usa: Kimi K2.6/K2.7, a família GLM 5.x e o DeepSeek V4. Desde 28 de julho de 2026 eles exigem plano pago e devolvem 403 na sua cara, mesmo aparecendo no catálogo.
- Onde pega: dash.cloudflare.com, menu AI, Workers AI, botão REST API. Você precisa do token e do Account ID (o hash na URL do dashboard). Não precisa criar Worker nenhum, apesar da página empurrar isso.
Google Gemini (AI Studio)
- Usa:
gemini-2.5-flash. O3.7-flashexiste no free e é feito pra agente, mas travou nos meus testes via roteador. Testa antes de confiar. - Cuidado: o Google parou de publicar os limites do plano grátis. Você só vê os seus números logado, em
aistudio.google.com/rate-limit. - A letra miúda que importa: no plano grátis o Google usa o seu conteúdo pra treinar e revisores humanos podem ler. Código de cliente aqui, nunca.
Mistral
A melhor surpresa. O tier "Experiment" não existe mais, virou "Free mode": US$ 10 de crédito por mês, sem cartão.
- Usa:
codestral-latest. Foi o mais rápido de tudo que eu testei, 0,4s e quase 120 tokens por segundo. - Morreu: a linha Devstral inteira foi aposentada em 31 de julho de 2026.
- Faz isso antes de usar: o treino com seus dados vem ligado por padrão. Desliga o toggle "Anonymous improvement data" nas configurações.
Ollama Cloud
- Usa:
gpt-oss:120b,qwen3.5,minimax-m3. - Não usa:
glm-5.3-flash:cloud(pede assinatura, 402) ekimi-k2.5(retirado em 31 de julho). - O melhor argumento dela: privacidade. Não treina com o seu prompt e não guarda nada. Se você mexe com código sensível, é essa.
Kilo Gateway
Sem conta, sem chave, sem cartão. Você cola a URL e roda.
- Base URL:
https://api.kilo.ai/api/gateway, como provider custom do tipo OpenAI-compatible. No campo da chave, qualquer coisa serve. - A pegadinha que trava todo mundo: enquanto não existe uma conexão, a lista de modelos fica vazia e o botão de importar fica apagado. A conexão vem antes dos modelos, é o inverso do que parece. Depois é um clique em "Import from /models" e vêm os 366 de uma vez.
- Privacidade: ela roteia pro pool
:freeda OpenRouter, e a própria doc avisa que os providers podem logar e treinar com o seu prompt.
OpenCode Free
O 9Router lista os modelos oc/ sem você criar nada, porque entra pelo mesmo caminho anônimo que o app do OpenCode usa quando você não tá logado.
- Usa:
big-pickle. Onemotron-3-ultra-freedeu 502 do upstream nos meus testes. - Ressalva honesta: dentro do OpenCode isso é 100% oficial. Por fora, é imitação do cliente deles. Por isso eu deixo essa lá pro fim da fila.
NVIDIA Build
Essa é a que mais gera comentário, então vamos com calma.
- Morreu em 21 de agosto de 2026:
z-ai/glm-5.2, o modelo do meu vídeo do 9Router. Devolve 410, "end of life". Se você seguiu aquele vídeo e deu erro, era isso. - Usa hoje:
deepseek-ai/deepseek-v4-flash-0731. Repara no-0731no fim, ele importa. - Pegadinha dupla: o catálogo do 9Router oferece
deepseek-ai/deepseek-v4-flashsem o número, e esse está aposentado. O que funciona é o com número, e ele só existe se você cadastrar na mão. - Outra: modelo novo da NVIDIA só responde pela API depois que você clica em "Try API" na página dele no build.nvidia.com. Antes disso, 404.
- Espera oscilação: no mesmo teste ela foi de 4 segundos a 89 segundos e terminou em erro de sobrecarga.
OpenRouter
- Usa:
minimax/minimax-m3:free,nvidia/nemotron-3-ultra-550b-a55b:free. - O que ninguém te fala: o MiniMax free responde lindo, mas não chamou a ferramenta no meu teste. Pra conversar tá ótimo, pra rodar como agente não serve.
- Cota: 50 requisições por dia (mil, se um dia você já colocou US$ 10 na conta). Numa sessão de agente, 50 morre em minutos.
Z.ai (GLM Flash)
- Usa:
glm-4.5-flashouglm-4.7-flash. Oglm-4.7sem "flash" é pago. - A pegadinha dos dois GLM: o 9Router tem dois providers de nome parecido. O que funciona com a chave grátis é o "GLM Coding", que bate em
api.z.ai, apesar do nome. O "GLM (China)" bate emopen.bigmodel.cne responde "saldo insuficiente, faça recarga". - Onde pega a chave:
https://z.ai/manage-apikey/apikey-list. Não é na home, que é o chat. E ignora o botão "Get API Key" que aparece no provider, porque ele joga pro site chinês. - Sinceridade: de manhã ela respondia em 30 a 45 segundos. De tarde recusou tudo dizendo que tava ocupada. Serve de reserva, não de principal.
O cemitério de 2026
Se um tutorial, meu ou de qualquer outra pessoa, menciona um desses, ele tá desatualizado, não quebrado:
| O que morreu | Quando | Onde era |
|---|---|---|
z-ai/glm-5.2 | 21/08/2026 | NVIDIA Build |
| GitHub Models | 30/07/2026 | GitHub |
| Devstral (linha toda) | 31/07/2026 | Mistral |
kimi-k2.5 | 31/07/2026 | Ollama Cloud |
| Kimi, GLM 5.x e DeepSeek V4 no free | 28/07/2026 | Cloudflare (viraram pagos) |
deepseek-v4-flash sem sufixo de data | 2026 | NVIDIA Build |
mmf/mimo-auto | 2026 | Xiaomi MiMo |
| Tier Experiment | 2026 | Mistral (virou Free mode) |
| Chutes e o free da Xiaomi | 2026 | — |
O combo: a ordem importa mais do que parece
Junta tudo num roteador e você para de se importar com qual morreu. A regra de ouro do fallback: ele só troca de modelo quando dá erro, nunca quando tá lento. Se você põe a NVIDIA em primeiro, toda pergunta sua vai esperar ela demorar antes de qualquer coisa acontecer. Eu já cometi esse erro e um simples "olá" levou quase um minuto.
Rápido e diário na frente, crédito mensal no meio, lento e instável no fim:
text
1. cloudflare-ai/@cf/openai/gpt-oss-120b
2. gemini/gemini-2.5-flash
3. ollama/gpt-oss:120b
4. mistral/codestral-latest
5. kilo/kilo-auto/free
6. oc/big-pickle
7. nvidia/deepseek-ai/deepseek-v4-flash-0731
8. openrouter/minimax/minimax-m3:free
9. glm/glm-4.5-flashE um segundo combo, só de modelo grande, pra tarefa difícil:
text
1. kiro/claude-sonnet-4.5
2. nvidia/deepseek-ai/deepseek-v4-pro-0813
3. nvidia/nvidia/nemotron-3-ultra-550b-a55b
4. openrouter/nvidia/nemotron-3-ultra-550b-a55b:free
5. gemini/gemini-2.5-pro
6. kilo/kilo-auto/freeRepara nas posições 2, 3 e 4: é o mesmo modelo entrando por três portas diferentes. Se a NVIDIA cai, a OpenRouter serve. Se a OpenRouter esgota, o OpenCode serve.
Se o modelo não aparecer na lista
Isso vai acontecer com você, e não quer dizer que o modelo não funciona. O catálogo do roteador é uma lista curada, e ela fica pra trás do que as empresas lançam toda semana. O gpt-oss da Cloudflare, que é o primeiro do meu combo e responde em um segundo, não estava lá.
Vai no provider, desce até Available Models, clica em + Add Model e cola o nome exato. Ele aparece marcado como custom e já pode entrar no combo.
Os que eu precisei cadastrar na mão:
| Provider | Nome exato pra colar |
|---|---|
| Cloudflare | @cf/openai/gpt-oss-120b |
| NVIDIA | deepseek-ai/deepseek-v4-flash-0731, deepseek-ai/deepseek-v4-pro-0813 |
| Z.ai (GLM Coding) | glm-4.5-flash, glm-4.7-flash |
| OpenCode Free | big-pickle, nemotron-3-ultra-free |
| OpenRouter | minimax/minimax-m3:free, nvidia/nemotron-3-ultra-550b-a55b:free |
| Kiro | auto, claude-sonnet-4.5, claude-haiku-4.5 |
Como saber se é o provider ou o modelo
Antes de comentar que não funciona, roda isso. Primeiro, pergunta ao provider quais modelos ele tem:
bash
curl https://openrouter.ai/api/v1/models -H "Authorization: Bearer SUA_CHAVE"Se essa lista voltar, o provider e a sua chave estão bem. Aí o problema é o nome do modelo: procura o que você quer usar dentro da resposta e usa o nome exato que veio de lá.
Agora manda uma pergunta de verdade:
bash
curl https://openrouter.ai/api/v1/chat/completions \
-H "Authorization: Bearer SUA_CHAVE" \
-H "Content-Type: application/json" \
-d "{\"model\":\"minimax/minimax-m3:free\",\"messages\":[{\"role\":\"user\",\"content\":\"diga OK\"}]}"E o que cada erro quer dizer:
| Erro | O que é de verdade |
|---|---|
| 401 | chave errada ou não enviada |
| 403 | a chave é válida, mas esse modelo não é do plano grátis |
| 404 | o nome do modelo tá errado, ou ele foi aposentado |
| 410 | o modelo morreu oficialmente |
| 429 | você bateu a cota, ou a fila do free tá cheia |
| 5xx | problema do lado deles, tenta de novo mais tarde |
Repara: só o 401 é culpa da sua configuração. 403, 404 e 410 são o modelo, não o provider.
O que ficou de fora, e por quê
- Groq — grátis de verdade e todo modelo tem tool calling, mas são 8 mil tokens por minuto. Um prompt com contexto de repositório estoura isso sozinho. Não roda coding agent.
- Antigravity (Google) — plano grátis real e funciona plugado, mas os termos proíbem harness de terceiro explicitamente e já tem gente banida. Na sua conta, a decisão é sua.
- Cline, Qoder, FreeBuff — de graça só dentro da ferramenta deles. É cliente, não é fonte, então não dá pra plugar num combo.
- Alibaba, Together, Cerebras — crédito que expira não é grátis, é trial.
- Vercel AI Gateway — a chave sai sem cartão, mas toda request devolve 403 pedindo um cartão válido na conta. Grátis com cartão não é grátis.
Mantendo isso vivo
Free tier muda de humor no mesmo dia, então essa página vai mudar junto. Se você bateu num erro que não tá aqui, ou descobriu um modelo que substituiu um dos mortos, comenta no vídeo ou me chama no Discord que eu atualizo.
Changelog
- 01/09/2026 — primeira versão, com a bateria de testes de 31 de agosto de 2026.