Guia prático
IA grátis para usar localmente
Rodar IA localmente garante soberania total de dados, elimina limites de mensagens e funciona 100% offline. Para desenvolvedores, permite criar APIs locais compatíveis com a OpenAI e RAG seguro em documentos confidenciais.
Modelos de IA local ainda são limitados e podem estar desatualizados em relação aos modelos de nuvem. Evite usá-los para decisões sobre saúde, finanças, questões jurídicas ou outros assuntos sensíveis — para esses casos, prefira fontes confiáveis ou profissionais qualificados.
Opções para começar
Ollama
Servidor e ferramenta de linha de comando para rodar LLMs e modelos multimodais no seu próprio computador com API compatível com a OpenAI.
Grátis: 100% grátis e de código aberto (MIT) — sem assinaturas, cotas ou telemetria forçada; o único limite é o har…
IA local / self-hostedLM Studio
Ambiente visual para baixar, testar e conversar com modelos GGUF locais no Windows, Mac e Linux com servidor local de 1 clique.
Grátis: Totalmente gratuito para uso pessoal e offline — sem contas obrigatórias, sem mensalidade e sem envio de da…
IA local / self-hostedJan
Cliente de chat open-source para rodar modelos de IA 100% offline, com motor llama.cpp e servidor local embutido.
Grátis: 100% gratuito e de código aberto (AGPLv3) — sem contas, telemetria intrusiva ou limites artificiais de uso.
Famílias de modelos abertosLlama
Família de LLMs open-weight da Meta (Llama 3.x / 4): roda localmente via Ollama/LM Studio ou em provedores de nuvem.
Grátis: Pesos disponíveis no Hugging Face / repositórios oficiais para download gratuito. Uso local ilimitado (só h…
Famílias de modelos abertosGemma
Família open-weight do Google DeepMind (Gemma 3 / 4): modelos compactos e multimodais para rodar localmente ou em Vertex / AI Studio.
Grátis: Pesos gratuitos no Kaggle, Hugging Face e Google AI. Uso local ilimitado. A geração Gemma 4 passou a ser di…
Famílias de modelos abertosMistral
Família open-weight da Mistral AI (Mistral Small/Nemo, Mixtral, Codestral…): ótima relação qualidade × tamanho para rodar localmente.
Grátis: Pesos Apache 2.0 (na maioria das variantes abertas) no Hugging Face / Ollama. Uso local ilimitado. O chat w…
Famílias de modelos abertosPhi
Família de SLMs da Microsoft (Phi-3 / Phi-4): modelos pequenos e capazes para CPU/GPU modesta, com pesos no Hugging Face e Azure.
Grátis: Pesos open-weight gratuitos (licença MIT nas linhas Phi-3/4 publicadas). Uso local ilimitado. Azure AI pode…
Chatbots e assistentesDeepSeek
Modelos abertos de raciocínio e linguagem geral da DeepSeek (R1, V3.x e V4), distribuídos sob licença permissiva MIT.
Grátis: Chat web e aplicativo gratuitos, com limites de uso. Pesos abertos no Hugging Face sob licença MIT para exe…
Chatbots e assistentesQwen
Família de modelos da Alibaba (geração Qwen 3.6) com chat web gratuito e variantes especializadas em código (Qwen-Coder), também disponíveis para rodar localmente.
Grátis: Qwen Chat (chat.qwen.ai) gratuito para conversar e pedir código. Variantes open-weight (ex.: Qwen 3.6, Qwen…
Transcrição, TTS e traduçãoWhisper
Modelo de reconhecimento de fala para transcrição multilíngue e tradução de fala para inglês.
Grátis: Código e pesos sob licença MIT; pode rodar localmente ou em infraestrutura própria. Consulte o site oficial…
Geração de imagemStable Diffusion
Família de modelos de geração de imagens com variantes usadas em ferramentas locais e serviços.
Grátis: Pesos de variantes disponíveis e serviços de inferência. Consulte o site oficial para os limites gratuitos…
Geração de imagemFLUX
Família de modelos abertos de difusão latente de última geração com variantes schnell (Apache 2.0) e dev.
Grátis: O modelo FLUX.1 schnell é 100% de código aberto sob licença Apache 2.0 (uso comercial liberado e gratuito p…
Quanto de memória (RAM e VRAM) você precisa?
Para rodar modelos de linguagem no seu computador sem travamentos, o fator mais importante é a memória de execução livre (RAM do sistema ou VRAM dedicada da sua placa de vídeo), não o espaço do seu SSD.
| Sua configuração | Tamanho ideal (Q4) | O que esperar na prática |
|---|---|---|
| 8 GB RAM (ou Mac M1/M2/M3) | 1B a 3B (ex: Qwen 3.6 4B, Gemma 4 4B) | Memória no limite. Feche outros aplicativos pesados (navegador com muitas abas) e mantenha conversas curtas. |
| 16 GB RAM (ou Mac com 16 GB) | 3B a 8B (ex: Qwen 3.6 8B, Gemma 4 12B) | Ponto de partida ideal. Bom equilíbrio entre velocidade, raciocínio em português e síntese de textos. |
| 32 GB+ RAM | 8B a 14B (ex: Qwen 3.6 14B) | Capacidade de carregar documentos e códigos maiores. A velocidade dependerá da força da CPU/GPU. |
| 6 a 8 GB VRAM dedicada (NVIDIA/AMD) | 3B a 8B Q4 | Respostas muito velozes (15 a 40 tokens/s). Deixe 1 GB livre para a exibição do Windows/monitor. |
| 12 a 16 GB VRAM dedicada | 8B a 14B Q4 | Desempenho de nível profissional para tarefas de programação e análise densa de documentos. |
💡 Três regras de ouro antes de baixar um modelo:
- Armazenamento em SSD não é memória RAM: Ter 1 TB de SSD livre significa apenas que você tem espaço para guardar arquivos, não que o seu computador aguenta rodar um modelo de 70B em tempo de execução.
- Não some RAM e VRAM: Dividir camadas de um modelo entre GPU e CPU costuma ser muito mais lento do que rodar um modelo menor (ex: 8B) que caiba 100% na VRAM da placa de vídeo.
- Prefira modelos com final "Instruct" ou "Chat" e formato ".gguf": Modelos marcados como "Base" são voltados para treino de desenvolvedores e não sabem manter um diálogo coerente.
Como escolher
Para chat visual imediato e testes de modelos GGUF, escolha o LM Studio ou Jan. Para automações, terminal e endpoints locais de desenvolvimento, prefira o Ollama. Para áudio offline, use Whisper; para imagens, Stable Diffusion ou FLUX.
Para ver o catálogo completo com mais opções e filtros, confira a categoria IA local / self-hosted.
Os planos e limites podem mudar. Abra a ficha de cada ferramenta e confirme a oferta atual no site oficial antes de depender dela para um projeto.