Toda vez que você pergunta algo ao ChatGPT, Gemini ou Claude, seu texto viaja até um datacenter, atravessa camadas de roteamento, é processado por clusters de GPUs que consomem megawatts e volta com uma resposta. É mágica — mas também significa que um terceiro leu, processou e potencialmente armazenou sua pergunta. Para um maker, isso levanta uma questão inevitável: e se eu pudesse rodar isso aqui, no meu hardware, com zero dependência externa?
A resposta em 2026 é: pode. E é mais fácil do que parece.
O Que Mudou: De Gigantes a Anões Poderosos
Em 2022, rodar um LLM decente localmente exigia uma GPU de US$ 3000. Em 2023, a Meta lançou o Llama 2, o primeiro modelo de código aberto competitivo. Em 2024, o Llama 3 chegou com variantes de 8B a 70B de parâmetros — a versão de 8 bilhões roda confortavelmente em 8 GB de RAM. A Mistral AI, startup francesa fundada por ex-engenheiros da Meta e DeepMind, lançou o Mistral 7B e o Mixtral 8x7B com arquitetura MoE (Mixture of Experts), eficientes e com desempenho próximo a modelos muito maiores.
Mas o catalisador foi o Ollama: um projeto de código aberto que empacota modelos de linguagem em containers prontos para executar. Instalou, rodou. Sem configurar Python, sem compilar CUDA, sem dependências exóticas. O Ollama fez para LLMs o que o Docker fez para serviços web e o que o Arduino fez para microcontroladores: eliminou a fricção.
Instalando e Rodando em 5 Minutos
O Ollama roda em Linux, macOS e Windows. A instalação é um comando:
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# Windows
# Baixe o instalador em https://ollama.com/download/windows
Para baixar e rodar um modelo:
# Llama 3 8B — ~4.7 GB de download
ollama pull llama3
ollama run llama3
Pronto. Você está conversando com uma IA que roda integralmente na sua máquina. O prompt aparece no terminal. Sem navegador. Sem internet. Sem latência de rede. O zumbido dos coolers da sua GPU lembrando que você é o dono do datacenter agora.
Outros modelos que recomendo testar:
- Mistral 7B:
ollama pull mistral— mais leve, excelente para código, roda em máquinas com 8 GB de RAM. - Phi-3 Mini (Microsoft):
ollama pull phi3— 3.8B parâmetros, surpreendentemente bom, cabe em 4 GB. - CodeGemma (Google):
ollama pull codegemma— especializado em código, autocompleta Python como ninguém. - DeepSeek Coder V2:
ollama pull deepseek-coder-v2— open-source da DeepSeek, rival de peso para GPT-4 em código.
Integrando com Python: Sua API Pessoal
O Ollama expõe uma API REST na porta 11434. Com Python, é trivial:
import requests
import json
def ask_llama(prompt):
"""Pergunta ao Llama 3 rodando localmente"""
url = "http://localhost:11434/api/generate"
payload = {
"model": "llama3",
"prompt": prompt,
"stream": False
}
response = requests.post(url, json=payload)
return response.json()["response"]
# Exemplo: pergunte o que quiser
resposta = ask_llama("Explique o que é um transistor MOSFET em duas frases.")
print(resposta)
Agora imagine um sistema maker que lê sensores (temperatura, umidade, presença) e consulta o LLM local para gerar um resumo do ambiente em linguagem natural: “Está quente e úmido no quarto, típico de tarde de verão. Recomendo ligar o ventilador e fechar a cortina.” Isso é IA no mundo físico — e é possível hoje.
Casos de Uso Reais para o Maker
- Assistente de código offline: o Ollama + Continue.dev (plugin VS Code) substitui o GitHub Copilot com zero custo e zero telemetria.
- Interface em linguagem natural para projetos: em vez de um dashboard com 20 botões, uma caixa de texto: “acenda a luz da sala e regule para 50%” → o LLM interpreta → chama a API do Home Assistant.
- Documentação automática: um script Python que lê os comentários do seu código e gera README.md com explicações em português.
- Classificador de imagens local: com o LLaVA (modelo multimodal), você pergunta “tem alguém na porta?” e ele analisa o frame da ESP32-CAM sem enviar nada pra nuvem.
- Tradutor embarcado: um display ePaper que traduz placas e menus em tempo real, offline.
Hardware: Quanto Você Precisa Investir
| Uso | Modelo | RAM Mínima | GPU Recomendada | Investimento (~BR) |
|---|---|---|---|---|
| Básico (chat, código simples) | Phi-3 Mini / Mistral 7B (Q4) | 8 GB | Integrada serve | R$ 0 (seu PC atual) |
| Intermediário (projetos makers) | Llama 3 8B / DeepSeek Coder | 16 GB | RTX 3060 12GB | ~R$ 2000-3000 (GPU) |
| Avançado (multimodal, código complexo) | Llama 3 70B (Q4) / Mixtral 8x7B | 32 GB+ | RTX 3090/4090 24GB | ~R$ 6000-10000 |
A boa notícia: para a maioria dos casos de uso maker, um notebook com 16 GB de RAM já roda Llama 3 8B quantizado a 4 bits com velocidade aceitável (~10 tokens/s em CPU, ~50 tokens/s com GPU). Você não precisa montar um cluster.
A Questão da Privacidade (E Por Que Ela Importa)
Quando você usa um LLM na nuvem, está compartilhando seu contexto — seus projetos, suas ideias, seu código proprietário — com uma corporação. Para um hobby, talvez não importe. Para uma startup desenvolvendo um produto, importa muito. Para um jornalista ou ativista trabalhando com dados sensíveis, é existencial.
LLMs locais resolvem isso por definição: os dados nunca saem da sua máquina. Você pode desconectar o cabo de rede e continuar usando. Pode auditar o modelo. Pode fazer fine-tuning com seus próprios dados. É a diferença entre alugar um quarto e ser dono da casa.
Fontes e Referências
- Ollama — Site oficial
- Ollama — Código-fonte no GitHub
- Meta Llama 3 — Página oficial do modelo
- Mistral AI — Modelos open-source de alto desempenho
- Continue.dev — Plugin open-source de IA para VS Code
- LangChain — Framework para aplicações com LLMs
- NetworkChuck — Tutoriais de Ollama e IA local para makers
- Eletrogate — Loja brasileira de hardware e componentes




