Local é onde a inferência acontece
Um aplicativo instalado no computador pode apenas enviar mensagens para a nuvem. Em IA local, o modelo processa a entrada no seu dispositivo ou em infraestrutura sob seu controle. Busca na web, conectores e sincronização podem continuar dependendo de serviços externos.
O principal ganho é controlar a operação. A contrapartida é administrar arquivos, memória, atualizações e segurança. Local não significa automaticamente privado, gratuito ou melhor.
Local ou nuvem?
| Critério | Local | Nuvem |
|---|---|---|
| Dados | Você controla a infraestrutura; integrações ainda podem enviar dados. | Processamento pelo provedor, conforme contrato e configuração. |
| Custo | Equipamento, energia, armazenamento e manutenção. | Assinatura, créditos ou cobrança por consumo. |
| Conexão | Inferência pode funcionar offline após os downloads. | Normalmente exige internet para responder. |
| Capacidade | Limitada por memória e velocidade do equipamento. | Infraestrutura operada pelo provedor. |
| Manutenção | Atualizações e configuração ficam sob seu controle. | Serviço atualizado pelo provedor, sujeito a alterações. |
Modelo, aplicativo e memória
RAM e VRAM
A memória precisa acomodar pesos, contexto e execução. Memória unificada, RAM convencional e VRAM dedicada têm comportamentos diferentes.
Quantização
Representa pesos com menos bits para reduzir uso de memória. Pode alterar qualidade e desempenho; o efeito depende da variante e da tarefa.
Formato e compatibilidade
GGUF é comum em runtimes baseados em llama.cpp; MLX aparece em fluxos para Apple Silicon. O formato precisa ser suportado pelo aplicativo.
Armazenamento e energia
Os arquivos podem ser grandes e a inferência consome energia. Reserve espaço e acompanhe temperatura e velocidade.
Não há um número universal de RAM que garanta a execução. Comece por uma variante pequena e consulte o tamanho do download, os requisitos e a estimativa de memória do aplicativo. Vídeo e modelos grandes podem exigir GPUs especializadas.
Ollama e LM Studio
Ollama oferece execução de modelos e integração por API local, além de opções em nuvem. LM Studio oferece uma interface para baixar modelos compatíveis, conversar e servir inferência local.
Procure variantes de Gemma, Qwen, Llama ou Mistral compatíveis com sua versão do aplicativo. Modelos publicados pelo desenvolvedor e conversões de terceiros não têm a mesma procedência: confira autor, licença e formato.
Seu primeiro teste local
- Confira o sistema operacional, a memória disponível e os requisitos oficiais do aplicativo.
- Baixe o aplicativo do site oficial e escolha um modelo pequeno compatível, com licença clara.
- Faça o download completo, selecione explicitamente a execução local e use um texto sem dados sensíveis.
- Teste um resumo curto e compare com o original. Observe tempo de resposta e uso de memória.
- Desconecte a internet e repita. Identifique quais funções precisam de conexão.
Evite expor um servidor de inferência diretamente à internet. Se precisar de acesso em rede, configure autenticação e restrições de acesso.