É possível rodar inteligência artificial no PC sem internet. Para isso, você precisa instalar um programa como LM Studio ou Ollama, baixar um modelo de IA e deixar os arquivos necessários salvos no computador. Depois dessa preparação, o processamento pode acontecer no próprio Windows, macOS ou Linux, sem enviar suas perguntas para servidores externos.
Tópicos
- O que é IA local e como ela funciona sem internet?
- Qual PC é necessário para rodar inteligência artificial local?
- Precisa ter placa de vídeo NVIDIA ou RTX?
- Windows, macOS e Linux são compatíveis?
- Qual programa usar para rodar IA no PC?
- Como instalar e usar IA local com LM Studio: passo a passo
- Como rodar IA local com Ollama no Windows 11, macOS e Linux
- 1. Instale o Ollama
- 2. Baixe um modelo enquanto estiver online
- 3. Inicie uma conversa
- 4. Confira os modelos e o uso da GPU
- 5. Experimente modelos menores em um PC fraco
- Qual modelo de inteligência artificial baixar para o seu PC?
- O que são GGUF, 4 bits e quantização?
- Como garantir que a inteligência artificial funcione realmente offline?
- Como desativar os recursos de nuvem do Ollama?
- Dá para conversar com PDFs e documentos sem internet?
- Como deixar a IA local mais rápida no PC?
- IA local não funciona? Veja problemas comuns e como resolver
- Três comandos para testar sua primeira IA offline
- Para estudar um assunto
- Para revisar um texto
- Para ajudar com programação
- Perguntas frequentes sobre IA local no PC
- Instalar o ChatGPT no PC faz ele funcionar sem internet?
- Posso levar o modelo de IA em um pendrive?
- A inteligência artificial local precisa de assinatura?
- Posso usar a IA local em português?
- Posso usar a IA do meu computador pelo celular?
- IA local é sempre privada e segura?
- Vale a pena usar IA local em vez de depender da nuvem?
- Fontes e documentação oficial
O caminho mais simples para iniciantes é o LM Studio, que oferece uma janela de conversa parecida com a de um chatbot. Já o Ollama é interessante para quem quer usar comandos, conectar aplicativos e experimentar diferentes modelos. Neste guia, o Overdrive explica as diferenças, mostra quais configurações de RAM e placa de vídeo fazem sentido e ensina a testar se a IA realmente funciona com o Wi-Fi desligado.
Resposta rápida: um PC com 8 GB de RAM pode começar com modelos pequenos, embora com limitações de velocidade e multitarefa. Com 16 GB, as opções aumentam; 32 GB oferecem mais conforto para modelos maiores. Uma placa de vídeo dedicada acelera o trabalho, mas não é obrigatória para executar modelos compatíveis por CPU. Os resultados variam conforme processador, modelo, quantização e tamanho do contexto.

O que é IA local e como ela funciona sem internet?
Uma IA local é um modelo executado diretamente no computador do usuário. Em vez de enviar a pergunta para um servidor remoto, o programa carrega os arquivos do modelo — chamados de pesos — na memória RAM ou na memória da placa de vídeo (VRAM) e gera a resposta usando o hardware disponível.
É importante separar três coisas: o programa, como Ollama ou LM Studio; o modelo, como Qwen, Llama ou Gemma; e o local de processamento. Um mesmo programa pode oferecer modelos locais e recursos de nuvem. Portanto, ter o aplicativo instalado não garante, por si só, que todas as conversas fiquem offline.
Quando tudo está configurado localmente, você pode pedir resumos, tirar dúvidas, revisar textos, gerar exemplos de código e consultar documentos armazenados no PC, desde que o aplicativo ofereça essa função. A IA, porém, não passa a saber notícias de hoje nem consegue pesquisar sites sem conexão. As respostas dependem dos conhecimentos do modelo e dos materiais que você disponibilizar.
Esse processamento no dispositivo também aparece em alguns recursos de aplicativos tradicionais. O Overdrive já explicou, por exemplo, por que o Chrome pode baixar um modelo local de IA. Aqui, a proposta é diferente: escolher o modelo e controlar sua instalação.
Qual PC é necessário para rodar inteligência artificial local?
Não existe uma configuração mínima universal: tudo depende do tamanho e do formato do modelo. As faixas abaixo são orientações práticas para começar, e não requisitos oficiais de todos os programas.
| Configuração do computador | Por onde começar | O que esperar |
|---|---|---|
| 8 GB de RAM, sem GPU dedicada | Llama 3.2 1B ou 3B, com contexto reduzido | Resumos e perguntas simples; pode ficar lento na CPU. |
| 16 GB de RAM | Qwen 3.5 4B ou modelos de 3B a 4B quantizados | Boa faixa de entrada para conversas e tarefas cotidianas. |
| 32 GB de RAM | Qwen 3.5 9B e outras opções maiores | Mais margem para multitarefa, contexto e modelos exigentes. |
| 64 GB de RAM e/ou GPU com bastante VRAM | Modelos maiores, após verificar os requisitos específicos | Mais possibilidades, mas sem garantia de desempenho rápido. |
Precisa ter placa de vídeo NVIDIA ou RTX?
Não. Diversos modelos funcionam usando somente o processador (CPU). A GPU costuma acelerar a geração das respostas, principalmente quando o modelo e seu contexto cabem na VRAM. A compatibilidade varia entre NVIDIA, AMD, Intel e chips Apple. Consulte a lista de hardware do Ollama antes de presumir que uma placa será acelerada.
Atenção: 8 GB de RAM não são a mesma coisa que 8 GB de VRAM. A RAM é a memória do sistema; a VRAM fica na placa de vídeo. Em Macs com Apple Silicon, a memória unificada é compartilhada entre CPU e GPU. Para entender melhor a diferença entre capacidade de memória e desempenho gráfico, veja a análise do Overdrive sobre o que 8 GB de VRAM ainda conseguem oferecer em 2026.

Windows, macOS e Linux são compatíveis?
Sim, mas há diferenças entre aplicativos. O Ollama para Windows exige Windows 10 22H2 ou posterior. No macOS, o Ollama pede macOS 14 ou mais recente; Macs Apple Silicon usam CPU e GPU, enquanto Macs Intel ficam limitados à CPU. O LM Studio também trabalha em Windows, macOS e Linux, mas recomenda 16 GB de RAM no Windows e exige CPU com AVX2 em máquinas x64. No Mac, o LM Studio é voltado a chips Apple Silicon, não aos modelos Intel. Confira os requisitos oficiais do LM Studio antes da instalação.
Também vale reservar espaço no SSD. Os arquivos dos modelos variam de centenas de megabytes a dezenas de gigabytes, e o programa ocupa espaço adicional. Se você pretende instalar vários modelos, planeje uma folga maior do que o tamanho de um único download.
Qual programa usar para rodar IA no PC?
Há opções para quem nunca usou terminal e outras voltadas a desenvolvimento. A diferença principal está na facilidade de configuração, na interface e nas integrações — não apenas na qualidade das respostas, que depende muito do modelo escolhido.
| Ferramenta | Melhor para | Como funciona | Site oficial |
|---|---|---|---|
| LM Studio | Iniciantes | Interface gráfica para baixar, carregar e conversar com modelos locais | LM Studio |
| Ollama | Quem quer simplicidade nos comandos e API local | Baixa e executa modelos pelo terminal ou pelos recursos do aplicativo | Ollama |
| Jan | Chat local com interface própria | Oferece aplicativo de desktop e gerenciamento de modelos | Jan |
| GPT4All | Conversas e consultas a arquivos locais | Aplicativo com catálogo de modelos e recurso LocalDocs | GPT4All |
Qual escolher? Para começar sem mexer em comandos, vá de LM Studio. Para integrar uma IA a programas, scripts ou fluxos de desenvolvimento, o Ollama costuma ser uma escolha prática. O Jan e o GPT4All são alternativas para experimentar outra experiência de chat; a disponibilidade de modelos e recursos varia conforme a versão.
Como instalar e usar IA local com LM Studio: passo a passo
O tutorial oficial do LM Studio descreve o processo de baixar um modelo, carregá-lo na memória e começar a conversa. Faça as etapas abaixo enquanto ainda estiver conectado à internet.
- Baixe o programa. Acesse a página oficial de downloads do LM Studio e escolha a versão correspondente ao seu sistema operacional.
- Instale e abra. Conclua a instalação e permita que o aplicativo baixe os componentes de execução necessários, caso solicite.
- Entre na área Discover. Procure por um modelo compatível com o computador, como um Qwen ou Llama de tamanho reduzido.
- Escolha uma versão apropriada. Quando houver opções GGUF, uma quantização de 4 bits pode ser um ponto de partida para economizar memória. Verifique o tamanho indicado antes de baixar.
- Espere o download terminar. Não confunda ver o modelo no catálogo com ter todos os seus arquivos disponíveis localmente.
- Abra a área de Chat e carregue o modelo. Selecione o arquivo já baixado e aguarde a alocação de memória.
- Faça uma pergunta. Experimente: “Explique em português o que é uma rede neural usando três exemplos simples”.
- Teste sem Wi-Fi. Feche recursos de nuvem, desligue a conexão, reabra o modelo e repita a pergunta. Se ele responder, a inferência está funcionando localmente.
Importante: o próprio LM Studio informa que conversar com modelos já baixados, consultar documentos locais e usar seu servidor local podem funcionar offline. Entretanto, buscar novos modelos, baixá-los, atualizar o programa e instalar runtimes ainda exigem conexão. Por isso, configure e teste tudo antes de depender da IA em um ambiente sem internet. Veja a documentação oficial sobre operação offline.

Como rodar IA local com Ollama no Windows 11, macOS e Linux
O Ollama permite baixar modelos diretamente para o computador e conversar pelo terminal. Ele também disponibiliza uma API local, útil para integrar o modelo a programas. No Windows, a instalação oficial fornece o comando ollama para PowerShell e Prompt de Comando.
1. Instale o Ollama
No Windows 10/11 ou no macOS, acesse ollama.com/download, baixe o instalador e siga as orientações da tela. Depois, abra o PowerShell no Windows ou o Terminal no Mac.
Em Linux, a documentação oficial oferece o seguinte comando de instalação. Execute-o apenas se confiar na origem do script e preferir esse método ao procedimento manual:
curl -fsSL https://ollama.com/install.sh | sh
Consulte as instruções oficiais para Linux. Se o serviço não estiver ativo, inicie-o conforme o método de instalação; em uma execução manual, o comando é ollama serve. Não tente abrir uma segunda instância se o aplicativo ou serviço já estiver executando.
2. Baixe um modelo enquanto estiver online
Para uma máquina intermediária, uma opção inicial é o Qwen 3.5 4B. Execute:
ollama pull qwen3.5:4b
Esse comando baixa os arquivos para o armazenamento local. A versão específica do modelo evita baixar acidentalmente uma variante padrão maior do que o esperado.
3. Inicie uma conversa
Depois que o download terminar, execute:
ollama run qwen3.5:4b
O terminal abrirá uma sessão de conversa. Digite uma pergunta em português e pressione Enter. É possível sair da interação com /bye nas versões que disponibilizam esse comando.
4. Confira os modelos e o uso da GPU
Estes comandos ajudam a administrar sua instalação:
ollama list
ollama ps
O que fazem: ollama list mostra os modelos disponíveis no computador; ollama ps informa quais estão carregados e se a execução está usando CPU, GPU ou ambas. Caso queira apagar um modelo e liberar espaço, o comando é ollama rm qwen3.5:4b. Não o execute se pretende continuar usando esse modelo offline.
Na saída de ollama ps, a coluna de processamento ajuda a identificar se o modelo está inteiramente na GPU ou dividido com a memória do sistema. Essa checagem é descrita na FAQ oficial do Ollama.
5. Experimente modelos menores em um PC fraco
Se a máquina tiver 8 GB de RAM, experimente primeiro um modelo compacto:
ollama pull llama3.2:1b
ollama run llama3.2:1b
Esse modelo ocupa aproximadamente 1,3 GB no download informado pelo catálogo oficial. O consumo efetivo durante a execução será maior, pois também inclui contexto, cache e memória do programa. Para uma alternativa intermediária, use llama3.2:3b, cujo download oficial gira em torno de 2 GB.
Qual modelo de inteligência artificial baixar para o seu PC?
O tamanho do modelo importa, mas mais parâmetros não significam automaticamente melhores respostas em todas as tarefas. Modelos novos e menores podem superar opções antigas em determinados usos. Para uma experiência confortável, priorize versões que deixem margem para o sistema operacional e outros aplicativos.
| Modelo no Ollama | Download aproximado | Uso inicial sugerido |
|---|---|---|
llama3.2:1b | 1,3 GB | PCs modestos, testes e perguntas simples |
llama3.2:3b | 2 GB | Conversas e resumos leves |
qwen3.5:4b | 3,3 a 4 GB | Equilíbrio inicial em computadores com 16 GB de RAM |
qwen3.5:9b | 6,6 a 7,6 GB | Máquinas com mais folga de RAM e/ou VRAM |
gemma4:e2b | Em torno de 7 GB na variante padrão consultada | Alternativa moderna; atenção ao consumo de memória |
qwen3.5:27b | 17 a 20 GB | Computadores avançados, com bastante memória disponível |
Os tamanhos se referem aos downloads indicados nos catálogos oficiais consultados em outubro de 2026, não ao consumo total de RAM/VRAM em execução. Podem mudar conforme quantização, atualização e variante. Contextos longos exigem memória adicional; o limite máximo anunciado de tokens não significa que qualquer PC conseguirá usá-lo.
O que são GGUF, 4 bits e quantização?
GGUF é um formato de arquivo amplamente usado para executar modelos com motores compatíveis com llama.cpp. Já a quantização reduz a precisão numérica utilizada para representar os pesos do modelo, o que costuma diminuir o espaço e a memória necessários. Arquivos com nomes como Q4_K_M usam uma quantização de 4 bits e podem ser interessantes para testar em PCs domésticos.
Isso envolve uma troca: modelos mais compactados podem perder alguma qualidade em comparação a versões de maior precisão. Além disso, o arquivo não é a única parte que usa memória. A janela de contexto — quantidade de texto que o modelo pode considerar ao mesmo tempo — também influencia bastante o consumo.

Como garantir que a inteligência artificial funcione realmente offline?
Faça a instalação completa e o primeiro teste antes de desligar a internet. Uma boa verificação envolve quatro etapas:
- Com o computador conectado, instale o aplicativo, baixe o modelo e, no LM Studio, obtenha os runtimes necessários.
- Confirme que o modelo abre normalmente e responde a uma pergunta.
- Desative recursos de nuvem, pesquisa online e integrações externas que não serão usados.
- Desconecte o Wi-Fi e o cabo de rede, se houver, reinicie a conversa e faça uma nova pergunta com o modelo local.
Como desativar os recursos de nuvem do Ollama?
O Ollama oferece modelos executados localmente e também modelos de nuvem. Os que possuem o sufixo :cloud na interface de linha de comando não são modelos offline. Para usar somente recursos locais, a documentação do Ollama explica como desabilitar a nuvem.
Uma opção é criar ou editar o arquivo server.json na pasta de configuração ~/.ollama/ com o seguinte conteúdo:
{
"disable_ollama_cloud": true
}
No Windows, a pasta corresponde ao diretório .ollama do usuário; no macOS e no Linux, ~/.ollama/ representa a pasta pessoal da conta em que o serviço é configurado. Outra opção documentada é definir a variável de ambiente OLLAMA_NO_CLOUD=1 no ambiente do serviço. Reinicie o Ollama após a alteração. Veja as instruções oficiais para desativar a nuvem.
O endereço http://localhost:11434 é a API local normalmente usada pelo Ollama. A palavra localhost aponta para o próprio computador e não significa, por si só, uma conexão com a internet. Por padrão, o Ollama escuta no endereço local 127.0.0.1. Não exponha essa porta na internet nem altere o endereço de escuta sem entender os riscos.
Mesmo em uma configuração local, verifique se outros recursos do aplicativo não estão conectados a serviços externos e se pastas ou backups do sistema não estão sincronizando arquivos sensíveis. Privacidade local depende da configuração completa, e não apenas do nome do modelo.
Dá para conversar com PDFs e documentos sem internet?
Sim, desde que o programa tenha um recurso de consulta a documentos e os componentes necessários estejam instalados. O LM Studio informa que sua função de conversar com arquivos e realizar recuperação de informações dos documentos (RAG, na sigla em inglês) pode operar inteiramente no computador. O GPT4All também oferece o recurso LocalDocs.
Na prática, é possível disponibilizar manuais, apostilas, anotações ou relatórios para que a IA responda com base nesses materiais. Contudo, a precisão depende da extração do texto e do mecanismo de busca local. PDFs digitalizados como imagem podem precisar de reconhecimento óptico de caracteres (OCR), e arquivos complexos nem sempre são interpretados corretamente.
Para trabalhos importantes, peça ao modelo que identifique os trechos usados e confira as informações no documento original. O fato de executar offline não elimina erros, interpretações equivocadas nem respostas inventadas.
Como deixar a IA local mais rápida no PC?
- Comece com um modelo menor. Trocar um modelo que não cabe confortavelmente na memória por um de 3B ou 4B pode melhorar bastante a experiência.
- Use uma quantização adequada. Versões de 4 bits geralmente economizam espaço e memória em comparação a arquivos de alta precisão.
- Reduza a janela de contexto. Não configure dezenas ou centenas de milhares de tokens se a tarefa precisa apenas de uma conversa curta.
- Feche aplicativos pesados. Navegadores com muitas abas, jogos e programas de edição disputam RAM e VRAM com a IA.
- Verifique se a GPU está sendo usada. No Ollama,
ollama psindica como o modelo foi carregado. - Atualize drivers e runtimes antes de ficar offline. Suporte a determinados modelos e placas pode depender de versões recentes.
- Prefira SSD. Ele pode reduzir o tempo para abrir e carregar o modelo, embora não garanta geração de texto mais rápida.
Se estiver escolhendo um notebook para essa finalidade, dê atenção à memória e à possibilidade de expansão. O Overdrive reúne critérios de RAM, armazenamento e desempenho no guia sobre qual notebook comprar para trabalhar.
IA local não funciona? Veja problemas comuns e como resolver
| Problema | Possível causa | O que fazer |
|---|---|---|
| “ollama” não é reconhecido | Instalação incompleta ou terminal aberto antes da instalação | Reabra o terminal; confira a instalação e o PATH seguindo a documentação do sistema. |
| Modelo não encontrado | Arquivos não foram baixados | Conecte-se à internet e execute ollama pull com o nome correto; depois verifique ollama list. |
| IA muito lenta | Modelo grande ou execução majoritariamente por CPU | Escolha modelo menor, reduza o contexto e confira ollama ps. |
| Falta de memória ou aplicativo fecha | RAM/VRAM insuficiente | Feche aplicativos, use quantização menor e reduza o tamanho do modelo. |
| LM Studio não abre no PC antigo | CPU ou sistema operacional incompatível | Confira requisitos de AVX2, versão do sistema e arquitetura do processador. |
| Funciona online, mas falha offline | Modelo, runtime ou recurso de nuvem ainda não preparado | Instale todos os componentes online e escolha explicitamente um modelo local. |
| A IA não conhece um fato recente | Modelo sem acesso à web ou dado novo | Forneça documentos atualizados ou use uma fonte externa quando voltar a ter internet. |
Três comandos para testar sua primeira IA offline
Depois da instalação, comece com tarefas que não dependem de informações em tempo real. Estes exemplos ajudam a verificar a capacidade do modelo e a ajustar o nível de detalhe das respostas:
Para estudar um assunto
“Explique o que é uma inteligência artificial generativa para quem nunca estudou programação. Use um exemplo cotidiano, depois resuma em cinco pontos e crie três perguntas para revisar o conteúdo.”
Para revisar um texto
“Revise o texto que vou colar a seguir. Corrija erros de português, preserve os fatos e a intenção original, destaque trechos ambíguos e não invente informações que não estejam no material.”
Para ajudar com programação
“Escreva um script Python simples que organize arquivos de uma pasta por extensão. Explique cada parte e inclua uma opção de simulação que não mova nenhum arquivo.”
Uma instrução clara, com objetivo e limites, também ajuda modelos locais. O Overdrive reuniu esse tipo de orientação em 10 dicas para escrever pedidos melhores para assistentes de IA; os princípios de clareza e contexto continuam úteis mesmo quando o modelo é executado offline.
Perguntas frequentes sobre IA local no PC
Instalar o ChatGPT no PC faz ele funcionar sem internet?
Não necessariamente. Instalar um aplicativo ou criar um atalho do ChatGPT não transforma os modelos usados pelo serviço em arquivos locais. Para utilizar IA sem internet, você precisa de um modelo que possa ser baixado e executado no computador, além de um programa compatível.
Posso levar o modelo de IA em um pendrive?
Sim, arquivos de modelos podem ser transferidos, desde que o aplicativo permita importação ou configuração do diretório de modelos. O LM Studio oferece importação de arquivos locais. Leve também os instaladores e runtimes necessários caso o computador de destino nunca tenha sido preparado.
A inteligência artificial local precisa de assinatura?
Não obrigatoriamente. Existem aplicativos gratuitos e modelos que podem ser baixados para uso local. Entretanto, confira a licença de cada modelo e programa, especialmente se a utilização for comercial. Hardware, energia e armazenamento continuam tendo custo.
Posso usar a IA local em português?
Sim, diversos modelos aceitam perguntas em português, mas a fluência e a qualidade variam conforme treinamento, tamanho e versão. Vale testar instruções reais no idioma antes de escolher um modelo para uso recorrente.
Posso usar a IA do meu computador pelo celular?
É tecnicamente possível disponibilizar uma interface ou API dentro da rede local, mas isso exige configuração adicional e cuidados com autenticação, firewall e exposição de portas. O acesso pela rede não deve ser confundido com uma instalação exclusivamente restrita ao próprio PC.
IA local é sempre privada e segura?
Ela oferece mais controle sobre onde os dados são processados, mas não é automaticamente imune a vazamentos. Extensões, recursos de nuvem, pastas sincronizadas, acesso remoto e falhas de segurança podem mudar o resultado. Prefira aplicativos oficiais, mantenha o sistema atualizado e revise as integrações habilitadas.
Vale a pena usar IA local em vez de depender da nuvem?
Vale especialmente para quem quer conversar com um modelo em lugares sem conexão, experimentar tecnologia sem depender de um serviço remoto ou trabalhar com documentos sem enviá-los automaticamente a um provedor de IA. A contrapartida é usar mais recursos do próprio computador e aceitar limites de velocidade, memória e atualização de conhecimento.
Para começar hoje: se você prefere clicar em botões, instale o LM Studio e escolha um modelo pequeno. Se quer um caminho com comandos e integrações, baixe o Ollama, execute ollama pull qwen3.5:4b enquanto estiver conectado e depois use ollama run qwen3.5:4b com a internet desligada. Em PCs mais limitados, comece por llama3.2:1b.
Fontes e documentação oficial
- LM Studio — funcionamento offline e operações que exigem internet.
- LM Studio — requisitos para Windows, macOS e Linux.
- Ollama — perguntas frequentes, uso da GPU e desativação da nuvem.
- Ollama — instalação no Windows e instalação no Linux.
- Ollama — catálogo Qwen 3.5, Llama 3.2 e Gemma 4.
- Jan — documentação oficial e GPT4All — guia do aplicativo.

Comentários