,

Como Rodar o DeepSeek-R1 Localmente com Ollama e Open WebUI: Guia Passo a Passo no Windows e Mac

Rodar o DeepSeek-R1 localmente na sua máquina garante privacidade total, zero custo recorrente em dólar e imunidade a instabilidades de servidores em nuvem. Com a combinação do Ollama como motor de inferência e do Open WebUI como interface gráfica, você obtém uma experiência visual idêntica à do ChatGPT ou Claude, mas com processamento 100% offline…

Avatar de Pedro Carrara

Por

4 minutos

min de leitura

Monitor ultrawide exibindo interface dark mode do Open WebUI com modelo de raciocínio DeepSeek executando em terminal local

Rodar o DeepSeek-R1 localmente na sua máquina garante privacidade total, zero custo recorrente em dólar e imunidade a instabilidades de servidores em nuvem. Com a combinação do Ollama como motor de inferência e do Open WebUI como interface gráfica, você obtém uma experiência visual idêntica à do ChatGPT ou Claude, mas com processamento 100% offline executado no seu próprio hardware.

O DeepSeek-R1 surpreendeu o ecossistema global de inteligência artificial por entregar capacidades de raciocínio lógico, matemática e programação comparáveis ao OpenAI o1. Graças às versões destiladas (baseadas em Llama e Qwen), é possível executá-lo em placas de vídeo intermediárias de 8 GB de VRAM ou até mesmo na memória unificada de Macs com chips Apple Silicon.

Tabela de Requisitos de Hardware: Qual Tamanho do DeepSeek-R1 Escolher?

Tamanho do ModeloVRAM Mínima RecomendadaMemória RAM do SistemaHardware Indicado
DeepSeek-R1 1.5B2 GB VRAM8 GB RAMNotebooks básicos, GPUs integradas
DeepSeek-R1 7B / 8B6 GB a 8 GB VRAM16 GB RAMRTX 3060, RTX 4060, RX 7600, Mac M1/M2 16GB
DeepSeek-R1 14B10 GB a 12 GB VRAM32 GB RAMRTX 3060 12GB, RTX 4070, Mac M2/M3 24GB+
DeepSeek-R1 32B20 GB a 24 GB VRAM64 GB RAMRTX 3090, RTX 4090, Mac M3/M4 Max
DeepSeek-R1 70B40 GB+ VRAM64 GB+ RAMDual RTX 3090 ou Mac Studio M2 Ultra

Passo 1: Instalando o Ollama no Windows ou macOS

O Ollama é a ferramenta definitiva para orquestrar LLMs locais. Ele compila acelerações de GPU automaticamente (CUDA no Windows/Linux e Metal no Mac):

  1. Acesse o site oficial ollama.com e baixe o instalador compatível com seu sistema.
  2. Conclua a instalação padrão. No Windows, o ícone de alpaca aparecerá na bandeja do sistema ao lado do relógio.
  3. Abra seu terminal (PowerShell no Windows ou Terminal no Mac) e confirme a instalação executando:
ollama --version

Passo 2: Baixando e Testando o DeepSeek-R1 pelo Terminal

Para a maioria dos computadores com placas de 6 GB a 8 GB de VRAM (como RTX 3060, 4060 ou Mac de 16 GB), o modelo ideal é o destilado de 8B (baseado no Llama 3.1) ou 7B (baseado no Qwen 2.5). Execute no terminal:

ollama run deepseek-r1:8b

O Ollama fará o download do modelo (cerca de 4.9 GB). Assim que o download terminar, você já poderá conversar diretamente pelo terminal. Você notará que o modelo responde exibindo o bloco <think> ... </think>, demonstrando todo o seu processo de raciocínio passo a passo antes da resposta final.

Passo 3: Instalando o Open WebUI para Ter Interface Gráfica Estilo ChatGPT

Conversar pelo terminal funciona, mas ter suporte a histórico de conversas, envio de documentos para leitura (RAG) e alternância de modelos exige uma interface gráfica. A melhor ferramenta atual é o Open WebUI via Docker:

  1. Instale o Docker Desktop (disponível gratuitamente para Windows e Mac).
  2. Abra o terminal e execute o seguinte comando em linha única para subir o container conectado ao seu Ollama local:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main

3. Abra o seu navegador e acesse: http://localhost:3000.

4. Crie uma conta de administrador local (todos os dados ficam salvos no seu disco, sem envio para terceiros). Na barra superior, selecione o modelo deepseek-r1:8b e comece a utilizá-lo com interface rica, formatação de código com realce de sintaxe e total fluidez.

Dicas de Performance: Otimizando o Consumo de Memória

  • Carregamento Total em VRAM: Certifique-se de fechar softwares pesados de edição ao iniciar o modelo. Se o modelo couber 100% na VRAM da GPU, a geração de texto atinge entre 35 e 60 tokens por segundo;
  • Context Window: No Open WebUI, você pode ajustar a janela de contexto nas configurações do modelo para 8.192 ou 16.384 tokens caso sua memória RAM comporte documentos maiores;
  • Uso no VS Code ou Cursor: Com o Ollama ativo em background na porta 11434, você pode conectar extensões como Continue.dev ou o Cursor AI para gerar autocompletar de código gratuitamente.

Conclusão

Em menos de 15 minutos de configuração, você passa a contar com um laboratório de inteligência artificial de fronteira na sua mesa de trabalho. Sem mensalidades, sem limites arbitrários de mensagens por hora e com a certeza de que nenhuma informação confidencial ou linha de código proprietária saiu da sua rede local.

💬 E você, o que achou dessa análise técnica? Deixe sua opinião ou dúvida na seção de comentários abaixo — respondemos a todos os leitores do Glitchz!

PC

Pedro Carrara

Fundador & Editor-Chefe

Fundador e Editor-Chefe do Glitchz. Entusiasta de hardware, inteligência artificial e cultura gamer, cobre o ecossistema tech com foco em análises críticas independentes, benchmarks e engenharia de produto.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *