Como usar Ollama para testar modelos de IA locais sem pagar API

Como usar Ollama para testar modelos de IA locais sem pagar API

Toda vez que uma empresa quer testar um modelo de inteligência artificial — seja para um chatbot, uma automação, uma prova de conceito ou um sistema interno — a primeira barreira que aparece é o custo. APIs da OpenAI, Anthropic, Google e outras cobram por token. Em testes intensivos, a fatura sobe rápido. E para muitas equipes, especialmente em fase de experimentação, isso limita a velocidade de aprendizado e prototipação.

Mas existe um caminho que muita gente ainda desconhece: rodar os modelos localmente, no próprio computador ou servidor, sem pagar nenhuma API.

A ferramenta que tornou isso acessível se chama Ollama.

O que é o Ollama

Ollama é uma ferramenta open source que permite executar grandes modelos de linguagem (LLMs) localmente, no seu próprio hardware, de forma simples. Foi lançada em 2023 e se tornou rapidamente uma das formas mais populares de experimentar IA sem depender de nuvem.

A ideia é simples: você instala o Ollama, escolhe um modelo, baixa e conversa com ele. Sem chave de API, sem cadastro, sem conta no Google ou na OpenAI, sem mandar seus dados para servidor nenhum.

O Ollama funciona como um gerenciador de modelos. Ele cuida do download, da otimização para o hardware disponível (incluindo GPU), da inferência e de uma API local que outras aplicações podem consumir. Tudo isso com poucos comandos.

Por que rodar modelos localmente

Antes de entrar no passo a passo, vale entender os motivos que tornam a execução local atrativa:

  • Custo zero por token: você usa o hardware que já tem. Não há cobrança por requisição ou por palavra gerada.
  • Privacidade total: nenhum dado sai do seu computador. Nada é enviado para servidores de terceiros.
  • Funciona offline: depois de baixar o modelo, não precisa de internet para usá-lo.
  • Liberdade para experimentar: quer testar 10 modelos diferentes? Sem problema. Não vai chegar fatura no fim do mês.
  • Latência baixa: a inferência acontece na sua máquina, sem round-trip para a nuvem.
  • Controle do modelo: você decide qual versão usar, com quais parâmetros, e pode até ajustar o comportamento com system prompts e configurações específicas.
  • Sem rate limit: não há limite de requisições por minuto. Teste o quanto quiser.

A contrapartida é que o desempenho depende do seu hardware. Modelos grandes exigem muita memória RAM e, idealmente, uma GPU dedicada. Mas mesmo em máquinas modestas, é possível rodar modelos menores com boa usabilidade.

O que você precisa no computador

O Ollama roda em Windows, macOS e Linux. Os requisitos básicos são:

  • Processador: qualquer CPU moderna x86-64 ou ARM. Modelos menores rodam até em notebooks comuns.
  • Memória RAM: mínimo de 8 GB para modelos pequenos (3B a 8B parâmetros). Para modelos de 14B a 32B, recomenda-se 16 GB a 32 GB. Modelos maiores (70B+) exigem muito mais.
  • GPU (opcional, mas recomendada): uma placa de vídeo com VRAM dedicada acelera drasticamente a geração de texto. NVIDIA (com CUDA) ou Apple Silicon (com Metal) são as opções mais suportadas.
  • Espaço em disco: cada modelo ocupa de 2 GB a 40 GB, dependendo do tamanho e da quantização (compressão).

Em Macs com chip M1/M2/M3/M4, o Ollama aproveita a memória unificada e a GPU do Apple Silicon de forma muito eficiente. Em PCs, uma GPU NVIDIA com 8 GB+ de VRAM já entrega ótimos resultados.

Instalação

macOS

A forma mais fácil é baixar o instalador direto do site oficial:

  1. Acesse ollama.com/download
  2. Baixe a versão para macOS
  3. Arraste o app para a pasta Aplicativos
  4. Abra o Ollama — ele roda como um serviço em segundo plano

Como alternativa, via Homebrew:

brew install ollama

Windows

  1. Acesse ollama.com/download
  2. Baixe o instalador .exe
  3. Execute e siga o assistente de instalação
  4. O Ollama passa a rodar como serviço

Linux

Via script oficial:

curl -fsSL https://ollama.com/install.sh | sh

Ou via Docker:

docker run -d -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama

Depois de instalado, o Ollama fica disponível como comando de terminal (ollama) e como serviço local na porta 11434.

Primeiros passos: baixando e rodando um modelo

Depois de instalar, o uso é direto pelo terminal.

Rodar o Llama 3.2

ollama run llama3.2

Na primeira execução, o Ollama baixa o modelo (cerca de 4 GB) e abre um chat interativo no próprio terminal. Você digita uma mensagem, ele responde. Simples assim.

Listar modelos instalados

ollama list

Mostra todos os modelos que você já baixou, com tamanho e data.

Remover um modelo

ollama rm llama3.2

Libera o espaço em disco.

Ver modelos disponíveis

ollama search llama

Lista os modelos disponíveis no repositório que correspondem ao termo buscado.

Modelos recomendados para começar

O repositório do Ollama tem centenas de modelos. Aqui estão alguns dos mais úteis para começar, organizados por tamanho e capacidade:

Modelos leves (rodam em qualquer máquina)

  • Llama 3.2 (3B): modelo da Meta, rápido, ótimo para testes gerais e respostas curtas. ollama run llama3.2
  • Phi-3 Mini (3.8B): modelo da Microsoft, surpreendentemente capaz para o tamanho. ollama run phi3
  • Qwen 2.5 (3B): modelo da Alibaba, bom em código e raciocínio. ollama run qwen2.5:3b
  • Gemma 2 (2B): modelo do Google, leve e eficiente. ollama run gemma2:2b

Modelos médios (exigem 16 GB+ de RAM)

  • Llama 3.1 (8B): versão maior do Llama, com melhor qualidade de resposta. ollama run llama3.1
  • Mistral (7B): modelo da Mistral AI, excelente para texto geral e raciocínio. ollama run mistral
  • Qwen 2.5 (7B): forte em código e português. ollama run qwen2.5
  • Gemma 2 (9B): modelo do Google, qualidade alta para o tamanho. ollama run gemma2

Modelos grandes (exigem GPU ou Mac com 32 GB+)

  • Qwen 2.5 (14B): ollama run qwen2.5:14b
  • DeepSeek-R1 (14B): modelo com raciocínio em cadeia, bom para lógica e matemática. ollama run deepseek-r1:14b
  • Llama 3.1 (70B): modelo grande da Meta, qualidade comparável a GPT-4 em muitos cenários. Exige hardware potente. ollama run llama3.1:70b

Modelos especializados

  • Code Llama: focado em geração e explicação de código. ollama run codellama
  • LLaVA: modelo multimodal que entende imagens. ollama run llava
  • nomic-embed-text: modelo de embeddings para busca semântica. ollama run nomic-embed-text

Usando a API local do Ollama

Além do chat no terminal, o Ollama expõe uma API REST local na porta 11434. Isso permite que qualquer aplicação — um script Python, um app Node.js, um frontend web — consuma o modelo como se fosse uma API comercial.

Requisição básica (equivalente ao Chat Completion da OpenAI)

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [
    {"role": "user", "content": "Explique o que é LGPD em 3 frases."}
  ],
  "stream": false
}'

Em Python (com a biblioteca oficial)

import ollama

response = ollama.chat(
    model="llama3.2",
    messages=[
        {"role": "user", "content": "Escreva um email comercial oferecendo consultoria em TI."}
    ]
)

print(response["message"]["content"])

Em Python (usando requests)

import requests

response = requests.post(
    "http://localhost:11434/api/chat",
    json={
        "model": "llama3.2",
        "messages": [
            {"role": "system", "content": "Você é um assistente técnico."},
            {"role": "user", "content": "Como funciona um certificado digital?"}
        ],
        "stream": False
    }
)

print(response.json()["message"]["content"])

Compatibilidade com a OpenAI API

O Ollama tem um endpoint compatível com o formato da OpenAI, em /v1/chat/completions. Isso significa que a maioria das bibliotecas e ferramentas que funcionam com a OpenAI podem ser apontadas para o Ollama simplesmente trocando a URL base:

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:11434/v1",
    api_key="ollama"  # qualquer valor funciona
)

response = client.chat.completions.create(
    model="llama3.2",
    messages=[
        {"role": "user", "content": "Qual a diferença entre REST e GraphQL?"}
    ]
)

print(response.choices[0].message.content)

Essa compatibilidade é um dos pontos mais fortes do Ollama. Você pode desenvolver e testar localmente sem custo e, quando quiser ir para produção, basta trocar a URL base para a API real — sem mudar uma linha de código.

Integrações com ferramentas populares

O Ollama se integra facilmente com diversas ferramentas do ecossistema de IA:

  • LangChain: as bibliotecas langchain-ollama (Python) e langchain-ollama (JS) permitem usar modelos locais em chains, agents e RAG.
  • LlamaIndex: suporte nativo para Ollama como backend de LLM.
  • Open WebUI: interface web open source que funciona como um "ChatGPT local" conectado ao Ollama. Permite múltiplos modelos, histórico, upload de documentos e mais.
  • Continue (VS Code): extensão para VS Code que usa o Ollama como copiloto de código local.
  • AnythingLLM: plataforma que combina Ollama com RAG, documentos e workspaces.
  • Dify: plataforma de orquestração de IA que suporta Ollama como provedor de modelo.

Com essas integrações, o Ollama deixa de ser apenas um chat no terminal e passa a funcionar como a base de uma stack completa de IA local.

Dicas práticas para aproveitar melhor

Escolha o modelo certo para a tarefa

Modelos pequenos (3B) são rápidos, mas podem errar em tarefas complexas. Modelos maiores (8B+) são mais capazes, mas mais lentos. Teste diferentes opções para encontrar o equilíbrio entre velocidade e qualidade para o seu caso.

Use system prompts

Você pode definir o comportamento do modelo com um system prompt, igual a qualquer LLM:

ollama run llama3.2 --system "Você é um consultor de TI sênior. Responda de forma técnica, objetiva e em português."

Crie modelos customizados com Modelfile

O Ollama permite criar modelos derivados com configurações personalizadas, usando um arquivo Modelfile:

FROM llama3.2

SYSTEM """
Você é um assistente jurídico especializado em direito empresarial brasileiro.
Responda sempre em português, com base na legislação vigente.
Se não souber, diga que não sabe.
"""

PARAMETER temperature 0.3
PARAMETER num_ctx 4096

Depois:

ollama create meu-assistente -f Modelfile
ollama run meu-assistente

Monitore o uso de recursos

Modelos consomem RAM e VRAM. Use htop ou o Monitor de Atividade para acompanhar o consumo. Se a máquina ficar lenta, considere um modelo menor ou feche outros aplicativos durante a inferência.

Mantenha os modelos atualizados

Os modelos são atualizados frequentemente. Para baixar a versão mais recente:

ollama pull llama3.2

Quantização: entenda o trade-off

Os modelos disponíveis no Ollama geralmente já vêm quantizados (comprimidos) para reduzir o uso de memória. A quantização reduz um pouco a qualidade das respostas em troca de muito menos consumo de recursos. Para a maioria dos casos de teste e desenvolvimento, a diferença é imperceptível.

Quando usar modelos locais vs. API em nuvem

O Ollama não substitui completamente as APIs comerciais em todos os cenários. Cada abordagem tem seu lugar:

Use Ollama (local) quando:

  • Está aprendendo, testando ou criando prova de conceito.
  • Quer experimentar múltiplos modelos sem custo.
  • Precisa de privacidade absoluta (dados sensíveis, documentos confidenciais).
  • Está desenvolvendo uma aplicação e quer testar offline.
  • Quer rodar em ambiente air-gapped (sem internet).
  • O volume de uso é baixo o suficiente para o hardware local dar conta.

Use API em nuvem quando:

  • Precisa dos modelos mais avançados (GPT-4o, Claude Opus, Gemini Ultra).
  • A aplicação precisa escalar para muitos usuários simultâneos.
  • A latência e o throughput do hardware local não são suficientes.
  • Precisa de recursos específicos não disponíveis em modelos locais.
  • A equipe não quer gerenciar infraestrutura de inferência.

A estratégia mais inteligente para muitas empresas é híbrida: desenvolver e testar localmente com Ollama e ir para a nuvem apenas em produção, quando o volume e os requisitos estiverem claros.

Cenários práticos onde o Ollama brilha

Prototipação de chatbot

Antes de gastar com API para testar um chatbot de atendimento, construa o protótipo inteiro com Ollama + LangChain. Valide o fluxo, o prompt, a experiência. Depois decida se precisa de um modelo pago em produção.

Análise de documentos confidenciais

Precisa extrair informações de contratos, relatórios financeiros ou dados de clientes? Rode o modelo localmente. Nenhum documento sai da empresa.

Copiloto de código para a equipe

Com o Continue no VS Code conectado ao Ollama, cada desenvolvedor tem um copiloto de código gratuito e privado. Sem custo por linha sugerida.

Batch processing offline

Precisa classificar milhares de textos, gerar resumos ou extrair entidades de um volume grande de dados? Rode em batch localmente, sem pagar por token.

Ambiente de demonstração

Quer mostrar uma solução de IA para um cliente em um local sem internet? O Ollama roda offline depois do modelo baixado.

Segurança e boas práticas

Mesmo sendo local, vale seguir algumas práticas:

  • O serviço do Ollama escuta em localhost:11434 por padrão. Se você expor essa porta para a rede (ou para a internet), qualquer pessoa pode consumir o modelo. Use firewall e autenticação se necessário.
  • Em ambientes multiusuário, considere isolar o Ollama em um container Docker com acesso restrito à rede.
  • Os modelos podem gerar conteúdo impróprio. Em ambiente corporativo, configure system prompts com guardrails e valide as saídas antes de exibir ao usuário final.
  • Atualize o Ollama regularmente. Como qualquer software, recebe correções de segurança.
  • Atenção ao uso de GPU compartilhada. Se a GPU também é usada por outras aplicações (VNC, display, renderização), o Ollama pode competir por recursos.

Como a Mira Sistemas pode ajudar

A Mira Sistemas ajuda empresas a explorarem, prototiparem e implementarem soluções de inteligência artificial com controle total de custo e privacidade.

Podemos atuar em:

  • Avaliação de infraestrutura: análise do hardware disponível e recomendação de modelos compatíveis com o ambiente da empresa.
  • Instalação e configuração do Ollama: deploy em máquinas locais, servidores ou containers, com otimização para o hardware disponível.
  • Prototipação de soluções de IA: desenvolvimento de chatbots, assistentes, automações e sistemas de análise usando modelos locais.
  • Integração com sistemas existentes: conexão do Ollama com CRMs, ERPs, sistemas internos, bancos de dados e aplicações web.
  • Pipeline de RAG local: combinação de Ollama com bancos de dados vetoriais para criar sistemas de busca inteligente sobre documentos da empresa, sem enviar nada para a nuvem.
  • Migração para produção: quando a solução amadurece, ajudamos a migrar de modelos locais para APIs comerciais (ou infraestrutura própria de inferência) com mínimo impacto no código.
  • Treinamento da equipe: capacitação para que desenvolvedores e analistas saibam usar, testar e avaliar modelos locais no dia a dia.

Se sua empresa quer começar a usar inteligência artificial sem travar por custo de API ou preocupação com privacidade, rodar modelos localmente com Ollama é o melhor ponto de partida.

Fale com a Mira Sistemas para planejar sua primeira prova de conceito.

Leia também