O que é o Servidor para LLM da Rollin Host?
É um servidor com GPU NVIDIA dedicada, pensado para hospedar e rodar LLMs (Large Language Models) open-source — como Llama 3, Mistral, DeepSeek, Qwen e Gemma. Vem com Ollama, vLLM e llama.cpp pré-instalados. Você roda inferência e, no plano Pro, fine-tuning, com a GPU 100% sua.
Qual plano escolher — Inferência ou Pro?
O plano Inferência (GPU 24 GB) serve modelos de 7B a 13B em produção sólida — Llama 3 8B, Mistral 7B, Phi-3, Gemma 2. O plano Pro (GPU 96 GB) roda modelos grandes (Llama 3 70B, Mixtral 8×22B, DeepSeek R1) e permite fine-tuning.
Quanto custa hospedar um LLM na Rollin Host?
O plano Inferência custa R$ 3.749/mês com setup único de R$ 1.799 (cobre a preparação do servidor, drivers CUDA e as ferramentas de IA). O plano Pro é sob consulta — por ser hardware de estoque limitado e alta capacidade, o valor é fechado na cotação. Sem fidelidade.
Em quanto tempo o servidor fica pronto?
O provisionamento de servidores com GPU leva até 48 horas úteis. Diferente de uma VPS comum, servidores GPU têm estoque limitado e preparação dedicada. O fluxo é: você solicita o plano, confirmamos a disponibilidade e a entrega, e provisionamos.
Como funciona upgrade e downgrade de plano?
Upgrade: a qualquer momento — do plano Inferência para o Pro, pagando só a diferença proporcional (pro rata) pelo tempo restante do ciclo já pago; o valor não é perdido, é abatido. Por envolver hardware de GPU com estoque limitado, a troca é feita em janela combinada com a equipe, preservando seus dados. Downgrade: agendado para a próxima renovação — a diferença do ciclo atual não volta em dinheiro; havendo saldo, vira crédito na sua conta para usar em qualquer serviço. Reduzir disco exige novo provisionamento e migração dos dados, que orientamos. A taxa de setup única não é reembolsada em downgrade. Detalhes na Política de Reembolso.
Os dados ficam privados?
Sim, totalmente. O modelo roda no seu servidor — prompts, respostas e dados de treino nunca saem da sua infraestrutura. É a diferença fundamental para APIs como OpenAI ou Anthropic, onde todo o conteúdo é enviado para servidores de terceiros. Ideal para conformidade LGPD.
Quais modelos e ferramentas funcionam?
Qualquer LLM open-source: Llama 3, Mistral, Mixtral, DeepSeek, Qwen, Gemma, Phi-3 e outros. As ferramentas Ollama, vLLM e llama.cpp já vêm instaladas. No plano Pro também Hugging Face Transformers, Accelerate e PEFT para fine-tuning.
Posso fazer fine-tuning?
Sim, no plano Pro (GPU 96 GB). Suporta LoRA, QLoRA, DPO e DeepSpeed — você adapta um modelo open-source aos seus dados e domínio. O plano Inferência é focado em servir modelos, não treinar.
Vale a pena hospedar um LLM próprio em vez de usar OpenAI?
Vale quando o volume é alto (a partir de ~10 milhões de tokens/mês) ou quando os dados são sensíveis (LGPD, saúde, jurídico, financeiro). O custo é fixo (sem surpresa por token), os dados ficam na sua infraestrutura e você troca o modelo sem reescrever código. Para volume baixo e dados não sensíveis, API per-token segue mais barata.
Qual a diferença entre o Servidor para LLM e o Servidor IA Cloud?
O Servidor para LLM tem GPU NVIDIA dedicada — performance alta para inferência em produção e fine-tuning. O Servidor IA Cloud roda Ollama em CPU (sem GPU), bem mais barato, ideal para chat interno, RAG corporativo e automações onde 8-15 tokens/segundo já bastam.
Como migrar de OpenAI/Anthropic para o Servidor para LLM?
Ollama e vLLM expõem API REST 100% compatível com a OpenAI — basta apontar o SDK para a URL do seu servidor (ex.: https://seu-servidor.rollin.host/v1) e usar como se fosse a OpenAI. Modelos open-source equivalentes ao GPT-4 (Llama 3 70B, Mixtral 8×22B, DeepSeek R1) rodam no plano Pro.
A Rollin Host é confiável para infra de IA?
Sim — Rollin Serviços Digitais e Tecnologia LTDA é empresa brasileira com datacenter Tier III internacional, com CDN no Brasil, NF-e, faturamento em real e suporte humano 24/7 em português. É a primeira cloud brasileira especializada em IA, com produtos dedicados a LLM, GPU, vector DB e agentes WhatsApp.
Tem suporte em português?
Sim — suporte humano 24/7 em português, com gente que entende CUDA, Ollama, vLLM e fine-tuning. A Rollin Host é empresa brasileira (Rollin Serviços Digitais e Tecnologia LTDA).