Treine, ajuste e implante modelos de IA sobre bare metal com
RTX 3090 ou RTX 5090, recursos 100% dedicados e stack pronto para usar.
Todos os servidores incluem Ubuntu 24.04 LTS, Drivers NVIDIA e CUDA pré-instalados. Stack de IA opcional instalável em um único comando (Docker, Ollama e Open WebUI).
Conectividade dedicada e simétrica de 1000 Mbit/s
Um IPv4 público incluído.
Faixas IPv6 disponíveis.
Controle total: acesso "root"
Pronto para usar: Ubuntu 24 LTS + Drivers NVIDIA + CUDA
Configurar um servidor GPU do zero pode levar entre 3 e 6 horas: drivers, CUDA, contêineres, ferramentas. Nossos servidores chegam com essa base resolvida. O primeiro comando que você executa é o do seu modelo.

Base incluída
O servidor chega com Ubuntu 24.04 LTS, drivers NVIDIA 550+ e CUDA instalados e verificados. Conecte-se via SSH e execute nvidia-smi - suas duas GPUs estão ativas desde o primeiro login.

Stack de IA com um comando
Com o script que enviamos junto com o acesso, você instala Docker, NVIDIA Container Toolkit, Ollama e Open WebUI em uma única linha. Em minutos você tem uma interface tipo ChatGPT conectada às suas GPUs, rodando no seu próprio servidor.
Inferência privada de LLM
Rode Llama 3, Mistral, DeepSeek e mais. Sem limites de taxa, sem custos por token. API compatível com OpenAI.
Fine-tuning e treinamento
Hardware dedicado para treinar seus próprios modelos. cuDNN e NCCL incluídos para multi-GPU.
Geração de embeddings e RAG
Embeddings locais com nomic-embed-text. Combine com seu banco de dados vetorial. Sem enviar dados a terceiros.
Visão computacional
Ideal para treinamento e inferência de modelos de detecção de objetos, classificação de imagens e segmentação.
Automações e agentes de IA
Deploy de frameworks como n8n, LangChain ou AutoGen com acesso direto a modelos locais.
Ambientes para equipes de P&D
Rode JupyterHub com acesso a GPU pelo navegador. Ideal para equipes acadêmicas e de data science.
Produção com soberania de dados
Seus dados nunca saem do seu servidor. Conformidade regulatória sem compromissos.

Você terá um servidor dedicado (Bare Metal) 100% para o seu projeto. Você não compartilhará hardware ou largura de banda com mais ninguém, portanto obterá performance e privacidade absoluta para seus projetos.
Nossos datacenters World Class dispõem de serviços redundantes n+1, garantindo que seu negócio continuará online mesmo quando algo falhar.
Além disso, latência regional mínima e proteção DDoS em nível de carrier.

Monitoramento Pró-Ativo
Os serviços críticos (redes, energia, resfriamento, etc.) são monitorados 24x365 a partir do nosso NOC.
Suporte especializado
Uma equipe com mais de 15 anos de experiência disposta a ajudar você de forma rápida e eficaz.
Redes de alta velocidade
Redes confiáveis e ultra rápidas, sobre os carriers mais importantes e reconhecidos da região.
Fornecedor certificado
Somos a única empresa do setor com tripla certificação: ISO 9001, ISO 14001 e OHSAS 18001
Infraestrutura sustentável
Datacenters com tecnologias eficientes e inovadoras para oferecer o melhor serviço sem sacrificar o futuro.
Cresça sem limites
Seu negócio cresce e você precisa de mais... perfeito! Ajudamos você a reconfigurar seu servidor ou migrar para outro hardware.
GPU dedicada para IA, com base pronta e implantação simplificada.
Perguntas frequentes
Colocamos à sua disposição múltiplas formas de pagamento para sua maior comodidade. Conheça-as aqui.
Os servidores estão hospedados em um dos nossos quatro datacenters próprios em Rosario, Santa Fe, Argentina. Isso implica menor latência para clientes da região LATAM e que os dados processados não saem do continente, o que pode simplificar o cumprimento regulatório em certos casos.
Na Donweb dispomos de várias camadas de proteção para mitigar ataques de negação de serviço do tipo: SYN, ICMP e UDP flood, Ping of Death, Smurf, etc. Também aqueles ataques que tentam saturar a largura de banda da nossa rede.
Em caso de ataques severos e de grande escala, serão ativados os sistemas de mitigação que se encontram acima, a nível de nossos provedores de conectividade (carriers). Estes são ativados automaticamente e dentro dos primeiros 5 minutos do início do ataque.
Se os ataques forem de menor dimensão e direcionados a servidores específicos, serão ativados os sistemas de mitigação que se encontram dentro dos nossos datacenters. Esses sistemas de filtragem contam com regras que são atualizadas periodicamente e trabalham de forma automática.
Adicionalmente, nossa equipe designada ao Network Operation Center está monitorando as redes 24x7x365 e agirá prontamente diante de qualquer anomalia detectada no tráfego.
Além disso, além do DDoS, existem muitas e diversas modalidades de ataques informáticos que podem afetar seu site ou aplicação. Por isso, recomendamos:
A ativação do servidor dedicado começará imediatamente após nossa equipe administrativa confirmar seu pagamento. Este processo inclui a implementação de todas as configurações necessárias para colocar seu servidor em funcionamento.
O tempo estimado para a ativação varia de acordo com o momento em que o pagamento for confirmado:
Cabe destacar que, se você precisar de configurações especiais, como a adição de discos ou uma infraestrutura balanceada, o processo de ativação pode se estender até 72 horas. No entanto, faremos o máximo esforço para minimizar esse tempo e garantir que seu servidor esteja disponível o mais rápido possível.
Assim que seu servidor estiver ativo, você receberá um e-mail com todas as informações necessárias para acessá-lo.
Todos os servidores são entregues com Ubuntu 24.04 LTS, drivers NVIDIA, CUDA, cuDNN e NCCL pré-instalados e verificados. Você pode se conectar via SSH e ter suas GPUs operacionais desde o primeiro login, sem configuração adicional.
6020 Como ativo o stack opcional de IA?
Com um único comando que executa um script fornecido no servidor. Há dois níveis:
As instruções de uso do script estarão disponíveis na mensagem de boas-vindas do console do servidor.
O servidor base inclui o sistema operacional e os drivers. Docker, NVIDIA Container Toolkit e Ollama são ativados com um único comando fornecido por nós. Se além disso você quiser Open WebUI ou monitoramento de GPU com nvitop, há um segundo nível opcional que também se instala com um comando.
Não. São servidores bare metal completamente dedicados. O hardware, a largura de banda e os recursos de computação são 100% seus. Não há “vizinho barulhento” nem throttling.
Em serviços de GPU cloud compartilhada, o hardware é distribuído entre múltiplos clientes. Isso pode implicar desempenho variável, latência imprevisível e que os dados do seu workload passem por infraestrutura de terceiros.
Com um servidor GPU dedicado da DonWeb, o hardware é 100% seu: GPUs, RAM, largura de banda e armazenamento não são compartilhados com ninguém. Além disso, você paga um preço fixo mensal, sem surpresas por horas de computação ou transferência de dados.
Qualquer carga de trabalho que se beneficie de GPU, por exemplo:
Você tem acesso root completo, então pode instalar e configurar o que precisar. A única exceção é que não são permitidos servidores de jogos nem mineração de criptomoedas.
Você não está limitado ao Docker. Pode rodar qualquer modelo compatível com as ferramentas ou frameworks que instalar no servidor. Isso inclui modelos usados com Ollama, vLLM, contêineres Docker ou diretamente de frameworks como PyTorch ou TensorFlow, já que você tem acesso root completo.
Isso inclui famílias como Llama, Mistral, DeepSeek, Qwen, CodeLlama e modelos do Hugging Face em formato GGUF, entre outros compatíveis com seu stack.
Com 48 GB de VRAM combinada (RTX 3090) ou 64 GB (RTX 5090), você pode rodar modelos de até 70B parâmetros em quantização Q4.
Sim, sem restrições. Você pode enviar modelos próprios em formatos como GGUF ou safetensors, rodar suas próprias imagens Docker, montar volumes com seus dados e configurar o ambiente exatamente como precisar.
Sim. Ollama expõe uma API compatível com o formato da OpenAI. Qualquer aplicação que use o SDK oficial da OpenAI pode apontar para seu servidor alterando apenas a base_url e a api_key, sem mudanças de código na sua aplicação.
Sim. Você tem acesso root completo. CUDA é compatível com PyTorch 2.x, TensorFlow 2.x e JAX. Também pode usar imagens oficiais do Docker do Hugging Face, vLLM e outros frameworks sem configuração adicional.
Serve para ambos. A configuração inclui cuDNN e NCCL, necessárias para training e fine-tuning distribuído em múltiplas GPUs. Você pode usar frameworks como Hugging Face Transformers, Axolotl ou Unsloth diretamente sobre o hardware, com acesso completo às duas GPUs via PyTorch ou TensorFlow.
Sim, sempre que a VRAM total permitir. Com 2 GPUs você pode distribuir cargas manualmente ou usar frameworks como vLLM com --tensor-parallel-size 2 para usar ambas as GPUs em um único modelo de grande porte.
vLLM é um motor de inferência otimizado para alto throughput e baixa latência com múltiplas requisições simultâneas. Ollama é mais simples e recomendado para desenvolvimento individual. Se você vai servir uma API de produção com muitos usuários concorrentes, vLLM é a opção.
A RTX 5090 é a geração mais recente da NVIDIA, com mais VRAM por GPU (32 GB vs 24 GB) e melhor desempenho em cargas de inferência e training.
A RTX 3090 continua sendo muito capaz para produção, especialmente para inferência de modelos de até 70B parâmetros em quantização Q4 usando ambas as GPUs. Se sua carga incluir fine-tuning intensivo ou modelos de próxima geração, a RTX 5090 é a opção recomendada.
Inclui conectividade dedicada e simétrica de 1 Gbit/s. Isso permite baixar modelos grandes ou transferir datasets sem inconvenientes nem demoras.
Sim. Podemos realizar conexões LAN entre dois ou mais servidores dedicados. Isso permite montar clusters de inferência distribuída ou separar funções, por exemplo entre servidor de modelos e servidor de banco de dados vetorial. Consulte nossos consultores para definir a configuração, já que tem requisitos especiais.
Sim. As configurações publicadas são as mais comuns, mas podemos montar opções sob medida de acordo com suas necessidades de RAM, armazenamento ou conectividade. Se o seu projeto exigir conectar múltiplos servidores GPU entre si via LAN, maior largura de banda ou qualquer outra variação, entre em contato com nossa equipe de infraestrutura para avaliar.
Inclui suporte técnico da DonWeb para hardware, rede e conectividade. O servidor é entregue com acesso root total, portanto a gestão do software e das aplicações é responsabilidade do cliente. Se precisar de assistência com configurações específicas, você pode consultar nossa equipe.