all systems operational
Get started
RTX PRO 4500 / 6000 Blackwell · dedicado

Servidores dedicados para inferência de IA

Passthrough de GPU para cargas de trabalho sérias de inferência de IA. RTX PRO 4500 (32 GB VRAM) ou RTX PRO 6000 (96 GB VRAM). CUDA completo, sem fatiamento MIG.

32 / 96 GB
VRAM por GPU
PCIe 5.0 x16
passthrough em velocidade máxima
CUDA 12 +
pré-instalado
from $550
/mês (RTX PRO 4500)

About AI inference server

Cargas de trabalho de inferência exigem três coisas de um host de GPU: VRAM suficiente para armazenar o modelo, largura de banda PCIe total para alimentá-lo e zero contenção de vizinhos barulhentos. Nosso nível de GPU dedicado oferece tudo isso — sem fatiamento MIG, sem GPU compartilhada com outros 8 locatários.

A RTX PRO 4500 Blackwell (32 GB VRAM) atende confortavelmente a modelos quantizados de 13-14B (Llama 3, Mistral, Qwen em INT4/INT8) ou modelos de precisão total de 7-8B. Taxa de transferência típica: 40-80 tokens/s em fluxo único, 200-400 tokens/s em lote. A RTX PRO 6000 (96 GB VRAM) escala para 70B quantizados ou 34B completos — 15-40 tokens/s em fluxo único, 100-250 em lote.

Todas as configurações vêm com Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM pré-instalados. Docker + NVIDIA Container Toolkit prontos. IPMI 2.0 para recuperação fora de banda. Armazenamento NVMe Gen5 de 1 TB para pesos de modelo + cache quente.

Para cargas de trabalho multi-GPU (2× / 4× / 8× GPU por caixa, NVLink onde suportado) — orçamento personalizado por configuração. Trabalhos de treinamento multi-locatário, fine-tuning LoRA, serviço de LLM em escala — envie a carga de trabalho, nós especificaremos a caixa.

/faq

Frequently asked questions

Qual tamanho de modelo cabe em 32 GB VRAM?

FP16 completo: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Com descarregamento de algumas camadas para a CPU, você pode atingir 70B em INT4, mas a taxa de transferência cai significativamente.

Vale a pena optar pela RTX PRO 6000 em vez de múltiplas 4500s?

Depende. Serviço de modelo único com baixa latência → prefira uma única 6000 (96 GB). Serviço multi-locatário com muitos modelos pequenos → múltiplas 4500s escalam melhor economicamente.

Vocês oferecem H100 ou H200?

Atualmente sem estoque. Se sua carga de trabalho exigir H100, podemos adquiri-las e instalá-las — orçamento personalizado, prazo de entrega de 2-3 semanas.

Chat with us@hostfory