all systems operational
Get started
RTX PRO 4500 / 6000 Blackwell · dedicado

Servidores dedicados para inferencia de IA

Passthrough de GPU para cargas de trabajo de inferencia de IA serias. RTX PRO 4500 (32 GB VRAM) o RTX PRO 6000 (96 GB VRAM). CUDA completo, sin segmentación MIG.

32 / 96 GB
VRAM por GPU
PCIe 5.0 x16
passthrough a velocidad completa
CUDA 12 +
preinstalado
from $550
/mes (RTX PRO 4500)

About AI inference server

Las cargas de trabajo de inferencia buscan tres cosas en un host de GPU: suficiente VRAM para alojar el modelo, ancho de banda PCIe completo para alimentarlo y cero contención de vecinos ruidosos. Nuestro nivel de GPU dedicado le ofrece las tres — sin segmentación MIG, sin GPU compartida con otros 8 inquilinos.

La RTX PRO 4500 Blackwell (32 GB VRAM) sirve cómodamente modelos cuantificados de 13-14B (Llama 3, Mistral, Qwen en INT4/INT8) o modelos de precisión completa de 7-8B. Rendimiento típico: 40-80 tokens/s en flujo único, 200-400 tokens/s en lotes. La RTX PRO 6000 (96 GB VRAM) escala a 70B cuantificados o 34B completos — 15-40 tokens/s en flujo único, 100-250 en lotes.

Todas las configuraciones se entregan con Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM preinstalados. Docker + NVIDIA Container Toolkit listos. IPMI 2.0 para recuperación fuera de banda. 1 TB de almacenamiento NVMe Gen5 para pesos de modelo + caché caliente.

Para cargas de trabajo multi-GPU (2× / 4× / 8× GPU por caja, NVLink donde sea compatible) — presupuesto personalizado por configuración. Trabajos de entrenamiento multi-inquilino, ajuste fino LoRA, servicio de LLM a escala — envíe la carga de trabajo, nosotros especificaremos la caja.

/faq

Frequently asked questions

¿Qué tamaño de modelo cabe en 32 GB de VRAM?

FP16 completo: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Con la descarga de algunas capas a la CPU, puede alcanzar 70B en INT4, pero el rendimiento disminuye significativamente.

¿Vale la pena optar por una RTX PRO 6000 frente a múltiples 4500?

Depende. Servicio de modelo único con baja latencia → preferir una única 6000 (96 GB). Servicio multi-inquilino con muchos modelos pequeños → múltiples 4500 escalan mejor económicamente.

¿Ofrecen H100 o H200?

No disponible actualmente. Si su carga de trabajo requiere H100, podemos conseguirlas e instalarlas — presupuesto personalizado, plazo de entrega de 2-3 semanas.

Chat with us@hostfory