Servidores dedicados para inferencia de IA
Passthrough de GPU para cargas de trabajo de inferencia de IA serias. RTX PRO 4500 (32 GB VRAM) o RTX PRO 6000 (96 GB VRAM). CUDA completo, sin segmentación MIG.
Best-fit dedicated plans
These are the closest stock plans in our catalogue for AI inference server workloads. Fully customizable — port, storage, RAM, DDoS profile.
VPS con GPU · RTX PRO 4500
16 vCPU · 128 GB DDR5 · 1 TB NVMe Gen5 · RTX PRO 4500 (32 GB VRAM) passthrough completo
VPS con GPU · RTX PRO 6000
32 vCPU · 256 GB DDR5 · 2 TB NVMe Gen5 · RTX PRO 6000 (96 GB VRAM) passthrough completo
Clusters de 2× / 4× / 8× GPU
Presupuesto personalizado por configuración — múltiples GPU Blackwell / L40S / L4, NVLink donde sea compatible
About AI inference server
Las cargas de trabajo de inferencia buscan tres cosas en un host de GPU: suficiente VRAM para alojar el modelo, ancho de banda PCIe completo para alimentarlo y cero contención de vecinos ruidosos. Nuestro nivel de GPU dedicado le ofrece las tres — sin segmentación MIG, sin GPU compartida con otros 8 inquilinos.
La RTX PRO 4500 Blackwell (32 GB VRAM) sirve cómodamente modelos cuantificados de 13-14B (Llama 3, Mistral, Qwen en INT4/INT8) o modelos de precisión completa de 7-8B. Rendimiento típico: 40-80 tokens/s en flujo único, 200-400 tokens/s en lotes. La RTX PRO 6000 (96 GB VRAM) escala a 70B cuantificados o 34B completos — 15-40 tokens/s en flujo único, 100-250 en lotes.
Todas las configuraciones se entregan con Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM preinstalados. Docker + NVIDIA Container Toolkit listos. IPMI 2.0 para recuperación fuera de banda. 1 TB de almacenamiento NVMe Gen5 para pesos de modelo + caché caliente.
Para cargas de trabajo multi-GPU (2× / 4× / 8× GPU por caja, NVLink donde sea compatible) — presupuesto personalizado por configuración. Trabajos de entrenamiento multi-inquilino, ajuste fino LoRA, servicio de LLM a escala — envíe la carga de trabajo, nosotros especificaremos la caja.
Frequently asked questions
¿Qué tamaño de modelo cabe en 32 GB de VRAM?
FP16 completo: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Con la descarga de algunas capas a la CPU, puede alcanzar 70B en INT4, pero el rendimiento disminuye significativamente.
¿Vale la pena optar por una RTX PRO 6000 frente a múltiples 4500?
Depende. Servicio de modelo único con baja latencia → preferir una única 6000 (96 GB). Servicio multi-inquilino con muchos modelos pequeños → múltiples 4500 escalan mejor económicamente.
¿Ofrecen H100 o H200?
No disponible actualmente. Si su carga de trabajo requiere H100, podemos conseguirlas e instalarlas — presupuesto personalizado, plazo de entrega de 2-3 semanas.