all systems operational
Get started
RTX PRO 4500 / 6000 Blackwell · dediziert

KI-Inferenz Dedicated Server

GPU-Passthrough für anspruchsvolle KI-Inferenz-Workloads. RTX PRO 4500 (32 GB VRAM) oder RTX PRO 6000 (96 GB VRAM). Volles CUDA, kein MIG-Slicing.

32 / 96 GB
VRAM pro GPU
PCIe 5.0 x16
Passthrough mit voller Geschwindigkeit
CUDA 12 +
vorinstalliert
from $550
/Monat (RTX PRO 4500)

About AI inference server

Inferenz-Workloads benötigen drei Dinge von einem GPU-Host: genügend VRAM, um das Modell zu speichern, volle PCIe-Bandbreite, um es zu versorgen, und keine Beeinträchtigung durch 'laute Nachbarn'. Unser dedizierter GPU-Tier bietet Ihnen alle drei — kein MIG-Slicing, keine geteilte GPU mit 8 anderen Mietern.

Die RTX PRO 4500 Blackwell (32 GB VRAM) bedient problemlos quantisierte 13-14B-Modelle (Llama 3, Mistral, Qwen bei INT4/INT8) oder 7-8B-Modelle mit voller Präzision. Typischer Durchsatz: 40-80 Tokens/s im Einzelstream, 200-400 Tokens/s im Batch-Betrieb. Die RTX PRO 6000 (96 GB VRAM) skaliert auf quantisierte 70B oder volle 34B — 15-40 Tokens/s einzeln, 100-250 im Batch.

Alle Builds werden mit Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM vorinstalliert geliefert. Docker + NVIDIA Container Toolkit bereit. IPMI 2.0 für Out-of-Band-Wiederherstellung. 1 TB NVMe Gen5 Speicher für Modellgewichte + Hot Cache.

Für Multi-GPU-Workloads (2× / 4× / 8× GPU pro Box, NVLink wo unterstützt) — kundenspezifisches Angebot pro Build. Multi-Tenant-Trainingsjobs, LoRA-Fine-Tuning, LLM-Serving im großen Maßstab — senden Sie uns den Workload, wir spezifizieren die Box.

/faq

Frequently asked questions

Welche Modellgröße passt in 32 GB VRAM?

Volles FP16: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Mit CPU-Offload einiger Layer können Sie 70B bei INT4 erreichen, aber der Durchsatz sinkt erheblich.

Lohnt es sich, eine RTX PRO 6000 gegenüber mehreren 4500ern zu wählen?

Kommt darauf an. Single-Modell-Serving mit geringer Latenz → bevorzugen Sie eine einzelne 6000 (96 GB). Multi-Tenant-Serving mit vielen kleinen Modellen → mehrere 4500er skalieren wirtschaftlicher.

Bieten Sie H100 oder H200 an?

Derzeit nicht auf Lager. Wenn Ihr Workload H100 erfordert, können wir diese beschaffen und racken — kundenspezifisches Angebot, 2-3 Wochen Lieferzeit.

Chat with us@hostfory