KI-Inferenz Dedicated Server
GPU-Passthrough für anspruchsvolle KI-Inferenz-Workloads. RTX PRO 4500 (32 GB VRAM) oder RTX PRO 6000 (96 GB VRAM). Volles CUDA, kein MIG-Slicing.
Best-fit dedicated plans
These are the closest stock plans in our catalogue for AI inference server workloads. Fully customizable — port, storage, RAM, DDoS profile.
GPU VPS · RTX PRO 4500
16 vCPU · 128 GB DDR5 · 1 TB NVMe Gen5 · RTX PRO 4500 (32 GB VRAM) volles Passthrough
GPU VPS · RTX PRO 6000
32 vCPU · 256 GB DDR5 · 2 TB NVMe Gen5 · RTX PRO 6000 (96 GB VRAM) volles Passthrough
2× / 4× / 8× GPU-Cluster
Kundenspezifisches Angebot pro Build — mehrere Blackwell / L40S / L4 GPUs, NVLink wo unterstützt
About AI inference server
Inferenz-Workloads benötigen drei Dinge von einem GPU-Host: genügend VRAM, um das Modell zu speichern, volle PCIe-Bandbreite, um es zu versorgen, und keine Beeinträchtigung durch 'laute Nachbarn'. Unser dedizierter GPU-Tier bietet Ihnen alle drei — kein MIG-Slicing, keine geteilte GPU mit 8 anderen Mietern.
Die RTX PRO 4500 Blackwell (32 GB VRAM) bedient problemlos quantisierte 13-14B-Modelle (Llama 3, Mistral, Qwen bei INT4/INT8) oder 7-8B-Modelle mit voller Präzision. Typischer Durchsatz: 40-80 Tokens/s im Einzelstream, 200-400 Tokens/s im Batch-Betrieb. Die RTX PRO 6000 (96 GB VRAM) skaliert auf quantisierte 70B oder volle 34B — 15-40 Tokens/s einzeln, 100-250 im Batch.
Alle Builds werden mit Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM vorinstalliert geliefert. Docker + NVIDIA Container Toolkit bereit. IPMI 2.0 für Out-of-Band-Wiederherstellung. 1 TB NVMe Gen5 Speicher für Modellgewichte + Hot Cache.
Für Multi-GPU-Workloads (2× / 4× / 8× GPU pro Box, NVLink wo unterstützt) — kundenspezifisches Angebot pro Build. Multi-Tenant-Trainingsjobs, LoRA-Fine-Tuning, LLM-Serving im großen Maßstab — senden Sie uns den Workload, wir spezifizieren die Box.
Frequently asked questions
Welche Modellgröße passt in 32 GB VRAM?
Volles FP16: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Mit CPU-Offload einiger Layer können Sie 70B bei INT4 erreichen, aber der Durchsatz sinkt erheblich.
Lohnt es sich, eine RTX PRO 6000 gegenüber mehreren 4500ern zu wählen?
Kommt darauf an. Single-Modell-Serving mit geringer Latenz → bevorzugen Sie eine einzelne 6000 (96 GB). Multi-Tenant-Serving mit vielen kleinen Modellen → mehrere 4500er skalieren wirtschaftlicher.
Bieten Sie H100 oder H200 an?
Derzeit nicht auf Lager. Wenn Ihr Workload H100 erfordert, können wir diese beschaffen und racken — kundenspezifisches Angebot, 2-3 Wochen Lieferzeit.