Serwery dedykowane do inferencji AI
Passthrough GPU dla poważnych obciążeń inferencji AI. RTX PRO 4500 (32 GB VRAM) lub RTX PRO 6000 (96 GB VRAM). Pełne CUDA, bez MIG slicing.
Best-fit dedicated plans
These are the closest stock plans in our catalogue for AI inference server workloads. Fully customizable — port, storage, RAM, DDoS profile.
GPU VPS · RTX PRO 4500
16 vCPU · 128 GB DDR5 · 1 TB NVMe Gen5 · RTX PRO 4500 (32 GB VRAM) pełne passthrough
GPU VPS · RTX PRO 6000
32 vCPU · 256 GB DDR5 · 2 TB NVMe Gen5 · RTX PRO 6000 (96 GB VRAM) pełne passthrough
Klastry 2× / 4× / 8× GPU
Wycena indywidualna dla każdej konfiguracji — wiele GPU Blackwell / L40S / L4, NVLink tam, gdzie wspierane
About AI inference server
Obciążenia inferencji wymagają trzech rzeczy od hosta GPU: wystarczającej ilości VRAM do przechowywania modelu, pełnej przepustowości PCIe do jego zasilania i braku zakłóceń od 'hałaśliwych sąsiadów'. Nasza dedykowana warstwa GPU zapewnia wszystkie trzy — bez MIG slicing, bez współdzielonego GPU z 8 innymi najemcami.
RTX PRO 4500 Blackwell (32 GB VRAM) komfortowo obsługuje skwantyzowane modele 13-14B (Llama 3, Mistral, Qwen w INT4/INT8) lub modele pełnej precyzji 7-8B. Typowa przepustowość: 40-80 tokenów/s w pojedynczym strumieniu, 200-400 tokenów/s w trybie wsadowym. RTX PRO 6000 (96 GB VRAM) skaluje się do skwantyzowanych 70B lub pełnych 34B — 15-40 tokenów/s w pojedynczym, 100-250 w trybie wsadowym.
Wszystkie konfiguracje dostarczane są z preinstalowanymi Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM. Docker + NVIDIA Container Toolkit gotowe do użycia. IPMI 2.0 do zdalnego odzyskiwania. 1 TB pamięci masowej NVMe Gen5 na wagi modelu + gorącą pamięć podręczną.
Dla obciążeń wielo-GPU (2× / 4× / 8× GPU na jednostkę, NVLink tam, gdzie wspierane) — wycena indywidualna dla każdej konfiguracji. Zadania szkoleniowe dla wielu najemców, dostrajanie LoRA, obsługa LLM na dużą skalę — prześlij obciążenie, a my dobierzemy odpowiednią maszynę.
Frequently asked questions
Jaki rozmiar modelu mieści się w 32 GB VRAM?
Pełne FP16: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Z odciążeniem niektórych warstw na CPU można osiągnąć 70B w INT4, ale przepustowość znacznie spada.
Czy warto wybrać RTX PRO 6000 zamiast wielu 4500?
Zależy. Obsługa pojedynczego modelu z niskim opóźnieniem → preferuj pojedynczy 6000 (96 GB). Obsługa wielu najemców z wieloma małymi modelami → wiele 4500 skaluje się lepiej ekonomicznie.
Czy oferujecie H100 lub H200?
Obecnie brak w magazynie. Jeśli Twoje obciążenie wymaga H100, możemy je pozyskać i zamontować — wycena indywidualna, czas realizacji 2-3 tygodnie.