all systems operational
Get started
RTX PRO 4500 / 6000 Blackwell · dedykowane

Serwery dedykowane do inferencji AI

Passthrough GPU dla poważnych obciążeń inferencji AI. RTX PRO 4500 (32 GB VRAM) lub RTX PRO 6000 (96 GB VRAM). Pełne CUDA, bez MIG slicing.

32 / 96 GB
VRAM na GPU
PCIe 5.0 x16
passthrough z pełną prędkością
CUDA 12 +
preinstalowane
from $550
/mies. (RTX PRO 4500)

About AI inference server

Obciążenia inferencji wymagają trzech rzeczy od hosta GPU: wystarczającej ilości VRAM do przechowywania modelu, pełnej przepustowości PCIe do jego zasilania i braku zakłóceń od 'hałaśliwych sąsiadów'. Nasza dedykowana warstwa GPU zapewnia wszystkie trzy — bez MIG slicing, bez współdzielonego GPU z 8 innymi najemcami.

RTX PRO 4500 Blackwell (32 GB VRAM) komfortowo obsługuje skwantyzowane modele 13-14B (Llama 3, Mistral, Qwen w INT4/INT8) lub modele pełnej precyzji 7-8B. Typowa przepustowość: 40-80 tokenów/s w pojedynczym strumieniu, 200-400 tokenów/s w trybie wsadowym. RTX PRO 6000 (96 GB VRAM) skaluje się do skwantyzowanych 70B lub pełnych 34B — 15-40 tokenów/s w pojedynczym, 100-250 w trybie wsadowym.

Wszystkie konfiguracje dostarczane są z preinstalowanymi Ubuntu 22.04 + CUDA 12.4, cuDNN, TensorRT, PyTorch/JAX/vLLM. Docker + NVIDIA Container Toolkit gotowe do użycia. IPMI 2.0 do zdalnego odzyskiwania. 1 TB pamięci masowej NVMe Gen5 na wagi modelu + gorącą pamięć podręczną.

Dla obciążeń wielo-GPU (2× / 4× / 8× GPU na jednostkę, NVLink tam, gdzie wspierane) — wycena indywidualna dla każdej konfiguracji. Zadania szkoleniowe dla wielu najemców, dostrajanie LoRA, obsługa LLM na dużą skalę — prześlij obciążenie, a my dobierzemy odpowiednią maszynę.

/faq

Frequently asked questions

Jaki rozmiar modelu mieści się w 32 GB VRAM?

Pełne FP16: 7-8B (Llama 3 8B, Mistral 7B). INT8: 13-14B. INT4: 30-34B. Z odciążeniem niektórych warstw na CPU można osiągnąć 70B w INT4, ale przepustowość znacznie spada.

Czy warto wybrać RTX PRO 6000 zamiast wielu 4500?

Zależy. Obsługa pojedynczego modelu z niskim opóźnieniem → preferuj pojedynczy 6000 (96 GB). Obsługa wielu najemców z wieloma małymi modelami → wiele 4500 skaluje się lepiej ekonomicznie.

Czy oferujecie H100 lub H200?

Obecnie brak w magazynie. Jeśli Twoje obciążenie wymaga H100, możemy je pozyskać i zamontować — wycena indywidualna, czas realizacji 2-3 tygodnie.

Chat with us@hostfory