all systems operational
Get started
KI / Medienverarbeitung
apps › ai / media processing › whisper

Whisper + ffmpeg GPU Farm auf unmetered Bare-Metal.

Speech-to-text und Video-Transkodierung im großen Maßstab auf einer dedizierten RTX PRO GPU – führen Sie Whisper large-v3 für Untertitel und Transkripte sowie NVENC ffmpeg für die Kodierungsleiter auf einer monatlichen Flatrate-Box anstelle einer Pro-Minute-API aus. Unmetered, um die Medien zu verschieben.

gpu
RTX PRO · NVENC
stt
Whisper large-v3
traffic
unmetered
deploy
2–6 h
/ warum es echte Hardware braucht

Warum eine GPU-Box die Transkriptions-API schlägt.

Keine Pro-Minute-Abrechnung

Cloud Speech-to-text rechnet pro Audiominute ab; eine Transkodierungs-API rechnet pro Ausgabeminute ab. Eine dedizierte GPU hat einen festen monatlichen Preis – transkribieren und kodieren Sie ein ganzes Archiv rund um die Uhr, und die Kosten bleiben gleich.

STT und Transkodierung auf einer Box

Dieselbe GPU führt Whisper large-v3 für präzise Transkripte und Untertitel sowie NVENC ffmpeg für die H.264/H.265-Kodierungsleiter aus – eine Maschine deckt die gesamte Medienverarbeitungspipeline ab.

Unmetered für Medienübertragung

Batch-Jobs ziehen große Quelldateien und pushen Transkripte, Untertitel und neu kodierte Videos. Der unmetered Port bedeutet, dass all diese I/O-Kosten zusätzlich zum Festpreis nichts kosten.

Ihre Daten bleiben Ihre

Sensible Audio- und Videodaten verlassen niemals eine Box, die Sie kontrollieren. Single-Tenant, in der von Ihnen gewählten Gerichtsbarkeit, mit Root-Zugriff und ohne dass Dritte Ihre Inhalte speichern.

/ empfohlene Konfigurationen

Auf Whisper / ffmpeg farm zugeschnitten.

Starter / Produktion / Hochlast — mit Kapazität in den für diese App relevanten Metriken.

KyivAmsterdamWarsawMiami
Batch
Whisper + NVENC · stabile Batch-Warteschlange
  • CPUEPYC + RTX PRO 4500
  • RAM128 GB
  • Speicher4 TB NVMe
  • Port10 Gbit/s
  • Trafficunmetered
$550/mo
Batch bereitstellen →
Empfohlen
Pipeline
large-v3 + 4K NVENC · hoher Durchsatz
  • CPUEPYC + RTX PRO 6000
  • RAM256 GB
  • Speicher8 TB NVMe
  • Port10 Gbit/s
  • Trafficunmetered
$990/mo
Pipeline bereitstellen →
Farm
Multi-GPU · Produktions-STT + Transcode-Farm
  • CPU2× RTX PRO 6000
  • RAM512 GB
  • Speicher16 TB NVMe
  • Port25 Gbit/s
  • Trafficunmetered
$1890/mo
Farm bereitstellen →
/ was enthalten ist

Standardmäßig aktiviert.

Whisper + ffmpeg bereit

Whisper (oder faster-whisper / whisper.cpp) und NVENC-fähiges ffmpeg mit CUDA und PyTorch installiert, bereit für Batch-Jobs und eine Warteschlange.

Dedizierte RTX PRO GPU

Eine ganze RTX PRO 4500 oder 6000 Blackwell — der gesamte VRAM und die NVENC-Engines gehören Ihnen, keine geteilte Scheibe, keine Warteschlange hinter anderen Mietern.

Unmetered Port

10 / 25 Gbit/s zum Festpreis — große Quelldateien ziehen und Transkripte sowie Neu-Kodierungen ohne pro-GB Egress pushen.

NVMe Scratch

Multi-Terabyte NVMe für Quellmedien und Zwischendateien, damit Batch-Jobs nicht durch die Festplatte begrenzt werden.

Storage Vault für Archive

Verbinden Sie einen Storage Vault für die Quellbibliothek und fertige Ausgaben — skalieren Sie das Archiv auf Hunderte von Terabyte.

Root-Zugriff + API

Voller Root-Zugriff für Skript-Pipelines, plus einfache Anbindung an einen kleinen REST/Queue-Dienst für Ihre App.

Whisper & GPU-Transcode-Hosting — Speech-to-Text und NVENC im großen Maßstab

OpenAIs Whisper ist das offene Speech-to-Text-Modell, das genaue Transkripte und Untertitel in Dutzenden von Sprachen erstellt, und NVENC ffmpeg ist der Standardweg, Videos effizient auf einer GPU zu transkodieren. Betreiben Sie es in jedem realen Volumen — ein Medienarchiv, ein Podcast-Netzwerk, eine Untertitel-Pipeline, ein Compliance-Workflow — und die Cloud-APIs, die pro Minute abrechnen, werden schnell teuer. Eine dedizierte GPU wandelt dies in feste, vorhersehbare Kosten um.

Hostfory betreibt Whisper und NVENC ffmpeg auf dedizierten RTX PRO Blackwell GPUs. Dieselbe Box transkribiert mit Whisper large-v3 und kodiert Ihre H.264/H.265-Leiter, sodass eine Maschine die gesamte Medienverarbeitungspipeline abdeckt. Da es sich um einen monatlichen Festpreis-Server handelt, können Sie ihn rund um die Uhr voll auslasten, ohne eine Minutengebühr. Der Port ist unbegrenzt, sodass das Abrufen großer Quelldateien und das Pushen von Transkripten, Untertiteln und neu kodierten Videos keine zusätzlichen Kosten verursacht, und Multi-Terabyte NVMe hält Batch-Jobs von langsamen Festplatten fern.

Ihr Audio und Video verlässt niemals eine Maschine, die Sie kontrollieren – Single-Tenant, in der von Ihnen gewählten Gerichtsbarkeit, mit vollem Root-Zugriff zum Skripten der Pipeline und einem Storage Vault für das Quell- und Ausgabearchiv. Server werden in wenigen Stunden mit Whisper, CUDA, PyTorch und NVENC ffmpeg bereitgestellt; kombinieren Sie ihn mit der ComfyUI GPU-Box für einen kompletten AI-Medien-Stack.

GPURTX PRO 4500 / 6000 Blackwell + NVENC
STTWhisper large-v3 / faster-whisper
Transkodierungffmpeg + NVENC (H.264 / H.265)
StackCUDA · PyTorch
SpeicherNVMe scratch + Storage Vault
StandorteAmsterdam · Warschau · Kiew · Miami
/ FAQ

Whisper / ffmpeg farm Fragen, beantwortet.

Wie ist das günstiger als eine Transkriptions-API?
Cloud STT rechnet pro Minute Audio ab und Transkodierungs-APIs pro Ausgabeminute. Eine dedizierte GPU hat einen festen monatlichen Preis, sodass, sobald Sie ein echtes Volumen verarbeiten – ein Archiv, ein Netzwerk, eine stabile Pipeline – der Betrieb Ihrer eigenen Box weitaus günstiger ist und die Kosten vorhersehbar sind.
Welche Whisper-Modelle kann ich ausführen?
Alle, einschließlich large-v3, plus faster-whisper und whisper.cpp für Geschwindigkeit. Die RTX PRO 6000 bewältigt large-v3 mit hohem Durchsatz; die 4500 eignet sich für stabile Batch-Warteschlangen.
Kann ich Videos auf derselben Box transkodieren?
Ja – NVENC-fähiges ffmpeg ist installiert, sodass dieselbe GPU, die transkribiert, auch Ihre H.264/H.265-Leiter kodiert. Eine Maschine deckt STT und Transkodierung ab.
Ist die Bandbreite kostenpflichtig?
Nein – der Port ist unlimitiert, daher kostet das Herunterladen großer Quelldateien und das Hochladen von Transkripten, Untertiteln und neu kodierten Ausgaben nichts zusätzlich zum monatlichen Festpreis.
Sind meine Daten privat?
Ja – es ist ein Single-Tenant-Server in der von Ihnen gewählten Gerichtsbarkeit mit vollem Root-Zugriff. Ihre Audio- und Videodaten berühren niemals die Infrastruktur Dritter.
Kann ich es in meine App integrieren?
Ja – Sie haben Root-Zugriff, sodass Sie Whisper und ffmpeg mit einem kleinen REST- oder Warteschlangendienst versehen und von Ihrem Backend aufrufen oder Aufträge zur Stapelverarbeitung in einen überwachten Ordner legen können.
Wo werden große Archive gespeichert?
Auf einem Storage Vault, der an die Box angeschlossen ist – Quellmedien und fertige Ausgaben skalieren auf Hunderte von Terabyte, während der NVMe als schneller Scratch frei bleibt.

Whisper / ffmpeg farm noch heute bereitstellen.

Konfigurationen auf Lager werden in 1–3 Stunden bereitgestellt. Die Migration von einem anderen Host übernehmen wir.

Chat with us@hostfory