all systems operational
Get started
IA / processamento de mídia
aplicativos › processamento de IA / mídia › whisper

Farm de GPU Whisper + ffmpeg em bare-metal ilimitado.

Transcreva áudio para texto e transcodifique vídeo em escala com uma GPU RTX PRO dedicada — execute o Whisper large-v3 para legendas e transcrições, e o NVENC ffmpeg para a escada de codificação, em um servidor com preço mensal fixo em vez de uma API por minuto. Tráfego ilimitado para mover a mídia.

gpu
RTX PRO · NVENC
stt
Whisper large-v3
tráfego
ilimitado
implantação
2–6 h
/ por que precisa de hardware de verdade

Por que um servidor com GPU supera a API de transcrição.

Sem cobrança por minuto

O speech-to-text na nuvem cobra por minuto de áudio; uma API de transcodificação cobra por minuto de saída. Uma GPU dedicada tem um preço mensal fixo — transcreva e codifique um arquivo inteiro 24 horas por dia e o custo não muda.

STT e transcodificação em um único servidor

A mesma GPU executa o Whisper large-v3 para transcrições e legendas precisas e o NVENC ffmpeg para a escada de codificação H.264/H.265 — uma única máquina cobre todo o pipeline de processamento de mídia.

Tráfego ilimitado para mover mídia

Trabalhos em lote puxam grandes arquivos de origem e enviam transcrições, legendas e vídeos recodificados. A porta ilimitada significa que todo esse I/O não custa nada além do preço fixo.

Seus dados permanecem seus

Áudio e vídeo sensíveis nunca saem de um servidor que você controla. Single-tenant, na jurisdição que você escolher, com acesso root e sem terceiros retendo seu conteúdo.

/ configurações recomendadas

Dimensionado para Whisper / ffmpeg farm.

Inicial / Produção / Alta carga — com capacidade nas métricas que importam para este aplicativo.

KyivAmsterdamWarsawMiami
Lote
Whisper + NVENC · fila de lote estável
  • CPUEPYC + RTX PRO 4500
  • RAM128 GB
  • Armazenamento4 TB NVMe
  • Porta10 Gbit/s
  • Tráfegounmetered
$550/mo
Implantar Lote →
Recomendado
Pipeline
large-v3 + 4K NVENC · alta vazão
  • CPUEPYC + RTX PRO 6000
  • RAM256 GB
  • Armazenamento8 TB NVMe
  • Porta10 Gbit/s
  • Tráfegounmetered
$990/mo
Implantar Pipeline →
Farm
multi-GPU · farm de STT + transcodificação de produção
  • CPU2× RTX PRO 6000
  • RAM512 GB
  • Armazenamento16 TB NVMe
  • Porta25 Gbit/s
  • Tráfegounmetered
$1890/mo
Implantar Farm →
/ o que está incluído

Ativado por padrão.

Whisper + ffmpeg pronto

Whisper (ou faster-whisper / whisper.cpp) e ffmpeg com NVENC instalados com CUDA e PyTorch, prontos para trabalhos em lote e uma fila.

GPU RTX PRO Dedicada

Uma RTX PRO 4500 ou 6000 Blackwell inteira — toda a VRAM e os motores NVENC são seus, sem fatias compartilhadas, sem fila atrás de outros inquilinos.

Porta ilimitada

10 / 25 Gbit/s com preço fixo — puxe grandes arquivos de origem e envie transcrições e re-codificações sem cobrança por GB de saída.

NVMe scratch

NVMe de múltiplos terabytes para mídia de origem e arquivos intermediários, para que os trabalhos em lote não sejam limitados pelo disco.

Storage Vault para arquivos

Anexe um Storage Vault para a biblioteca de origem e saídas finalizadas — escale o arquivo para centenas de terabytes.

Acesso root + API

Acesso root completo para scripts de pipelines, além de fácil integração com um pequeno serviço REST/fila para seu aplicativo.

Hospedagem de transcodificação Whisper & GPU — speech-to-text e NVENC em escala

O Whisper da OpenAI é o modelo open source de speech-to-text que produz transcrições e legendas precisas em dezenas de idiomas, e o NVENC ffmpeg é a maneira padrão de transcodificar vídeo de forma eficiente em uma GPU. Execute em qualquer volume real — um arquivo de mídia, uma rede de podcasts, um pipeline de legendagem, um fluxo de trabalho de conformidade — e as APIs de nuvem que cobram por minuto ficam caras rapidamente. Uma GPU dedicada transforma isso em um custo fixo e previsível.

A Hostfory executa Whisper e NVENC ffmpeg em GPUs RTX PRO Blackwell dedicadas. A mesma máquina transcreve com Whisper large-v3 e codifica sua escada H.264/H.265, então uma única máquina cobre todo o pipeline de processamento de mídia. E como é um servidor com preço mensal fixo, você pode executá-lo sem parar, 24 horas por dia, sem um medidor por minuto. A porta não é medida, então puxar grandes arquivos de origem e enviar transcrições, legendas e vídeo recodificado não custa nada extra, e o NVMe de vários terabytes mantém os trabalhos em lote longe de um disco lento.

Seu áudio e vídeo nunca saem de uma máquina que você controla — single-tenant, na jurisdição que você escolher, com acesso root completo para roteirizar o pipeline e um Storage Vault para o arquivo de origem e saída. Os servidores são provisionados em poucas horas com Whisper, CUDA, PyTorch e NVENC ffmpeg prontos; combine-o com a máquina GPU ComfyUI para uma pilha completa de mídia-IA.

GPURTX PRO 4500 / 6000 Blackwell + NVENC
STTWhisper large-v3 / faster-whisper
Transcodificaçãoffmpeg + NVENC (H.264 / H.265)
PilhaCUDA · PyTorch
ArmazenamentoNVMe scratch + Storage Vault
LocalizaçõesAmsterdam · Warsaw · Kyiv · Miami
/ faq

Perguntas sobre Whisper / ffmpeg farm, respondidas.

Como isso é mais barato do que uma API de transcrição?
As APIs de STT na nuvem cobram por minuto de áudio e as APIs de transcodificação cobram por minuto de saída. Uma GPU dedicada tem um preço mensal fixo, então, uma vez que você processa qualquer volume real — um arquivo, uma rede, um pipeline constante — executar sua própria máquina é muito mais barato e o custo é previsível.
Quais modelos Whisper posso executar?
Todos eles, incluindo large-v3, além de faster-whisper e whisper.cpp para velocidade. A RTX PRO 6000 lida com large-v3 em alta taxa de transferência; a 4500 é adequada para filas de lote constantes.
Posso transcodificar vídeo na mesma máquina?
Sim — o ffmpeg habilitado para NVENC está instalado, então a mesma GPU que transcreve também codifica sua escada H.264/H.265. Uma máquina cobre STT e transcodificação.
A largura de banda é medida?
Não — a porta é ilimitada, então baixar arquivos de origem grandes e enviar transcrições, legendas e saídas re-codificadas não custa nada além do preço mensal fixo.
Meus dados são privados?
Sim — é um servidor de locatário único na jurisdição que você escolher, com acesso root completo. Seu áudio e vídeo nunca tocam a infraestrutura de terceiros.
Posso integrá-lo ao meu aplicativo?
Sim — você tem acesso root, então use Whisper e ffmpeg com um pequeno serviço REST ou de fila e chame-o do seu backend, ou coloque trabalhos em uma pasta monitorada para processamento em lote.
Onde ficam os grandes arquivos?
Em um Storage Vault conectado ao servidor — a mídia de origem e as saídas finalizadas escalam para centenas de terabytes enquanto o NVMe permanece livre como um scratch rápido.

Implante Whisper / ffmpeg farm hoje.

Configurações em estoque são provisionadas em 1–3 horas. A migração de outro host é por nossa conta.

Chat with us@hostfory