GPU-серверы NVIDIA для AI

RTX 4090, RTX 5090, A100 и H100 с преднастроенным CUDA-стеком. Под инференс LLM, обучение нейросетей, генерацию изображений, видео-транскод и рендер. Активация за час.

CUDA
cuDNN · Docker

~1 час
активация RTX

H100
под заказ

Дата-центр · в реальном времени
69,6 Гбит/с

исходящий трафик сейчас

0
серверов в сети
8 504
VPS онлайн
0
GPU в работе
99.95%
аптайм месяца

Доступные ускорители

Выберите карту под нагрузку

От лучшего соотношения цена/производительность до флагмана для тренировки больших моделей.

Ada · 24 GB

RTX 4090

24 GB

GDDR6X

16 384 CUDA

82.6 TFLOPS FP16

Хост: Ryzen 9 · 128 GB

45 000 ₽/мес

Blackwell · 32 GB

RTX 5090

32 GB

GDDR7

21 760 CUDA

104.8 TFLOPS FP16

Хост: Ryzen 9 · 192 GB

85 000 ₽/мес

Ampere · 80 GB

A100 80GB

80 GB

HBM2e

6 912 CUDA

312 TFLOPS FP16

Хост: EPYC · 512 GB · NVLink

190 000 ₽/мес

Hopper · по заказу

H100 PCIe

80 GB

HBM3

14 592 CUDA

756 TFLOPS FP16

Хост: EPYC · 1 TB · 10G

от 390 000 ₽/мес

Сравнение

Характеристики ускорителей

КартаVRAMCUDA-ядраFP16Цена / мес
RTX 4090
Ada · инференс
24 GB GDDR6X 16 38482.6 TFLOPS45 000 ₽
RTX 5090
Blackwell · new
32 GB GDDR721 760104.8 TFLOPS85 000 ₽
A100 80GB
Ampere · обучение
80 GB HBM2e6 912312 TFLOPS190 000 ₽
H100 PCIe
Hopper · флагман
80 GB HBM314 592756 TFLOPSот 390 000 ₽

Под какие задачи берут GPU-серверы

GPU-сервер содержит дискретный ускоритель NVIDIA с CUDA-ядрами и большим объёмом видеопамяти. На задачах обучения и инференса нейросетей это даёт прирост в 50–500 раз по сравнению с обычным CPU-сервером.

Как выбрать GPU для задачи

RTX 4090 и RTX 5090 — для инференса и диффузии

RTX 4090 (24 GB VRAM, 82.6 TFLOPS FP16) — оптимальный выбор для инференса LLM до 13B параметров, Stable Diffusion, ComfyUI и
видеотранскодирования. Лучший показатель $/TFLOPS среди доступных
конфигураций.
RTX 5090 (32 GB VRAM) добавляет возможность работы с моделями до 20B.

A100 80GB — для обучения foundation-моделей

A100 с 80 GB HBM2e и поддержкой NVLink — выбор для fine-tuning и обучения моделей 30B–70B параметров. Поддерживает FP64 для научных вычислений. 

Размещён на хост-сервере AMD EPYC с 512 GB ECC RAM.

H100 PCIe — флагман для самых больших трансформеров

H100 с 756 TFLOPS FP16 и поддержкой FP8 — для тренировки и инференса моделей 70B–405B параметров (Llama 3.1 405B, Mistral Large).

Доступен под заказ от 24 часов. Хост-сервер: EPYC, 1 TB RAM, 10 Гбит/с

Быстрый старт: что преднастроено на GPU-сервере

После получения доступа на сервере уже установлены:

  • Драйверы NVIDIA последней стабильной версии
  • CUDA 12.x и cuDNN — готово для PyTorch и TensorFlow
  • Docker с GPU runtime — запустите контейнер с --gpus all
  • По запросу: vLLM, Ollama, ComfyUI, Triton Inference Server под
    ключ

Для запуска Llama 3.1 8B на RTX 4090: docker run --gpus all -p 8000:8000 vllm/vllm-openai:latest \
--model meta-llama/Llama-3.1-8B-Instruct

Какую карту выбрать

RTX 4090 / 5090 — лучший $/TFLOPS для инференса и диффузии, для большинства задач до 32 GB VRAM их достаточно. A100 80GB — для обучения foundation-моделей и нагрузок, где нужна большая видеопамять и NVLink. H100 — флагман для тренировки и инференса самых больших трансформеров с FP8.
RTX-карты активируем за час, A100 — за сутки. H100 — под заказ от 24 часов до 3 дней. Для разовых задач возможна аренда на короткий срок — обсудим в Telegram.

Стек преднастроен

Драйверы

NVIDIA latest

CUDA / cuDNN

Docker GPU

PyTorch

по запросу

vLLM / Ollama

под ключ

Хранилище

NVMe + S3

Сеть

до 10 Гбит/с

Не уверены, какая карта нужна?

Опишите модель и нагрузку — подскажем оптимальный GPU по соотношению цена/производительность.

FAQ

Частые вопросы об аренде GPU-серверов

Сколько VRAM нужно для запуска Llama 3.1 70B?

Модель Llama 3.1 70B в формате FP16 требует около 140 GB VRAM — нужна мультикарточная конфигурация или квантизация. В формате Q4_K_M (llama.cpp) — около 40 GB, достаточно RTX 5090 или A100 80GB. Для production-инференса рекомендуем A100 80GB.

Стандартный срок — 1 месяц. Для разовых задач (обучение модели, рендер батча) обсуждаем краткосрочную аренду — напишите в @RealityHostBot.

Да. На сервере установлен Docker и полный root-доступ. Вы можете запустить JupyterLab в контейнере или подключиться через VS Code Remote SSH прямо из вашего редактора.

A100 80GB размещён на хосте с поддержкой NVLink для объединения карт. Конфигурации с несколькими GPU доступны под заказ — уточните в @RealityHostBot.