Главная страница » GPU-серверы NVIDIA для AI
RTX 4090, RTX 5090, A100 и H100 с преднастроенным CUDA-стеком. Под инференс LLM, обучение нейросетей, генерацию изображений, видео-транскод и рендер. Активация за час.
CUDA
cuDNN · Docker
~1 час
активация RTX
H100
под заказ
исходящий трафик сейчас
Доступные ускорители
От лучшего соотношения цена/производительность до флагмана для тренировки больших моделей.
Ada · 24 GB
Blackwell · 32 GB
Ampere · 80 GB
Hopper · по заказу
Сравнение
| Карта | VRAM | CUDA-ядра | FP16 | Цена / мес |
|---|---|---|---|---|
| RTX 4090 Ada · инференс | 24 GB GDDR6X | 16 384 | 82.6 TFLOPS | 45 000 ₽ |
| RTX 5090 Blackwell · new | 32 GB GDDR7 | 21 760 | 104.8 TFLOPS | 85 000 ₽ |
| A100 80GB Ampere · обучение | 80 GB HBM2e | 6 912 | 312 TFLOPS | 190 000 ₽ |
| H100 PCIe Hopper · флагман | 80 GB HBM3 | 14 592 | 756 TFLOPS | от 390 000 ₽ |
GPU-сервер содержит дискретный ускоритель NVIDIA с CUDA-ядрами и большим объёмом видеопамяти. На задачах обучения и инференса нейросетей это даёт прирост в 50–500 раз по сравнению с обычным CPU-сервером.
RTX 4090 (24 GB VRAM, 82.6 TFLOPS FP16) — оптимальный выбор для инференса LLM до 13B параметров, Stable Diffusion, ComfyUI и
видеотранскодирования. Лучший показатель $/TFLOPS среди доступных
конфигураций.
RTX 5090 (32 GB VRAM) добавляет возможность работы с моделями до 20B.
A100 с 80 GB HBM2e и поддержкой NVLink — выбор для fine-tuning и обучения моделей 30B–70B параметров. Поддерживает FP64 для научных вычислений.
Размещён на хост-сервере AMD EPYC с 512 GB ECC RAM.
H100 с 756 TFLOPS FP16 и поддержкой FP8 — для тренировки и инференса моделей 70B–405B параметров (Llama 3.1 405B, Mistral Large).
Доступен под заказ от 24 часов. Хост-сервер: EPYC, 1 TB RAM, 10 Гбит/с
После получения доступа на сервере уже установлены:
--gpus allДля запуска Llama 3.1 8B на RTX 4090: docker run --gpus all -p 8000:8000 vllm/vllm-openai:latest \
--model meta-llama/Llama-3.1-8B-Instruct
Драйверы
NVIDIA latest
CUDA / cuDNN
✓
Docker GPU
✓
PyTorch
по запросу
vLLM / Ollama
под ключ
Хранилище
NVMe + S3
Сеть
до 10 Гбит/с
Опишите модель и нагрузку — подскажем оптимальный GPU по соотношению цена/производительность.
FAQ
Модель Llama 3.1 70B в формате FP16 требует около 140 GB VRAM — нужна мультикарточная конфигурация или квантизация. В формате Q4_K_M (llama.cpp) — около 40 GB, достаточно RTX 5090 или A100 80GB. Для production-инференса рекомендуем A100 80GB.
Стандартный срок — 1 месяц. Для разовых задач (обучение модели, рендер батча) обсуждаем краткосрочную аренду — напишите в @RealityHostBot.
Да. На сервере установлен Docker и полный root-доступ. Вы можете запустить JupyterLab в контейнере или подключиться через VS Code Remote SSH прямо из вашего редактора.
A100 80GB размещён на хосте с поддержкой NVLink для объединения карт. Конфигурации с несколькими GPU доступны под заказ — уточните в @RealityHostBot.