
GPU-ускоритель NVIDIA H100 80GB на архитектуре Hopper для AI, обучения LLM и HPC. Доступна в SXM5 и PCIe исполнении, HBM3 на 3.35 TB/s, FP8 3958 TFLOPS на GPU, NVLink 900 GB/s.
Спецификация платформы
Базовая конфигурация сервера на 8 GPU-ускоритель NVIDIA H100 80GB SXM5. Под конкретную задачу состав CPU, RAM и хранилища подбираем индивидуально.
8x NVIDIA H100 80GB SXM5
- Архитектура: Hopper
- CUDA Cores: 16 896 на GPU (135 168 всего)
- Tensor Cores: 528 (4 поколение)
- Память: 80GB HBM3, 3.35 TB/s
- FP8 (Transformer Engine): 3 958 TFLOPS на GPU
- FP16 / BF16: 1 979 TFLOPS на GPU
- FP64: 67 TFLOPS на GPU
- TDP: 700 Вт на GPU
NVLink 4.0 + InfiniBand
- NVLink между GPU: 900 GB/s
- NVSwitch: полная связность 8 GPU
- InfiniBand: NDR 400Gb/s (по запросу)
- PCIe Gen5: x16 на каждый GPU
- Сетевые порты: 2x 100GbE, опционально 8x 400Gb
- Out-of-band управление: IPMI 2.0, Redfish
Шасси и питание
- Бренды: Dell PowerEdge, Supermicro, HPE, Lenovo
- Форм-фактор: 6U-8U rack-mount
- CPU: 2x Intel Xeon Platinum 8480+ или AMD EPYC 9004
- RAM: 1-4 TB DDR5-4800 ECC
- Хранилище: 8x NVMe SSD до 30 TB суммарно
- Питание: 4-6x 3000 Вт PSU, hot-swap
- Охлаждение: воздух или жидкость (по запросу)
Что включено
- ОС: Ubuntu 22.04, RHEL 9, Rocky Linux 9
- Драйверы NVIDIA: CUDA 12.4+, cuDNN, NCCL
- Контейнеризация: Docker, NVIDIA Container Toolkit
- Оркестрация:
- Тесты: CUDA-Z, NVIDIA-SMI, MLPerf benchmarks
- Стресс-тест:
- Гарантия:

GPU-ускорители для сервера
Профессиональные GPU-ускорители NVIDIA для AI, инференса, рендеринга и научных вычислений. Сравните объём VRAM, bandwidth, TFLOPS и подберите GPU под вашу задачу.
Как мы работаем над проектом
Проектирование системы начинается с задачи, а не с перечня доступного оборудования. Заказчик не обязан заранее знать, какой именно GPU, процессор, объём памяти или тип сети ему нужен - это работа технического подбора.
Вы описываете задачу или присылаете готовое техническое задание. Что планируется считать: обучение или дообучение модели, инференс, генеративные модели, RAG, компьютерное зрение, инженерные расчёты. Какой объём данных, какой режим работы, есть ли ограничения по размещению оборудования.
Разбираем профиль нагрузки и определяем архитектуру: требуется ли один узел или многоузловая система, какой класс GPU и сколько памяти GPU нужно под задачу, какая роль отводится процессору и системной памяти, как устроена топология PCIe и межGPU-соединение.
Под выбранную архитектуру подбирается серверная платформа и её наполнение: GPU, процессоры, оперативная память, подсистема хранения и сетевая часть. Отдельно учитываются требования платформы к электропитанию и охлаждению.
Формируется итоговая конфигурация и коммерческое предложение. Далее - комплектация, сборка, тестирование и поставка оборудования. Условия и срок гарантии определяются производителем, конфигурацией оборудования и условиями конкретной поставки; срок поставки указывается в коммерческом предложении.
Когда нужен сервер 8x H100
Обучение LLM
Pretraining моделей до 70B параметров на одном узле. Файн-тюнинг 175B+ моделей с FSDP. Скорость обучения Llama 3 70B - около 3 дней на 1.5T токенов.
Инференс с низкой задержкой
Production-нагрузка LLM с тысячами одновременных запросов. Llama 3 70B в FP8 - 2400 токенов/сек, GPT-4-class на 4 GPU из 8.
HPC и научные расчёты
Молекулярная динамика, CFD, рендеринг, геномика. FP64 67 TFLOPS на GPU - 4-5x быстрее A100. Подходит под NAMD, GROMACS, OpenFOAM.
Чем H100 отличается от A100 на практике
NVIDIA H100 архитектуры Hopper даёт прирост в 2-6 раз по сравнению с A100 (Ampere) на современных AI-нагрузках. Главное отличие - встроенный Transformer Engine, который автоматически переключает точность между FP16 и FP8 на каждом слое нейросети. На GPT-3 175B обучение ускоряется в 4 раза, на Llama-style моделях - в 3 раза.
HBM3 память даёт 3.35 TB/s против 2.0 TB/s у HBM2e на A100. Это критично для inference больших моделей, где скорость доступа к весам важнее compute. NVLink 4.0 на 900 GB/s между GPU позволяет обучать модели до 70B параметров без шардинга по узлам - всё помещается в одном сервере.
Что мы поставляем под ключ
Сборка под задачу, не магазин коробок. Каждый сервер собирается из проверенных компонентов под конкретное применение клиента. Заказ начинается с интервью на 30-40 минут, где обсуждаем модель которую планируете обучать или запускать в инференс, объёмы данных, требования к latency и доступности.
Только после успешного прохождения теста сервер отгружается клиенту.
Все продолжают работать в продакшене, ноль возвратов по неисправности GPU. Главное - правильно подобрать охлаждение под помещение клиента.» Технический директор GPUServer Kazakhstan
Кластеризация и масштабирование
Один сервер 8x H100 даёт 31 664 TFLOPS FP8 - этого достаточно для обучения моделей до 70B параметров. Если нужно больше - собираем кластер из 2-64 узлов на InfiniBand NDR 400Gb с топологией fat-tree. Типичный проект на 32 узла (256 H100) реализуется за 4-6 недель: согласование спецификации, заказ компонентов, сборка, монтаж в дата-центре клиента, пуско-наладка с MLPerf-бенчмарками.
- До 8 GPU: один сервер, NVLink 4.0, без межузловой сети
- 8-16 GPU (2 узла): InfiniBand NDR между узлами, NCCL автоматически выбирает топологию
- 16-256 GPU (2-32 узла):
- 256+ GPU: dual-rail InfiniBand, проектирование под конкретный workload и помещение
Частые вопросы по серверу 8x H100
Чем H100 отличается от A100 в реальных задачах+
Сколько VRAM нужно для обучения LLM+
H100 SXM5 или H100 PCIe - что выбрать+
Можно ли масштабировать до кластера+
Какое охлаждение нужно для H100+
Сроки поставки H100 серверов+

Обсудить проект
Расскажите о задаче - инженер подготовит оптимальную конфигурацию и расчёт окупаемости
Получить предложение
Заполните форму - мы свяжемся с вами