ОБСУДИТЬ ПРОЕКТ
GPU-ускоритель NVIDIA H100 80GB Hopper для AI и HPC
NVIDIA GPU под проект

GPU-ускоритель
H100 80GB

GPU-ускоритель NVIDIA H100 80GB на архитектуре Hopper для AI, обучения LLM и HPC. Доступна в SXM5 и PCIe исполнении, HBM3 на 3.35 TB/s, FP8 3958 TFLOPS на GPU, NVLink 900 GB/s.

Характеристики
FP8
3958TFLOPS
пиковая на одну H100
VRAM
80GB HBM3
3.35 TB/s пропускная
CUDA
16 896ядер
плюс 528 Tensor Cores
наличие
5-7дней
доставка из Алматы
Технические характеристики

Спецификация платформы

Базовая конфигурация сервера на 8 GPU-ускоритель NVIDIA H100 80GB SXM5. Под конкретную задачу состав CPU, RAM и хранилища подбираем индивидуально.

GPU

8x NVIDIA H100 80GB SXM5

  • Архитектура: Hopper
  • CUDA Cores: 16 896 на GPU (135 168 всего)
  • Tensor Cores: 528 (4 поколение)
  • Память: 80GB HBM3, 3.35 TB/s
  • FP8 (Transformer Engine): 3 958 TFLOPS на GPU
  • FP16 / BF16: 1 979 TFLOPS на GPU
  • FP64: 67 TFLOPS на GPU
  • TDP: 700 Вт на GPU
Interconnect

NVLink 4.0 + InfiniBand

  • NVLink между GPU: 900 GB/s
  • NVSwitch: полная связность 8 GPU
  • InfiniBand: NDR 400Gb/s (по запросу)
  • PCIe Gen5: x16 на каждый GPU
  • Сетевые порты: 2x 100GbE, опционально 8x 400Gb
  • Out-of-band управление: IPMI 2.0, Redfish
Платформа

Шасси и питание

  • Бренды: Dell PowerEdge, Supermicro, HPE, Lenovo
  • Форм-фактор: 6U-8U rack-mount
  • CPU: 2x Intel Xeon Platinum 8480+ или AMD EPYC 9004
  • RAM: 1-4 TB DDR5-4800 ECC
  • Хранилище: 8x NVMe SSD до 30 TB суммарно
  • Питание: 4-6x 3000 Вт PSU, hot-swap
  • Охлаждение: воздух или жидкость (по запросу)
Софт и поддержка

Что включено

  • ОС: Ubuntu 22.04, RHEL 9, Rocky Linux 9
  • Драйверы NVIDIA: CUDA 12.4+, cuDNN, NCCL
  • Контейнеризация: Docker, NVIDIA Container Toolkit
  • Оркестрация:
  • Тесты: CUDA-Z, NVIDIA-SMI, MLPerf benchmarks
  • Стресс-тест:
  • Гарантия:

GPU-ускорители для сервера

Профессиональные GPU-ускорители NVIDIA для AI, инференса, рендеринга и научных вычислений. Сравните объём VRAM, bandwidth, TFLOPS и подберите GPU под вашу задачу.

Сравнение GPU-ускорителей NVIDIA в Казахстане по объёму VRAM, bandwidth, производительности FP16 для AI, обучения нейросетей, инференса LLM, рендеринга и HPC
МодельПамятьBandwidth, GB/sFP16, TFLOPS
dense
TDP, WОбласть применения
NVIDIA B200Blackwell192 GB HBM3e8.0 TB/s11251000WОбучение LLM, суперкомпьютерные кластеры
NVIDIA H200 NVLHopper141 GB HBM3e4.8 TB/s835600WPCIe-серверы, обучение и инференс LLM
NVIDIA H100 NVLHopper94 GB HBM33.94 TB/s835400WИнференс больших LLM, продакшн-сервинг
NVIDIA H200 SXMHopper141 GB HBM3e4.8 TB/s494700WГенеративный AI, большие языковые модели
NVIDIA H100 SXMHopper80 GB HBM33.35 TB/s494700WFine-tuning моделей, дата-центры
NVIDIA H100 PCIeHopper80 GB HBM32.0 TB/s378350WВысокопроизводительные вычисления, HPC
NVIDIA L40SAda48 GB GDDR6864 GB/s181350WГенерация изображений, мультимодальный AI
NVIDIA A100 PCIeAmpere80 GB HBM2e1.94 TB/s156300WРаспознавание образов, автоматизация
NVIDIA Tesla V100Volta32 GB HBM2900 GB/s125300WИнференс классических моделей, легаси-задачи
NVIDIA L40Ada48 GB GDDR6864 GB/s90.5300WОблачные вычисления, виртуальные десктопы
NVIDIA A40Ampere48 GB GDDR6696 GB/s74.8300WМедицина, фармацевтика, 3D-графика
NVIDIA L4Ada24 GB GDDR6300 GB/s6072WВидеонаблюдение, потоковая аналитика

Как мы работаем над проектом

Проектирование системы начинается с задачи, а не с перечня доступного оборудования. Заказчик не обязан заранее знать, какой именно GPU, процессор, объём памяти или тип сети ему нужен - это работа технического подбора.

Шаг 1
Задача или техническое задание

Вы описываете задачу или присылаете готовое техническое задание. Что планируется считать: обучение или дообучение модели, инференс, генеративные модели, RAG, компьютерное зрение, инженерные расчёты. Какой объём данных, какой режим работы, есть ли ограничения по размещению оборудования.

Задача заказчикаТехническое заданиеСпецификация
Шаг 2
Анализ нагрузки и архитектура решения

Разбираем профиль нагрузки и определяем архитектуру: требуется ли один узел или многоузловая система, какой класс GPU и сколько памяти GPU нужно под задачу, какая роль отводится процессору и системной памяти, как устроена топология PCIe и межGPU-соединение.

WorkloadGPU memoryPCIe / NVLinkSingle-node / multi-node
Шаг 3
Подбор платформы и компонентов

Под выбранную архитектуру подбирается серверная платформа и её наполнение: GPU, процессоры, оперативная память, подсистема хранения и сетевая часть. Отдельно учитываются требования платформы к электропитанию и охлаждению.

ComputeStorageNetworkingPower / Cooling
Шаг 4
Конфигурация, поставка и ввод в работу

Формируется итоговая конфигурация и коммерческое предложение. Далее - комплектация, сборка, тестирование и поставка оборудования. Условия и срок гарантии определяются производителем, конфигурацией оборудования и условиями конкретной поставки; срок поставки указывается в коммерческом предложении.

КонфигурацияКоммерческое предложениеПоставка
Применение

Когда нужен сервер 8x H100

🧠

Обучение LLM

Pretraining моделей до 70B параметров на одном узле. Файн-тюнинг 175B+ моделей с FSDP. Скорость обучения Llama 3 70B - около 3 дней на 1.5T токенов.

Инференс с низкой задержкой

Production-нагрузка LLM с тысячами одновременных запросов. Llama 3 70B в FP8 - 2400 токенов/сек, GPT-4-class на 4 GPU из 8.

🔬

HPC и научные расчёты

Молекулярная динамика, CFD, рендеринг, геномика. FP64 67 TFLOPS на GPU - 4-5x быстрее A100. Подходит под NAMD, GROMACS, OpenFOAM.

Чем H100 отличается от A100 на практике

NVIDIA H100 архитектуры Hopper даёт прирост в 2-6 раз по сравнению с A100 (Ampere) на современных AI-нагрузках. Главное отличие - встроенный Transformer Engine, который автоматически переключает точность между FP16 и FP8 на каждом слое нейросети. На GPT-3 175B обучение ускоряется в 4 раза, на Llama-style моделях - в 3 раза.

HBM3 память даёт 3.35 TB/s против 2.0 TB/s у HBM2e на A100. Это критично для inference больших моделей, где скорость доступа к весам важнее compute. NVLink 4.0 на 900 GB/s между GPU позволяет обучать модели до 70B параметров без шардинга по узлам - всё помещается в одном сервере.

МетрикаA100 80GBH100 80GB SXM5Прирост
FP16 / BF16 TFLOPS3121 9796.3x
FP8 TFLOPSнет3 958новое
Память HBM80 GB HBM2e80 GB HBM3+68% bandwidth
Пропускная памяти2.0 TB/s3.35 TB/s1.7x
NVLink600 GB/s900 GB/s1.5x
TDP на GPU400 Вт700 Вт+75%

Что мы поставляем под ключ

Сборка под задачу, не магазин коробок. Каждый сервер собирается из проверенных компонентов под конкретное применение клиента. Заказ начинается с интервью на 30-40 минут, где обсуждаем модель которую планируете обучать или запускать в инференс, объёмы данных, требования к latency и доступности.

Только после успешного прохождения теста сервер отгружается клиенту.

Все продолжают работать в продакшене, ноль возвратов по неисправности GPU. Главное - правильно подобрать охлаждение под помещение клиента.» Технический директор GPUServer Kazakhstan

Кластеризация и масштабирование

Один сервер 8x H100 даёт 31 664 TFLOPS FP8 - этого достаточно для обучения моделей до 70B параметров. Если нужно больше - собираем кластер из 2-64 узлов на InfiniBand NDR 400Gb с топологией fat-tree. Типичный проект на 32 узла (256 H100) реализуется за 4-6 недель: согласование спецификации, заказ компонентов, сборка, монтаж в дата-центре клиента, пуско-наладка с MLPerf-бенчмарками.

  • До 8 GPU: один сервер, NVLink 4.0, без межузловой сети
  • 8-16 GPU (2 узла): InfiniBand NDR между узлами, NCCL автоматически выбирает топологию
  • 16-256 GPU (2-32 узла):
  • 256+ GPU: dual-rail InfiniBand, проектирование под конкретный workload и помещение
FAQ

Частые вопросы по серверу 8x H100

Чем H100 отличается от A100 в реальных задачах+
NVIDIA H100 на архитектуре Hopper даёт прирост в 2-6 раз по сравнению с A100 (Ampere) при обучении трансформерных моделей. Ключевые отличия: поддержка FP8 (3 958 TFLOPS, у A100 нет), память HBM3 с пропускной способностью 3.35 TB/s (vs 2.0 TB/s HBM2e), NVLink 4.0 на 900 GB/s (vs 600 GB/s), а также встроенный Transformer Engine, который автоматически выбирает оптимальную точность для каждого слоя нейросети.
Сколько VRAM нужно для обучения LLM+
Правило оценки: для обучения в FP16 нужно примерно 2 байта на параметр модели плюс оптимизатор Adam добавляет около 12 байт на параметр. Модель 7B требует около 100 GB VRAM (2x H100), 13B - около 200 GB (3-4x H100), 70B - около 560 GB (8x H100 c NVLink), 180B и выше - кластер из нескольких узлов. Файн-тюнинг с LoRA или QLoRA снижает требования в 4-8 раз: 7B помещается на 1x H100, 70B - на 2-4x H100.
H100 SXM5 или H100 PCIe - что выбрать+
H100 SXM5 - для максимальной производительности: 700 Вт TDP, NVLink 4.0 (900 GB/s между GPU), HBM3 на полной скорости. Идеален для обучения больших моделей где межгпушная связь критична. H100 PCIe - более доступный вариант (350 Вт TDP), устанавливается в стандартные серверы, NVLink только через мост (2 GPU). Подходит для инференса и файн-тюнинга где не нужна связь 4-8 GPU. Для серьёзного обучения LLM рекомендуем SXM5.
Можно ли масштабировать до кластера+
Да. Мы строим кластеры от 2 до 64 узлов (до 512 GPU H100). Топология fat-tree с неблокирующим InfiniBand-коммутатором. Типичный проект кластера на 32 узла (256x H100) реализуется за 4-6 недель.
Какое охлаждение нужно для H100+
H100 SXM5 потребляет до 700 Вт на GPU. Сервер с 8x H100 генерирует около 10 кВт тепла. Для единичных серверов достаточно воздушного охлаждения в серверной с кондиционированием (температура на входе до 35°C). Для кластеров от 8 узлов рекомендуем жидкостное охлаждение (direct liquid cooling) - снижает PUE с 1.5 до 1.1, уменьшает шум и позволяет плотнее размещать серверы. Мы проектируем системы охлаждения под конкретные помещения.
Сроки поставки H100 серверов+
Кластерные решения (10+ узлов): 3-6 недель в зависимости от масштаба и требований к сети. Экспресс-сборка: +30% к стоимости, сроки сокращаются вдвое. Каждый сервер проходит тестирование CUDA, NVLink bandwidth, памяти и термалов.
СВЯЗАТЬСЯ

Обсудить проект

Расскажите о задаче - инженер подготовит оптимальную конфигурацию и расчёт окупаемости

Бесплатная консультация и подбор конфигурации
Ответ в течение 2 часов в рабочее время
NDA по запросу

Получить предложение

Заполните форму - мы свяжемся с вами

Или свяжитесь напрямую: +7 (701) 466-22-22 · WhatsApp