ƒpurfunc()
Главная/Решения

GPU Infrastructure

GPU-серверы для LLM: подбор и развёртывание

Сервер для LLM выбирают по требуемой модели, длине контекста, числу одновременных запросов и целевой скорости. Количество пользователей само по себе не даёт достаточной информации для подбора GPU.

Коротко / Главное

  1. Модель должна помещаться в видеопамять вместе с KV-cache и рабочим запасом.
  2. Для RAG важны не только GPU, но и RAM, NVMe, сеть и скорость подготовки контекста.
  3. Резервирование и возможность обслуживания часто важнее пиковой производительности одной карты.

01 / Раздел

Что определяет конфигурацию

Размер весов модели задаёт базовую потребность в VRAM. Длина контекста и одновременные сессии добавляют KV-cache, а требуемая скорость влияет на допустимую степень квантования и число GPU.

  • Класс и точность модели: FP16, FP8, INT8 или более сильная квантование.
  • Максимальная и реальная длина контекста.
  • Число одновременных генераций и целевые токены в секунду.
  • Необходимость нескольких моделей или embeddings на одном узле.
  • Требования к отказоустойчивости и окнам обслуживания.

02 / Раздел

Стартовые уровни инфраструктуры

Диапазоны ниже помогают определить класс решения, но не заменяют нагрузочное тестирование выбранной модели и inference-движка.

УровеньПример конфигурацииОриентир бюджета
Стартовый1 GPU 48–96 ГБ, 256 ГБ RAM, 4 ТБ NVMe1,5–2,5 млн ₽
Бизнес2–4 GPU, 512 ГБ RAM, 8 ТБ NVMe3,5–7,5 млн ₽
Корпоративный4–8+ GPU, несколько узлов, HAот 9 млн ₽

03 / Раздел

Что часто забывают при закупке

Серверные GPU предъявляют требования к питанию, охлаждению, глубине стойки и уровню шума. Для офиса может оказаться важнее подходящий tower или изолированная серверная, чем максимальная плотность карт в 4U-корпусе.

  • Доступная электрическая мощность и резервный ввод.
  • Тепловыделение, вентиляция и допустимый шум.
  • Гарантия, запасные компоненты и удалённое управление.
  • Скорость сети между узлами и хранилищем.
  • План роста без замены всей платформы.

04 / Раздел

Почему нужен нагрузочный тест

Две модели одинакового размера могут существенно отличаться по архитектуре, поддержке inference-движком и реальной скорости. Поэтому финальная спецификация должна опираться на тест с ожидаемыми промптами, контекстом и одновременностью.

FAQ / По теме

Частые вопросы

Можно ли использовать игровые GPU?+

Для пилота иногда да. Для production нужно отдельно оценить объём VRAM, охлаждение, форм-фактор, гарантию, удалённое управление и требования к непрерывной работе.

Нужна ли быстрая связь между GPU?+

Она особенно важна, когда одна модель распределена между несколькими картами или узлами. Для независимых моделей требования могут быть мягче.

Сколько GPU нужно для 70B?+

Зависит от квантования, контекста и нагрузки. Практический старт для качественной production-конфигурации часто рассматривают в классе двух GPU по 80 ГБ, но решение подтверждается тестом.

Обсудим вашу
AI-инфраструктуру.

За 30 минут определим вероятный класс моделей, конфигурацию и следующие шаги для пилота.

Получить бесплатную оценку