GPU Infrastructure
GPU-серверы для LLM: подбор и развёртывание
Сервер для LLM выбирают по требуемой модели, длине контекста, числу одновременных запросов и целевой скорости. Количество пользователей само по себе не даёт достаточной информации для подбора GPU.
Коротко / Главное
- Модель должна помещаться в видеопамять вместе с KV-cache и рабочим запасом.
- Для RAG важны не только GPU, но и RAM, NVMe, сеть и скорость подготовки контекста.
- Резервирование и возможность обслуживания часто важнее пиковой производительности одной карты.
01 / Раздел
Что определяет конфигурацию
Размер весов модели задаёт базовую потребность в VRAM. Длина контекста и одновременные сессии добавляют KV-cache, а требуемая скорость влияет на допустимую степень квантования и число GPU.
- Класс и точность модели: FP16, FP8, INT8 или более сильная квантование.
- Максимальная и реальная длина контекста.
- Число одновременных генераций и целевые токены в секунду.
- Необходимость нескольких моделей или embeddings на одном узле.
- Требования к отказоустойчивости и окнам обслуживания.
02 / Раздел
Стартовые уровни инфраструктуры
Диапазоны ниже помогают определить класс решения, но не заменяют нагрузочное тестирование выбранной модели и inference-движка.
| Уровень | Пример конфигурации | Ориентир бюджета |
|---|---|---|
| Стартовый | 1 GPU 48–96 ГБ, 256 ГБ RAM, 4 ТБ NVMe | 1,5–2,5 млн ₽ |
| Бизнес | 2–4 GPU, 512 ГБ RAM, 8 ТБ NVMe | 3,5–7,5 млн ₽ |
| Корпоративный | 4–8+ GPU, несколько узлов, HA | от 9 млн ₽ |
03 / Раздел
Что часто забывают при закупке
Серверные GPU предъявляют требования к питанию, охлаждению, глубине стойки и уровню шума. Для офиса может оказаться важнее подходящий tower или изолированная серверная, чем максимальная плотность карт в 4U-корпусе.
- Доступная электрическая мощность и резервный ввод.
- Тепловыделение, вентиляция и допустимый шум.
- Гарантия, запасные компоненты и удалённое управление.
- Скорость сети между узлами и хранилищем.
- План роста без замены всей платформы.
04 / Раздел
Почему нужен нагрузочный тест
Две модели одинакового размера могут существенно отличаться по архитектуре, поддержке inference-движком и реальной скорости. Поэтому финальная спецификация должна опираться на тест с ожидаемыми промптами, контекстом и одновременностью.
FAQ / По теме
Частые вопросы
Можно ли использовать игровые GPU?+
Для пилота иногда да. Для production нужно отдельно оценить объём VRAM, охлаждение, форм-фактор, гарантию, удалённое управление и требования к непрерывной работе.
Нужна ли быстрая связь между GPU?+
Она особенно важна, когда одна модель распределена между несколькими картами или узлами. Для независимых моделей требования могут быть мягче.
Сколько GPU нужно для 70B?+
Зависит от квантования, контекста и нагрузки. Практический старт для качественной production-конфигурации часто рассматривают в классе двух GPU по 80 ГБ, но решение подтверждается тестом.
Обсудим вашу
AI-инфраструктуру.
За 30 минут определим вероятный класс моделей, конфигурацию и следующие шаги для пилота.
Получить бесплатную оценку ↗