Инференс с контролем памяти, задержки и пропускной способности
Сравните GPU по объёму памяти, пропускной способности и надёжности, чтобы разместить модель и выдержать нужный профиль запросов.

- Класс
- Потребительский / серверный
- Память
- 48–80 GB
- Режим
- По запросу
- Приоритет
- Latency, throughput
Что определяет конфигурацию
Начинайте с измеримых ограничений workload. Модель GPU имеет смысл сравнивать уже после того, как понятны память, режим и узкое место.
Модель
веса + KV-cache
Квантизация и длина контекста меняют размер модели и KV-cache.
SLO
latency / throughput
Одиночные запросы и пакетная обработка требуют разного баланса задержки и throughput.
Запас
20–30% после замера
Запас памяти позволяет увеличивать batch и не упираться в OOM на пиках.
От проверки гипотезы до масштабного запуска
Профили показывают направление выбора. Перед арендой подтвердите совместимость, доступность и итоговые условия конкретного предложения.
Старт
profile 01Прототип и редкие запросы
- GPU
- 1 × GPU
- Память
- от 24 GB VRAM
- Режим
- По запросу
Подходит только если квантизованная модель и контекст помещаются.
Смотреть предложенияБаланс
profile 02Сервис с устойчивым потоком
- GPU
- 1 × производительный GPU
- Память
- 48–80 GB VRAM
- Режим
- По запросу
Подберите batch по реальным p95 latency и tokens/sec.
Смотреть предложенияМасштаб
profile 03Крупные модели или высокий параллелизм
- GPU
- 2+ однородных GPU
- Память
- 80 GB+ на GPU
- Режим
- С резервированием
Сверьте поддержку tensor parallel и скорость связи.
Смотреть предложенияКак перейти к запуску
- 01
Опишите SLO
Зафиксируйте модель, квантизацию, контекст и профиль входных запросов.
- 02
Сузьте каталог
Отберите GPU, где остаётся запас под KV-cache и рабочий batch.
- 03
Проведите замер
Измерьте p50/p95 latency и throughput на типичных данных.
- 04
Масштабируйте
Добавляйте реплики или GPU только после определения узкого места.
Вопросы по сценарию
Короткие ориентиры перед тем, как перейти к конкретным GPU.
Сколько памяти нужно для LLM?
Оцените размер весов в выбранной точности, KV-cache для целевой длины контекста и память runtime. Затем измерьте реальный профиль на репрезентативных запросах.
Что важнее: latency или throughput?
Для интерактивного продукта важнее p95 latency, для очереди задач — tokens/sec и цена завершённого задания. Сравнивайте предложения по своей метрике.
Нужен ли multi-GPU?
Если модель помещается на одном GPU, это обычно проще. Несколько GPU нужны, когда веса или контекст не помещаются либо требуется больше параллелизма.
ready for comparison
Сравните GPU для сценария «Инференс»
Стартовые фильтры уже учитывают базовый объём памяти, класс GPU и режим аренды. Уточните регион и условия в каталоге.