Инфраструктура и GPU под задачи ИИ
От рекомендаций по ИИ-контуру до работающего оборудования. Отвечаем на вопросы «какой сервер», «облако или on-premise», «как работать с LLM и не нарушить 152-ФЗ» — расчётом, а затем собираем выбранный контур, поставляем GPU-серверы и кластеры и сопровождаем эксплуатацию с SLA.
Контур под ключ
Рекомендации, сборка и сопровождение
Инженерное направление закрывает техническую часть ИИ-трансформации: проектирует и разворачивает корпоративный ИИ-контур, подбирает и поставляет GPU-оборудование, обеспечивает маскирование данных и сопровождение. Ниже — состав услуг, варианты контура и экономика.
- Какой сервер и сколько GPU — считаем под вашу нагрузку
- Облако, on-premise или гибрид — подбираем вариант контура
- Как работать с LLM и соблюсти 152-ФЗ — маскирование и разграничение доступа
- Сколько это стоит в год — оценка стоимости владения до старта
Состав услуг
Что входит в инженерное направление
Аудит и рекомендации
Разбираем ИТ-контур, данные, модели потребления и нагрузку. За 1–2 недели выдаём архитектурную схему, спецификацию оборудования, смету и план внедрения — с вариантами «бюджет / оптимум / премиум» и обоснованием каждого решения.
Выбор варианта контура
Помогаем выбрать между облачной LLM, облаком с маскированием, on-premise / air-gap и гибридом с локальным оркестратором. Все варианты собраны на одном стеке, поэтому переход между ними не требует переписывать систему.
Расчёт под нагрузку
Считаем от бизнеса: пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Даём три уровня бюджета и предлагаем замерить реальную нагрузку в аренде до покупки оборудования.
Корпоративный доступ к ИИ
Единый интерфейс для команд с политиками MASK / BLOCK / ALLOW, шлюзом маскирования данных, оркестратором провайдеров и подписок, аудитом и контролем расходов по отделам.
Развёртывание
Разворачиваем в SaaS, российском облаке (Cloud.ru, Yandex Cloud, Selectel) или on-premise у вас. Стек контейнеризирован — вариант меняется без переписывания, переносятся те же контейнеры в более закрытый периметр.
Поставка GPU и серверов
Поставляем от одной карты до кластера: L4, L40S, A100, RTX PRO 6000, H100, H200, HGX-серверы, B200 / B300 и стойки GB200 / GB300 NVL72. Монтаж, тесты, запуск; возможна поэтапная оплата.
Эксплуатация и SLA
Берём на сопровождение: мониторинг (Prometheus, Grafana, Langfuse), обновление моделей без простоя, масштабирование и резервирование. SLA 99,5–99,9% с последующей передачей команде заказчика.
AI-ЦОД и GPU-кластеры
Проектируем вычислительное ядро: обучающие кластеры с NVLink и InfiniBand, мультиарендность, биллинг GPU-часов, приёмочные испытания и ввод в эксплуатацию.
Варианты контура
Четыре варианта ИИ-контура на одном стеке
Стоимость (GPU или плата за токены) и то, покидает ли чувствительный контекст периметр, определяет генеративная LLM. Поэтому деление на варианты относится именно к ней — данные, retrieval, агенты и приложение остаются в контуре компании во всех вариантах.
| Вариант | Где генеративная LLM | Что в контуре компании | Когда выбирать | |
|---|---|---|---|---|
| A | Облачная LLM напрямую | GigaChat, YandexGPT или DeepSeek; запрос с контекстом уходит через egress-firewall без маскирования. | Qdrant, Redis, MinIO, PostgreSQL, FastAPI и GPU-узел под эмбеддинги и reranker. | Нечувствительные данные, пилот, обучение. Появились ПДн — переход на B без изменения остального. |
| B | Облако + маскирование · рекомендуемый старт | Внешняя модель получает только обезличенные токены; ответ демаскируется внутри контура. | Всё из A плюс Masking Gateway, mTLS, NetworkPolicy, RBAC и Vault. | Есть ПДн и коммерческая тайна, но пока нет готовности к капзатратам на большие GPU. |
| C | On-premise / air-gap | vLLM с локальной моделью 32–72B или MoE на GPU-узлах (A100, H100, H200, NVLink); выхода в интернет нет. | HA-кластер Kubernetes: control-plane ×3, CPU-узлы, GPU node-pool, offline-реестр образов и весов, бэкап и DR. | Чувствительные данные, импортонезависимость, стабильно высокая нагрузка — окупаются свои GPU. |
| D | Локальный оркестратор + облако | Малая LLM берёт классификацию, оценку чувствительности и простые ответы; топ-модель — только на ключевой запрос через маскирование. | Как в B плюс локальная модель и TEI на одном GPU-узле. | Нужна сила топовой модели на главном шаге, есть ПДн и важно не переплачивать за токены. |
Переход A → B → C меняет только LLM-звено и периметр. Хранилище данных, RAG, агенты и интеграции остаются прежними — инвестиции в контур не теряются при ужесточении требований.
Единый стек
Один стек, разный периметр
Контур контейнеризирован и одинаков во всех вариантах: меняется только, где работает генеративная модель. Переход между облаком, гибридом и on-premise — это перенос тех же контейнеров, а не переписывание системы.
Расчёт под нагрузку
Считаем от бизнеса, а не от железа
Пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Три уровня бюджета, а реальную нагрузку можно замерить в аренде до покупки оборудования.
Бюджет
Минимальная конфигурация под старт и пилот: экономичные карты (L4, L40S, A100), инференс средних моделей, базовый мониторинг.
Оптимум
Баланс цены и запаса: H100 / H200, NVLink, резервирование по питанию и сети, SLA и предсказуемая стоимость владения на год.
Премиум
Максимальная плотность и скорость: HGX B200 / B300, InfiniBand, кластерная файловая система, SLA 24×7 и выделенный инженер.
Развёртывание
Где разворачиваем контур
SaaS
Быстрый старт без закупки оборудования — платите за использование. Подходит для пилота и нечувствительных задач.
Российское облако
Cloud.ru, Yandex Cloud, Selectel — аренда GPU и инфраструктуры в РФ-периметре, соответствие требованиям к размещению данных.
On-premise
Контур у вас: модели, данные и генерация внутри периметра, прозрачная стоимость владения и полный контроль.
Air-gap
Изолированный контур без выхода в интернет — для чувствительных данных, импортонезависимости и требований к КИИ.
Эксплуатация и SLA
Сопровождаем, а не бросаем после запуска
Берём контур на сопровождение и доводим до SLA, затем передаём команде заказчика — с документацией и обучением.
- Мониторинг: Prometheus, Grafana, Langfuse — метрики, трейсинг LLM и алерты до аварии, а не после
- Обновление моделей и компонентов без простоя, откат на предыдущую версию
- Масштабирование узлов и реплик под рост нагрузки, резервирование по питанию и сети
- SLA 99,5–99,9%, регламент реакции и восстановления
- Передача контура команде заказчика с документацией и обучением
AI-ЦОД и GPU-кластеры
Вычислительное ядро под обучение и инференс
Проектируем и строим вычислительное ядро: от отдельного GPU-узла до обучающего кластера с мультиарендностью и биллингом GPU-часов.
- Проектирование вычислительного ядра: топология, питание, охлаждение (воздух / СЖО), стойки
- Обучающие кластеры с NVLink внутри узла и InfiniBand между узлами
- Мультиарендность и изоляция проектов, квоты и приоритеты
- Биллинг GPU-часов и прозрачный учёт потребления по командам
- Приёмочные испытания, нагрузочное тестирование и ввод в эксплуатацию
Оборудование
Поставка GPU и серверов
От одной карты до кластера и стойки. Популярные модели с ориентировочными ценами — в магазине, своя сборка под нагрузку — в конфигураторе. Монтаж, тесты, запуск; возможна поэтапная оплата.
Магазин GPU и серверов
L4, L40S, A100, RTX PRO 6000, H100, H200, HGX-серверы, B200 / B300 и стойки GB200 / GB300 NVL72. В корзину — и заявка на поставку.
Открыть каталог →Конфигуратор сервера и GPU
Платформа, модель и число GPU, CPU, память, диски, сеть, SLA и гарантия — с ориентировочной ценой в реальном времени.
Собрать конфигурацию →Следующий шаг
Поможем выбрать контур и оборудование
Расскажите про задачу и нагрузку — посчитаем число и класс GPU, предложим вариант контура и соберём смету. Замерить можно в аренде до покупки.
Обсудить задачу →