Xora Цифровизация
бизнеса
Обсудить задачу
01Услуги02Инфраструктура03Отрасли04Кейсы05О компании06Контакты
Обсудить задачу

Инфраструктура и GPU под задачи ИИ

От рекомендаций по ИИ-контуру до работающего оборудования. Отвечаем на вопросы «какой сервер», «облако или on-premise», «как работать с LLM и не нарушить 152-ФЗ» — расчётом, а затем собираем выбранный контур, поставляем GPU-серверы и кластеры и сопровождаем эксплуатацию с SLA.

Контур под ключ

Рекомендации, сборка и сопровождение

Инженерное направление закрывает техническую часть ИИ-трансформации: проектирует и разворачивает корпоративный ИИ-контур, подбирает и поставляет GPU-оборудование, обеспечивает маскирование данных и сопровождение. Ниже — состав услуг, варианты контура и экономика.

  • Какой сервер и сколько GPU — считаем под вашу нагрузку
  • Облако, on-premise или гибрид — подбираем вариант контура
  • Как работать с LLM и соблюсти 152-ФЗ — маскирование и разграничение доступа
  • Сколько это стоит в год — оценка стоимости владения до старта

Состав услуг

Что входит в инженерное направление

01

Аудит и рекомендации

Разбираем ИТ-контур, данные, модели потребления и нагрузку. За 1–2 недели выдаём архитектурную схему, спецификацию оборудования, смету и план внедрения — с вариантами «бюджет / оптимум / премиум» и обоснованием каждого решения.

02

Выбор варианта контура

Помогаем выбрать между облачной LLM, облаком с маскированием, on-premise / air-gap и гибридом с локальным оркестратором. Все варианты собраны на одном стеке, поэтому переход между ними не требует переписывать систему.

03

Расчёт под нагрузку

Считаем от бизнеса: пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Даём три уровня бюджета и предлагаем замерить реальную нагрузку в аренде до покупки оборудования.

04

Корпоративный доступ к ИИ

Единый интерфейс для команд с политиками MASK / BLOCK / ALLOW, шлюзом маскирования данных, оркестратором провайдеров и подписок, аудитом и контролем расходов по отделам.

05

Развёртывание

Разворачиваем в SaaS, российском облаке (Cloud.ru, Yandex Cloud, Selectel) или on-premise у вас. Стек контейнеризирован — вариант меняется без переписывания, переносятся те же контейнеры в более закрытый периметр.

06

Поставка GPU и серверов

Поставляем от одной карты до кластера: L4, L40S, A100, RTX PRO 6000, H100, H200, HGX-серверы, B200 / B300 и стойки GB200 / GB300 NVL72. Монтаж, тесты, запуск; возможна поэтапная оплата.

07

Эксплуатация и SLA

Берём на сопровождение: мониторинг (Prometheus, Grafana, Langfuse), обновление моделей без простоя, масштабирование и резервирование. SLA 99,5–99,9% с последующей передачей команде заказчика.

08

AI-ЦОД и GPU-кластеры

Проектируем вычислительное ядро: обучающие кластеры с NVLink и InfiniBand, мультиарендность, биллинг GPU-часов, приёмочные испытания и ввод в эксплуатацию.

Варианты контура

Четыре варианта ИИ-контура на одном стеке

Стоимость (GPU или плата за токены) и то, покидает ли чувствительный контекст периметр, определяет генеративная LLM. Поэтому деление на варианты относится именно к ней — данные, retrieval, агенты и приложение остаются в контуре компании во всех вариантах.

ВариантГде генеративная LLMЧто в контуре компанииКогда выбирать
A Облачная LLM напрямую GigaChat, YandexGPT или DeepSeek; запрос с контекстом уходит через egress-firewall без маскирования. Qdrant, Redis, MinIO, PostgreSQL, FastAPI и GPU-узел под эмбеддинги и reranker. Нечувствительные данные, пилот, обучение. Появились ПДн — переход на B без изменения остального.
B Облако + маскирование · рекомендуемый старт Внешняя модель получает только обезличенные токены; ответ демаскируется внутри контура. Всё из A плюс Masking Gateway, mTLS, NetworkPolicy, RBAC и Vault. Есть ПДн и коммерческая тайна, но пока нет готовности к капзатратам на большие GPU.
C On-premise / air-gap vLLM с локальной моделью 32–72B или MoE на GPU-узлах (A100, H100, H200, NVLink); выхода в интернет нет. HA-кластер Kubernetes: control-plane ×3, CPU-узлы, GPU node-pool, offline-реестр образов и весов, бэкап и DR. Чувствительные данные, импортонезависимость, стабильно высокая нагрузка — окупаются свои GPU.
D Локальный оркестратор + облако Малая LLM берёт классификацию, оценку чувствительности и простые ответы; топ-модель — только на ключевой запрос через маскирование. Как в B плюс локальная модель и TEI на одном GPU-узле. Нужна сила топовой модели на главном шаге, есть ПДн и важно не переплачивать за токены.

Переход A → B → C меняет только LLM-звено и периметр. Хранилище данных, RAG, агенты и интеграции остаются прежними — инвестиции в контур не теряются при ужесточении требований.

Единый стек

Один стек, разный периметр

Контур контейнеризирован и одинаков во всех вариантах: меняется только, где работает генеративная модель. Переход между облаком, гибридом и on-premise — это перенос тех же контейнеров, а не переписывание системы.

DockerKubernetesFastAPILangChain / LangGraphvLLMTEIQdrantRedisMinIOPostgreSQLLangfuseKeycloakVaultGitLab CIPrometheusGrafana

Расчёт под нагрузку

Считаем от бизнеса, а не от железа

Пользователи × частота обращений × длина ответа → токены в секунду → необходимое число и класс GPU. Три уровня бюджета, а реальную нагрузку можно замерить в аренде до покупки оборудования.

Бюджет

Минимальная конфигурация под старт и пилот: экономичные карты (L4, L40S, A100), инференс средних моделей, базовый мониторинг.

Оптимум

Баланс цены и запаса: H100 / H200, NVLink, резервирование по питанию и сети, SLA и предсказуемая стоимость владения на год.

Премиум

Максимальная плотность и скорость: HGX B200 / B300, InfiniBand, кластерная файловая система, SLA 24×7 и выделенный инженер.

Развёртывание

Где разворачиваем контур

SaaS

Быстрый старт без закупки оборудования — платите за использование. Подходит для пилота и нечувствительных задач.

Российское облако

Cloud.ru, Yandex Cloud, Selectel — аренда GPU и инфраструктуры в РФ-периметре, соответствие требованиям к размещению данных.

On-premise

Контур у вас: модели, данные и генерация внутри периметра, прозрачная стоимость владения и полный контроль.

Air-gap

Изолированный контур без выхода в интернет — для чувствительных данных, импортонезависимости и требований к КИИ.

Эксплуатация и SLA

Сопровождаем, а не бросаем после запуска

Берём контур на сопровождение и доводим до SLA, затем передаём команде заказчика — с документацией и обучением.

  • Мониторинг: Prometheus, Grafana, Langfuse — метрики, трейсинг LLM и алерты до аварии, а не после
  • Обновление моделей и компонентов без простоя, откат на предыдущую версию
  • Масштабирование узлов и реплик под рост нагрузки, резервирование по питанию и сети
  • SLA 99,5–99,9%, регламент реакции и восстановления
  • Передача контура команде заказчика с документацией и обучением

AI-ЦОД и GPU-кластеры

Вычислительное ядро под обучение и инференс

Проектируем и строим вычислительное ядро: от отдельного GPU-узла до обучающего кластера с мультиарендностью и биллингом GPU-часов.

  • Проектирование вычислительного ядра: топология, питание, охлаждение (воздух / СЖО), стойки
  • Обучающие кластеры с NVLink внутри узла и InfiniBand между узлами
  • Мультиарендность и изоляция проектов, квоты и приоритеты
  • Биллинг GPU-часов и прозрачный учёт потребления по командам
  • Приёмочные испытания, нагрузочное тестирование и ввод в эксплуатацию

Оборудование

Поставка GPU и серверов

От одной карты до кластера и стойки. Популярные модели с ориентировочными ценами — в магазине, своя сборка под нагрузку — в конфигураторе. Монтаж, тесты, запуск; возможна поэтапная оплата.

Следующий шаг

Поможем выбрать контур и оборудование

Расскажите про задачу и нагрузку — посчитаем число и класс GPU, предложим вариант контура и соберём смету. Замерить можно в аренде до покупки.

Обсудить задачу →