Практика

SLM на edge vs LLM в облаке: TCO-калькулятор для ЛПР

Рублёвый калькулятор точки безубыточности edge-устройства для офиса, ритейла и логистики: когда мини-ПК дешевле облачного API.

SLM на edge vs LLM в облаке: TCO-калькулятор для ЛПР

Что считать: не цену токена, а совокупную стоимость владения

Вы сравниваете два сценария. Первый — платить за каждый запрос облачному провайдеру: Yandex Cloud, SberCloud или API западного вендора. Второй — купить edge-устройство, которое выполняет инференс локально, и платить только за электричество и амортизацию. Разница не в том, что дешевле «на токен», а в том, при каком объёме задач постоянные затраты на железо становятся ниже переменных затрат на API.

В расчёт TCO на 36 месяцев входят:

  • CapEx: стоимость устройства, лицензии на ПО (если есть), пусконаладка.
  • OpEx: электричество, охлаждение (для серверного класса), MLOps-поддержка, обновление моделей, замена железа по истечении срока службы.
  • Облачные затраты: цена за 1 млн токенов × объём токенов в месяц.

Сравнивать только цену токена — значит игнорировать lifecycle железа (3–5 лет для мини-ПК), стоимость инженерного времени на обновление моделей и риск простоя. Для ЛПР вне производства ключевой вопрос: «Мой офис, склад или сеть магазинов — это уже edge-кейс или ещё нет?» Ответ даёт калькулятор.

Рублёвый TCO-калькулятор: точка безубыточности за 30 минут

Соберите четыре параметра — и получите месяц окупаемости, рекомендацию и стоп-лист рисков.

Входные параметры:

  1. Запросов в день — среднее количество обращений к модели.
  2. Средний размер промпта в токенах (включая системный промпт и контекст). Для классификации договора — 500–800 токенов, для суммаризации часовой встречи — 2 000–4 000 токенов.
  3. Тип задачи: классификация, суммаризация, Q&A по базе знаний, генерация текста.
  4. Бюджет на железо (₽) и стоимость электроэнергии (₽/кВт·ч, в РФ ~6–8 руб.).
  5. Горизонт расчёта: 12, 24 или 36 месяцев.

Выходные метрики:

  • Месячная стоимость облачного API (₽).
  • Месячная стоимость edge (электричество + амортизация + MLOps, ₽).
  • Точка безубыточности — месяц, в котором накопленная экономия на API превышает CapEx + OpEx железа.
  • Рекомендация: edge / cloud / hybrid.
  • Стоп-лист: скрытые риски выбранного варианта.

Пример расчёта для офисного сценария:

Сеть из 10 филиалов, в каждом — 500 запросов в день на классификацию входящих документов. Средний промпт — 600 токенов. Итого 5 000 запросов/день, ~90 млн токенов/мес. Стоимость YandexGPT Lite — 0,8 ₽ за 1 000 токенов, месячный счёт — 72 000 ₽. Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS) — 180 000 ₽, потребление 65 Вт, электричество — 375 ₽/мес. Амортизация на 3 года — 5 000 ₽/мес. MLOps (обновление модели на 10 устройствах) — 10 000 ₽/мес. Итого edge — 15 375 ₽/мес. Точка безубыточности — 4 месяца. Рекомендация: edge.

При 500 запросах в день на один офис — 15 млн токенов/мес, облачный счёт — 12 000 ₽. Edge — те же 15 375 ₽/мес. Облако дешевле. Рекомендация: cloud.

Калькулятор не даёт универсального ответа «edge всегда выгоден». Он показывает порог: для классификации и суммаризации — от 30–50 тыс. запросов/день, для генерации — от 5–10 тыс. запросов/день (из-за большего размера ответа). Подставьте свои цифры — получите решение под вашу нагрузку.

Матрица «задача × нагрузка»: edge, cloud или hybrid

Выбор архитектуры зависит от типа задачи и профиля нагрузки. Ниже — матрица для non-manufacturing сценариев.

Тип задачиНизкая нагрузка (<1k req/day)Средняя (1k–50k req/day)Высокая (>50k req/day)
Офисный ассистент (Q&A по регламентам)Cloud APIHybrid: SLM на edge для 80% запросов, cloud для сложныхEdge (мини-ПК в каждом офисе)
Классификация документов (договоры, счета)Cloud APIEdge (7B Q4 на мини-ПК)Edge (выделенный сервер с GPU)
Суммаризация встречCloud APIHybrid (edge для черновой суммаризации, cloud для финальной)Edge
FAQ по базе знаний (внутренний портал)Cloud APIEdge (RAG на устройстве)Edge (распределённый RAG)
Аналитика продаж (отчёты)Cloud APICloud API (тяжёлый reasoning)Cloud API или on-prem сервер

Правило: если 80% запросов укладываются в возможности 7B-модели, а latency критична — edge. Если задачи требуют модели 13B+ или нагрузка непредсказуема — cloud. Подробный выбор между open-weight моделями и API — в статье open-weights-onprem-2026. Производственные триггеры окупаемости SLM — в malye-modeli-onprem-proizvodstvo.

Edge-устройства для офиса: что брать и почём

Рынок предлагает три класса устройств для non-manufacturing edge.

УстройствоЦена, ₽VRAM / NPUTokens/sec (7B Q4)Потребление, ВтСрок службы
Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS)150 000–200 00032 GB RAM (shared)15–25653–5 лет
Apple Mac Mini M4 (16 GB)120 000–160 00016 GB unified20–30404–5 лет
NUC-класс с Intel Arc iGPU100 000–140 00016 GB RAM10–18503–4 лет
ARM-сервер (Graviton4-подобный, 8 ядер)250 000–350 00032 GB RAM25–40905 лет

Для классификации и Q&A достаточно мини-ПК с NPU. Для одновременной обработки нескольких потоков (10+ пользователей) — ARM-сервер или NUC с дискретной GPU. Ключевой параметр — не только tokens/sec, но и стабильность latency: edge даёт p50 50–200 мс против 200–800 мс у облачного API. Для интерактивных сценариев (чат-бот, ассистент) это решающий фактор.

Скрытые расходы edge: что не входит в ценник железа

Edge-устройство за 180 000 ₽ — только вершина айсберга. Три статьи расходов, которые ЛПР часто упускает:

  1. Lifecycle железа. Через 3–5 лет устройство морально устаревает. Новые модели требуют больше VRAM, NPU не поддерживает свежие форматы квантизации. Замена парка из 50 устройств — 5–7 млн ₽ раз в 3 года.
  2. MLOps для распределённого парка. Обновление модели на 10+ устройствах — не копирование файла. Нужен CI/CD пайплайн: сборка образа, тестирование, canary-деплой, откат при падении точности. Минимум 10–20 часов инженера в месяц. При ставке 2 500 ₽/час — 25 000–50 000 ₽/мес.
  3. Мониторинг и безопасность. Каждое устройство — точка отказа. Нужен централизованный сбор метрик (latency, throughput, ошибки), алертинг, security-патчинг ОС и рантайма. Без этого edge-парк превращается в «серую зону» инфраструктуры.

Суммарно скрытые расходы добавляют 20–30% к месячной стоимости edge. Включайте их в калькулятор — иначе точка безубыточности окажется завышенной.

Гибридный роутинг: дефолтная архитектура 2026

Бинарный выбор «edge или cloud» устарел. Рабочая схема: SLM на edge обрабатывает 80% запросов (классификация, простой Q&A, суммаризация), облачный LLM — 20% сложных (генерация отчётов, reasoning, многодокументный анализ). Роутер — лёгкий классификатор на том же edge-устройстве — определяет, куда отправить запрос.

Пример: сеть из 10 офисов, 500 запросов/день/офис.

  • 80% запросов (4 000/день) — SLM на edge: классификация договоров, ответы на FAQ по HR-регламентам.
  • 20% (1 000/день) — облачный LLM: анализ тендерной документации, генерация коммерческого предложения.

Затраты: edge — 15 375 ₽/мес (как в примере выше). Облако — 1 000 запросов × 2 000 токенов × 30 дней = 60 млн токенов/мес × 0,8 ₽/1k = 48 000 ₽/мес. Итого гибрид — 63 375 ₽/мес. Полное облако для 5 000 запросов — 240 000 ₽/мес. Экономия — 73%.

Гибридный роутинг снижает затраты на инференс на 60–80% для типовых офисных сценариев. Это не будущее — это архитектура, которую уже используют ритейлеры и логистические операторы в РФ.

Чеклист: 7 вопросов перед покупкой edge-железа

Пройдите чеклист за 15 минут — он убережёт от решения, которое не окупится.

  1. Утилизация >60%? Если устройство простаивает больше 40% времени, облако дешевле.
  2. Есть ли MLOps-ресурс для обновлений? Без инженера, который пересобирает и деплоит модели, edge-парк деградирует за 3–6 месяцев.
  3. Нужна ли офлайн-работа? Если склад или филиал работают без стабильного интернета — edge безальтернативен.
  4. Данные под 152-ФЗ? Локализация ПДн — сильный аргумент за edge, но оцените операционную сложность: иногда проще арендовать выделенный облачный контур с аттестацией.
  5. Сколько точек деплоя? Одно устройство в центральном офисе — управляемо. 50+ устройств в филиалах — нужна система оркестрации.
  6. Кто обслуживает железо? Edge-устройство — физический объект. Выход из строя в удалённом офисе требует выезда или замены силами местного персонала.
  7. Есть ли задачи, требующие >13B модели? Если да — edge не заменит облако полностью, только в гибриде.

Ответили «да» на первые три вопроса — edge оправдан. «Нет» на два и более — начинайте с облака, накапливайте статистику, возвращайтесь к калькулятору через квартал.

152-ФЗ как триггер: compliance-вынужденность

Для части российских B2B-компаний edge — не вопрос экономии, а требование регулятора. Если вы обрабатываете персональные данные и не можете использовать облачный API с аттестованным контуром, локальный инференс становится единственным вариантом. Но compliance-триггер не отменяет расчёта TCO: вы всё равно выбираете между edge-устройством и on-prem сервером в аттестованном ЦОДе. Сравнивайте стоимость аренды стойки с GPU (80 000–150 000 ₽/мес) и парка мини-ПК. Иногда централизованный сервер под 152-ФЗ выгоднее распределённого edge.

Edge-устройство — финансовое решение. Калькулятор, матрица и чеклист превращают его из инженерного спора в управленческий расчёт. Подставьте свои цифры — и получите ответ, при каком объёме задач ваш офис, склад или сеть магазинов становятся edge-кейсом.

Читайте также:

Ключевые факты

  • При нагрузке свыше 30–50 тыс. запросов в день на классификацию или суммаризацию edge-устройство окупается за 6–10 месяцев против облачного API.
  • Гибридный роутинг SLM на edge / LLM в облаке снижает затраты на инференс на 60–80% для типовых офисных сценариев.
  • Скрытые расходы edge: lifecycle железа 3–5 лет, MLOps-поддержка парка устройств и обновление моделей — могут съесть до 30% экономии.
  • 152-ФЗ — самостоятельный триггер для edge, но не всегда перевешивает операционную сложность распределённого деплоя.

Частые вопросы

Чем edge-устройство отличается от on-prem сервера?
Edge-устройство — компактный мини-ПК или NUC с NPU/GPU, работающий непосредственно в точке использования (офис, магазин, склад). On-prem сервер — централизованная машина в серверной. Edge снижает latency и зависимость от канала связи, но усложняет управление парком устройств.
Какие SLM работают на русском языке на edge?
Qwen-2.5-7B, YandexGPT Lite (квантизованные версии), Saiga/Mistral-7B, Vikhr-7B. Для офисной классификации и суммаризации достаточно 7B-моделей в 4-битной квантизации.
Что делать, если нагрузка непредсказуема?
Начинайте с облачного API, накапливайте статистику за 2–3 месяца. При стабильной утилизации выше 60–70% переходите на edge. Для пиковых нагрузок держите облачный fallback.
Когда edge однозначно не нужен?
Если у вас менее 1 000 запросов в день, нет жёстких требований по latency и данным, а задачи требуют моделей больше 13B — облачный API останется дешевле и проще.

О brezatech

brezatech — интегратор ИИ в данные и процессы: от разработки и BI до автоматизации документооборота и внедрения LLM в контур компании. ИИ-агент продаж 24/7 →

Ещё в журнале