Что считать: не цену токена, а совокупную стоимость владения
Вы сравниваете два сценария. Первый — платить за каждый запрос облачному провайдеру: Yandex Cloud, SberCloud или API западного вендора. Второй — купить edge-устройство, которое выполняет инференс локально, и платить только за электричество и амортизацию. Разница не в том, что дешевле «на токен», а в том, при каком объёме задач постоянные затраты на железо становятся ниже переменных затрат на API.
В расчёт TCO на 36 месяцев входят:
- CapEx: стоимость устройства, лицензии на ПО (если есть), пусконаладка.
- OpEx: электричество, охлаждение (для серверного класса), MLOps-поддержка, обновление моделей, замена железа по истечении срока службы.
- Облачные затраты: цена за 1 млн токенов × объём токенов в месяц.
Сравнивать только цену токена — значит игнорировать lifecycle железа (3–5 лет для мини-ПК), стоимость инженерного времени на обновление моделей и риск простоя. Для ЛПР вне производства ключевой вопрос: «Мой офис, склад или сеть магазинов — это уже edge-кейс или ещё нет?» Ответ даёт калькулятор.
Рублёвый TCO-калькулятор: точка безубыточности за 30 минут
Соберите четыре параметра — и получите месяц окупаемости, рекомендацию и стоп-лист рисков.
Входные параметры:
- Запросов в день — среднее количество обращений к модели.
- Средний размер промпта в токенах (включая системный промпт и контекст). Для классификации договора — 500–800 токенов, для суммаризации часовой встречи — 2 000–4 000 токенов.
- Тип задачи: классификация, суммаризация, Q&A по базе знаний, генерация текста.
- Бюджет на железо (₽) и стоимость электроэнергии (₽/кВт·ч, в РФ ~6–8 руб.).
- Горизонт расчёта: 12, 24 или 36 месяцев.
Выходные метрики:
- Месячная стоимость облачного API (₽).
- Месячная стоимость edge (электричество + амортизация + MLOps, ₽).
- Точка безубыточности — месяц, в котором накопленная экономия на API превышает CapEx + OpEx железа.
- Рекомендация: edge / cloud / hybrid.
- Стоп-лист: скрытые риски выбранного варианта.
Пример расчёта для офисного сценария:
Сеть из 10 филиалов, в каждом — 500 запросов в день на классификацию входящих документов. Средний промпт — 600 токенов. Итого 5 000 запросов/день, ~90 млн токенов/мес. Стоимость YandexGPT Lite — 0,8 ₽ за 1 000 токенов, месячный счёт — 72 000 ₽. Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS) — 180 000 ₽, потребление 65 Вт, электричество — 375 ₽/мес. Амортизация на 3 года — 5 000 ₽/мес. MLOps (обновление модели на 10 устройствах) — 10 000 ₽/мес. Итого edge — 15 375 ₽/мес. Точка безубыточности — 4 месяца. Рекомендация: edge.
При 500 запросах в день на один офис — 15 млн токенов/мес, облачный счёт — 12 000 ₽. Edge — те же 15 375 ₽/мес. Облако дешевле. Рекомендация: cloud.
Калькулятор не даёт универсального ответа «edge всегда выгоден». Он показывает порог: для классификации и суммаризации — от 30–50 тыс. запросов/день, для генерации — от 5–10 тыс. запросов/день (из-за большего размера ответа). Подставьте свои цифры — получите решение под вашу нагрузку.
Матрица «задача × нагрузка»: edge, cloud или hybrid
Выбор архитектуры зависит от типа задачи и профиля нагрузки. Ниже — матрица для non-manufacturing сценариев.
| Тип задачи | Низкая нагрузка (<1k req/day) | Средняя (1k–50k req/day) | Высокая (>50k req/day) |
|---|---|---|---|
| Офисный ассистент (Q&A по регламентам) | Cloud API | Hybrid: SLM на edge для 80% запросов, cloud для сложных | Edge (мини-ПК в каждом офисе) |
| Классификация документов (договоры, счета) | Cloud API | Edge (7B Q4 на мини-ПК) | Edge (выделенный сервер с GPU) |
| Суммаризация встреч | Cloud API | Hybrid (edge для черновой суммаризации, cloud для финальной) | Edge |
| FAQ по базе знаний (внутренний портал) | Cloud API | Edge (RAG на устройстве) | Edge (распределённый RAG) |
| Аналитика продаж (отчёты) | Cloud API | Cloud API (тяжёлый reasoning) | Cloud API или on-prem сервер |
Правило: если 80% запросов укладываются в возможности 7B-модели, а latency критична — edge. Если задачи требуют модели 13B+ или нагрузка непредсказуема — cloud. Подробный выбор между open-weight моделями и API — в статье open-weights-onprem-2026. Производственные триггеры окупаемости SLM — в malye-modeli-onprem-proizvodstvo.
Edge-устройства для офиса: что брать и почём
Рынок предлагает три класса устройств для non-manufacturing edge.
| Устройство | Цена, ₽ | VRAM / NPU | Tokens/sec (7B Q4) | Потребление, Вт | Срок службы |
|---|---|---|---|---|---|
| Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS) | 150 000–200 000 | 32 GB RAM (shared) | 15–25 | 65 | 3–5 лет |
| Apple Mac Mini M4 (16 GB) | 120 000–160 000 | 16 GB unified | 20–30 | 40 | 4–5 лет |
| NUC-класс с Intel Arc iGPU | 100 000–140 000 | 16 GB RAM | 10–18 | 50 | 3–4 лет |
| ARM-сервер (Graviton4-подобный, 8 ядер) | 250 000–350 000 | 32 GB RAM | 25–40 | 90 | 5 лет |
Для классификации и Q&A достаточно мини-ПК с NPU. Для одновременной обработки нескольких потоков (10+ пользователей) — ARM-сервер или NUC с дискретной GPU. Ключевой параметр — не только tokens/sec, но и стабильность latency: edge даёт p50 50–200 мс против 200–800 мс у облачного API. Для интерактивных сценариев (чат-бот, ассистент) это решающий фактор.
Скрытые расходы edge: что не входит в ценник железа
Edge-устройство за 180 000 ₽ — только вершина айсберга. Три статьи расходов, которые ЛПР часто упускает:
- Lifecycle железа. Через 3–5 лет устройство морально устаревает. Новые модели требуют больше VRAM, NPU не поддерживает свежие форматы квантизации. Замена парка из 50 устройств — 5–7 млн ₽ раз в 3 года.
- MLOps для распределённого парка. Обновление модели на 10+ устройствах — не копирование файла. Нужен CI/CD пайплайн: сборка образа, тестирование, canary-деплой, откат при падении точности. Минимум 10–20 часов инженера в месяц. При ставке 2 500 ₽/час — 25 000–50 000 ₽/мес.
- Мониторинг и безопасность. Каждое устройство — точка отказа. Нужен централизованный сбор метрик (latency, throughput, ошибки), алертинг, security-патчинг ОС и рантайма. Без этого edge-парк превращается в «серую зону» инфраструктуры.
Суммарно скрытые расходы добавляют 20–30% к месячной стоимости edge. Включайте их в калькулятор — иначе точка безубыточности окажется завышенной.
Гибридный роутинг: дефолтная архитектура 2026
Бинарный выбор «edge или cloud» устарел. Рабочая схема: SLM на edge обрабатывает 80% запросов (классификация, простой Q&A, суммаризация), облачный LLM — 20% сложных (генерация отчётов, reasoning, многодокументный анализ). Роутер — лёгкий классификатор на том же edge-устройстве — определяет, куда отправить запрос.
Пример: сеть из 10 офисов, 500 запросов/день/офис.
- 80% запросов (4 000/день) — SLM на edge: классификация договоров, ответы на FAQ по HR-регламентам.
- 20% (1 000/день) — облачный LLM: анализ тендерной документации, генерация коммерческого предложения.
Затраты: edge — 15 375 ₽/мес (как в примере выше). Облако — 1 000 запросов × 2 000 токенов × 30 дней = 60 млн токенов/мес × 0,8 ₽/1k = 48 000 ₽/мес. Итого гибрид — 63 375 ₽/мес. Полное облако для 5 000 запросов — 240 000 ₽/мес. Экономия — 73%.
Гибридный роутинг снижает затраты на инференс на 60–80% для типовых офисных сценариев. Это не будущее — это архитектура, которую уже используют ритейлеры и логистические операторы в РФ.
Чеклист: 7 вопросов перед покупкой edge-железа
Пройдите чеклист за 15 минут — он убережёт от решения, которое не окупится.
- Утилизация >60%? Если устройство простаивает больше 40% времени, облако дешевле.
- Есть ли MLOps-ресурс для обновлений? Без инженера, который пересобирает и деплоит модели, edge-парк деградирует за 3–6 месяцев.
- Нужна ли офлайн-работа? Если склад или филиал работают без стабильного интернета — edge безальтернативен.
- Данные под 152-ФЗ? Локализация ПДн — сильный аргумент за edge, но оцените операционную сложность: иногда проще арендовать выделенный облачный контур с аттестацией.
- Сколько точек деплоя? Одно устройство в центральном офисе — управляемо. 50+ устройств в филиалах — нужна система оркестрации.
- Кто обслуживает железо? Edge-устройство — физический объект. Выход из строя в удалённом офисе требует выезда или замены силами местного персонала.
- Есть ли задачи, требующие >13B модели? Если да — edge не заменит облако полностью, только в гибриде.
Ответили «да» на первые три вопроса — edge оправдан. «Нет» на два и более — начинайте с облака, накапливайте статистику, возвращайтесь к калькулятору через квартал.
152-ФЗ как триггер: compliance-вынужденность
Для части российских B2B-компаний edge — не вопрос экономии, а требование регулятора. Если вы обрабатываете персональные данные и не можете использовать облачный API с аттестованным контуром, локальный инференс становится единственным вариантом. Но compliance-триггер не отменяет расчёта TCO: вы всё равно выбираете между edge-устройством и on-prem сервером в аттестованном ЦОДе. Сравнивайте стоимость аренды стойки с GPU (80 000–150 000 ₽/мес) и парка мини-ПК. Иногда централизованный сервер под 152-ФЗ выгоднее распределённого edge.
Edge-устройство — финансовое решение. Калькулятор, матрица и чеклист превращают его из инженерного спора в управленческий расчёт. Подставьте свои цифры — и получите ответ, при каком объёме задач ваш офис, склад или сеть магазинов становятся edge-кейсом.
Читайте также:
Ключевые факты
- При нагрузке свыше 30–50 тыс. запросов в день на классификацию или суммаризацию edge-устройство окупается за 6–10 месяцев против облачного API.
- Гибридный роутинг SLM на edge / LLM в облаке снижает затраты на инференс на 60–80% для типовых офисных сценариев.
- Скрытые расходы edge: lifecycle железа 3–5 лет, MLOps-поддержка парка устройств и обновление моделей — могут съесть до 30% экономии.
- 152-ФЗ — самостоятельный триггер для edge, но не всегда перевешивает операционную сложность распределённого деплоя.
Частые вопросы
- Чем edge-устройство отличается от on-prem сервера?
- Edge-устройство — компактный мини-ПК или NUC с NPU/GPU, работающий непосредственно в точке использования (офис, магазин, склад). On-prem сервер — централизованная машина в серверной. Edge снижает latency и зависимость от канала связи, но усложняет управление парком устройств.
- Какие SLM работают на русском языке на edge?
- Qwen-2.5-7B, YandexGPT Lite (квантизованные версии), Saiga/Mistral-7B, Vikhr-7B. Для офисной классификации и суммаризации достаточно 7B-моделей в 4-битной квантизации.
- Что делать, если нагрузка непредсказуема?
- Начинайте с облачного API, накапливайте статистику за 2–3 месяца. При стабильной утилизации выше 60–70% переходите на edge. Для пиковых нагрузок держите облачный fallback.
- Когда edge однозначно не нужен?
- Если у вас менее 1 000 запросов в день, нет жёстких требований по latency и данным, а задачи требуют моделей больше 13B — облачный API останется дешевле и проще.
О brezatech
brezatech — интегратор ИИ в данные и процессы: от разработки и BI до автоматизации документооборота и внедрения LLM в контур компании. ИИ-агент продаж 24/7 →
