Покупка мини-ПК с NPU за 150–300 тыс. рублей окупается за 6–10 месяцев, если вы обрабатываете от 30 тыс. запросов в день на классификацию, суммаризацию или FAQ. При меньшей нагрузке облачный API дешевле. Универсальный ответ — гибридный роутинг: SLM на edge берёт 80% рутинных задач, LLM в облаке — 20% сложных. В статье — рублёвый калькулятор, матрица «задача × нагрузка → решение» и чеклист из 7 вопросов перед покупкой железа. Что считать: не цену токена, а совокупную стоимость владения Вы сравниваете два сценария. Первый — платить за каждый запрос облачному провайдеру: Yandex Cloud, SberCloud или API западного вендора. Второй — купить edge-устройство, которое выполняет инференс локально, и платить только за электричество и амортизацию. Разница не в том, что дешевле «на токен», а в том, при каком объёме задач постоянные затраты на железо становятся ниже переменных затрат на API. В расчёт TCO на 36 месяцев входят: • CapEx: стоимость устройства, лицензии на ПО (если есть), пусконаладка. • OpEx: электричество, охлаждение (для серверного класса), MLOps-поддержка, обновление моделей, замена железа по истечении срока службы. • Облачные затраты: цена за 1 млн токенов × объём токенов в месяц. Сравнивать только цену токена — значит игнорировать lifecycle железа (3–5 лет для мини-ПК), стоимость инженерного времени на обновление моделей и риск простоя. Для ЛПР вне производства ключевой вопрос: «Мой офис, склад или сеть магазинов — это уже edge-кейс или ещё нет?» Ответ даёт калькулятор. Рублёвый TCO-калькулятор: точка безубыточности за 30 минут Соберите четыре параметра — и получите месяц окупаемости, рекомендацию и стоп-лист рисков. Входные параметры: 1. Запросов в день — среднее количество обращений к модели. 2. Средний размер промпта в токенах (включая системный промпт и контекст). Для классификации договора — 500–800 токенов, для суммаризации часовой встречи — 2 000–4 000 токенов. 3. Тип задачи: классификация, суммаризация, Q&A по базе знаний, генерация текста. 4. Бюджет на железо (₽) и стоимость электроэнергии (₽/кВт·ч, в РФ ~6–8 руб.). 5. Горизонт расчёта: 12, 24 или 36 месяцев. Выходные метрики: • Месячная стоимость облачного API (₽). • Месячная стоимость edge (электричество + амортизация + MLOps, ₽). • Точка безубыточности — месяц, в котором накопленная экономия на API превышает CapEx + OpEx железа. • Рекомендация: edge / cloud / hybrid. • Стоп-лист: скрытые риски выбранного варианта. Пример расчёта для офисного сценария: Сеть из 10 филиалов, в каждом — 500 запросов в день на классификацию входящих документов. Средний промпт — 600 токенов. Итого 5 000 запросов/день, ~90 млн токенов/мес. Стоимость YandexGPT Lite — 0,8 ₽ за 1 000 токенов, месячный счёт — 72 000 ₽. Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS) — 180 000 ₽, потребление 65 Вт, электричество — 375 ₽/мес. Амортизация на 3 года — 5 000 ₽/мес. MLOps (обновление модели на 10 устройствах) — 10 000 ₽/мес. Итого edge — 15 375 ₽/мес. Точка безубыточности — 4 месяца. Рекомендация: edge. При 500 запросах в день на один офис — 15 млн токенов/мес, облачный счёт — 12 000 ₽. Edge — те же 15 375 ₽/мес. Облако дешевле. Рекомендация: cloud. Калькулятор не даёт универсального ответа «edge всегда выгоден». Он показывает порог: для классификации и суммаризации — от 30–50 тыс. запросов/день, для генерации — от 5–10 тыс. запросов/день (из-за большего размера ответа). Подставьте свои цифры — получите решение под вашу нагрузку. Матрица «задача × нагрузка»: edge, cloud или hybrid Выбор архитектуры зависит от типа задачи и профиля нагрузки. Ниже — матрица для non-manufacturing сценариев. Тип задачи | Низкая нагрузка (<1k req/day) | Средняя (1k–50k req/day) | Высокая (>50k req/day) Офисный ассистент (Q&A по регламентам) | Cloud API | Hybrid: SLM на edge для 80% запросов, cloud для сложных | Edge (мини-ПК в каждом офисе) Классификация документов (договоры, счета) | Cloud API | Edge (7B Q4 на мини-ПК) | Edge (выделенный сервер с GPU) Суммаризация встреч | Cloud API | Hybrid (edge для черновой суммаризации, cloud для финальной) | Edge FAQ по базе знаний (внутренний портал) | Cloud API | Edge (RAG на устройстве) | Edge (распределённый RAG) Аналитика продаж (отчёты) | Cloud API | Cloud API (тяжёлый reasoning) | Cloud API или on-prem сервер Правило: если 80% запросов укладываются в возможности 7B-модели, а latency критична — edge. Если задачи требуют модели 13B+ или нагрузка непредсказуема — cloud. Подробный выбор между open-weight моделями и API — в статье open-weights-onprem-2026. Производственные триггеры окупаемости SLM — в malye-modeli-onprem-proizvodstvo. Edge-устройства для офиса: что брать и почём Рынок предлагает три класса устройств для non-manufacturing edge. Устройство | Цена, ₽ | VRAM / NPU | Tokens/sec (7B Q4) | Потребление, Вт | Срок службы Мини-ПК с Intel Core Ultra 7 (NPU 34 TOPS) | 150 000–200 000 | 32 GB RAM (shared) | 15–25 | 65 | 3–5 лет Apple Mac Mini M4 (16 GB) | 120 000–160 000 | 16 GB unified | 20–30 | 40 | 4–5 лет NUC-класс с Intel Arc iGPU | 100 000–140 000 | 16 GB RAM | 10–18 | 50 | 3–4 лет ARM-сервер (Graviton4-подобный, 8 ядер) | 250 000–350 000 | 32 GB RAM | 25–40 | 90 | 5 лет Для классификации и Q&A достаточно мини-ПК с NPU. Для одновременной обработки нескольких потоков (10+ пользователей) — ARM-сервер или NUC с дискретной GPU. Ключевой параметр — не только tokens/sec, но и стабильность latency: edge даёт p50 50–200 мс против 200–800 мс у облачного API. Для интерактивных сценариев (чат-бот, ассистент) это решающий фактор. Скрытые расходы edge: что не входит в ценник железа Edge-устройство за 180 000 ₽ — только вершина айсберга. Три статьи расходов, которые ЛПР часто упускает: 1. Lifecycle железа. Через 3–5 лет устройство морально устаревает. Новые модели требуют больше VRAM, NPU не поддерживает свежие форматы квантизации. Замена парка из 50 устройств — 5–7 млн ₽ раз в 3 года. 2. MLOps для распределённого парка. Обновление модели на 10+ устройствах — не копирование файла. Нужен CI/CD пайплайн: сборка образа, тестирование, canary-деплой, откат при падении точности. Минимум 10–20 часов инженера в месяц. При ставке 2 500 ₽/час — 25 000–50 000 ₽/мес. 3. Мониторинг и безопасность. Каждое устройство — точка отказа. Нужен централизованный сбор метрик (latency, throughput, ошибки), алертинг, security-патчинг ОС и рантайма. Без этого edge-парк превращается в «серую зону» инфраструктуры. Суммарно скрытые расходы добавляют 20–30% к месячной стоимости edge. Включайте их в калькулятор — иначе точка безубыточности окажется завышенной. Гибридный роутинг: дефолтная архитектура 2026 Бинарный выбор «edge или cloud» устарел. Рабочая схема: SLM на edge обрабатывает 80% запросов (классификация, простой Q&A, суммаризация), облачный LLM — 20% сложных (генерация отчётов, reasoning, многодокументный анализ). Роутер — лёгкий классификатор на том же edge-устройстве — определяет, куда отправить запрос. Пример: сеть из 10 офисов, 500 запросов/день/офис. • 80% запросов (4 000/день) — SLM на edge: классификация договоров, ответы на FAQ по HR-регламентам. • 20% (1 000/день) — облачный LLM: анализ тендерной документации, генерация коммерческого предложения. Затраты: edge — 15 375 ₽/мес (как в примере выше). Облако — 1 000 запросов × 2 000 токенов × 30 дней = 60 млн токенов/мес × 0,8 ₽/1k = 48 000 ₽/мес. Итого гибрид — 63 375 ₽/мес. Полное облако для 5 000 запросов — 240 000 ₽/мес. Экономия — 73%. Гибридный роутинг снижает затраты на инференс на 60–80% для типовых офисных сценариев. Это не будущее — это архитектура, которую уже используют ритейлеры и логистические операторы в РФ. Чеклист: 7 вопросов перед покупкой edge-железа Пройдите чеклист за 15 минут — он убережёт от решения, которое не окупится. 1. Утилизация >60%? Если устройство простаивает больше 40% времени, облако дешевле. 2. Есть ли MLOps-ресурс для обновлений? Без инженера, который пересобирает и деплоит модели, edge-парк деградирует за 3–6 месяцев. 3. Нужна ли офлайн-работа? Если склад или филиал работают без стабильного интернета — edge безальтернативен. 4. Данные под 152-ФЗ? Локализация ПДн — сильный аргумент за edge, но оцените операционную сложность: иногда проще арендовать выделенный облачный контур с аттестацией. 5. Сколько точек деплоя? Одно устройство в центральном офисе — управляемо. 50+ устройств в филиалах — нужна система оркестрации. 6. Кто обслуживает железо? Edge-устройство — физический объект. Выход из строя в удалённом офисе требует выезда или замены силами местного персонала. 7. Есть ли задачи, требующие >13B модели? Если да — edge не заменит облако полностью, только в гибриде. Ответили «да» на первые три вопроса — edge оправдан. «Нет» на два и более — начинайте с облака, накапливайте статистику, возвращайтесь к калькулятору через квартал. 152-ФЗ как триггер: compliance-вынужденность Для части российских B2B-компаний edge — не вопрос экономии, а требование регулятора. Если вы обрабатываете персональные данные и не можете использовать облачный API с аттестованным контуром, локальный инференс становится единственным вариантом. Но compliance-триггер не отменяет расчёта TCO: вы всё равно выбираете между edge-устройством и on-prem сервером в аттестованном ЦОДе. Сравнивайте стоимость аренды стойки с GPU (80 000–150 000 ₽/мес) и парка мини-ПК. Иногда централизованный сервер под 152-ФЗ выгоднее распределённого edge. Edge-устройство — финансовое решение. Калькулятор, матрица и чеклист превращают его из инженерного спора в управленческий расчёт. Подставьте свои цифры — и получите ответ, при каком объёме задач ваш офис, склад или сеть магазинов становятся edge-кейсом. *Читайте также:* • Open-weight модели on-prem в 2026: когда это разумнее API • Малые LLM на производстве: когда edge-модель дешевле облака • Корпоративная база знаний vs RAG: когда что выбрать Ключевые факты • При нагрузке свыше 30–50 тыс. запросов в день на классификацию или суммаризацию edge-устройство окупается за 6–10 месяцев против облачного API. • Гибридный роутинг SLM на edge / LLM в облаке снижает затраты на инференс на 60–80% для типовых офисных сценариев. • Скрытые расходы edge: lifecycle железа 3–5 лет, MLOps-поддержка парка устройств и обновление моделей — могут съесть до 30% экономии. • 152-ФЗ — самостоятельный триггер для edge, но не всегда перевешивает операционную сложность распределённого деплоя.