Почему «внедрили ИИ» — это не результат
По данным IBM (2026), только 25% ИИ-инициатив приносят ожидаемый ROI. При этом большинство команд умеют запускать пилоты — но не умеют их измерять. Типичная картина: пилот прошёл, модель работает, команда довольна. Через полгода CFO спрашивает, что изменилось в P&L. Ответа нет.
Проблема не в технологии. Проблема в том, что метрики не были определены до начала работы, baseline не зафиксирован, а «успех» остался субъективным ощущением.
ИИ-проект отличается от традиционного внедрения ПО: ROI нелинеен, эффект накапливается, а первые месяцы — всегда инвестиция без отдачи. Это нормально. Ненормально — не знать, когда ждать отдачи и по каким сигналам её распознать.
Шаг 0: Baseline до деплоя
Любое утверждение об улучшении без зафиксированного «до» — это мнение, а не факт. CFO не подпишет бюджет на масштабирование на основании мнений.
Алгоритм фиксации baseline:
- Определите процесс-мишень с конкретными операционными параметрами: время цикла, количество ошибок, стоимость операции, объём эскалаций.
- Соберите данные минимум за один бизнес-цикл — обычно 30–60 дней, для сезонных процессов — полный цикл. Для документооборота это может быть квартал.
- Инструментируйте систему до запуска ИИ. Логи, тайминги, счётчики ошибок должны работать ещё до деплоя модели — иначе сравнивать будет не с чем.
- Получите sign-off финансового директора на методологию расчёта. Не на результаты — на методологию. Это страховка от будущих споров о том, «правильно ли считали».
- Зафиксируйте baseline в артефакте (таблица, страница в Confluence, раздел в проектном документе) с датой и подписями стейкхолдеров.
Без этого шага все последующие метрики — относительные, а не абсолютные.
Сводная таблица метрик по этапам
Ниже — фреймворк для копирования в презентацию совету директоров. Пороги ориентировочные; для каждого проекта они уточняются на этапе постановки задачи.
| Метрика | Пилот | Прод | Масштаб | Владелец |
|---|---|---|---|---|
| Accuracy / F1 / Hallucination rate | F1 >0.80 на hold-out; hallucination <5% | Drift <10% от пилота | Стабильность ±5% | ML-инженер / аналитик |
| Latency (p95) | Оценочно; <5s допустимо | <2s интерактив; <500ms встроенный | SLA по контракту | IT / DevOps |
| Early Adoption | >40% целевых пользователей к неделе 2 | >40% sustained к неделе 4; DAU/MAU >0.3 | Рост MAU квартал к кварталу | Продукт / операции |
| Cost per Query / Task | Оценка unit economics | Обоснован бизнес-кейсом | Снижение на 15–30% при масштабе | FinOps / IT |
| ROI | 0% (норма) | Первые сигналы к месяцу 6 | 10–30% к месяцу 12; 50–150% к месяцу 18 | CFO / директор проекта |
| CSAT / User Satisfaction | Baseline опрос | Не хуже baseline −5% | Рост на 10–20% от baseline | Операционный директор |
| Containment Rate (агенты/боты) | — | 40–65% (RAG, по Gartner 2025) | >65% при зрелой базе знаний | Продукт |
| Cycle Time Reduction | — | −10–20% от baseline | −20–55% при зрелом внедрении | Операционный директор |
| Compliance Rate (152-ФЗ, РФ) | Архитектурная оценка | 100% для данных с ПДн | Аудит ежеквартально | ИБ / юридический |
| Production Conversion Rate | — | — | >30% пилотов в прод (industry avg 20–30%) | CIO / CDO |
Go/No-Go чеклист: переход пилот → прод
Переход в продакшен — не автоматический. Вот минимальные условия:
- Качество модели: hallucination rate <5% на репрезентативной выборке продакшен-данных (не тестовой)
- Скорость: latency p95 <2s для интерактивных сценариев; <500ms для встроенных в процесс
- Раннее принятие: adoption >40% целевых пользователей к 4-й неделе пилота
- Экономика: cost per query обоснован unit economics — понятно, при каком объёме запросов проект выходит в ноль
- Baseline зафиксирован: есть документ с подписью CFO или финансового контролёра
- Интеграция: подтверждена совместимость с целевой системой (1С, ERP, СЭД) — не на уровне «работает в sandbox», а на реальных данных
- Compliance: для данных с ПДн — архитектурное решение по локализации согласовано с ИБ и юридическим отделом
- Эскалационный путь: определён процесс human-in-the-loop для случаев, когда модель не уверена
Если хотя бы три пункта не выполнены — пилот продлевается, не масштабируется.
Кто смотрит на что: матрица стейкхолдеров
Разные роли нуждаются в разных срезах одних и тех же данных.
| Роль | Ключевые метрики | Периодичность |
|---|---|---|
| CEO / CFO | ROI, cost savings, cycle time reduction, portfolio ROI | Ежеквартально |
| CIO / CDO | Latency, adoption, production conversion rate, compliance rate | Ежемесячно |
| Операционный директор | Cycle time reduction, error rate, CSAT, containment rate | Еженедельно в первые 3 месяца |
| ML-инженер / аналитик | Accuracy, F1, drift, hallucination rate, cost per query | Непрерывно (мониторинг) |
Ошибка — давать всем одинаковый дашборд. CEO не нужен drift score; ML-инженеру не нужен quarterly P&L impact.
Временная шкала ROI: почему ИИ ≠ традиционный софт
Классическое корпоративное ПО даёт эффект с первого месяца эксплуатации — пользователи просто работают в новом интерфейсе. ИИ работает иначе.
Месяцы 1–3 (пилот): ROI = 0. Это норма и не повод для паники. Идёт калибровка модели, обучение пользователей, устранение интеграционных проблем. Метрики этого этапа — качество модели и ранний adoption, не финансовый результат.
Месяцы 4–6 (ранний прод): Первые сигналы операционного эффекта. Cycle time начинает снижаться, error rate падает. ROI ещё отрицательный с учётом инвестиций, но тренд виден.
Месяцы 7–12: Накопление эффекта. При правильном масштабировании ROI выходит в диапазон 10–30%. Именно здесь важно не останавливаться — многие команды фиксируют «достаточный» результат и прекращают развитие.
Месяцы 13–18: Зрелое внедрение. Эффект от масштабирования, снижение cost per query за счёт оптимизации, рост adoption. ROI 50–150% — реалистичный диапазон для документооборота и аналитических сценариев.
Ключевой вывод для совета директоров: не требуйте ROI на пилоте — требуйте правильные метрики на пилоте. Это разные задачи.
Российская специфика: 152-ФЗ и суверенные LLM в KPI-фреймворке
Западные фреймворки метрик игнорируют два измерения, критичных для РФ.
Compliance как KPI, а не как галочка. 152-ФЗ и требования к локализации персональных данных — это не абстрактный риск. Это конкретные метрики: compliance rate (% процессов с ПДн, соответствующих требованиям), data residency score (доля обработки данных на российской инфраструктуре), время прохождения аудита ИБ. Если эти метрики не включены в KPI-фреймворк с самого начала, проект блокируется на этапе согласования с юридическим отделом — уже после того, как потрачен бюджет пилота.
Cost per query: суверенные LLM vs публичные API. Стоимость токена у GigaChat или YandexGPT отличается от OpenAI API не только номинально. Разница в unit economics включает: отсутствие compliance-штрафов и рисков утечки, предсказуемость ценообразования в рублях, но — другие характеристики latency и качества для специфических задач. При расчёте cost per query для российского проекта необходимо включать полную стоимость: токены + инфраструктура + compliance-overhead + стоимость human rescue при ошибках модели.
Интеграция с 1С и отечественными ERP. Метрика integration complexity на этапе пилота должна включать оценку совместимости с целевой системой учёта. Для документооборота и аналитики (топ-2 сценария по данным TAdviser 2026) это критично: задержки на интеграционном слое могут свести на нет выигрыш по latency самой модели.
Пять антипаттернов, которые уничтожают ROI
1. Измеряем логины вместо outcome. «10 000 запросов к ИИ-ассистенту» — это операционный cost, не ROI. ROI — это «время обработки входящего документа сократилось с 45 до 28 минут». Первое легко посчитать, второе — требует baseline. Поэтому его и не считают.
2. Нет baseline — нет доказательства. Реальный кейс из практики: чат-бот для обработки обращений показал 80% автоматизации. Звучит отлично. Но CSAT упал на 30 пунктов, потому что автоматизированные ответы не решали нестандартные кейсы, а клиенты не могли быстро выйти на оператора. Метрика автоматизации была оптимизирована — за счёт клиентской лояльности. Это произошло потому, что CSAT не был включён в KPI-фреймворк с самого начала.
3. Пилотные метрики в продакшене. Accuracy на тестовой выборке систематически лучше, чем на реальных данных: нет distribution shift, нет edge cases, нет пользовательских ошибок ввода. Команды, которые не переходят на мониторинг продакшен-метрик, обнаруживают деградацию модели через 3–6 месяцев — когда ущерб уже нанесён.
4. Бесконечный пилот. Изолированный PoC без дорожной карты масштабирования и без привязки к P&L — это не внедрение, это исследование за корпоративный бюджет. Если через 3 месяца нет Go/No-Go решения — проект нужно либо закрывать, либо переформулировать задачу.
5. Игнорирование cost per query при масштабировании. Успешный GenAI-фичер с 500 пользователями может стать runaway cost line при 5000. Стоимость токенов, инфраструктуры и human rescue масштабируется нелинейно. FinOps для GenAI — не опция, а обязательный элемент перехода в масштаб.
Метрики для топ-2 сценариев: документооборот и аналитика
По данным TAdviser (2026), документооборот и аналитика — лидирующие сценарии внедрения ИИ в российском B2B. Для них метрики имеют отраслевую специфику.
Документооборот (СЭД, входящие/исходящие, договоры):
- Cycle time: время от поступления документа до завершения обработки (baseline → −30–50% при зрелом внедрении)
- Error rate: % документов с ошибками классификации или извлечения данных
- Straight-through processing rate: % документов, обработанных без ручного вмешательства
- Compliance rate: % обработки ПДн в соответствии с 152-ФЗ
Аналитика и BI (отчёты, запросы к данным, интерпретация):
- Time-to-insight: время от запроса до готового ответа (baseline → −40–60%)
- Query accuracy: % аналитических запросов, давших корректный результат без доработки
- Self-service rate: % запросов, решённых без участия аналитика
- Hallucination rate на числовых данных: критично для финансовой отчётности
Измерение — это не бюрократия и не самоцель. Это единственный способ отличить работающее внедрение от дорогого эксперимента. Интегратор, который приходит с фреймворком метрик, а не с демо модели, помогает ЛПР принимать решения на основе данных — и защищать эти решения перед советом директоров.
Читайте также в блоге brezatech:
- Чеклист внедрения LLM в B2B: что проверить до деплоя
- BI для операционных решений: от дашборда к действию
brezatech — интегратор ИИ в данные и процессы: разработка, BI и автоматизация для B2B-компаний в РФ.
Ключевые факты
- По данным IBM (2026), только 25% ИИ-инициатив приносят ожидаемый ROI — главная причина: отсутствие измеримых метрик до деплоя.
- Industry average: лишь 20–30% пилотов доходят до продакшена (production conversion rate). Фреймворк метрик удваивает этот показатель.
- Adoption >40% к 4-й неделе — ключевой ранний сигнал жизнеспособности внутреннего ИИ-инструмента. Ниже — стоп-сигнал для масштабирования.
- Для GenAI в РФ cost per query у суверенных LLM (GigaChat, YandexGPT) и OpenAI API различается не только ценой токена, но и compliance-стоимостью: 152-ФЗ меняет unit economics.
- ROI ИИ-проекта нелинеен: 0% на пилоте — норма, 10–30% к месяцу 12, 50–150% к месяцу 18 при правильном масштабировании.
Частые вопросы
- Как объяснить CFO, почему accuracy 95% — это не ROI?
- Accuracy измеряет качество модели на тестовой выборке, но не влияние на бизнес-процесс. CFO нужен ответ на вопрос: сколько часов сотрудников высвободилось, сколько ошибок стало меньше, как изменился цикл обработки документа. 95% accuracy при нулевом adoption — это дорогой эксперимент, а не внедрение.
- Сколько метрик достаточно для пилота?
- 3–5 метрик: одна на качество модели (accuracy/hallucination rate), одна на раннее принятие (adoption к неделе 2–4), одна на скорость (latency p95), одна на стоимость (cost per query) и одна на бизнес-результат (baseline delta). Больше — перегрузка, меньше — слепые зоны.
- Что делать, если adoption низкий через 4 недели?
- Сначала диагностика: latency >2s убивает adoption механически; неудобный UX — второй фактор; недоверие к результатам — третий. Если после устранения технических причин adoption не растёт — проблема в ценностном предложении для пользователя, а не в модели. Пересматривайте сценарий, не улучшайте модель.
- Нужно ли измерять compliance как KPI?
- В РФ — обязательно. Compliance rate (% процессов, соответствующих 152-ФЗ и требованиям локализации данных) входит в governance-блок метрик. Игнорирование этого измерения блокирует переход в прод на этапе согласования с юридическим и ИБ-отделами.
- Как считать ROI, если эффект косвенный (качество решений, а не прямая экономия)?
- Используйте прокси-метрики с финансовым переводом: сокращение цикла принятия решения на X часов × ставка руководителя = экономия. Или: снижение числа ошибок в документах на Y% × стоимость одной ошибки (переработка + риск) = избежанные потери. Главное — зафиксировать baseline до деплоя и получить sign-off CFO на методологию расчёта.
Источники
- AI Performance Metrics & KPIs: Complete Enterprise Guide
- Pilot-to-Production KPIs: 12 Metrics That Predict Scaling Success
- Measuring Enterprise AI Success: KPIs Beyond Accuracy
- ИИ-проекты съедают бюджеты, но не приносят ROI
- How to Maximize AI ROI in 2026
- TAdviser: Тенденции ИИ в России 2026
- Agility at Scale — How to Measure & Evaluate Enterprise AI ROI
- Larridin — AI Adoption KPIs Every CIO Should Track in 2026
О brezatech
brezatech — интегратор ИИ в данные и процессы: разработка, BI и автоматизация для B2B-компаний в РФ. ИИ-агент продаж 24/7 →
