Сколько стоил вчерашний разговор вашего бота? В большинстве компаний этого не знает никто.
Счёт от провайдера приходит одной суммой в конце месяца. Она либо приемлемая — и тогда вопрос закрывают до следующего месяца, либо неприятная — и тогда бота отключают целиком, потому что непонятно, какую его часть выключить.
Между этими двумя реакциями есть третья: понять, из чего эта сумма состоит. Ниже — как устроен учёт, который отвечает на вопрос «сколько стоил вот этот конкретный разговор», и почему без него любое обсуждение окупаемости ИИ — это разговор о вкусах.
Главное за минуту
Считать по вызовам модели
Реплик в диалоге шесть, а обращений к модели двадцать — из-за работы с инструментами.
Девять источников расхода
От диалога и скоринга до эмбеддингов. Бот в чате — не всегда самая дорогая статья.
Дорогой диалог — это провал
Бот ходил по кругу и не справился, а вы заплатили дважды: за токены и за клиента.
Потолок передаёт человеку
При превышении бот прощается и передаёт диалог оператору, а не замолкает посреди разговора.
Почему учёт «по диалогам» врёт, а «по обращениям к модели» — нет
Тонкость, из-за которой расходятся все самодельные калькуляторы.
Кажется логичным считать так: диалог состоял из шести реплик бота, значит шесть обращений к модели. На практике реплик шесть, а обращений двадцать — потому что бот работает инструментами. Чтобы ответить «есть ли в наличии стиральная машина на 6 кг», он делает поиск, получает результат, просит модель выбрать из кандидатов, проверяет остаток, формулирует ответ. Каждый шаг — отдельное обращение с отдельными токенами.
Поэтому строка расхода должна писаться на каждое обращение к провайдеру, а не на ход диалога. Тогда в отчёт попадают и промежуточные вызовы при работе с инструментами — те, которые в наивном учёте не видны вообще, а в счёте провайдера видны прекрасно.
Что фиксируется по каждому обращению: входные и выходные токены, отдельно кэшированные, длительность, модель, провайдер и применённые цены. Точность учёта — до шести знаков.
Девять источников расхода: где на самом деле уходят деньги
Большинство владельцев уверены, что ИИ — это «бот в чате». В реальности источников расхода девять, и бот в чате не всегда самый дорогой.
| Источник | Что это и когда бывает дорого |
|---|---|
| Диалог | Ответы бота клиенту. Основная статья, растёт с потоком обращений |
| Классификаторы | Определение темы и намерения. Дешёвые вызовы, но их много |
| Скоринг | Оценка интереса по диалогу и по расшифровке звонка |
| Почта | Разбор входящих писем и оценка интереса по ним |
| Подбор товаров | Сборка спецификации по переписке. Дорого на больших каталогах |
| Суфлёр | Подсказки оператору на живом звонке — расход в реальном времени |
| Ассистент | Внутренний помощник для сотрудников |
| Эмбеддинги | Индексация базы знаний. Пик при первом запуске, потом спад |
| Служебные вызовы | Всё остальное, включая шаги бизнес-процессов |
Поверх этого — разрез по ботам, каналам и моделям. То есть можно увидеть не «расходы на ИИ», а экономику конкретного канала: во что обходится ночной поток из Instagram и во что — чат на сайте. Это уже основание, чтобы принимать решения про рекламу, а не только про бота.
Топ-25 самых дорогих диалогов — и почему это не отчёт о расходах
Самый полезный экран во всём контуре, и полезен он неочевидным образом.
Таблица 25 самых дорогих разговоров со ссылкой прямо в переписку выглядит как финансовый инструмент. На практике это инструмент качества: дорогой диалог почти всегда означает, что бот не справился. Он ходил по кругу, переспрашивал, вызывал инструменты, получал ошибки и снова пытался.
То есть вы платите дважды: за токены и за клиента, который в итоге ушёл к оператору или вообще ушёл. Открыв такой диалог, вы обычно находите не «дорогую модель», а конкретный сценарий, который нужно починить — добавить факт в базу знаний или дать боту инструмент, которого ему не хватило.
Практика первой недели: откройте три самых дорогих диалога и прочитайте их целиком. Это обычно даёт больше, чем месяц обсуждения промпта.
Потолок расхода: бот не замолкает, а передаёт клиента
«А если бот сожжёт бюджет на токенах?» — законный вопрос, особенно после первого дорогого месяца.
Есть два потолка: на себестоимость одного диалога и на суточный расход компании. Но важнее не сами лимиты, а реакция на превышение.
Плохая реакция — бот молча выключается посреди разговора. Клиент остаётся без ответа, и вы экономите на токенах, теряя продажу.
Правильная — бот произносит прощальную фразу, снимается с чата, ставит признак «нужен оператор» и оставляет заметку тому, кто подхватит. Перерасход заканчивается живым менеджером, а не тишиной.
Честно: в поставке лимиты выключены. Механизм реализован полностью, но включается и настраивается осознанно. Поэтому мы говорим «лимиты включаются», а не «расходы ограничены автоматически» — разница существенная, и узнавать о ней из счёта неприятно.
Что можно не покупать у провайдера
Часть работы, за которую обычно платят по токенам, считается локально — и это прямое сокращение счёта.
- Смысловой поиск по каталогу. Векторы считает локальная модель на вашем сервере. За поисковый запрос покупателя не платится по токенам, и каталог не уходит во внешнее облако.
- Разбор проблемных диалогов. Идёт по тексту и метаданным, без обращения к языковой модели. Контроль качества не добавляет к счёту ни цента — хотя обычно «AI анализирует каждый диалог» означает вторую статью расходов.
- Переобход сайта для базы знаний. По сохранённым отметкам неизменённые страницы не пересчитываются заново — эмбеддинги не тратятся на то, что не менялось.
- Стоп-темы. Проверяются в реплике клиента до обращения к модели: по запретной теме модель не вызывается вовсе — нет ни токенов, ни риска.
- Порог автосделки. Оценка интереса не даёт заводить карточку по каждому «вы работаете в субботу?» — и заодно ограничивает расход на скоринг.
Распознавание речи тоже может работать на собственном сервере компании. Для клиник и финансовых организаций это вопрос не экономии, а допустимости проекта.
Как устроена подписка: восемь ресурсов по отдельности
Отдельно от себестоимости моделей считается сама подписка — и здесь тоже важна механика, а не «пакет услуг».
Тарифицируются восемь позиций: дни подписки, число операторов, объём почтового ящика, ответы бота, минуты разговора голосового робота, дни канала WhatsApp на личном номере, дни канала WhatsApp Business и дни телефонии. Плюс отдельные признаки «есть обмен с 1С» и «есть маркетплейсы».
Что это означает практически: салон на три кресла и сеть клиник платят за разный объём, а не за одинаковую лицензию. Компания без 1С не платит за чужую функциональность. Списание идёт раз в сутки, а предупреждение об исчерпании приходит за пять дней до конца — по фактической скорости расхода, а не по календарю.
Триал — 14 дней на 5 сотрудников: 100 ответов бота, 60 минут разговора робота, почтовый ящик 1 ГБ. Этого хватает, чтобы увидеть свою реальную структуру расхода, а не средние цифры по рынку.
Как считать окупаемость, не выдумывая проценты
Мы не называем сроков окупаемости и процентов роста конверсии — таких измерений у продукта нет. Но посчитать можно на своих данных, и это честнее любой цифры из презентации.
| Что считаем | Как | Ваше значение |
|---|---|---|
| Обращения вне рабочих часов за месяц | История чатов и отчёт АТС | ___ |
| Доля из них, которую бот закроет сам | Посчитайте на двух неделях триала, а не на оценке | ___ % |
| Себестоимость одного диалога бота | Отчёт по себестоимости за период триала | ___ ₸ |
| Расход на ИИ в месяц | Обращения × доля × себестоимость диалога | ___ ₸ |
| Стоимость того же объёма людьми | Сколько часов это заняло бы × стоимость часа | ___ ₸ |
Обратите внимание на вторую строку: её нельзя оценить заранее, её можно только измерить. Именно поэтому триал стоит проходить на живом трафике, а не на демо-стенде — иначе вы получите чьи-то средние вместо своих фактических.
Самый дорогой диалог в отчёте почти никогда не про дорогую модель. Это сценарий, который бот не смог закрыть.
Границы: что честно сказать сразу
- Лимиты расхода в поставке выключены и включаются при настройке.
- Всё, что делает ИИ, расходует токены постоянно, а не разово. Это подписная, а не разовая статья бюджета.
- Подготовка карточек для маркетплейса — отдельная заметная статья: около 13 обращений к модели на товар. На большом каталоге сумму считаем до старта работ.
- Никаких обещаний окупаемости, процентов роста конверсии и «экономии N часов». Таких измерений у продукта нет, и выдумывать их мы не станем.
- Ежедневные списания привязаны к одному часовому поясу платформы, а не к поясу каждой компании.
Связанные материалы
- Бот пообещал скидку: как проверять реплики до отправки клиенту
- ИИ-сотрудник или чат-бот: в чём разница на практике
- ROI от AI в продажах: формула, пример и шаблон метрик
- BI-аналитика и контроль качества
Посчитаем себестоимость на вашем трафике — с первого дня
Триал 14 дней, до 5 сотрудников. Ставим бота на первую линию и через две недели открываем отчёт вместе: сколько стоил ваш поток обращений, какой канал съедает больше и где расход был лишним. Дальше включаем потолки — по фактическим цифрам, а не наугад.