Сколько стоит ИИ: себестоимость каждого разговора с ботом | CrmAI

Сколько стоит ИИ: себестоимость каждого разговора с ботом

Расход по девяти источникам, цена одного ответа и топ самых дорогих диалогов. Как считать экономику ИИ и что делать с клиентом, который заболтал бота на всю ночь.

Отчёт по себестоимости AI с разрезом по ботам, каналам и моделям

Сколько стоил вчерашний разговор вашего бота? В большинстве компаний этого не знает никто.

Счёт от провайдера приходит одной суммой в конце месяца. Она либо приемлемая — и тогда вопрос закрывают до следующего месяца, либо неприятная — и тогда бота отключают целиком, потому что непонятно, какую его часть выключить.

Между этими двумя реакциями есть третья: понять, из чего эта сумма состоит. Ниже — как устроен учёт, который отвечает на вопрос «сколько стоил вот этот конкретный разговор», и почему без него любое обсуждение окупаемости ИИ — это разговор о вкусах.

Главное за минуту

Считать по вызовам модели

Реплик в диалоге шесть, а обращений к модели двадцать — из-за работы с инструментами.

Девять источников расхода

От диалога и скоринга до эмбеддингов. Бот в чате — не всегда самая дорогая статья.

Дорогой диалог — это провал

Бот ходил по кругу и не справился, а вы заплатили дважды: за токены и за клиента.

Потолок передаёт человеку

При превышении бот прощается и передаёт диалог оператору, а не замолкает посреди разговора.

Почему учёт «по диалогам» врёт, а «по обращениям к модели» — нет

Тонкость, из-за которой расходятся все самодельные калькуляторы.

Кажется логичным считать так: диалог состоял из шести реплик бота, значит шесть обращений к модели. На практике реплик шесть, а обращений двадцать — потому что бот работает инструментами. Чтобы ответить «есть ли в наличии стиральная машина на 6 кг», он делает поиск, получает результат, просит модель выбрать из кандидатов, проверяет остаток, формулирует ответ. Каждый шаг — отдельное обращение с отдельными токенами.

Поэтому строка расхода должна писаться на каждое обращение к провайдеру, а не на ход диалога. Тогда в отчёт попадают и промежуточные вызовы при работе с инструментами — те, которые в наивном учёте не видны вообще, а в счёте провайдера видны прекрасно.

Что фиксируется по каждому обращению: входные и выходные токены, отдельно кэшированные, длительность, модель, провайдер и применённые цены. Точность учёта — до шести знаков.

Девять источников расхода: где на самом деле уходят деньги

Большинство владельцев уверены, что ИИ — это «бот в чате». В реальности источников расхода девять, и бот в чате не всегда самый дорогой.

Сравнение счёта провайдера и учёта себестоимости AI внутри CRM по источникам
Одна сумма в конце месяца против расхода, который видно по разговорам.
Источник Что это и когда бывает дорого
Диалог Ответы бота клиенту. Основная статья, растёт с потоком обращений
Классификаторы Определение темы и намерения. Дешёвые вызовы, но их много
Скоринг Оценка интереса по диалогу и по расшифровке звонка
Почта Разбор входящих писем и оценка интереса по ним
Подбор товаров Сборка спецификации по переписке. Дорого на больших каталогах
Суфлёр Подсказки оператору на живом звонке — расход в реальном времени
Ассистент Внутренний помощник для сотрудников
Эмбеддинги Индексация базы знаний. Пик при первом запуске, потом спад
Служебные вызовы Всё остальное, включая шаги бизнес-процессов

Поверх этого — разрез по ботам, каналам и моделям. То есть можно увидеть не «расходы на ИИ», а экономику конкретного канала: во что обходится ночной поток из Instagram и во что — чат на сайте. Это уже основание, чтобы принимать решения про рекламу, а не только про бота.

Топ-25 самых дорогих диалогов — и почему это не отчёт о расходах

Самый полезный экран во всём контуре, и полезен он неочевидным образом.

Таблица 25 самых дорогих разговоров со ссылкой прямо в переписку выглядит как финансовый инструмент. На практике это инструмент качества: дорогой диалог почти всегда означает, что бот не справился. Он ходил по кругу, переспрашивал, вызывал инструменты, получал ошибки и снова пытался.

То есть вы платите дважды: за токены и за клиента, который в итоге ушёл к оператору или вообще ушёл. Открыв такой диалог, вы обычно находите не «дорогую модель», а конкретный сценарий, который нужно починить — добавить факт в базу знаний или дать боту инструмент, которого ему не хватило.

Практика первой недели: откройте три самых дорогих диалога и прочитайте их целиком. Это обычно даёт больше, чем месяц обсуждения промпта.

Потолок расхода: бот не замолкает, а передаёт клиента

«А если бот сожжёт бюджет на токенах?» — законный вопрос, особенно после первого дорогого месяца.

Есть два потолка: на себестоимость одного диалога и на суточный расход компании. Но важнее не сами лимиты, а реакция на превышение.

Плохая реакция — бот молча выключается посреди разговора. Клиент остаётся без ответа, и вы экономите на токенах, теряя продажу.

Правильная — бот произносит прощальную фразу, снимается с чата, ставит признак «нужен оператор» и оставляет заметку тому, кто подхватит. Перерасход заканчивается живым менеджером, а не тишиной.

Честно: в поставке лимиты выключены. Механизм реализован полностью, но включается и настраивается осознанно. Поэтому мы говорим «лимиты включаются», а не «расходы ограничены автоматически» — разница существенная, и узнавать о ней из счёта неприятно.

Что можно не покупать у провайдера

Часть работы, за которую обычно платят по токенам, считается локально — и это прямое сокращение счёта.

  • Смысловой поиск по каталогу. Векторы считает локальная модель на вашем сервере. За поисковый запрос покупателя не платится по токенам, и каталог не уходит во внешнее облако.
  • Разбор проблемных диалогов. Идёт по тексту и метаданным, без обращения к языковой модели. Контроль качества не добавляет к счёту ни цента — хотя обычно «AI анализирует каждый диалог» означает вторую статью расходов.
  • Переобход сайта для базы знаний. По сохранённым отметкам неизменённые страницы не пересчитываются заново — эмбеддинги не тратятся на то, что не менялось.
  • Стоп-темы. Проверяются в реплике клиента до обращения к модели: по запретной теме модель не вызывается вовсе — нет ни токенов, ни риска.
  • Порог автосделки. Оценка интереса не даёт заводить карточку по каждому «вы работаете в субботу?» — и заодно ограничивает расход на скоринг.

Распознавание речи тоже может работать на собственном сервере компании. Для клиник и финансовых организаций это вопрос не экономии, а допустимости проекта.

Как устроена подписка: восемь ресурсов по отдельности

Отдельно от себестоимости моделей считается сама подписка — и здесь тоже важна механика, а не «пакет услуг».

Тарифицируются восемь позиций: дни подписки, число операторов, объём почтового ящика, ответы бота, минуты разговора голосового робота, дни канала WhatsApp на личном номере, дни канала WhatsApp Business и дни телефонии. Плюс отдельные признаки «есть обмен с 1С» и «есть маркетплейсы».

Что это означает практически: салон на три кресла и сеть клиник платят за разный объём, а не за одинаковую лицензию. Компания без 1С не платит за чужую функциональность. Списание идёт раз в сутки, а предупреждение об исчерпании приходит за пять дней до конца — по фактической скорости расхода, а не по календарю.

Триал — 14 дней на 5 сотрудников: 100 ответов бота, 60 минут разговора робота, почтовый ящик 1 ГБ. Этого хватает, чтобы увидеть свою реальную структуру расхода, а не средние цифры по рынку.

Как считать окупаемость, не выдумывая проценты

Мы не называем сроков окупаемости и процентов роста конверсии — таких измерений у продукта нет. Но посчитать можно на своих данных, и это честнее любой цифры из презентации.

Что считаем Как Ваше значение
Обращения вне рабочих часов за месяц История чатов и отчёт АТС ___
Доля из них, которую бот закроет сам Посчитайте на двух неделях триала, а не на оценке ___ %
Себестоимость одного диалога бота Отчёт по себестоимости за период триала ___ ₸
Расход на ИИ в месяц Обращения × доля × себестоимость диалога ___ ₸
Стоимость того же объёма людьми Сколько часов это заняло бы × стоимость часа ___ ₸

Обратите внимание на вторую строку: её нельзя оценить заранее, её можно только измерить. Именно поэтому триал стоит проходить на живом трафике, а не на демо-стенде — иначе вы получите чьи-то средние вместо своих фактических.

Самый дорогой диалог в отчёте почти никогда не про дорогую модель. Это сценарий, который бот не смог закрыть.

Границы: что честно сказать сразу

  • Лимиты расхода в поставке выключены и включаются при настройке.
  • Всё, что делает ИИ, расходует токены постоянно, а не разово. Это подписная, а не разовая статья бюджета.
  • Подготовка карточек для маркетплейса — отдельная заметная статья: около 13 обращений к модели на товар. На большом каталоге сумму считаем до старта работ.
  • Никаких обещаний окупаемости, процентов роста конверсии и «экономии N часов». Таких измерений у продукта нет, и выдумывать их мы не станем.
  • Ежедневные списания привязаны к одному часовому поясу платформы, а не к поясу каждой компании.

Связанные материалы

Посчитаем себестоимость на вашем трафике — с первого дня

Триал 14 дней, до 5 сотрудников. Ставим бота на первую линию и через две недели открываем отчёт вместе: сколько стоил ваш поток обращений, какой канал съедает больше и где расход был лишним. Дальше включаем потолки — по фактическим цифрам, а не наугад.

Посмотреть отчёт
Решения CrmAI

Услуги по теме статьи