Whisper отключают: как перевести расшифровку звонков в CRM

Whisper отключают: как перевести расшифровку звонков в CRM

OpenAI отключает Whisper и gpt-4o-transcribe 26 февраля. Как найти, где в CRM работает расшифровка звонков и голосовых, что теряется при переходе и сколько стоит новая модель.

Звуковая волна телефонного разговора превращается в текст в карточке клиента, рядом календарь с отмеченной датой

Руководитель отдела продаж открывает утром карточку вчерашнего звонка: запись есть, расшифровки нет. В соседней карточке клиент прислал в WhatsApp голосовое на полторы минуты – вместо текста пустое поле. Интегратор, который настраивал расшифровку два года назад, давно работает в другой компании, а в настройках телефонии стоит одна строка: whisper-1.

Такое утро вполне реально наступит 27 февраля 2027 года. За день до этого OpenAI отключит в API модели, на которых обычно и строилась расшифровка звонков в CRM, если распознавание речи подключали через OpenAI. Срок кажется далёким. Но между ним и сегодняшним днём – новогодние праздники, закрытие года и конец квартала, а переход затрагивает не одну строку кода.

Откуда повод

26 августа 2026 года OpenAI объявила об отключении whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe и gpt-4o-transcribe-diarize. Дата отключения – 26 февраля 2027 года. Замена – gpt-transcribe для записей и gpt-live-transcribe для потоковой расшифровки.

Главное за минуту

Два срока, а не один

20 января 2027 года отключаются старые голосовые модели реального времени. 26 февраля – модели расшифровки.

Записи станут дешевле

Минута у gpt-transcribe стоит $0,0045 против $0,006 у Whisper. Но тем, кто сидел на mini-модели за $0,003, переход обойдётся дороже.

Спикеры и метки времени

По документации OpenAI разметку «кто говорит» даёт только отключаемая модель с diarize в названии, а метки времени по словам – только whisper-1.

Свой сервер не затронут

Отключение касается API. Открытый Whisper, развёрнутый на ваших серверах, продолжит работать как работал.

Где в CRM прячется Whisper

Самая долгая часть перехода – не замена модели, а поиск мест, где она используется. Распознавание речи редко живёт в одном месте: его подключали в разное время разные люди под разные задачи. Голосовые сообщения из мессенджеров – одна история, мы разбирали её в статье «Голосовые сообщения: умеет ли CRM распознавать «войсы» от клиентов». Записи звонков для контроля качества – другая. Бот, которому клиент надиктовал адрес доставки, – третья.

Перед тем как что-то менять, пройдитесь по списку. Он собран из мест, где модель расшифровки чаще всего оказывается у компаний с CRM и телефонией:

  • модуль телефонии или речевой аналитики в CRM – расшифровка записей звонков;
  • интеграция с WhatsApp и Telegram – перевод голосовых клиентов в текст;
  • чат-бот, который принимает голос и отвечает текстом;
  • сценарии в конструкторах автоматизации: n8n, Make и похожих, где узел «OpenAI – Transcribe» настраивали мышкой;
  • скрипты подрядчика на отдельном сервере, о которых помнит только подрядчик;
  • голосовой бот на старой модели реального времени – у него срок раньше, 20 января.

Для своего кода хватит поиска по репозиторию на строки whisper-1, gpt-4o-transcribe и gpt-4o-mini-transcribe. С готовыми сервисами проще задать вопрос письменно: «На какой модели у вас работает расшифровка и когда вы переходите?» Ответ «мы в курсе, перейдём в январе» – это тоже информация. Он значит, что тестировать новую модель на ваших звонках будет некогда.

Что меняется при переходе на gpt-transcribe

Если коротко: для обычной расшифровки записи переход простой, для речевой аналитики – нет. Таблица собрана по документации OpenAI на конец сентября.

Что нужно Сейчас После 26 февраля
Расшифровать запись звонка или голосовое whisper-1, gpt-4o-transcribe, mini-версия gpt-transcribe, тот же эндпоинт расшифровки
Подсказать модели язык Одно поле language Поле languages с несколькими подсказками. Оба поля сразу передавать нельзя
Научить модель названиям и фамилиям Подсказка в prompt, у Whisper – до 224 токенов Отдельное поле keywords плюс контекст
Понять, где говорит менеджер, а где клиент gpt-4o-transcribe-diarize У gpt-transcribe разметки по спикерам нет
Метки времени по словам и сегментам Только whisper-1 В описании новых моделей их нет
Перевод речи на английский Только whisper-1 Новые модели перевод не поддерживают

Первые три строки – это правка интеграции на день. Последние три могут сломать отчёты, о которых никто не вспомнит до первого совещания.

Кто говорит: менеджер или клиент

Речевая аналитика ищет в звонке фразы менеджера: поздоровался ли, назвал ли цену, предложил ли следующий шаг. Без разметки по спикерам «назвал цену» и «клиент спросил цену» выглядят одинаково. Как устроена такая проверка, мы писали в материале «Speech Analytics в колл-центре: расшифровка, QA, поиск триггер-фраз и KPI».

Здесь выручает телефония. Часть АТС и облачных телефоний умеет писать звонок в стерео: менеджер в одном канале, клиент в другом. Тогда каналы делятся до расшифровки, каждый распознаётся отдельно, и разметка получается без всякой модели. Проверьте, как пишет ваша АТС. Если в моно – переключить запись в стерео обычно дешевле, чем искать новый сервис диаризации. Для голосовых из мессенджеров вопрос вообще не стоит: там говорит один человек.

Метки времени

Метки нужны, когда руководитель нажимает на фразу в расшифровке и плеер перематывает запись на нужную секунду. Если ваша аналитика так умеет, узнайте у поставщика, откуда она берёт метки. Если от whisper-1, после февраля эта функция сломается тихо: текст будет, перемотки – нет.

Найдём, где у вас работает Whisper

Посмотрим интеграции CRM, телефонии и ботов, составим список мест с отключаемыми моделями и скажем, что сломается при переходе.

Проверить интеграции

Сколько стоит расшифровка звонков после перехода

Возьмём оптовую компанию на двадцать пять менеджеров: 700 звонков в день, в среднем по четыре минуты, 22 рабочих дня. Это 61 600 минут записи в месяц. Курс – 440,86 тенге за доллар, официальный курс Нацбанка на 1 октября.

Модель Цена минуты 61 600 минут в месяц
whisper-1 или gpt-4o-transcribe $0,006 около $370, примерно 163 000 тенге
gpt-4o-mini-transcribe $0,003 около $185, примерно 81 500 тенге
gpt-transcribe $0,0045 около $277, примерно 122 000 тенге
gpt-live-transcribe $0,017 около $1047, примерно 462 000 тенге

Из таблицы видны две ловушки. Первая – для тех, кто экономил на mini-модели: переход поднимет счёт в полтора раза, и это стоит согласовать с финансовым директором заранее, а не в марте. Вторая – выбрать «живую» модель для записей. Она нужна, только если текст должен появляться на экране оператора во время разговора, например для подсказок по скрипту. Для записей, которые разбирают после звонка, она стоит почти вчетверо дороже и ничего не добавляет.

Русский, казахский и названия ваших товаров

Цена – не главный риск. Главный – качество на ваших клиентах. Звонок в Казахстане редко звучит как диктор: «Сәлеметсіз бе, мне по заказу», номер БИН группами по три цифры, улица на казахском, артикул на латинице. Списка языков с оценкой качества для gpt-transcribe в документации OpenAI нет, поэтому полагаться можно только на собственную проверку.

Соберите 40–50 записей с согласия клиентов или обезличенных: короткие и длинные звонки, чистая линия и шумный склад, русский, казахский и смешанная речь, плюс десяток голосовых из WhatsApp. Прогоните их через старую и новую модель. Считайте не «похоже или нет», а ошибки в том, что попадает в карточку: имя, телефон, сумма, адрес, название товара. Эти записи станут контрольным набором, по которому вы будете проверять и следующие смены моделей, – а они будут.

При настройке передайте в languages обе подсказки, русскую и казахскую, а в keywords – названия брендов, товаров, услуг и улиц, на которых ошибалась старая модель. Это бесплатная настройка, и она даёт больше, чем кажется.

Персональные данные в записях

Голос, имя и телефон клиента в одной записи – персональные данные, а расшифровка через OpenAI – передача за рубеж: казахстанского региона хранения в списке нет. Хорошая новость: эндпоинт расшифровки по документации не хранит ни журналы мониторинга, ни состояние запроса, поддерживает режим нулевого хранения, и данные API по умолчанию не идут в обучение. У потоковой расшифровки через сессии реального времени условия другие: журналы мониторинга хранятся 30 дней, регионы – США и Европа.

Со 2 октября 2026 года в Казахстане действуют обновлённые правила сбора и обработки персональных данных, и трансграничная передача по ним требует согласия. Переход на новую модель – удобный момент проверить, есть ли это согласие в начале звонка и в приветствии бота. Подробнее – в статье «Новые правила сбора персональных данных: лиды, маскирование, ИИ».

Чего не ждать

  • Что поставщик CRM или телефонии перейдёт сам и вовремя. Спросите письменно и попросите дату.
  • Что новая модель сразу распознает ваши фамилии и артикулы лучше старой. Это проверяется только на ваших записях.
  • Что разметка по спикерам и метки времени появятся у новых моделей к февралю. OpenAI таких обещаний не давала.
  • Что прайс останется прежним. Сверяйте цену на дату переключения.
  • Это не юридическое заключение: схему согласия на передачу записей за рубеж согласуйте с юристом.

План перехода по месяцам

Пять месяцев – достаточно, если начать сейчас, и мало, если начать в феврале. Мы бы раскладывали работу так:

  • Октябрь: найти все места с отключаемыми моделями, запросить у поставщиков даты перехода, проверить, пишет ли АТС звонки в стерео.
  • Ноябрь: собрать контрольный набор из 40–50 записей, сравнить старую и новую модель по ошибкам в именах, телефонах и суммах.
  • Декабрь: переключить расшифровку голосовых и записей, неделю держать обе модели параллельно и сверять результаты.
  • До 20 января: перевести голосового бота со старой модели реального времени, если он у вас есть.
  • До середины февраля: убедиться, что речевая аналитика, отчёты и перемотка по фразам работают без старых моделей. Последнюю неделю перед отключением оставить запасом.

Отдельный совет: не совмещайте переход с запуском новых сценариев. Если после переключения упадёт доля распознанных голосовых, вы должны точно знать, что виновата модель, а не новая логика бота.

Связанные материалы

Переведём расшифровку на новую модель без потерь

Пришлите 40 обезличенных записей и голосовых – за неделю сравним старую и новую модель на ваших звонках, посчитаем месячный счёт и составим план перехода до 26 февраля.

Обсудить переход
Решения CrmAI по теме статьи

Хотите так же у себя?

Выберите услугу или опишите задачу в чате — подскажем, с чего начать в вашем бизнесе.