Синтез речи OpenAI отключают: что будет с IVR и озвучкой в CRM

Синтез речи OpenAI отключают: что будет с IVR и озвучкой в CRM

Синтез речи OpenAI на tts-1 и gpt-4o-mini-tts отключают 6 января, а замену предлагают только через Realtime API. Где в CRM и телефонии это сломается и как перейти спокойно.

Сотрудники обсуждают телефонное меню и карточку клиента в CRM, рядом календарь с отмеченной датой

Клиент сервисного центра в Караганде звонит узнать, готов ли ноутбук. Приветствие звучит как обычно, он нажимает «2» – и слышит тишину. Приветствие записали год назад, оно лежит файлом на АТС и работает. А фразу «Ваш заказ 4817 готов, к оплате 18 500 тенге» система каждый раз собирает на лету: отправляет текст в API OpenAI и получает обратно звук. С 6 января 2027 года отправлять будет некуда.

Синтез речи OpenAI на моделях tts-1, tts-1-hd и gpt-4o-mini-tts отключается, а прямой замены, которая работала бы тем же запросом, OpenAI не предложила. До срока три месяца, и в них попадают закрытие года и новогодние праздники.

Откуда повод

1 октября 2026 года OpenAI внесла в список отключаемых моделей tts-1, tts-1-hd и обе версии gpt-4o-mini-tts (от 20 марта и 15 декабря 2025 года). Дата отключения – 6 января 2027 года. В качестве замены указана gpt-realtime-2.1-mini, которая работает только через Realtime API.

Главное за минуту

Готовые файлы не пострадают

Записанные заранее приветствия и меню IVR – это файлы у вас или у оператора телефонии. Ломается только озвучка на лету.

Одной строкой не обойтись

Вместо запроса «текст на вход – файл на выход» – сессия Realtime API, события и другой формат звука. Это переделка интеграции.

Модель-замена умеет разговаривать

Ей нужно велеть прочитать текст дословно и проверить, что она так и делает. Особенно на суммах, датах и номерах заказов.

Альтернатива дорожает в январе

Синтез речи Gemini 3.8 знает русский и казахский, но с 1 января 2027 года Google поднимает цену аудио вдвое.

Где в CRM и телефонии работает синтез речи

Озвучку текста подключают тихо и по мелочи: тут напоминание, там фраза в меню. Поэтому первый шаг – не выбор новой модели, а список мест, где старая уже работает. Обычно их находится больше, чем помнят:

  • динамические фразы в IVR – статус заказа, баланс, свободное время записи;
  • робот-обзвон с напоминаниями, где в текст подставляются имя, дата визита или сумма долга;
  • голосовой бот, собранный по цепочке «распознавание – языковая модель – синтез»: синтез в ней последнее звено, и без него молчит весь разговор;
  • ответы голосом в WhatsApp и Telegram, если бот так умеет;
  • узлы озвучки в n8n, Make и похожих конструкторах;
  • разово сгенерированные приветствия и меню – их отключение не затронет.

Робот-обзвон заслуживает отдельного внимания: у него и так много способов испортить отношения с клиентом, мы разбирали их в статье «Автообзвон без репутационных рисков: как делать корректно и эффективно». Робот, который в январе вдруг замолчит на середине фразы, к этому списку добавится.

Для своего кода хватит поиска по репозиторию на tts-1, gpt-4o-mini-tts и адрес /v1/audio/speech. Поставщику IVR или робота задайте вопрос письменно: «Через какую модель вы озвучиваете текст и что будет после 6 января?» Ответ нужен с датой, а не «разберёмся».

Статичные фразы: ничего не сломается, но есть нюанс

Файлы, загруженные на АТС, продолжат играть. Неприятность случится позже, когда понадобится поменять одну фразу в меню: новый голос от другой модели будет звучать иначе, а меню из двух голосов режет слух. Сохраните исходные тексты всех фраз уже сейчас, а при переходе перезапишите меню целиком, одним заходом.

Что меняется при переходе на gpt-realtime-2.1-mini

Старая схема была простой: отправили текст, получили файл. Модель-замена устроена для живого разговора, и это видно по каждой строке таблицы. Данные – из документации OpenAI на начало октября.

Что сравниваем Сейчас: tts-1, gpt-4o-mini-tts gpt-realtime-2.1-mini
Как вызывается Один запрос к эндпоинту синтеза: текст на вход, звук на выход Сессия Realtime API через WebSocket, WebRTC или SIP: текст отправляется событием, звук приходит частями
Формат звука MP3, Opus, AAC, FLAC, WAV, PCM PCM 24 кГц или G.711 μ-law
Что делает модель Читает переданный текст Отвечает на текст; прочитать дословно – это инструкция, а не гарантия
Цена tts-1 – $15 за 1 млн символов; gpt-4o-mini-tts – $12 за 1 млн токенов аудио $20 за 1 млн токенов аудио на выходе, $0,60 за 1 млн токенов текста на входе
Хранение данных Журналы мониторинга 30 дней, доступно нулевое хранение, регионы – США и Европа Те же условия

Для телефонии смена формата скорее удобна: G.711 – родной формат телефонной линии, перекодировать почти нечего. Для голосовых в WhatsApp – наоборот: мессенджер ждёт файл OGG с кодеком Opus, значит, в цепочке появится конвертер. Мелочь, но про неё вспоминают в последний день.

Дословно – значит проверено

В руководстве OpenAI по промптам для Realtime прямо сказано: если попросить модель повторить строку точно, она может перефразировать её, обрезать или добавить что-то от себя. Для бота-собеседника это не беда. Для IVR, который должен сказать «к оплате 18 500 тенге», а не «около восемнадцати тысяч», – беда.

Проверка здесь простая и скучная. Соберите 50 фраз из реальных сценариев: суммы, даты, номера заказов, время записи, казахские названия улиц, фамилии. Прогоните через новую схему и прослушайте. Чтобы не слушать всё ухом, озвученный звук можно отдать обратно в распознавание и сравнить текст с исходным – о моделях расшифровки, которые тоже меняются этой зимой, мы писали в статье «Whisper отключают: как перевести расшифровку звонков в CRM». Расхождение в цифре – повод разбираться, а не «редкая ошибка».

Найдём, где у вас озвучка через OpenAI

Посмотрим IVR, робот-обзвон и ботов, отделим готовые файлы от синтеза на лету и скажем, что замолчит 6 января.

Проверить озвучку

Четыре пути после 6 января

Универсального ответа нет: всё зависит от того, сколько у вас озвучки на лету и насколько важно, чтобы каждое слово звучало точно. Мы видим четыре рабочих варианта.

Остаться у OpenAI через Realtime

Плюс – тот же аккаунт, те же условия по данным, не нужен новый договор. Минус – переписать интеграцию под сессии и события и отдельно доказать себе, что модель читает текст дословно. Цена токена аудио на выходе выше на две трети, чем у gpt-4o-mini-tts. Цену минуты для этой модели OpenAI не публикует, поэтому считайте по счётчику токенов на тестовом прогоне.

Перейти на другой синтез речи

С 22 сентября у Google в общем доступе Gemini 3.8 Flash TTS и Flash-Lite TTS. В их списке языков есть и русский, и казахский, а схема привычная: текст на вход, WAV 24 кГц на выход. Подвох в цене. По прайсу Google до 31 декабря 2026 года секунды звука стоят одних денег, а с 1 января – вдвое больше. Бесплатный уровень тоже есть, но данные с него идут на улучшение продуктов Google, для звонков с именами клиентов он не подходит.

Убрать синтез там, где он не нужен

Половина фраз в IVR не меняется месяцами. Их можно один раз записать – живым диктором или любым синтезом – и хранить файлами. Для чисел остаётся старый приём телефонии: склейка из заранее записанных «восемнадцать тысяч», «пятьсот», «тенге». Звучит механически, зато не зависит ни от чьего API и не ошибается в цифрах.

Пересадить голосового бота на модель «голос в голос»

Если синтез – последнее звено в цепочке голосового бота, отключение – удобный повод пересобрать бота целиком на модели, которая сама слышит и сама говорит. Экономику такой модели мы считали в статье «Голосовой бот на GPT-Live-1 или Gemini 3.8 Live: цена минуты». Но затевать это стоит, только если пересборка и так стояла в планах: три месяца с праздниками – мало для нового бота.

Сколько стоит озвучка на практике

Возьмём сеть клиник, которая обзванивает пациентов с напоминаниями: 4000 звонков в месяц, в каждом около 25 секунд синтезированной речи. Это примерно 1670 минут звука, а в тексте – около 1,4 млн символов. Курс – 447,73 тенге за доллар, официальный курс Нацбанка на 4 октября.

Вариант Цена по прайсу В месяц до 31 декабря В месяц с 1 января
tts-1 $15 за 1 млн символов около $21, примерно 9 400 тенге отключена с 6 января
Gemini 3.8 Flash TTS $0,00225 за 10 секунд, с января – $0,0045 около $22,5, примерно 10 100 тенге около $45, примерно 20 100 тенге
Gemini 3.8 Flash-Lite TTS $0,0015 за 10 секунд, с января – $0,003 около $15, примерно 6 700 тенге около $30, примерно 13 400 тенге
gpt-realtime-2.1-mini $20 за 1 млн токенов аудио считать по тестовому прогону

Вывод неожиданный: счёт за синтез у большинства компаний сопоставим с расходами на кофе в офисе, даже после удвоения у Google. Настоящая цена перехода – часы разработчика и риск, что робот однажды назовёт клиенту не ту сумму.

Персональные данные в озвучке

Текст, который уходит в синтез, редко бывает обезличенным: «Айгерим, напоминаем о записи на 14 октября», «у вас задолженность 32 000 тенге». Это персональные данные, и они уходят за рубеж: у OpenAI в списке регионов только США и Европа, облачного региона в Казахстане нет и у Google. С 2 октября 2026 года обновлённые правила обработки персональных данных требуют согласия на трансграничную передачу.

Смена провайдера – это новая передача и новый получатель. Проверьте, что согласие клиента не привязано к одной конкретной компании, и не отправляйте в синтез то, что не нужно произносить. Имя и время записи – да. ИИН и полный номер договора робот вслух не читает, значит, и в запрос им незачем попадать.

Чего не ждать

  • Что OpenAI выпустит классическую модель синтеза до января. Разработчики спрашивают об этом на форуме OpenAI, официального ответа на момент публикации мы не нашли. Планируйте так, будто её не будет.
  • Что поставщик IVR или робота переключится сам и вовремя. Спросите письменно.
  • Что модель-собеседник прочитает числа без ошибок без проверки на ваших фразах.
  • Что цены Google останутся прежними: удвоение с 1 января уже в прайсе.
  • Это не юридическое заключение: схему согласия на передачу данных за рубеж согласуйте с юристом.

План до 6 января

Срок коварный: последняя рабочая неделя декабря уходит на закрытие года, а первые дни января – праздники. Реально у вас есть октябрь, ноябрь и первая половина декабря. Мы бы раскладывали работу так:

  • Октябрь: найти все места с синтезом, разделить их на готовые файлы и озвучку на лету, запросить у поставщиков планы перехода.
  • Ноябрь: выбрать путь, собрать 50 проверочных фраз с цифрами и казахскими названиями, прогнать и прослушать, сравнить обратной расшифровкой.
  • Начало декабря: переключить озвучку, неделю держать старую и новую схему параллельно, перезаписать статичное меню новым голосом целиком.
  • Середина декабря: заморозить изменения. Всё, что не готово к этому дню, переводить на заранее записанные фразы, а не чинить в праздники.

И одно правило напоследок: не меняйте синтез и сценарий обзвона одновременно. Если в январе упадёт доля дослушанных напоминаний, вы должны точно знать, виноват голос или новый текст.

Связанные материалы

Переведём озвучку до 6 января без сюрпризов

Пришлите сценарии IVR и обзвона – за неделю найдём синтез на лету, прогоним ваши фразы с цифрами через новую схему и предложим путь перехода с расчётом.

Обсудить переход
Решения CrmAI по теме статьи

Хотите так же у себя?

Выберите услугу или опишите задачу в чате — подскажем, с чего начать в вашем бизнесе.