Клиент сервисного центра в Караганде звонит узнать, готов ли ноутбук. Приветствие звучит как обычно, он нажимает «2» – и слышит тишину. Приветствие записали год назад, оно лежит файлом на АТС и работает. А фразу «Ваш заказ 4817 готов, к оплате 18 500 тенге» система каждый раз собирает на лету: отправляет текст в API OpenAI и получает обратно звук. С 6 января 2027 года отправлять будет некуда.
Синтез речи OpenAI на моделях tts-1, tts-1-hd и gpt-4o-mini-tts отключается, а прямой замены, которая работала бы тем же запросом, OpenAI не предложила. До срока три месяца, и в них попадают закрытие года и новогодние праздники.
Откуда повод
1 октября 2026 года OpenAI внесла в список отключаемых моделей tts-1, tts-1-hd и обе версии gpt-4o-mini-tts (от 20 марта и 15 декабря 2025 года). Дата отключения – 6 января 2027 года. В качестве замены указана gpt-realtime-2.1-mini, которая работает только через Realtime API.
Главное за минуту
Готовые файлы не пострадают
Записанные заранее приветствия и меню IVR – это файлы у вас или у оператора телефонии. Ломается только озвучка на лету.
Одной строкой не обойтись
Вместо запроса «текст на вход – файл на выход» – сессия Realtime API, события и другой формат звука. Это переделка интеграции.
Модель-замена умеет разговаривать
Ей нужно велеть прочитать текст дословно и проверить, что она так и делает. Особенно на суммах, датах и номерах заказов.
Альтернатива дорожает в январе
Синтез речи Gemini 3.8 знает русский и казахский, но с 1 января 2027 года Google поднимает цену аудио вдвое.
Где в CRM и телефонии работает синтез речи
Озвучку текста подключают тихо и по мелочи: тут напоминание, там фраза в меню. Поэтому первый шаг – не выбор новой модели, а список мест, где старая уже работает. Обычно их находится больше, чем помнят:
- динамические фразы в IVR – статус заказа, баланс, свободное время записи;
- робот-обзвон с напоминаниями, где в текст подставляются имя, дата визита или сумма долга;
- голосовой бот, собранный по цепочке «распознавание – языковая модель – синтез»: синтез в ней последнее звено, и без него молчит весь разговор;
- ответы голосом в WhatsApp и Telegram, если бот так умеет;
- узлы озвучки в n8n, Make и похожих конструкторах;
- разово сгенерированные приветствия и меню – их отключение не затронет.
Робот-обзвон заслуживает отдельного внимания: у него и так много способов испортить отношения с клиентом, мы разбирали их в статье «Автообзвон без репутационных рисков: как делать корректно и эффективно». Робот, который в январе вдруг замолчит на середине фразы, к этому списку добавится.
Для своего кода хватит поиска по репозиторию на tts-1, gpt-4o-mini-tts и адрес /v1/audio/speech. Поставщику IVR или робота задайте вопрос письменно: «Через какую модель вы озвучиваете текст и что будет после 6 января?» Ответ нужен с датой, а не «разберёмся».
Статичные фразы: ничего не сломается, но есть нюанс
Файлы, загруженные на АТС, продолжат играть. Неприятность случится позже, когда понадобится поменять одну фразу в меню: новый голос от другой модели будет звучать иначе, а меню из двух голосов режет слух. Сохраните исходные тексты всех фраз уже сейчас, а при переходе перезапишите меню целиком, одним заходом.
Что меняется при переходе на gpt-realtime-2.1-mini
Старая схема была простой: отправили текст, получили файл. Модель-замена устроена для живого разговора, и это видно по каждой строке таблицы. Данные – из документации OpenAI на начало октября.
| Что сравниваем | Сейчас: tts-1, gpt-4o-mini-tts |
gpt-realtime-2.1-mini |
|---|---|---|
| Как вызывается | Один запрос к эндпоинту синтеза: текст на вход, звук на выход | Сессия Realtime API через WebSocket, WebRTC или SIP: текст отправляется событием, звук приходит частями |
| Формат звука | MP3, Opus, AAC, FLAC, WAV, PCM | PCM 24 кГц или G.711 μ-law |
| Что делает модель | Читает переданный текст | Отвечает на текст; прочитать дословно – это инструкция, а не гарантия |
| Цена | tts-1 – $15 за 1 млн символов; gpt-4o-mini-tts – $12 за 1 млн токенов аудио |
$20 за 1 млн токенов аудио на выходе, $0,60 за 1 млн токенов текста на входе |
| Хранение данных | Журналы мониторинга 30 дней, доступно нулевое хранение, регионы – США и Европа | Те же условия |
Для телефонии смена формата скорее удобна: G.711 – родной формат телефонной линии, перекодировать почти нечего. Для голосовых в WhatsApp – наоборот: мессенджер ждёт файл OGG с кодеком Opus, значит, в цепочке появится конвертер. Мелочь, но про неё вспоминают в последний день.
Дословно – значит проверено
В руководстве OpenAI по промптам для Realtime прямо сказано: если попросить модель повторить строку точно, она может перефразировать её, обрезать или добавить что-то от себя. Для бота-собеседника это не беда. Для IVR, который должен сказать «к оплате 18 500 тенге», а не «около восемнадцати тысяч», – беда.
Проверка здесь простая и скучная. Соберите 50 фраз из реальных сценариев: суммы, даты, номера заказов, время записи, казахские названия улиц, фамилии. Прогоните через новую схему и прослушайте. Чтобы не слушать всё ухом, озвученный звук можно отдать обратно в распознавание и сравнить текст с исходным – о моделях расшифровки, которые тоже меняются этой зимой, мы писали в статье «Whisper отключают: как перевести расшифровку звонков в CRM». Расхождение в цифре – повод разбираться, а не «редкая ошибка».
Найдём, где у вас озвучка через OpenAI
Посмотрим IVR, робот-обзвон и ботов, отделим готовые файлы от синтеза на лету и скажем, что замолчит 6 января.
Четыре пути после 6 января
Универсального ответа нет: всё зависит от того, сколько у вас озвучки на лету и насколько важно, чтобы каждое слово звучало точно. Мы видим четыре рабочих варианта.
Остаться у OpenAI через Realtime
Плюс – тот же аккаунт, те же условия по данным, не нужен новый договор. Минус – переписать интеграцию под сессии и события и отдельно доказать себе, что модель читает текст дословно. Цена токена аудио на выходе выше на две трети, чем у gpt-4o-mini-tts. Цену минуты для этой модели OpenAI не публикует, поэтому считайте по счётчику токенов на тестовом прогоне.
Перейти на другой синтез речи
С 22 сентября у Google в общем доступе Gemini 3.8 Flash TTS и Flash-Lite TTS. В их списке языков есть и русский, и казахский, а схема привычная: текст на вход, WAV 24 кГц на выход. Подвох в цене. По прайсу Google до 31 декабря 2026 года секунды звука стоят одних денег, а с 1 января – вдвое больше. Бесплатный уровень тоже есть, но данные с него идут на улучшение продуктов Google, для звонков с именами клиентов он не подходит.
Убрать синтез там, где он не нужен
Половина фраз в IVR не меняется месяцами. Их можно один раз записать – живым диктором или любым синтезом – и хранить файлами. Для чисел остаётся старый приём телефонии: склейка из заранее записанных «восемнадцать тысяч», «пятьсот», «тенге». Звучит механически, зато не зависит ни от чьего API и не ошибается в цифрах.
Пересадить голосового бота на модель «голос в голос»
Если синтез – последнее звено в цепочке голосового бота, отключение – удобный повод пересобрать бота целиком на модели, которая сама слышит и сама говорит. Экономику такой модели мы считали в статье «Голосовой бот на GPT-Live-1 или Gemini 3.8 Live: цена минуты». Но затевать это стоит, только если пересборка и так стояла в планах: три месяца с праздниками – мало для нового бота.
Сколько стоит озвучка на практике
Возьмём сеть клиник, которая обзванивает пациентов с напоминаниями: 4000 звонков в месяц, в каждом около 25 секунд синтезированной речи. Это примерно 1670 минут звука, а в тексте – около 1,4 млн символов. Курс – 447,73 тенге за доллар, официальный курс Нацбанка на 4 октября.
| Вариант | Цена по прайсу | В месяц до 31 декабря | В месяц с 1 января |
|---|---|---|---|
tts-1 |
$15 за 1 млн символов | около $21, примерно 9 400 тенге | отключена с 6 января |
| Gemini 3.8 Flash TTS | $0,00225 за 10 секунд, с января – $0,0045 | около $22,5, примерно 10 100 тенге | около $45, примерно 20 100 тенге |
| Gemini 3.8 Flash-Lite TTS | $0,0015 за 10 секунд, с января – $0,003 | около $15, примерно 6 700 тенге | около $30, примерно 13 400 тенге |
gpt-realtime-2.1-mini |
$20 за 1 млн токенов аудио | считать по тестовому прогону | |
Вывод неожиданный: счёт за синтез у большинства компаний сопоставим с расходами на кофе в офисе, даже после удвоения у Google. Настоящая цена перехода – часы разработчика и риск, что робот однажды назовёт клиенту не ту сумму.
Персональные данные в озвучке
Текст, который уходит в синтез, редко бывает обезличенным: «Айгерим, напоминаем о записи на 14 октября», «у вас задолженность 32 000 тенге». Это персональные данные, и они уходят за рубеж: у OpenAI в списке регионов только США и Европа, облачного региона в Казахстане нет и у Google. С 2 октября 2026 года обновлённые правила обработки персональных данных требуют согласия на трансграничную передачу.
Смена провайдера – это новая передача и новый получатель. Проверьте, что согласие клиента не привязано к одной конкретной компании, и не отправляйте в синтез то, что не нужно произносить. Имя и время записи – да. ИИН и полный номер договора робот вслух не читает, значит, и в запрос им незачем попадать.
Чего не ждать
- Что OpenAI выпустит классическую модель синтеза до января. Разработчики спрашивают об этом на форуме OpenAI, официального ответа на момент публикации мы не нашли. Планируйте так, будто её не будет.
- Что поставщик IVR или робота переключится сам и вовремя. Спросите письменно.
- Что модель-собеседник прочитает числа без ошибок без проверки на ваших фразах.
- Что цены Google останутся прежними: удвоение с 1 января уже в прайсе.
- Это не юридическое заключение: схему согласия на передачу данных за рубеж согласуйте с юристом.
План до 6 января
Срок коварный: последняя рабочая неделя декабря уходит на закрытие года, а первые дни января – праздники. Реально у вас есть октябрь, ноябрь и первая половина декабря. Мы бы раскладывали работу так:
- Октябрь: найти все места с синтезом, разделить их на готовые файлы и озвучку на лету, запросить у поставщиков планы перехода.
- Ноябрь: выбрать путь, собрать 50 проверочных фраз с цифрами и казахскими названиями, прогнать и прослушать, сравнить обратной расшифровкой.
- Начало декабря: переключить озвучку, неделю держать старую и новую схему параллельно, перезаписать статичное меню новым голосом целиком.
- Середина декабря: заморозить изменения. Всё, что не готово к этому дню, переводить на заранее записанные фразы, а не чинить в праздники.
И одно правило напоследок: не меняйте синтез и сценарий обзвона одновременно. Если в январе упадёт доля дослушанных напоминаний, вы должны точно знать, виноват голос или новый текст.
Связанные материалы
Переведём озвучку до 6 января без сюрпризов
Пришлите сценарии IVR и обзвона – за неделю найдём синтез на лету, прогоним ваши фразы с цифрами через новую схему и предложим путь перехода с расчётом.