Вторник, 20 октября, частная клиника в Алматы. Бот, который полтора года записывал пациентов через WhatsApp, с утра отвечает одной фразой: «Извините, сейчас не могу ответить». Новых записей в CRM нет. Подрядчик, который подключал Gemini, давно ведёт другие проекты, а доступ к проекту в Google Cloud оформлен на сотрудника, уволившегося весной.
Клиника придуманная, дата – нет. Отключение Gemini 2.5 в Vertex AI назначено на 20 октября 2026 года: в этот день Google снимает с платформы Gemini 2.5 Pro, 2.5 Flash и 2.5 Flash-Lite. От сегодняшнего дня – одиннадцать. Из всех смен моделей, о которых мы писали этой осенью, эта самая срочная и самая запутанная по деньгам.
Откуда повод
В таблице жизненного цикла моделей Google Cloud, обновлённой 7 октября, у gemini-2.5-pro, gemini-2.5-flash и gemini-2.5-flash-lite стоит дата вывода – 20 октября 2026 года. Ту же дату для бэкенда Vertex AI называет документация Firebase AI Logic от 6 октября. В документации Google платформа теперь называется Gemini Enterprise Agent Platform, так что письма и консоль могут говорить уже о ней.
Главное за минуту
Раньше не станет
Google обещает, что дату могут только отодвинуть. Но в апрельской заметке стояло 16 октября, поэтому заканчивать мы бы советовали к этому числу.
AI Studio – не убежище
В Gemini Developer API модели 2.5 пока работают и даты отключения нет, но доступ к ним оставили только тем, кто пользовался ими недавно.
Цена – от «столько же» до «в шесть раз»
Всё решает выбор замены и то, сколько новая модель рассуждает перед ответом.
Одной строкой не обойтись
Temperature, бюджет рассуждений и история диалога, собранная из CRM вручную, на Gemini 3.x работают иначе или дают ошибку.
Кого касается отключение Gemini 2.5 в Vertex AI
Правильный вопрос звучит не «пользуемся ли мы Gemini», а «через какую дверь». Одна и та же модель доступна тремя путями, и судьба у них разная.
- Vertex AI (Agent Platform) – сервисный аккаунт Google Cloud, запросы на
aiplatform.googleapis.com. Отключение 20 октября. - Firebase AI Logic с бэкендом Vertex AI – так Gemini часто встраивают в мобильные приложения и сайты. Тоже 20 октября.
- Gemini Developer API – ключ из AI Studio, запросы на
generativelanguage.googleapis.com. Даты нет, но новым проектам 2.5 уже не дают, Google советует им 3.5 Flash-Lite или 3.8 Flash.
Отдельная история – конструкторы ботов и модули интеграторов. Если в настройках написано просто «Gemini 2.5 Flash», спросите поставщика, через какой API он ходит и какой у него план до 20 октября. Ответ «разберёмся» – уже повод для беспокойства.
Голосовых ботов это отключение пока не задевает, но и у них часы тикают: модель gemini-live-2.5-flash-native-audio выводят 13 декабря 2026 года. Чем её заменить и сколько стоит минута на новой модели, мы считали в статье «Голосовой бот на GPT-Live-1 или Gemini 3.8 Live: цена минуты».
На что переезжать: замены и цены
Google для каждой модели называет сразу несколько замен, и по цене они различаются в разы. Ниже – прайс Agent Platform за 1 млн токенов, вход / выход, для глобальной обработки. Рассуждения оплачиваются по цене выходных токенов.
| Было | Замена | Цена замены | Что учесть |
|---|---|---|---|
| 2.5 Flash, $0,30 / $2,50 | 3.5 Flash-Lite | $0,30 / $2,50 | Та же цена, рассуждения по умолчанию на минимуме |
| 2.5 Flash | 3.8 Flash | $0,75 / $3,75 до 31 декабря, с 1 января 2027 года – $1,50 / $7,50 | По умолчанию рассуждает на уровне medium, ниже low не опускается |
| 2.5 Flash-Lite, $0,10 / $0,40 | 3.1 Flash-Lite | $0,25 / $1,50 | Вход дороже в 2,5 раза, выход – в 3,75 раза |
| 2.5 Flash-Lite | Gemma 4 | 26B – $0,15 / $0,60 | Открытая модель, русский и казахский проверять отдельно |
| 2.5 Pro, $1,25 / $10 | 3.8 Flash или 3.5 Flash | 3.5 Flash – $1,50 / $9,00 | Pro-класса среди рекомендованных замен нет, только Flash |
Главная ловушка – вторая строка. Gemini 3.8 Flash сейчас продаётся по вводной цене, и с 1 января тот же бот без единой правки станет вдвое дороже. Если переезжаете на неё, бюджет на 2027 год считайте сразу по второй цене.
Вторая неприятность тише: дешёвый уровень перестал быть дешёвым. Классификатор на 2.5 Flash-Lite, который раскладывает 100 000 обращений в месяц по 500 входных и 20 выходных токенов, обходится примерно в $6. На 3.1 Flash-Lite – около $15,5. Сумма копеечная, но рост почти втрое, и он умножается на каждую задачу, которую вы когда-то отдали самой дешёвой модели.
И ещё одна новая строка в счёте. У моделей 3.x цена обработки в конкретном регионе в прайсе на 10% выше глобальной, у 2.5 такого деления не было. Если вы выбирали регион ради хранения данных, сверьте итоговую цену в первом же счёте после переезда.
Сколько это в тенге: бот на 20 000 ответов
Возьмём бота интернет-магазина на Gemini 2.5 Flash с выключенными рассуждениями. 20 000 ответов в месяц, на каждый – 3000 входных токенов (инструкция, каталог, история диалога) и 200 выходных. Курс – 448,94 тенге, официальный курс Нацбанка на 9 октября. Кэш не учитываем, 300 токенов рассуждений у 3.8 Flash – условная цифра для иллюстрации.
| Вариант | В месяц |
|---|---|
| 2.5 Flash, без рассуждений | около $28, примерно 12 600 тенге |
| 3.5 Flash-Lite, уровень minimal | от $28, примерно от 12 600 тенге |
| 3.1 Flash-Lite, уровень minimal | от $21, примерно от 9 400 тенге |
| 3.8 Flash, уровень low, до 31 декабря | около $82,5, примерно 37 000 тенге |
| 3.8 Flash, уровень low, с 1 января 2027 года | около $165, примерно 74 100 тенге |
Между первой и последней строкой – почти шесть раз. Мы не говорим, что 3.8 Flash брать не стоит: для бота, который сам ищет заказ, проверяет остатки и считает доставку, сильная модель может окупиться меньшим числом передач менеджеру. Но решение должно приниматься по контрольному прогону, а не по строчке «рекомендованная замена» в документации.
И ещё предупреждение самой Google: на новой инфраструктуре число токенов в отчётах может вырасти – она учитывает то, что старая недосчитывала. Таблица – ориентир, точные цифры дадут только ваши логи.
Посчитаем ваш счёт на Gemini 3.x до переключения
Прогоним сотню ваших обезличенных обращений через две-три замены и покажем цену месяца сейчас и с января.
Что в коде бота сломается при переходе с Gemini 2.5
Название модели меняется одной строкой. Всё остальное – нет. Вот места, которые мы бы проверили первыми, по руководству Google по переходу на Gemini 3.
Temperature
В ботах часто ставят temperature 0,1–0,3, чтобы ответы были ровными. Для Gemini 3 Google рекомендует оставить значение по умолчанию 1,0 и вовсе убрать параметр: более низкие значения могут приводить к зацикливанию и падению качества. В руководстве по переходу temperature, top_p и top_k для моделей 3.x прямо названы устаревшими. Строгость теперь задаётся инструкцией и структурированным ответом.
Бюджет рассуждений
У 2.5 рассуждения ограничивались числом – thinking_budget, и типичная настройка для бота на 2.5 Flash выглядела как thinking_budget: 0. У моделей 3.x вместо числа – уровень thinking_level, и передать оба параметра в одном запросе нельзя: будет ошибка. Самый низкий уровень у Flash-Lite и 3.5 Flash – minimal. У 3.8 Flash его нет, запрос с minimal вернёт ошибку, нижняя ступень – low.
История диалога, собранная из CRM
Это место мы считаем самым опасным для интеграций с CRM. Многие боты хранят переписку в карточке клиента и перед каждым запросом собирают историю заново из сохранённого текста. Пока бот просто отвечает, это работает. Но когда он вызывает функции – ищет заказ, создаёт сделку, проверяет запись к врачу, – Gemini 3 добавляет к ответу служебную подпись рассуждений. Её нужно вернуть модели ровно в той части сообщения, где она пришла. Нет подписи – ошибка 400.
SDK от Google делает это сам, если в историю добавляется полный ответ модели. А вот если в CRM лежит только текст, подпись теряется. Лечится хранением сырого ответа модели рядом с текстом или отказом от пересборки истории посреди цепочки вызовов. Заодно проверьте вторую тихую поломку: на каждый вызов функции нужно вернуть ровно один результат. Если результатов меньше или больше, модель может прислать пустой ответ без всякой ошибки. Пустой ответ бот должен передавать менеджеру, а не отправлять клиенту тишину.
Фото и документы
Если бот читает фото накладных, сканы удостоверений или PDF со счетами, у Gemini 3 другая нарезка изображений на токены: картинки и PDF по умолчанию могут стоить дороже, а качество распознавания плотных документов Google советует проверить с media_resolution: high.
SDK и дообученные модели
Vertex AI SDK в версиях после июня 2026 года Gemini не поддерживает, Google просит перейти на google-genai версии 2.0.0 или новее. Если вы дообучали 2.5 на своих диалогах, перенести такую модель нельзя: обучение придётся запустить заново на новой версии.
Как проверить бота за неделю
Ошибки 400 вылезут на первом тестовом запросе. Поведение видно только на реальных обращениях, поэтому нужен контрольный набор из 100–200 сообщений клиентов с известными правильными ответами. Как его собрать за день, описано в материале «Оценка качества AI-бота: golden set, метрики, A/B-тест и регресс в CI/CD». Для этого перехода смотрите на:
- заполнение полей CRM – по каждому полю отдельно;
- долю пустых ответов и ошибок в цепочках с вызовом функций;
- число токенов на запрос, включая рассуждения, – от него зависит счёт;
- время ответа на выбранном уровне рассуждений;
- ответы на казахском и на смеси языков, если такие клиенты у вас есть.
Если цифры на дешёвой замене не хуже старых, на ней и оставайтесь. Если хуже – пробуйте следующую ступень и сравнивайте, что дороже: модель или ошибки.
Чего не ждать
- Что срок продлят. Google обещает только не переносить дату раньше, ставить работу бота на продление – лотерея.
- Что переезд в AI Studio решает вопрос. Там другие ключи и квоты, новым проектам 2.5 уже не дают, а дату отключения просто ещё не назвали.
- Что вводная цена 3.8 Flash останется. В прайсе прямо указано: до 31 декабря 2026 года.
- Что смена модели не касается персональных данных. Выбор между глобальной обработкой и конкретным регионом теперь стоит денег, а для согласий клиентов он важен. Подробнее – в статье «Новые правила сбора персональных данных: лиды, маскирование, ИИ».
План на одиннадцать дней
Запаса нет, поэтому раскладываем по дням:
- До понедельника, 12 октября: найти все вызовы
gemini-2.5– в проектах Google Cloud, в Firebase, у подрядчиков, в ночных скриптах и выгрузках. Расход по моделям виден в отчётах биллинга. - 13–14 октября: выбрать замену под каждую задачу, убрать temperature, перевести бюджет рассуждений на уровни, починить хранение истории для цепочек с функциями.
- 14–15 октября: контрольный прогон, сравнение полей, токенов и времени со старой моделью.
- Четверг, 15 октября, утро: переключение, пока менеджеры на месте и заметят пропавшие заявки за час. Пятница 16-го – апрельская дата, понедельник 19-го – запас на исправления.
Связанные материалы
- Как снижать стоимость AI-бота: токены, кэш, model routing, fallback и лимиты
- AI-боты для входящих обращений
Переведём бота с Gemini 2.5 до 20 октября
Дайте доступ к настройкам интеграции и выгрузку 200 обезличенных обращений – за три рабочих дня подберём замену под каждую задачу, поправим код и посчитаем счёт на 2027 год.