Сервисная компания в Алматы, сто тысяч входящих сообщений в месяц. WhatsApp, Instagram, форма на сайте – всё это разбирает Claude Haiku 4.5: какой отдел, насколько срочно, есть ли номер заказа. Результат сразу ложится в карточку CRM. Счёт за модель – около 78 тысяч тенге в месяц, и к нему давно привыкли. Пока не вышел Claude Haiku 5.5.
Восьмого октября руководитель читает новость: новая модель в прайсе в десять раз дешевле. Вопрос разработчику понятный – почему мы ещё платим по-старому? Разработчик меняет название модели в настройках. Через минуту в логах сыплются ошибки 400, а новые обращения перестают раскладываться по отделам.
Компания условная, цены – из прайса Anthropic. Переход на Claude Haiku 5.5 действительно сильно сокращает счёт, но не в десять раз и не одной строкой. Ниже – откуда берётся разница, где прячется дорогая ловушка и что поправить в коде.
Откуда повод
7 октября 2026 года Anthropic выпустила Claude Haiku 5.5 (claude-haiku-5-5) – модель для классификации, маршрутизации, извлечения данных и поддержки клиентов в реальном времени. Haiku 4.5 пока в статусе Active, но в таблице жизненного цикла у неё стоит «отключение не раньше 15 октября 2026 года». Об отключении Anthropic предупреждает минимум за 60 дней.
Главное за минуту
Прайс в десять раз ниже
$0,10 против $1 за 1 млн входных токенов, $0,50 против $5 за выходные. Чтение из кэша – $0,01 вместо $0,10.
Экономия скромнее прайса
Сама Anthropic говорит, что Haiku 5.5 обходится примерно на 75% дешевле Haiku 4.5. Часть разницы съедают новый токенизатор и рассуждения.
Порог 100 000 токенов
Запрос длиннее этой отметки стоит в пять раз дороже: $0,50 за вход и $2,50 за выход.
Ломается меньше, чем у Sonnet
Принудительный вызов инструмента работает. Но temperature, prefill и бюджет рассуждений дают ошибку 400.
Почему Claude Haiku 5.5 дешевле не в десять раз
Первая причина – токенизатор. Haiku 5.5 считает текст так же, как модели Claude начиная с 4.7: по данным Anthropic, тот же текст даёт примерно на 30% больше токенов, чем на Haiku 4.5. Сообщение клиента не стало длиннее, а в счёте его стало больше. Насколько именно для русского и казахского текста – покажет только подсчёт токенов на ваших запросах с новой моделью в параметре.
Вторая причина – рассуждения. Haiku 4.5 без указаний отвечала сразу. Haiku 5.5 по умолчанию включает адаптивные рассуждения с уровнем effort: medium: модель сама решает, подумать ли перед ответом. Эти токены оплачиваются как выходные, а выход в пять раз дороже входа. Для классификатора, который отвечает одним словом, двести-триста токенов размышлений – это уже больше, чем сам ответ.
Третья причина касается не всех, зато бьёт больнее остальных. О ней отдельный раздел ниже.
Расчёт: классификатор обращений на 100 000 сообщений
Вернёмся к сервисной компании. На Haiku 4.5 каждый запрос – 1500 входных токенов (инструкция, список отделов, текст обращения) и 50 выходных: вызов инструмента с отделом и срочностью. Кэширование для наглядности не считаем. Курс – 447,14 тенге за доллар, официальный курс Нацбанка на 8 октября. Объём рассуждений в последней строке условный, свой вы увидите только в логах.
| Вариант | В месяц |
|---|---|
| Haiku 4.5, без рассуждений | $175, около 78 250 тенге |
| Haiku 5.5, принудительный вызов инструмента, токенов на 30% больше | $22,75, около 10 170 тенге |
| Haiku 5.5 по умолчанию, если на рассуждения уходит 300 токенов | $37,75, около 16 880 тенге |
Экономия выходит от 78 до 87% – близко к оценке самой Anthropic. Третья строка дороже второй в 1,7 раза, и решает это одна настройка. Если модели не нужно думать, не заставляйте её платить за размышления.
Ловушка длинных запросов: порог 100 000 токенов
У Haiku 5.5, в отличие от Sonnet 5.5 и Opus 5.5, цена зависит от длины запроса. До 100 000 токенов – обычный тариф, после – в пять раз выше. Тариф выбирается по длине конкретного запроса, так что дорогими станут только длинные запросы, но каждый из них целиком.
Где в CRM бывают такие запросы? Сводка по клиенту перед звонком: переписка за год, сделки, расшифровки разговоров. Разбор длинного договора или тендерной документации. Допустим, на Haiku 4.5 сводка занимает 85 000 токенов, ответ – 1000, и менеджеры запрашивают 2000 сводок в месяц. После перехода из-за токенизатора запрос вырастает до 110 000 токенов и перешагивает порог.
| Вариант | 2000 сводок в месяц |
|---|---|
| Haiku 4.5, 85 000 токенов | $180, около 80 500 тенге |
| Haiku 5.5, та же история – уже 110 000 токенов, дорогой тариф | $117, около 52 300 тенге |
| Haiku 5.5, самая старая история обрезана, запрос до 100 000 токенов | около $21, примерно 9300 тенге |
Дешевле стало в обоих случаях. Но вторая строка дороже третьей в пять с лишним раз, хотя отличается только тем, что в запрос попала прошлогодняя переписка. Если ваш код собирает контекст «всё, что есть по клиенту», поставьте ограничение по токенам и отрезайте самое старое. Обычно для звонка хватает последних месяцев.
Посчитаем ваш счёт на Haiku 5.5
Пришлите выгрузку использования из консоли Anthropic за месяц – покажем, сколько вы сэкономите и какие запросы перейдут порог в 100 000 токенов.
Что поправить в коде при переходе с Haiku 4.5
Список короче, чем у недавнего перехода с Sonnet 4.5, который мы разбирали в статье «Отключение Claude Sonnet 4.5: как перевести бота на Sonnet 5.5». Главное отличие – принудительный вызов инструмента на Haiku 5.5 работает. Для классификаторов и разбора заявок в поля CRM это важно: схема «модель обязана вызвать функцию с отделом» остаётся рабочей. Остальное собрано в таблицу по руководству Anthropic.
| Что стоит в коде | Что будет на Haiku 5.5 | Что делать |
|---|---|---|
temperature: 0 или любые top_p, top_k |
Ошибка 400 | Удалить. Строгость ответа задаётся инструкцией |
| Предзаполненный ответ ассистента (prefill) | Ошибка 400, даже с выключенными рассуждениями | Для классификации – инструмент с перечнем допустимых значений, для формата – структурированный ответ |
thinking с budget_tokens |
Ошибка 400 | Адаптивные рассуждения и уровень effort |
| Ответ читается из первого блока | Первым может прийти блок рассуждений | Выбирать блоки по типу |
Маленький max_tokens, например 100 |
Рассуждения съедают лимит, ответ обрывается | Поднять лимит или понизить effort |
tool_choice с типом any или tool |
Работает, ответ начинается сразу с вызова, без рассуждений | Оставить – для классификатора это самый дешёвый режим |
Ещё три вещи, которые не падают сразу. Ответ с stop_reason: refusal: у Haiku 5.5 есть классификаторы безопасности, и обращение с таким ответом бот должен передать менеджеру, а не потерять. Текст рассуждений по умолчанию теперь пустой: если ваш интерфейс показывал оператору «почему модель так решила», он замолчит, пока не включить сводку рассуждений. И если бот в цепочке с инструментами задним числом правит историю диалога, а потом возвращает блоки рассуждений, для аккаунтов, созданных с 31 августа 2026 года, такой запрос вернёт ошибку. Историю нужно только дописывать.
Haiku 5.5 или GPT-6 Luna
На коротких запросах обе модели стоят одинаково: $0,10 за вход, $0,01 за кэш, $0,50 за выход. У Luna вдобавок есть Decisions API, который возвращает не текст, а выбор из ваших вариантов с вероятностью, – подробно в статье «Decisions API от OpenAI: маршрутизация обращений в CRM». За Haiku 5.5 – работающий принудительный вызов инструмента и привычный Claude API, если бот уже на нём.
Мы считаем, что выбирать по прайсу здесь бессмысленно: он одинаковый. Выбирать стоит по трём вещам. Как модель справляется с вашими обращениями, особенно на казахском и смешанном языке. Где у вас уже настроены ключи, оплата, мониторинг. И какой поставщик подходит под ваши обязательства по персональным данным: казахстанского региона обработки нет ни у одного из двух.
Чего ждать не стоит
- Что результаты тестов из анонса повторятся у вас. Цифры по бенчмаркам и отзывы клиентов в анонсе – данные Anthropic, на русских и казахских обращениях модель никто, кроме вас, не проверял.
- Что Priority Tier переедет вместе с моделью. Если у вас есть такой договор на Haiku 4.5, на Haiku 5.5 он не поддерживается – мощности придётся планировать отдельно.
- Что на Amazon Bedrock всё будет как на Claude API. Структурированных ответов там нет, формат держится на инструментах.
- Что Haiku 4.5 отключат именно 15 октября. Это нижняя граница, а не дата. Точная появится в уведомлении, и от него будет минимум 60 дней.
План перехода на две-три недели
Срочности, как с Sonnet 4.5, пока нет, но и тянуть невыгодно: каждый месяц на старой модели – это переплата. Мы бы шли так.
- Найти все вызовы
claude-haiku-4-5, включая конструкторы ботов, модули подрядчиков и ночные скрипты. Выгрузка использования по ключам и моделям есть в консоли Anthropic. - Пересчитать токены типичных запросов уже с
claude-haiku-5-5и найти те, что после перехода перешагнут 100 000. - Убрать
temperature, prefill и бюджет рассуждений, переписать чтение ответа по типам блоков, обработать отказы. - Для классификации и разбора полей оставить принудительный вызов инструмента. Для ответов клиентам начать с
effort: lowи поднимать, только если качество просело. - Прогнать контрольный набор из 100–200 обращений и сравнить поля, время ответа и токены со старой моделью. Как собрать такой набор, описано в статье «Оценка качества AI-бота: golden set, метрики, A/B-тест и регресс в CI/CD».
- Переключить сначала фоновые задачи – классификацию, теги, сводки. Ответы клиентам – последними, в будний день утром.
Если бот разбирает заявки, неделю после переключения сверяйте, сколько обращений в день CRM получила от бота раньше и сейчас. Пропавший лид заметнее всего в этой цифре.
Связанные материалы
- Автоклассификация обращений: intent, entities и routing – как сделать и где ломается
- AI-боты для входящих обращений
Переведём бота на Haiku 5.5 и проверим на ваших обращениях
Пришлите 200 обезличенных обращений и доступ к настройкам интеграции – за неделю поправим код, сравним старую и новую модель по полям, времени и счёту и назначим дату переключения.