ИИ
Зачем ИИ-агенту для клиентов нужна резервная модель
У провайдера модели плохой час, и ваш агент в WhatsApp замолкает, пока клиенты ждут. Резервная модель — самая дешёвая страховка от этого. Как работает резерв, как его выбрать и как он сочетается с быстрыми моделями и бюджетами.
Команда MonoChat Обновлено: 5 мин чтения
На этой странице
- Почему сбои моделей больнее бьют по диалогам с клиентами
- Что может пойти не так
- Как работает резерв в агенте
- Как выбрать резервную модель
- Быстрая модель: другая половина надёжности
- Бюджеты: страховка под страховкой
- Резерв — это не передача человеку
- Простой чек-лист
- Настройте один раз для всех каналов
ИИ-агенту для клиентов нужна резервная модель, потому что любая модель рано или поздно даёт сбой в самый неподходящий момент: у провайдера авария, ваш аккаунт упирается в лимит запросов, запрос завершается по тайм-ауту или один необычный диалог расходует больше токенов, чем планировалось. Без резерва агент замолкает, а клиент ждёт. С резервом вторая модель берёт работу на себя, и диалог продолжается. В Agent Harness MonoChat у каждого узла «ИИ-агент» есть основная, резервная и быстрая модели, а также лимит бюджета на запуск.
В этой статье объясняется, почему сбои моделей важнее всего именно в клиентских сообщениях, как работает резерв, как выбрать резервную модель и как она сочетается с быстрыми моделями, бюджетами и передачей диалога человеку.
Почему сбои моделей больнее бьют по диалогам с клиентами
Во внутреннем инструменте неудачный запрос к ИИ — это неудобство: вы нажимаете «повторить». В диалоге с клиентом в WhatsApp это нарушенное обещание. Клиент задал вопрос, увидел синие галочки и ждёт ответа.
Несколько факторов делают клиентские сообщения особенно чувствительными:
- Клиенты не повторяют запрос. Они пишут снова, уже раздражённые, или уходят.
- Нагрузка скачет. Кампания, задержка доставки или распродажа могут за минуты многократно увеличить число диалогов, и именно тогда срабатывают лимиты запросов.
- Агенты делают много вызовов. Agent harness запускает модель в цикле, часто несколько раз на одно сообщение клиента. Один неудачный вызов может остановить весь запуск.
- В WhatsApp важно время. Ответы в свободной форме разрешены только в течение 24 часов после последнего сообщения клиента. Долгая пауза может вытолкнуть ответ за пределы окна, где понадобится одобренный шаблон.
Всё это не означает, что какой-то провайдер ненадёжен. У каждого провайдера бывают инциденты, плановые работы и ограничения по мощности. Вопрос только в том, есть ли у вашего агента план на такие случаи.
Что может пойти не так
Сбои у провайдера. Частичные или полные, короткие или долгие. Даже доступность 99,9% в месяц допускает более 40 минут простоя.
Лимиты запросов. Ваш аккаунт может допускать определённое число запросов или токенов в минуту. Загруженный час может упереться в этот потолок, даже когда с самим провайдером всё в порядке.
Тайм-ауты и медленные ответы. Модель, которая обычно отвечает за две секунды, под нагрузкой может отвечать двадцать. Клиенту на телефоне это кажется, будто ничего не происходит.
Запуски вразнос. Агент, зациклившийся на запутанном запросе, или разрастающийся диалог могут израсходовать намного больше обычного запуска.
Изменения моделей. Провайдеры обновляют и выводят из эксплуатации модели. Поведение, на которое вы полагались, может измениться почти без предупреждения.
Как работает резерв в агенте
Идея проста: когда основная модель не может завершить работу, её берёт на себя вторая. В MonoChat резервная модель подключается после мягкого лимита или когда основная модель даёт сбой. Диалог, инструменты и инструкции остаются теми же; меняется только модель, которая выполняет работу.
В каждом узле «ИИ-агент» вместе работают три роли:
| Роль | Что делает |
|---|---|
| Основная модель | Рассуждает, принимает решения и пишет ответы |
| Резервная модель | Подключается после мягкого лимита или сбоя |
| Быстрая модель | Выполняет фоновые задачи |
Поверх ролей лимит бюджета на запуск ограничивает расходы одного диалога.
Как выбрать резервную модель
Предпочитайте другого провайдера
Резерв от того же провайдера защищает от сбоя одной модели, но не от инцидента у всего провайдера или лимита запросов на вашем аккаунте у этого провайдера. Модель второго провайдера закрывает оба случая. MonoChat позволяет подключить нескольких провайдеров через собственные LLM, так что это вопрос настройки, а не проект.
Достаточно хорошая, а не идентичная
Резервной модели не обязательно быть лучшей из доступных. Ей нужно следовать вашим инструкциям, правильно вызывать ваши инструменты и писать приличные ответы. Протестируйте её отдельно на реальных диалогах, как если бы она была основной, прежде чем на неё полагаться.
Проверьте, как она работает с вашими инструментами
Агенты зависят от вызовов инструментов: найти заказ, проверить слот, создать заявку. Некоторые модели намного лучше других справляются со структурированными вызовами инструментов. Резерв, который пишет прекрасные тексты, но неправильно вызывает инструменты, хуже, чем его отсутствие.
Учитывайте языки, на которых вы общаетесь
Если ваши клиенты пишут на турецком, арабском или испанском, убедитесь, что резервная модель пишет на этих языках так же хорошо, как основная. Резкая смена качества или тона заметна.
Учитывайте стоимость в обе стороны
Более дешёвый резерв снижает стоимость длинных или необычных запусков, которые перешли за мягкий лимит. Более дорогой резерв может подойти, если он обрабатывает только редкие сбои. Решите, какую задачу вы хотите поручить резерву.
Быстрая модель: другая половина надёжности
Не каждому шагу нужна лучшая модель. Фоновые задачи, то есть работа вокруг диалога, а не сам ответ, могут выполняться на меньшей и более быстрой модели. Это сохраняет мощность и бюджет основной модели для того, что клиент действительно видит, и снижает вероятность упереться в лимит запросов основной модели в часы пик.
На практике: поставьте самую сильную модель для рассуждений основной, надёжную модель второго провайдера резервной, а быструю недорогую модель отдайте под фоновые задачи.
Бюджеты: страховка под страховкой
Резерв поддерживает работу агента. Бюджеты поддерживают его доступность по цене. Лимит бюджета на запуск означает, что ни один диалог, каким бы странным он ни был, не потратит больше запланированного. В сочетании с мягким лимитом, после которого подключается резерв, получается предсказуемая схема: обычные диалоги идут на основной модели, длинные продолжаются на резервной, и ничто не выходит из-под контроля.
С вашими собственными ключами провайдеров MonoChat не добавляет наценку на ИИ, так что вы планируете бюджет ровно по тому, что берут ваши провайдеры.
Резерв — это не передача человеку
Резервную модель легко принять за ответ на любую проблему. Это не так. Резерв решает технические сбои: модель недоступна, медленна или бюджет исчерпан. Передача решает проблемы суждения: жалобу, юридический вопрос, возврат выше вашего лимита или клиента, который просто просит человека.
В MonoChat агент работает внутри сценария, поэтому передача в общие входящие команды с полной историей всегда доступна. WhatsApp также ожидает, что автоматические ответы предлагают понятный путь к человеку. Продумайте оба пути:
- Основная модель даёт сбой или достигает мягкого лимита → продолжает резервная модель.
- Случай требует человека → передача нужной команде вместе с историей диалога.
- Отказали обе → сценарий сообщает клиенту, что ему ответит человек, и направляет диалог во входящие.
Простой чек-лист
- Основная модель выбрана по качеству на ваших реальных диалогах.
- Резервная модель от второго провайдера, протестированная отдельно с вашими инструментами и языками.
- Быстрая модель для фоновых задач.
- Лимит бюджета на запуск, соответствующий стоимости обычного диалога с некоторым запасом.
- Чёткие правила передачи в инструкциях агента и в сценарии.
- Просмотр выборки диалогов после первой недели, включая те, что шли на резервной модели.
Настройте один раз для всех каналов
Поскольку узел «ИИ-агент» находится в сценарии MonoChat, одни и те же основная, резервная и быстрая модели защищают вашего агента в WhatsApp, Instagram, Messenger, TikTok, Telegram, веб-чате, SMS и голосовом канале. А поскольку Agent Harness позволяет выбрать фреймворк, тот же подход работает независимо от того, на чём работает ваш агент: на встроенном harness MonoChat, Claude Agent SDK, OpenAI Agents SDK, Pi или на вашем собственном фреймворке.
Как роли моделей сочетаются друг с другом, смотрите на странице Agent Harness.
Применяйте это на практике с MonoChat