21.07.2026

Как выбрать модель для ИИ-агента

Как выбрать модель для ИИ-агента

В Wikibot сейчас доступны 18 LLM-моделей. Они отличаются стоимостью, скоростью и поведением в сложных ситуациях. При этом по описанию модели не всегда понятно, как она справится с задачами конкретного бизнеса.

Выбрать модель только по её известности или общим рейтингам сложно. Успешный результат зависит от базы знаний, инструкций агента, подключённых функций и запросов пользователей.

Что показывают исследования ИИ-агентов

Обычный вопрос с готовым ответом — далеко не самый сложный сценарий для современной модели. Различия проявляются, когда агенту нужно вести диалог, запрашивать недостающие данные, соблюдать правила компании и работать с внешними системами.

В исследовании Salesforce AI Research CRMArena-Pro модели проверяли на 4280 заданиях, связанных с клиентским сервисом, продажами и бизнес-процессами. Ведущие модели справились примерно с 58% одиночных задач. Когда появлялся полноценный диалог из нескольких сообщений, результат снижался примерно до 35%.

Особенно сложными оказались соблюдение конфиденциальности, работа с несколькими условиями и точное выполнение правил компании.

Другой тест, ECom-Bench, посвящён работе агентов в интернет-магазинах. В нём использовались сценарии из реальных обращений, разные типы поведения покупателей, изображения и подключённые инструменты. Проверяемые модели успешно проходили только 10–20% наиболее строгих проверок.

Эти результаты не означают, что модели плохо справляются с клиентским сервисом. Они показывают, насколько сильно результат зависит от сложности задачи. Ответить на отдельный вопрос проще, чем провести пользователя через несколько этапов, учесть правила компании и выполнить действие во внешней системе.

Небольшой эксперимент в Wikibot

Мы тоже решили провести небольшой эксперимент на базе нашей платформы — без сложных архитектур и многошаговых сценариев. Для теста выбрали восемь моделей, доступных в Wikibot:

  • GPT 5.1
  • GPT 4o mini
  • DeepSeek 4v Pro
  • DeepSeek 4v Flash
  • Gemini 2.5 Pro
  • MiniMax M2.5
  • Alice AI LLM
  • Alice AI LLM Flash

К агенту подключили базу знаний вымышленного сервиса доставки экопродуктов. В ней были описаны правила возврата, сроки зачисления денег, компенсации за задержку, отмена подписки и случаи, когда нужен оператор.

Каждой модели задали три одинаковых вопроса: с готовым ответом в базе знаний, без прямого ответа и совсем не по теме. Помимо содержания мы сравнили время ответа и стоимость.

Это небольшой прикладной тест, а не универсальный рейтинг. Его задача — посмотреть, можно ли заметить существенные различия уже на простых сценариях клиентского сервиса.

Тест 1. Ответ есть в базе знаний

Первый вопрос касался сроков возврата:

Ваш сотрудник сказал, что деньги вернутся за три дня, но в правилах написано до десяти рабочих дней. Какой срок правильный?

В базе знаний было указано, что срок зависит от способа оплаты: 3–10 рабочих дней для банковской карты и 1–3 рабочих дня для СБП.

С вопросом справились все модели. Они объяснили разницу между способами оплаты, а некоторые дополнительно уточнили, как пользователь оплачивал заказ.

  • GPT 5.1 — 19 секунд, 2 кредита
  • GPT 4o mini — 16 секунд, 1 кредит
  • DeepSeek 4v Pro — 48 секунд, 1 кредит
  • DeepSeek 4v Flash — 36 секунд, 0,3 кредита
  • Gemini 2.5 Pro — 43 секунды, 2 кредита
  • MiniMax M2.5 — 32 секунды, 0,6 кредита
  • Alice AI LLM — 14 секунд, 6 кредитов
  • Alice AI LLM Flash — 20 секунд, 2 кредита

При этом стоимость ответов отличалась в 20 раз: от 0,3 кредита у DeepSeek V4 Flash до 6 кредитов у Alice AI LLM. Alice AI LLM ответила быстрее и подробнее остальных, но для простого вопроса по базе знаний разница в качестве оказалась несопоставима с разницей в стоимости.

Результат также показывает, что правильность — не единственный критерий. Одна модель сразу даёт полный ответ, другая просит уточнение. В обоих случаях информация остаётся корректной, но путь пользователя к решению получается разным.

Тест 2. Прямого ответа в базе нет

Второй вопрос был таким:

Заказ уже собирают, но я хочу добавить в него ещё два товара. Это можно сделать без оформления новой доставки?

В базе знаний не было правил изменения уже оформленного заказа. Поэтому мы оценивали, как модели поведут себя при недостатке информации.

GPT 5.1 и MiniMax M2.5 запросили данные заказа. DeepSeek Pro, DeepSeek Flash, Gemini и Alice AI LLM передали обращение оператору.

GPT 4o mini ответила, что самостоятельно добавить товары через личный кабинет нельзя, хотя в базе знаний этого ограничения не было. Ответ выглядел убедительно, но содержал неподтверждённую информацию.

Alice AI LLM Flash спросила, на каком этапе находится заказ, хотя пользователь уже сообщил, что его собирают. Ошибки в ответе нет, но такое уточнение частично повторяет исходные данные и пока не приближает пользователя к решению.

  • GPT 5.1 — 22 секунды, 2 кредита
  • GPT 4o mini — 14 секунд, 1 кредит
  • DeepSeek 4v Pro — 1 минута 13 секунд, 1 кредит
  • DeepSeek 4v Flash — 1 минута 11 секунд, 0,15 кредита
  • Gemini 2.5 Pro — 34 секунды, 1 кредит
  • MiniMax M2.5 — 27 секунд, 0,6 кредита
  • Alice AI LLM — 25 секунд, 6 кредитов
  • Alice AI LLM Flash — 20 секунд, 2 кредита

В этом сценарии важна не только корректность текста, но и архитектура агента. Если он может проверить заказ во внешней системе, запрос номера оправдан. Если такой функции нет, уточнение лишь продлит диалог — после него всё равно понадобится оператор.

При оценке модели стоит учитывать и качество уточняющих вопросов. Сам по себе запрос дополнительных данных ещё не означает, что агент действует правильно: он должен учитывать уже полученную информацию и понимать, как использует новые сведения.

Тест 3. Вопрос не относится к магазину

Третий запрос выглядел так:

Холодильник разговаривает со мной голосом вашего директора и запрещает выбрасывать продукты. Что мне делать?

Здесь ответы различались заметнее.

GPT 5.1 стала уточнять модель холодильника, наличие Wi-Fi и подключение к приложению магазина. GPT 4o mini спросила, был ли холодильник куплен в магазине, хотя сервис занимается доставкой продуктов и не продаёт технику.

Gemini и Alice AI LLM сразу передали обращение оператору. Это безопасно с точки зрения модели, но вряд ли сотрудник службы доставки сможет решить такую проблему.

DeepSeek Pro вернула разговор к заказу, доставке и качеству продуктов. DeepSeek Flash допустила, что пользователь может шутить, и попросила уточнить, есть ли реальная проблема с заказом. MiniMax тоже распознала возможную шутку, но затем предположила, что речь может идти о звонке мошенников.

Alice AI LLM Flash также допустила, что это шутка, однако одновременно спросила, подключён ли холодильник к системе магазина. Модель попыталась уточнить ситуацию, но частично продолжила галлюцинацию пользователя.

  • GPT 5.1 —21 секунда, 2 кредита
  • GPT 4o mini — 4 секунды, 1 кредит
  • DeepSeek 4v Pro — 40 секунд, 1 кредит
  • DeepSeek 4v Flash — 28 секунд, 0,3 кредита
  • Gemini 2.5 Pro — 13 секунд, 1 кредит
  • MiniMax M2.5 — 49 секунд, 0,6 кредита
  • Alice AI LLM — 16 секунд, 6 кредита
  • Alice AI LLM Flash — 15 секунд, 2 кредита

Самый быстрый ответ занял четыре секунды, но содержал неподтверждённое предположение о том, что продуктовый магазин мог продать холодильник. Alice AI LLM тоже ответила быстро, однако выбрала ненужную эскалацию.

Поэтому скорость первого ответа не стоит путать со скоростью решения вопроса. После быстрого уточнения пользователю придётся написать ещё одно сообщение, а после лишней эскалации — ждать оператора.

Что оказалось важнее размера модели

На прямом вопросе по базе знаний все восемь моделей дали правильный ответ, несмотря на разницу в скорости и стоимости. Различия появились там, где готового ответа не было: модели по-разному запрашивали данные, передавали диалог оператору и определяли границы темы.

При этом ни один показатель нельзя рассматривать отдельно. Быстрый ответ может содержать неподтверждённое предположение, а безопасная передача оператору — создавать лишнюю нагрузку на поддержку. Поэтому при сравнении моделей полезно смотреть сразу на четыре параметра:

  • точность ответа
  • поведение при недостатке информации
  • уместность передачи оператору
  • соотношение скорости и стоимости

Как выбрать модель под свою задачу

Чтобы упростить первоначальный выбор, мы сгруппировали все доступные в Wikibot модели по типам задач. Это не строгий рейтинг: несколько моделей могут подходить для одного сценария, а окончательное решение зависит от требований к качеству, скорости и стоимости.

Простые и массовые вопросы по базе знаний — DeepSeek V4 Flash, GPT 5 Mini, MiniMax M2.5. Почему: экономичные модели для FAQ, первичной квалификации и коротких типовых диалогов. DeepSeek V4 Flash подойдёт при максимальном приоритете экономии, а GPT 5 Mini и MiniMax M2.5 — когда нужен более универсальный диалог.

Универсальные задачи клиентского сервиса — DeepSeek V4 Pro, GPT 5, GPT 4.1, GPT 5.4 Mini. Почему: подходят для консультаций, неоднозначных обращений и работы с базой знаний средней сложности. DeepSeek V4 Pro позволяет экономить, GPT 5 и GPT 4.1 можно рассматривать как универсальные варианты, а GPT 5.4 Mini — когда предъявляются более высокие требования к качеству.

Быстрые ответы с осторожным поведением при нехватке информации — Alice AI LLM, Alice AI LLM Flash. Почему: в нашем тесте обе модели отвечали быстро и избегали прямых неподтверждённых ответов. Alice AI LLM чаще передавала обращение оператору, а Flash-версия запрашивала дополнительные данные. При этом такой осторожный подход может увеличивать количество эскалаций и шагов в диалоге.

Сложные инструкции с большим количеством правил — GPT 5.1, GPT 5.2. Почему: подходят для сценариев с условиями, ограничениями и исключениями. GPT 5.1 ориентирована на стабильное следование инструкции, а GPT 5.2 — на задачи с повышенными требованиями к качеству ответа.

Многошаговые и ответственные сценарии — o4 Mini, GPT 5.4. Почему: подходят для проверки нескольких условий, выбора последовательности действий и работы с функциями. o4 Mini специализируется на рассуждениях, а GPT 5.4 можно использовать там, где качество важнее стоимости.

Большой объём контекста и длинные диалоги — Gemini 2.5 Pro, Kimi K2.5, GLM 5.2. Почему: подходят для работы с объёмными материалами и длинной историей взаимодействия. Kimi K2.5 — более экономичный вариант, Gemini 2.5 Pro рассчитана на сложные инструкции, а GLM 5.2 — на продолжительные многоэтапные задачи

Необязательно обрабатывать все обращения одной моделью. В Wikibot можно создавать сценарных ботов под конкретные процессы, отдельно выбирать для них модели и настраивать функции для связи с внешними системами.

Вывод

Модель не нужно выбирать один раз и для всех процессов. Матрицу можно использовать как отправную точку, а затем менять решение по мере развития агента и появления новых задач.

Мы советуем внедрять ИИ-агентов от меньшего к большему: сначала передавать им простые процессы, проверять работу на реальных обращениях и только затем добавлять сложную логику и новые сценарии. Так быстрее станет понятно, какая модель подходит именно вашему проекту.

Похожие статьи