Skip to content
Neuronavt
Go back

Как выбирать инструменты для ИИ-оркестратора

Кейс8/10

Коротко

Автор сравнил передачу модели полного каталога из 91 инструмента с предварительным отбором подходящих инструментов роутером. В проведённых тестах узкий набор улучшил точность и уменьшил контекст и задержку; при этом ошибка роутера может оставить модель без инструментов и привести к выдуманному выполнению задачи.

Контекст

Автор описывает собственный ИИ-оркестратор с более чем 90 инструментами для таблиц, документов, почты, задач и других корпоративных операций. Цель — добиться приемлемого качества и скорости в закрытом контуре, в том числе на локальной модели Qwen3.6 27B с RTX 3090 24 ГБ. В отличие от систем, ориентированных на фронтир-модели и полный список инструментов, автор проверяет, помогает ли предварительная маршрутизация.

Главное

Как сделано

Перед основным вызовом отдельный роутер анализирует запрос, выбирает раздел инструментов и подраздел; модели передают примерно 20 подходящих описаний вместо каталога почти из 90. Настройка режима маршрутизации хранится отдельно для каждой модели и переключается вместе с ней.

Автор сравнивал варианты на одном корпусе пользовательских запросов, фиксируя точность выбора, объём контекста и задержку. В августе тестировал локальную Qwen 27B на RTX 3090: 49 запросов и два прогона, различавшиеся длиной списка кандидатов. В сентябре тот же корпус использовался для GigaChat-2-Max и gpt-oss 120B, при каталоге из 91 инструмента и четырёх режимах отбора. Также был небольшой июльский разведочный тест на восьми запросах с gpt-4.1.

Результаты

В тесте локальной Qwen узкий набор дал 43 верных выбора из 44 против 39 на полном; контекст полного списка был в 2,7 раза больше, а прогон — примерно на треть дольше. Ошибки полного набора концентрировались среди похожих инструментов. В июльском тесте из восьми запросов локальная модель получила 7/8 на узком наборе и 6/8 на полном, а gpt-4.1 — 7/8 и 8/8 соответственно. В сентябрьских тестах GigaChat-2-Max и gpt-oss 120B узкий набор оказался лучше по точности, контексту и задержке. У GigaChat все три неуспешных случая на узком наборе были уточняющими вопросами; если считать уместные уточнения успехом, результат составил бы 44/44. Автор сообщает, что для всех трёх моделей, измеренных на полном корпусе, лучшим был узкий набор.

Ограничения

Выборка локального теста — 49 запросов, разведочного сравнения gpt-4.1 — всего восемь; автор подчёркивает, что гипотеза о преимуществе широкого набора для сильных моделей не доказана и требует полного теста на фронтир-модели. Оценка зависит от формулировок и описаний инструментов, а также от того, засчитываются ли уточняющие вопросы как успех. Каталог инструментов меняется, поэтому результаты требуют фиксации его версии или отпечатка. Если роутер не находит раздел, модель может получить ноль инструментов и уверенно симулировать выполнение задачи. Упомянутый пример со сканированием сети также показывает, что часть действий недоступна агенту из-за изоляции; автор считает необходимым честно сообщать об этом.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если вам нужны подробности четырёх режимов отбора, конкретные ошибки на отдельных запросах или рекомендации автора по воспроизводимой настройке тестов.