Коротко
Автор сравнил передачу модели полного каталога из 91 инструмента с предварительным отбором подходящих инструментов роутером. В проведённых тестах узкий набор улучшил точность и уменьшил контекст и задержку; при этом ошибка роутера может оставить модель без инструментов и привести к выдуманному выполнению задачи.
Контекст
Автор описывает собственный ИИ-оркестратор с более чем 90 инструментами для таблиц, документов, почты, задач и других корпоративных операций. Цель — добиться приемлемого качества и скорости в закрытом контуре, в том числе на локальной модели Qwen3.6 27B с RTX 3090 24 ГБ. В отличие от систем, ориентированных на фронтир-модели и полный список инструментов, автор проверяет, помогает ли предварительная маршрутизация.
Главное
- Оркестратор содержит более 90 инструментов; к сентябрьскому тесту каталог насчитывал 91.
- Локальная конфигурация автора: RTX 3090 24 ГБ и Qwen3.6 27B.
- При узкой маршрутизации модель видит около 20 инструментов из выбранного раздела и подраздела, а не весь каталог.
- В августовском тесте Qwen на 49 запросах узкий набор дал 43 правильных выбора из 44, полный — 39; полный контекст был в 2,7 раза больше, прогон дольше примерно на треть.
- Ошибки полного набора возникали среди похожих инструментов: например, объединение датасетов путалось с управлением ими, а разбор новостей — с сырой загрузкой страницы.
- Июльский разведочный тест на восьми запросах дал неоднозначную картину: gpt-4.1 набрал 8/8 на полном наборе против 7/8 на узком; локальная модель — 7/8 на узком против 6/8 на полном.
- В сентябре сравнили четыре режима отбора на GigaChat-2-Max и gpt-oss 120B; обе модели показали лучшие результаты с узким набором по точности, контексту и задержке.
- Три провала GigaChat на узком наборе были уточняющими вопросами; при их зачёте как допустимого поведения автор получил бы 44/44.
- Если роутер не распознаёт нужный раздел, модель может остаться без инструментов и заявить, что выполняет действие, которого фактически не совершает.
- Автор советует проводить сравнения на одном достаточно большом корпусе, в один день и на одной модели, фиксировать каталог и отдельно учитывать уточнения.
Как сделано
Перед основным вызовом отдельный роутер анализирует запрос, выбирает раздел инструментов и подраздел; модели передают примерно 20 подходящих описаний вместо каталога почти из 90. Настройка режима маршрутизации хранится отдельно для каждой модели и переключается вместе с ней.
Автор сравнивал варианты на одном корпусе пользовательских запросов, фиксируя точность выбора, объём контекста и задержку. В августе тестировал локальную Qwen 27B на RTX 3090: 49 запросов и два прогона, различавшиеся длиной списка кандидатов. В сентябре тот же корпус использовался для GigaChat-2-Max и gpt-oss 120B, при каталоге из 91 инструмента и четырёх режимах отбора. Также был небольшой июльский разведочный тест на восьми запросах с gpt-4.1.
Результаты
В тесте локальной Qwen узкий набор дал 43 верных выбора из 44 против 39 на полном; контекст полного списка был в 2,7 раза больше, а прогон — примерно на треть дольше. Ошибки полного набора концентрировались среди похожих инструментов. В июльском тесте из восьми запросов локальная модель получила 7/8 на узком наборе и 6/8 на полном, а gpt-4.1 — 7/8 и 8/8 соответственно. В сентябрьских тестах GigaChat-2-Max и gpt-oss 120B узкий набор оказался лучше по точности, контексту и задержке. У GigaChat все три неуспешных случая на узком наборе были уточняющими вопросами; если считать уместные уточнения успехом, результат составил бы 44/44. Автор сообщает, что для всех трёх моделей, измеренных на полном корпусе, лучшим был узкий набор.
Ограничения
Выборка локального теста — 49 запросов, разведочного сравнения gpt-4.1 — всего восемь; автор подчёркивает, что гипотеза о преимуществе широкого набора для сильных моделей не доказана и требует полного теста на фронтир-модели. Оценка зависит от формулировок и описаний инструментов, а также от того, засчитываются ли уточняющие вопросы как успех. Каталог инструментов меняется, поэтому результаты требуют фиксации его версии или отпечатка. Если роутер не находит раздел, модель может получить ноль инструментов и уверенно симулировать выполнение задачи. Упомянутый пример со сканированием сети также показывает, что часть действий недоступна агенту из-за изоляции; автор считает необходимым честно сообщать об этом.
Что взять себе
- Ограниченный список инструментов может повысить точность не только за счёт меньшего контекста, но и благодаря сокращению числа похожих кандидатов.
- Не переносите результаты маршрутизации с одной модели на другую: проверяйте настройки отдельно для каждой модели.
- Тестируйте не только ошибки выбора, но и поведение при отсутствии найденных инструментов — это может быть опаснее обычного промаха.
- Для воспроизводимого сравнения фиксируйте корпус и версию каталога, учитывайте уточняющие вопросы отдельно и проверяйте, что тест проходит тем же путём, что и продукт.
Читать оригинал, если…
Откройте оригинал, если вам нужны подробности четырёх режимов отбора, конкретные ошибки на отдельных запросах или рекомендации автора по воспроизводимой настройке тестов.