Skip to content
Neuronavt
Go back

Практическая оценка классификатора Jev

Исследование7/10

Коротко

Автор протестировал Jev версии jev-1.13.0 на примерно 160 тысячах запросов и сравнил её с моделями OpenAI и классическими классификаторами. Jev показала точность на уровне gpt-4.1-mini при меньших цене и задержке, но её confidence нельзя считать вероятностью и нужно заново калибровать после изменения схемы классов.

Контекст

Автор проверял Jev для себя и своей команды, чтобы понять, где модель пригодна для практической классификации и автоматической маршрутизации, а где нужны очистка входа или дополнительная проверка. С 19 по 30 сентября 2026 года он провёл 22 эксперимента через API раннего доступа, отправил около 160 тысяч запросов к jev-1.13.0 и контрольным моделям OpenAI; затраты составили примерно $18. Jev принимает текст и вопросы с вариантами или шкалами, а не генерирует текст.

Главное

Как сделано

В основном сравнении Jev и модели OpenAI получали одни и те же примеры и одинаковые описания классов без обучающих примеров; GPT также использовала structured output и temperature = 0. Для оценки её уверенности автор извлекал вероятности токенов меток через top_logprobs = 20 и нормировал их по классам. Замеры задержки проводились через OpenRouter, последовательно, с машины на Кипре; первые пять запросов исключались как прогрев. Анализ включал синтетические банковские обращения, срез banking77, MASSIVE на нескольких языках, BoolQ и Yelp; применялись парные сравнения, поправка Холма и бутстрэп по примерам.

Отдельно проверялись пороги автоматической обработки, изменение числа классов, формулировки и порядок схемы, пачечная отправка нескольких вопросов, длина и позиция текста, искажения входа, чужие запросы, языки и обученная логистическая регрессия на эмбеддингах. Для выбора между автоматической обработкой и эскалацией автор изучал не только точность, но и кривые риск–охват. Стоимость Jev считалась по собственным входным токенам: тариф на дату теста — $0.042 за миллион входных токенов, выход бесплатен.

Результаты

На 400 синтетических банковских примерах Jev достигла 97.8% точности; gpt-4.1-mini — 97.0%, статистически различимой разницы не показано. Jev отвечала с p50 346 мс и оценочной стоимостью $23 за миллион классификаций; для gpt-4.1-mini указаны 846 мс и $118. На MASSIVE с 30 классами точность составила 89.3% у Jev и 89.5% у gpt-4.1-mini. При пороге confidence 0.9 в этой задаче в автопоток попадало 82.9% ответов Jev с точностью 96.3%; у gpt-4.1-mini — 96.9% потока с точностью 91.0%, причём 83% её ошибок имели уверенность выше 0.9 против 29% у Jev. Однако настройка по доле трафика позволяла GPT ранжировать риск почти так же хорошо.

Добавление классов могло ухудшать точность и менять долю ошибок, пропускаемых порогом, поэтому порог приходилось подбирать заново. Исправление трёх дефектных описаний классов подняло точность на конкретной выборке с 86.7% до 90.2%; автор предупреждает, что эта выборка не была независимой. Пачка из 40 вопросов отвечала за 346 мс p50 и для длинного письма обходилась примерно на 86% дешевле, чем отдельные запросы. Уже 700 символов нейтрального наполнителя снижали точность Jev на трудной синтетической банковской задаче примерно на 4 п.п.; почтовая цитата и HTML также могли уводить ответы в класс readmail. Явный класс other обнаруживал близкие запросы вне схемы в 39 случаях из 40. На четырёх проверенных неанглийских языках падение точности Jev относительно английского составляло 1.5–2.8 п.п. При примерно 16 размеченных примерах на класс обученная логистическая регрессия на эмбеддингах сравнялась с Jev на MASSIVE, а на полном обучающем пуле достигла 91.5% против 89.6%.

Ограничения

Выводы относятся к одной версии модели — jev-1.13.0 — и ограниченному числу доменов и наборов данных. Самые сильные эффекты длинного контекста и преимущество над классическими методами на сдвинутых данных в основном измерялись на синтетике, созданной с помощью моделей Claude; рабочую почту и чаты автор не проверял. Выборки местами малы, поэтому отсутствие статистически значимого эффекта не доказывает его отсутствия. Исправление описаний оценивали на тех же примерах, где нашли ошибки; замер пачек проведён в один поток, а качество 39 из 40 вопросов в больших пачках отдельно не размечалось. Уверенность Jev — не вероятность, её шкала зависит от числа классов, а при повторах она иногда меняется. Сравнение GPT использовало один из способов оценки уверенности через logprobs; альтернативные способы не проверялись. Цены привязаны к дате теста, задержки — к маршруту Кипр–США; открытые модели класса System One систематически не сравнивались, fine-tuning трансформера не тестировался.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны таблицы по отдельным экспериментам, точные методики статистических проверок, примеры схем и запросов либо планируемые скрипты и сырые ответы.