Коротко
Автор протестировал Jev версии jev-1.13.0 на примерно 160 тысячах запросов и сравнил её с моделями OpenAI и классическими классификаторами. Jev показала точность на уровне gpt-4.1-mini при меньших цене и задержке, но её confidence нельзя считать вероятностью и нужно заново калибровать после изменения схемы классов.
Контекст
Автор проверял Jev для себя и своей команды, чтобы понять, где модель пригодна для практической классификации и автоматической маршрутизации, а где нужны очистка входа или дополнительная проверка. С 19 по 30 сентября 2026 года он провёл 22 эксперимента через API раннего доступа, отправил около 160 тысяч запросов к jev-1.13.0 и контрольным моделям OpenAI; затраты составили примерно $18. Jev принимает текст и вопросы с вариантами или шкалами, а не генерирует текст.
Главное
- Jev не генерирует ответы: она принимает state и вопросы типов choice, score или noul и возвращает классы либо числовые оценки с распределениями вероятностей.
- Серия охватила 22 эксперимента и около 160 тысяч запросов к jev-1.13.0; тестирование проходило через API раннего доступа и стоило примерно $18.
- На 400 синтетических банковских примерах Jev показала 97.8%, gpt-4.1-mini — 97.0%, gpt-4.1-nano — 93.5%; значимое отставание среди этих моделей показала nano.
- Для 30 классов MASSIVE результаты Jev и gpt-4.1-mini практически совпали: 89.3% и 89.5%; Jev в банковском сравнении отвечала быстрее и стоила дешевле.
- Confidence Jev не является вероятностью и зависит от числа классов. На 30 классах порог 0.9 пропускал в автопоток 29% ошибок Jev и 83% ошибок gpt-4.1-mini, но GPT хорошо ранжировала риск при отсечении фиксированной доли трафика.
- Порог confidence нельзя переносить между схемами: добавление классов меняло точность и состав ошибок; после изменения схемы его следует перекалибровать на размеченной выборке.
- Описания классов — важный рычаг: исправление трёх дефектных описаний повысило точность на тестовой выборке с 86.7% до 90.2%. С корректными описаниями имена меток влияли на общую точность мало; без описаний они могли резко менять результат.
- Пачка из 40 вопросов к одному тексту отвечала с p50 346 мс; для письма в 2000 символов она снижала оценочную стоимость на 86% по сравнению с отдельными запросами.
- Нерелевантный текст вредил Jev уже при добавлении около 700 символов на трудной синтетической задаче; позиция обращения влияла на уверенность, но статистически убедительного эффекта позиции на точность не показано.
- Чужой вход лучше обрабатывать явным классом other: он выявил 39 из 40 близких по теме запросов вне схемы. При нескольких сотнях размеченных примеров логистическая регрессия на эмбеддингах может стать более сильной альтернативой.
Как сделано
В основном сравнении Jev и модели OpenAI получали одни и те же примеры и одинаковые описания классов без обучающих примеров; GPT также использовала structured output и temperature = 0. Для оценки её уверенности автор извлекал вероятности токенов меток через top_logprobs = 20 и нормировал их по классам. Замеры задержки проводились через OpenRouter, последовательно, с машины на Кипре; первые пять запросов исключались как прогрев. Анализ включал синтетические банковские обращения, срез banking77, MASSIVE на нескольких языках, BoolQ и Yelp; применялись парные сравнения, поправка Холма и бутстрэп по примерам.
Отдельно проверялись пороги автоматической обработки, изменение числа классов, формулировки и порядок схемы, пачечная отправка нескольких вопросов, длина и позиция текста, искажения входа, чужие запросы, языки и обученная логистическая регрессия на эмбеддингах. Для выбора между автоматической обработкой и эскалацией автор изучал не только точность, но и кривые риск–охват. Стоимость Jev считалась по собственным входным токенам: тариф на дату теста — $0.042 за миллион входных токенов, выход бесплатен.
Результаты
На 400 синтетических банковских примерах Jev достигла 97.8% точности; gpt-4.1-mini — 97.0%, статистически различимой разницы не показано. Jev отвечала с p50 346 мс и оценочной стоимостью $23 за миллион классификаций; для gpt-4.1-mini указаны 846 мс и $118. На MASSIVE с 30 классами точность составила 89.3% у Jev и 89.5% у gpt-4.1-mini. При пороге confidence 0.9 в этой задаче в автопоток попадало 82.9% ответов Jev с точностью 96.3%; у gpt-4.1-mini — 96.9% потока с точностью 91.0%, причём 83% её ошибок имели уверенность выше 0.9 против 29% у Jev. Однако настройка по доле трафика позволяла GPT ранжировать риск почти так же хорошо.
Добавление классов могло ухудшать точность и менять долю ошибок, пропускаемых порогом, поэтому порог приходилось подбирать заново. Исправление трёх дефектных описаний классов подняло точность на конкретной выборке с 86.7% до 90.2%; автор предупреждает, что эта выборка не была независимой. Пачка из 40 вопросов отвечала за 346 мс p50 и для длинного письма обходилась примерно на 86% дешевле, чем отдельные запросы. Уже 700 символов нейтрального наполнителя снижали точность Jev на трудной синтетической банковской задаче примерно на 4 п.п.; почтовая цитата и HTML также могли уводить ответы в класс readmail. Явный класс other обнаруживал близкие запросы вне схемы в 39 случаях из 40. На четырёх проверенных неанглийских языках падение точности Jev относительно английского составляло 1.5–2.8 п.п. При примерно 16 размеченных примерах на класс обученная логистическая регрессия на эмбеддингах сравнялась с Jev на MASSIVE, а на полном обучающем пуле достигла 91.5% против 89.6%.
Ограничения
Выводы относятся к одной версии модели — jev-1.13.0 — и ограниченному числу доменов и наборов данных. Самые сильные эффекты длинного контекста и преимущество над классическими методами на сдвинутых данных в основном измерялись на синтетике, созданной с помощью моделей Claude; рабочую почту и чаты автор не проверял. Выборки местами малы, поэтому отсутствие статистически значимого эффекта не доказывает его отсутствия. Исправление описаний оценивали на тех же примерах, где нашли ошибки; замер пачек проведён в один поток, а качество 39 из 40 вопросов в больших пачках отдельно не размечалось. Уверенность Jev — не вероятность, её шкала зависит от числа классов, а при повторах она иногда меняется. Сравнение GPT использовало один из способов оценки уверенности через logprobs; альтернативные способы не проверялись. Цены привязаны к дате теста, задержки — к маршруту Кипр–США; открытые модели класса System One систематически не сравнивались, fine-tuning трансформера не тестировался.
Что взять себе
- Перед автоматизацией проверьте не только точность, но и то, как confidence связан с ошибками; порог подбирайте на собственных размеченных данных.
- Перекалибруйте порог после добавления, удаления или переопределения классов; описания должны точно соответствовать данным, а качество стоит смотреть по каждому классу.
- Отправляйте все вопросы к одному тексту одним запросом, если схема и ограничения API это позволяют; проверяйте стабильность ответов в больших пачках.
- Для входов вне таксономии предусмотрите отдельный класс other, а для длинных писем удаляйте фрагменты, похожие на конкурирующие классы, например цитаты и HTML.
- Сравните Jev с обученным классификатором на эмбеддингах, если у вас уже есть несколько сотен размеченных примеров из стабильного рабочего потока.
Читать оригинал, если…
Откройте оригинал, если нужны таблицы по отдельным экспериментам, точные методики статистических проверок, примеры схем и запросов либо планируемые скрипты и сырые ответы.