Skip to content
Neuronavt
Go back

OenoBench: бенчмарк знаний моделей о вине

Кейс8/10

Коротко

Автор создал OenoBench — тест из 3 266 вопросов о винных регионах, сортах, производстве и бизнесе — и проверил на нём 16 конфигураций моделей. Главный вывод не только в результатах моделей: автоматическая генерация масштабируется, но требует строгой проверки источников и самих вопросов, а тест в основном измеряет доступность знаний, а не рассуждение.

Контекст

Автор — специалист с дипломом WSET четвёртого уровня, работающий с языковыми моделями и ИИ в винной отрасли. Он хотел оценивать конкретные знания о вине, которых не показывают общие бенчмарки, и в одиночку построил корпус на открытых источниках. Статья описывает проект, поданный на NeurIPS 2026 в трек Datasets & Benchmarks; суммарные расходы на API составили около $800.

Главное

Как сделано

Автор собрал факты из Wikipedia, Wikidata, HuggingFace и Kaggle, а также официальных источников вроде INAO, TTB и базы UC Davis. После выявления подмены реального скрапинга захардкоженными списками он переписал 17 скраперов, исправил ещё 8 и добился того, чтобы каждый факт имел ссылку на источник. Факты разбивались на атомарные утверждения, проверялись и относились к одному из шести доменов; сэмплер компенсировал перекос по странам.

Вопросы создавались пятью стратегиями и пятью генераторами через OpenRouter: Claude Opus 4.7, GPT-5.4, Gemini 3.1 Pro, Hermes-3 на Llama 3.1 405B и Qwen3 235B. Кандидаты проходили проверки формата, дубликатов и решаемости без источника; для вопросов от Llama и Qwen применялся дополнительный верификатор ключа. Затем десять агентов аудита проверяли стиль, копирование источника, ключи, неоднозначность, сложность и перекосы. Автор вручную калибровал их решения и после этого оценил 16 конфигураций моделей на тесте с выбором ответа.

Результаты

Итоговый корпус содержит 38 104 факта с источниками и 3 266 вопросов. На первоначальном этапе 17 из 35 скраперов фактически не обращались к источникам; после исправлений из базы удалили 12 563 неподтверждённых факта. В первом аудите 36% вопросов копировали источник, а 28% решались без него; фильтр копирования снизил долю до 1,7%, но проблема решаемости без источника осталась и в релизе затрагивала 40% вопросов. Прогон 16 конфигураций дал 52 256 ответов и стоил $98,33. o3, GPT-5, Gemini 2.5 Pro и Opus 4.7 расположились в пределах 2,6 процентного пункта; Opus 4.7 без рассуждения набрал около 81% за $3,35 на весь корпус. GPT-5-mini набрал 78,4% и показал лучший результат на домене винного бизнеса — 66,3%. На вопросах, помеченных как решаемые без источника, фронтирные модели набрали 96–97%, а на остальных — 65–70%. Проверка 500 вопросов с предоставлением исходных фактов подняла точность GPT-5 примерно до 99%, что указывает: тест преимущественно измеряет наличие знаний, а не рассуждение.

Ограничения

Статья описывает один проект, а автор сам признаёт, что корпус и аудит не свободны от дефектов. Ни одна из проверенных рубрик аудиторов не достигла κ Коэна 0,6; судьи иногда соглашались с неверным ключом, а модели-фронтиры считали решаемыми без источника гораздо больше вопросов, чем эксперт-человек. Из 97 вопросов, на которые не ответила ни одна модель, только 14 автор счёл честно сложными; остальные содержали ошибки или неоднозначности. В базе есть перекос источников и стран, в частности избыточное представление Португалии из-за данных Wikidata. Сильный результат отдельных моделей и выводы о self-preference зависят от конкретного корпуса и конфигураций; объяснение отрицательного эффекта Gemini автор называет гипотезой. Некоторые сравнения режимов рассуждения несопоставимы. Инфраструктура и подписка Claude Code не включены в оценку расходов, а часть примерно $797 расходов на OpenRouter не распределена по статьям.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны таблицы результатов по всем 16 конфигурациям, детали реализации скраперов и аудиторских агентов, ссылки на код и датасет или разбор конкретных вопросов и ошибок.