Коротко
Автор создал OenoBench — тест из 3 266 вопросов о винных регионах, сортах, производстве и бизнесе — и проверил на нём 16 конфигураций моделей. Главный вывод не только в результатах моделей: автоматическая генерация масштабируется, но требует строгой проверки источников и самих вопросов, а тест в основном измеряет доступность знаний, а не рассуждение.
Контекст
Автор — специалист с дипломом WSET четвёртого уровня, работающий с языковыми моделями и ИИ в винной отрасли. Он хотел оценивать конкретные знания о вине, которых не показывают общие бенчмарки, и в одиночку построил корпус на открытых источниках. Статья описывает проект, поданный на NeurIPS 2026 в трек Datasets & Benchmarks; суммарные расходы на API составили около $800.
Главное
- OenoBench включает 3 266 вопросов с выбором ответа, шесть тематических доменов и четыре уровня сложности — от базового до уровня Master of Wine.
- База содержит 38 104 факта с source_id и URL; 34,3% фактов взяты из Wikipedia, 31,0% — из Wikidata, 12,4% — из датасетов HuggingFace и Kaggle, 22,2% — из других источников.
- Проверка происхождения данных обнаружила 17 скраперов без настоящих HTTP-запросов и ещё 8 частично ненадёжных. Автор удалил 12 563 факта без реального источника, переписал 17 скраперов и исправил 8.
- В генерации участвовали пять стратегий: fact_to_question, distractor_mining, template, scenario_synthesis и comparative. Для шаблонов использовали Haiku 4.5; генераторы через OpenRouter — Claude Opus 4.7, GPT-5.4, Gemini 3.1 Pro, Hermes-3 на Llama 3.1 405B и Qwen3 235B.
- Условие AVOID WORLD-KNOWLEDGE SOLVABILITY предписывало спрашивать об observable attribute из источника и возвращать skip, если факт содержал только знаменитое название без технической детали.
- Гейт решаемости без источника использовал Haiku 4.5 для L1, Sonnet 4.6 для L2 и Opus 4.7 для L3; порог уверенности — 0.6. Метку closed_book_solvable получили 1 601 вопрос.
- Первая ручная проверка выявила неверный ключ у 40% вопросов от Llama и 29% от Qwen; для этих генераторов добавили проверку ответа другой моделью с исходным фактом.
- Релизный аудит охватил 3 670 вопросов, потребовал 29 610 вызовов API, 5 часов 22 минуты и $75,79. После исключений и ручной проверки осталось 3 266 вопросов.
- На 341 отброшенном вопросе модели в среднем показали 64,1% против 73,3% на релизном корпусе, однако порядок моделей почти не менялся: корреляция рангов Спирмена составила ρ=0,996.
- По оценке автора, Anthropic-модели давали преимущество около 9–10 п. п. на вопросах, созданных Claude, тогда как у Gemini наблюдался обратный эффект; после учёта сложности и closed-book-метки эффект Anthropic сокращался примерно до 3 п. п.
Как сделано
Автор собрал факты из Wikipedia, Wikidata, HuggingFace и Kaggle, а также официальных источников вроде INAO, TTB и базы UC Davis. После выявления подмены реального скрапинга захардкоженными списками он переписал 17 скраперов, исправил ещё 8 и добился того, чтобы каждый факт имел ссылку на источник. Факты разбивались на атомарные утверждения, проверялись и относились к одному из шести доменов; сэмплер компенсировал перекос по странам.
Вопросы создавались пятью стратегиями и пятью генераторами через OpenRouter: Claude Opus 4.7, GPT-5.4, Gemini 3.1 Pro, Hermes-3 на Llama 3.1 405B и Qwen3 235B. Кандидаты проходили проверки формата, дубликатов и решаемости без источника; для вопросов от Llama и Qwen применялся дополнительный верификатор ключа. Затем десять агентов аудита проверяли стиль, копирование источника, ключи, неоднозначность, сложность и перекосы. Автор вручную калибровал их решения и после этого оценил 16 конфигураций моделей на тесте с выбором ответа.
Результаты
Итоговый корпус содержит 38 104 факта с источниками и 3 266 вопросов. На первоначальном этапе 17 из 35 скраперов фактически не обращались к источникам; после исправлений из базы удалили 12 563 неподтверждённых факта. В первом аудите 36% вопросов копировали источник, а 28% решались без него; фильтр копирования снизил долю до 1,7%, но проблема решаемости без источника осталась и в релизе затрагивала 40% вопросов. Прогон 16 конфигураций дал 52 256 ответов и стоил $98,33. o3, GPT-5, Gemini 2.5 Pro и Opus 4.7 расположились в пределах 2,6 процентного пункта; Opus 4.7 без рассуждения набрал около 81% за $3,35 на весь корпус. GPT-5-mini набрал 78,4% и показал лучший результат на домене винного бизнеса — 66,3%. На вопросах, помеченных как решаемые без источника, фронтирные модели набрали 96–97%, а на остальных — 65–70%. Проверка 500 вопросов с предоставлением исходных фактов подняла точность GPT-5 примерно до 99%, что указывает: тест преимущественно измеряет наличие знаний, а не рассуждение.
Ограничения
Статья описывает один проект, а автор сам признаёт, что корпус и аудит не свободны от дефектов. Ни одна из проверенных рубрик аудиторов не достигла κ Коэна 0,6; судьи иногда соглашались с неверным ключом, а модели-фронтиры считали решаемыми без источника гораздо больше вопросов, чем эксперт-человек. Из 97 вопросов, на которые не ответила ни одна модель, только 14 автор счёл честно сложными; остальные содержали ошибки или неоднозначности. В базе есть перекос источников и стран, в частности избыточное представление Португалии из-за данных Wikidata. Сильный результат отдельных моделей и выводы о self-preference зависят от конкретного корпуса и конфигураций; объяснение отрицательного эффекта Gemini автор называет гипотезой. Некоторые сравнения режимов рассуждения несопоставимы. Инфраструктура и подписка Claude Code не включены в оценку расходов, а часть примерно $797 расходов на OpenRouter не распределена по статьям.
Что взять себе
- Если используете ИИ для подготовки датасетов, отдельно проверяйте происхождение данных: правдоподобный код и тесты не доказывают, что скрапер действительно получил сведения из источника.
- Дайте генератору право пропустить неподходящий материал; это может предотвратить больше плохих примеров, чем последующая фильтрация.
- Не считайте согласие нескольких моделей независимой проверкой: общий дефект формулировки или посылки может привести их к одному неверному ответу.
- Проверяйте вопросы с исходным фактом: если модель не может выбрать правильный вариант даже с ним, вероятно, проблема в ключе или формулировке.
- Не оценивайте модель только вопросами, созданными ею или её близкой версией; смещение может быть как в пользу, так и против генератора.
Читать оригинал, если…
Откройте оригинал, если нужны таблицы результатов по всем 16 конфигурациям, детали реализации скраперов и аудиторских агентов, ссылки на код и датасет или разбор конкретных вопросов и ошибок.