Skip to content
Neuronavt
Go back

Проверка скиллов Claude Code против плацебо

Исследование8/10

Коротко

Автор сравнил девять популярных скиллов для программирования с нейтральными текстами той же длины на 450 запусках Claude Code. Большинство не показало убедимого преимущества; два немного снизили стоимость относительно плацебо, а planning-with-files ухудшил долю решённых задач.

Контекст

Автор независимого исследования собрал популярные универсальные скиллы и плагины для кодовых агентов, чтобы отделить пользу инструкций от влияния дополнительного текста в контексте. Ни с одним автором скиллов он не связан и финансирования от них не получал; стенд и анализ частично создавались с помощью Claude Code.

Главное

Как сделано

Для девяти скиллов, зафиксированных на конкретных коммитах и установленных по README, автор подготовил пять нейтральных текстов-плацебо. Их длина соответствовала всегда присутствующей в контексте части скиллов с допуском до 10%; в них не было рабочих советов или названий скиллов. На каждый скилл сравнивались три условия: без добавки, с плацебо и с самим скиллом.

Испытания запускались в чистых Docker-контейнерах через Harbor: Claude Code 2.1.282, claude-opus-5-5, средний уровень рассуждений. Использовались 15 задач из SWE-bench Verified, Terminal-Bench 2.1 и OpenThoughts-TBLite; проверка шла тестами задач, без LLM-судей. Провели по 30 запусков на каждую группу — всего 450. Стоимость оценивали по токенам и публичным тарифам API. Доверительные интервалы получали бутстрапом по задачам, для девяти сравнений применяли поправку Холма.

Метод и критерии вердикта были зафиксированы до первого запуска. Запланированные 1 125 запусков остановили на 450 из-за нагрузки на Mac — до просмотра результатов по группам. В день публикации исправили ошибку: два запуска, превысившие лимит в 20 минут, ошибочно считались успешными при прошедших тестах. После исправления planning-with-files получил вердикт «хуже плацебо».

Результаты

Относительно плацебо ponytail снизил среднюю стоимость на 12% (R=0,88; 95% ДИ 0,76–0,97), а agent-skills — на 5% (R=0,95; 0,90–0,99); скорректированное p у обоих — 0,049, то есть результаты на границе принятого порога. У planning-with-files решено 80% задач против 100% с плацебо, при этом стоимость не изменилась. Остальные шесть скиллов, включая superpowers, не показали убедимого отличия от плацебо.

Относительно работы вообще без скилла ни один не оказался заметно дешевле. Сам плацебо повышал стоимость на 2–16%; ponytail был примерно на уровне базовой работы (R=0,99; 95% ДИ 0,81–1,13), а agent-skills стоил на 9% дороже (1,09; 1,02–1,19). Для caveman заявленное в README сокращение токенов ответов на 65% не подтвердилось: против базовой работы ответы сократились на 2% с интервалом, включающим отсутствие эффекта, а общий расход токенов вырос на 18%, стоимость — на 14%. У ponytail стоимость против базы изменилась на −1%, а итоговый дифф был меньше на 13%, но оценка диффа особенно неточна.

По Codex был только небольшой пилот: три скилла, пять задач и по 10 запусков на группу. В нём agent-skills и compound-engineering оказались дороже плацебо на 24% и 42%, но автор не считает выборку достаточной для выводов.

Ограничения

Исследована только одна модель и один уровень рассуждений; на других моделях результат может отличаться. Задачи короткие и публичные, а Opus мог встречать их при обучении. Модель решала большинство задач, поэтому доля решённых имеет широкую неопределённость — около ±10 процентных пунктов при 30 запусках. Испытание не оценивает длительные сессии, память и многодневное планирование. Расходы рассчитаны по публичным ценам, хотя запуски выполнялись по подписке, поэтому это оценка, а не фактический счёт. Проверены лишь 15 задач; заявления в README сделаны на других наборах, моделях и базовых линиях. Codex-результат пилотный. Кроме того, исследование сравнивает плацебо по длине, но автор отмечает, что будущая контрольная группа с перемешанными предложениями могла бы отделить эффект темы от эффекта рабочей процедуры.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны таблица результатов и интервалы по каждому скиллу, журнал поправок к методу, логи запусков, инструкции по повторению или подробности пилота Codex.