Коротко
Автор сравнил девять популярных скиллов для программирования с нейтральными текстами той же длины на 450 запусках Claude Code. Большинство не показало убедимого преимущества; два немного снизили стоимость относительно плацебо, а planning-with-files ухудшил долю решённых задач.
Контекст
Автор независимого исследования собрал популярные универсальные скиллы и плагины для кодовых агентов, чтобы отделить пользу инструкций от влияния дополнительного текста в контексте. Ни с одним автором скиллов он не связан и финансирования от них не получал; стенд и анализ частично создавались с помощью Claude Code.
Главное
- Проверены девять универсальных скиллов; среди них superpowers, mattpocock/skills, andrej-karpathy-skills, ponytail, caveman, agent-skills, i-have-adhd, planning-with-files и compound-engineering.
- Для контроля дополнительного текста использованы пять плацебо, сопоставленных по длине; плацебо не содержали инструкций по планированию, тестированию или стилю работы.
- Основной стенд: Claude Code 2.1.282 и claude-opus-5-5 со средним уровнем рассуждений; 15 задач из SWE-bench Verified, Terminal-Bench 2.1 и OpenThoughts-TBLite.
- Каждый запуск происходил в чистом Docker-контейнере через Harbor; задачи оценивались собственными тестами, а не LLM-судьями.
- Сравнивались три условия — без скилла, с плацебо и со скиллом; по 30 запусков на группу, всего 450.
- Лучшие относительно плацебо результаты по стоимости: ponytail — на 12% ниже, agent-skills — на 5% ниже; для обоих скорректированное p=0,049.
- После исправления ошибки учёта таймаутов planning-with-files оказался хуже плацебо по успешности: 80% решённых задач против 100%; стоимость не различалась.
- Нейтральная добавка сама по себе увеличивала стоимость на 2–16%, а ни один скилл не оказался заметно дешевле базовой работы без скилла.
- Для caveman заявленное сокращение токенов ответов на 65% не воспроизвелось: измерено −2% ответных токенов, но +18% общего расхода и +14% стоимости относительно работы без скилла.
- Пилот Codex на gpt-6-sol был мал: три скилла, пять задач и 10 запусков на группу; автор не делает по нему надёжных выводов.
Как сделано
Для девяти скиллов, зафиксированных на конкретных коммитах и установленных по README, автор подготовил пять нейтральных текстов-плацебо. Их длина соответствовала всегда присутствующей в контексте части скиллов с допуском до 10%; в них не было рабочих советов или названий скиллов. На каждый скилл сравнивались три условия: без добавки, с плацебо и с самим скиллом.
Испытания запускались в чистых Docker-контейнерах через Harbor: Claude Code 2.1.282, claude-opus-5-5, средний уровень рассуждений. Использовались 15 задач из SWE-bench Verified, Terminal-Bench 2.1 и OpenThoughts-TBLite; проверка шла тестами задач, без LLM-судей. Провели по 30 запусков на каждую группу — всего 450. Стоимость оценивали по токенам и публичным тарифам API. Доверительные интервалы получали бутстрапом по задачам, для девяти сравнений применяли поправку Холма.
Метод и критерии вердикта были зафиксированы до первого запуска. Запланированные 1 125 запусков остановили на 450 из-за нагрузки на Mac — до просмотра результатов по группам. В день публикации исправили ошибку: два запуска, превысившие лимит в 20 минут, ошибочно считались успешными при прошедших тестах. После исправления planning-with-files получил вердикт «хуже плацебо».
Результаты
Относительно плацебо ponytail снизил среднюю стоимость на 12% (R=0,88; 95% ДИ 0,76–0,97), а agent-skills — на 5% (R=0,95; 0,90–0,99); скорректированное p у обоих — 0,049, то есть результаты на границе принятого порога. У planning-with-files решено 80% задач против 100% с плацебо, при этом стоимость не изменилась. Остальные шесть скиллов, включая superpowers, не показали убедимого отличия от плацебо.
Относительно работы вообще без скилла ни один не оказался заметно дешевле. Сам плацебо повышал стоимость на 2–16%; ponytail был примерно на уровне базовой работы (R=0,99; 95% ДИ 0,81–1,13), а agent-skills стоил на 9% дороже (1,09; 1,02–1,19). Для caveman заявленное в README сокращение токенов ответов на 65% не подтвердилось: против базовой работы ответы сократились на 2% с интервалом, включающим отсутствие эффекта, а общий расход токенов вырос на 18%, стоимость — на 14%. У ponytail стоимость против базы изменилась на −1%, а итоговый дифф был меньше на 13%, но оценка диффа особенно неточна.
По Codex был только небольшой пилот: три скилла, пять задач и по 10 запусков на группу. В нём agent-skills и compound-engineering оказались дороже плацебо на 24% и 42%, но автор не считает выборку достаточной для выводов.
Ограничения
Исследована только одна модель и один уровень рассуждений; на других моделях результат может отличаться. Задачи короткие и публичные, а Opus мог встречать их при обучении. Модель решала большинство задач, поэтому доля решённых имеет широкую неопределённость — около ±10 процентных пунктов при 30 запусках. Испытание не оценивает длительные сессии, память и многодневное планирование. Расходы рассчитаны по публичным ценам, хотя запуски выполнялись по подписке, поэтому это оценка, а не фактический счёт. Проверены лишь 15 задач; заявления в README сделаны на других наборах, моделях и базовых линиях. Codex-результат пилотный. Кроме того, исследование сравнивает плацебо по длине, но автор отмечает, что будущая контрольная группа с перемешанными предложениями могла бы отделить эффект темы от эффекта рабочей процедуры.
Что взять себе
- Не принимайте цифры экономии из README за универсальные: эффект зависит от модели, задач, базовой линии и того, как считаются токены.
- Учитывайте стоимость текста, постоянно добавляемого в контекст: даже полезные инструкции могут обходиться дороже, чем работа без скилла.
- Если сравниваете скиллы сами, используйте контроль равной длины, заранее зафиксированные критерии и повторные запуски; простого сравнения «со скиллом/без него» недостаточно.
- Учитывайте неопределённость: пограничное снижение стоимости не означает крупного или гарантированного выигрыша, а краткие задачи не проверяют пользу долгосрочного планирования.
Читать оригинал, если…
Откройте оригинал, если нужны таблица результатов и интервалы по каждому скиллу, журнал поправок к методу, логи запусков, инструкции по повторению или подробности пилота Codex.