Коротко
Автор исследует, можно ли улучшать компетентность модели 3B без увеличения её весов: через контекстную доставку проверенных решений и локальное обучение. Близкий пример задачи заметно повышает решаемость, а эффект одного цикла LoRA положителен, но пока не доказывает долговременный рост.
Контекст
Автор описывает двухмесячный исследовательский проект на бытовой GPU с 12 ГБ видеопамяти. Цель — измерить отдельно пользу проверенных решений в контексте, усвоение знаний весами и эффект повторных циклов обучения; основной полигон — синтетические задачи программирования с автоматической проверкой.
Главное
- Исследование разделяет три эффекта: подсказка с решением в контексте, усвоение в весах и накопление эффекта при повторных циклах.
- Основной стенд — модель 3B на GPU с 12 ГБ видеопамяти; задачи проверяются в песочнице полным набором тестов.
- В тесте доставки использованы 200 свежих задач одного семейства; для каждой подготовили проверенные NEAR- и FAR-решения. В таблице результатов указан n=40.
- NEAR-референс повысил решаемость с 50% до 80%; FAR дал 45%, без статистически значимого эффекта. Воспроизведение на трёх сидах показало +18.3 п.п.
- Обучение — LoRA-дистилляция, r=8 и 40 шагов на 80 проверенных решениях; экзамен проходил без доставки примеров.
- Один цикл обучения поднял результат с 52.75% до 57.25%, но автор не трактует это как доказательство устойчивого роста.
- Эксперимент формы кривой рассчитан на 4 цикла × 2 траектории × 3 группы и 200 фиксированных экзаменационных задач; ранние данные похожи на скачок с плато, но признаны недостаточными.
- В протоколе предусмотрены предварительная фиксация сидов и пулов задач, хеширование, независимый пересчёт логов и допустимое состояние UNKNOWN.
- Два обнаруженных сбоя: ключ возобновления не учитывал экспериментальную группу и мог пропускать контроль; при bf16-логитах -inf энтропия давала NaN через 0 × (-inf).
- Открытая инфраструктура включает 286 тестов, транзакционную память с provenance и хеш-цепочкой, а также 17 типов проверок целостности.
Как сделано
Эксперименты предварительно фиксируют: критерии, сиды, наборы задач и их хеши. Ответы проверяются в цепочке компиляция → тесты → интеграция → регрессия; неуверенный результат может быть UNKNOWN. Сырые логи независимо пересчитываются отдельным кодом.
Для проверки доставки знаний модель решала свежие задачи, получая в контексте верифицированное решение похожей (NEAR) или далёкой (FAR) задачи. Для проверки интернализации применялась LoRA-дистилляция с r=8, 40 шагами на 80 проверенных решениях, после чего модель проходила экзамен без подсказки. Отдельный текущий эксперимент сравнивает четыре цикла обучения и три режима: накопление весов, сброс к исходной модели и отсутствие обучения.
Состояние памяти обновляется транзакционно: подготовка записи, проверка и commit/rollback; журналирование и хеш-цепочка нужны для отслеживания происхождения изменений. Форензик-чекер проверяет целостность прогонов, а монитор каждые 15 минут перечитывает активный лог.
Результаты
В одном замере с 40 задачами базовая решаемость составила 50%, с NEAR-референсом — 80% (+30 процентных пунктов; p=0.004, Holm-corrected p=0.008), а с FAR-референсом — 45% (изменение статистически незначимо). На трёх сидах эффект доставки составил +18.3 п.п. (p=0.0003); промежуточная дистанция дала промежуточный результат. Собственный оракул обеспечил 100% — потолочный контроль.
После одного цикла LoRA результат экзамена без подсказок вырос с 52.75% до 57.25% (+4.5 п.п.; McNemar p=0.011, Holm p=0.023). Автор сообщает β=+0.145 с 95%-м интервалом [+0.0575, +0.250], но подчёркивает, что одной точки недостаточно, чтобы заключить, что многократное обучение ведёт к дальнейшему росту. Текущий четырёхцикловый эксперимент пока неполный: ранняя траектория выглядит как скачок после первого цикла и последующее плато, но выводов автор не делает.
Инфраструктурная проверка пересчитала исторические результаты: сошлись 51 из 51 проверок. Форензик-чекер включает 17 типов проверок и, по тестам с внесением ошибок, обнаруживает все 15 проверявшихся классов порчи.
Ограничения
Убедительно измерена польза контекстной доставки на программных задачах, но её перенос на другие семейства задач не проверен. Рост компетентности при повторном обучении ещё не установлен: текущие данные неполные, порог значимого роста не определён. Для обучаемого интерфейса без доставки указано +10 п.п., p=0.219 — эффект не подтверждён. Результаты ограничены малой моделью, небольшими наборами задач и верифицируемым программным доменом; численные выводы обобщать на неверифицируемые области нельзя. Стоимость и длительность прогонов подробно не указаны.
Что взять себе
- Контекстная подсказка с решением близкой задачи может помочь сильнее, чем далёкий пример; похожесть примера важна.
- Не смешивайте улучшение за счёт подсказки с обучением модели: проверяйте способность решать задачу после удаления контекста.
- Один успешный цикл обучения показывает возможный эффект, но не доказывает continual learning — нужны несколько циклов и контрольные группы.
- Предварительно фиксируйте протокол и автоматически проверяйте логи: ошибки в возобновлении прогонов и численной устойчивости способны испортить выводы.
- Для задач без надёжного автоматического верификатора эти результаты пока не дают готового способа измерения компетентности.
Читать оригинал, если…
Откройте оригинал, если нужны репозиторий, протоколы, сырые данные, код анализаторов и подробности незавершённого эксперимента с кривой обучения.