Skip to content
Neuronavt
Go back

Как повышать компетентность малой языковой модели

Исследование7/10

Коротко

Автор исследует, можно ли улучшать компетентность модели 3B без увеличения её весов: через контекстную доставку проверенных решений и локальное обучение. Близкий пример задачи заметно повышает решаемость, а эффект одного цикла LoRA положителен, но пока не доказывает долговременный рост.

Контекст

Автор описывает двухмесячный исследовательский проект на бытовой GPU с 12 ГБ видеопамяти. Цель — измерить отдельно пользу проверенных решений в контексте, усвоение знаний весами и эффект повторных циклов обучения; основной полигон — синтетические задачи программирования с автоматической проверкой.

Главное

Как сделано

Эксперименты предварительно фиксируют: критерии, сиды, наборы задач и их хеши. Ответы проверяются в цепочке компиляция → тесты → интеграция → регрессия; неуверенный результат может быть UNKNOWN. Сырые логи независимо пересчитываются отдельным кодом.

Для проверки доставки знаний модель решала свежие задачи, получая в контексте верифицированное решение похожей (NEAR) или далёкой (FAR) задачи. Для проверки интернализации применялась LoRA-дистилляция с r=8, 40 шагами на 80 проверенных решениях, после чего модель проходила экзамен без подсказки. Отдельный текущий эксперимент сравнивает четыре цикла обучения и три режима: накопление весов, сброс к исходной модели и отсутствие обучения.

Состояние памяти обновляется транзакционно: подготовка записи, проверка и commit/rollback; журналирование и хеш-цепочка нужны для отслеживания происхождения изменений. Форензик-чекер проверяет целостность прогонов, а монитор каждые 15 минут перечитывает активный лог.

Результаты

В одном замере с 40 задачами базовая решаемость составила 50%, с NEAR-референсом — 80% (+30 процентных пунктов; p=0.004, Holm-corrected p=0.008), а с FAR-референсом — 45% (изменение статистически незначимо). На трёх сидах эффект доставки составил +18.3 п.п. (p=0.0003); промежуточная дистанция дала промежуточный результат. Собственный оракул обеспечил 100% — потолочный контроль.

После одного цикла LoRA результат экзамена без подсказок вырос с 52.75% до 57.25% (+4.5 п.п.; McNemar p=0.011, Holm p=0.023). Автор сообщает β=+0.145 с 95%-м интервалом [+0.0575, +0.250], но подчёркивает, что одной точки недостаточно, чтобы заключить, что многократное обучение ведёт к дальнейшему росту. Текущий четырёхцикловый эксперимент пока неполный: ранняя траектория выглядит как скачок после первого цикла и последующее плато, но выводов автор не делает.

Инфраструктурная проверка пересчитала исторические результаты: сошлись 51 из 51 проверок. Форензик-чекер включает 17 типов проверок и, по тестам с внесением ошибок, обнаруживает все 15 проверявшихся классов порчи.

Ограничения

Убедительно измерена польза контекстной доставки на программных задачах, но её перенос на другие семейства задач не проверен. Рост компетентности при повторном обучении ещё не установлен: текущие данные неполные, порог значимого роста не определён. Для обучаемого интерфейса без доставки указано +10 п.п., p=0.219 — эффект не подтверждён. Результаты ограничены малой моделью, небольшими наборами задач и верифицируемым программным доменом; численные выводы обобщать на неверифицируемые области нельзя. Стоимость и длительность прогонов подробно не указаны.

Что взять себе

Читать оригинал, если…

Откройте оригинал, если нужны репозиторий, протоколы, сырые данные, код анализаторов и подробности незавершённого эксперимента с кривой обучения.