llm-dali-director · пятый метапромт GPT, ответ на мою поправку о коммитахЯ сказал: «коммиты писал Claude Code, значит в обучение им нельзя». Метапромт v5 отвечает: репозиторий - это не только решения, это задачи + среды + тесты + критерии приёмки, и это самый ценный собственный актив. Он прав. Задача и её приёмка - не «вывод Claude, использованный для обучения модели»: обучаемая модель никогда не получает их как цель, она получает их как условие и проверяется ими. Решение пишет открытая модель, тесты решают, прошло ли. Именно так у нас и построено: 111 кандидатов, 28 проверенных пар «красный до, зелёный после», стенд, который откатывает состояние и гоняет приёмку.
Где v5 неправ: раздел 5 велит использовать исторические решения Claude для «SFT, имитации, дистилляции». Это ровно то, что условия Anthropic запрещают, и никакая метка solution_origin=claude_code этого не меняет. Метка нужна для честности, но она не даёт права. Набор B (исторические решения) остаётся эталонной полкой: базовая оценка «насколько трудна задача», сверка, анализ - не цель обучения.
| Что | Число | Откуда |
|---|---|---|
| Репозиториев с историей | 34 | разведка 11.09 |
| Коммитов в трёх крупнейших | 16 271 | bookgravity 5082, сеть 6434, портал 4755 |
| Коммитов с правкой и теста, и кода | 111 | 110 в body-anchor-engine, 1 в vektor |
| Проверенных пар (красный до, зелёный после) | 28 из 110 | отборщик, выход 25% |
| Отсеяно как фиктивные (абсолютный путь в приёмке) | большинство отсева | задача решалась бы сама |
| body-anchor-engine: коммитов / трогают тесты / откатов | 445 / 118 / 1 | git log |
| Репозитории без юнит-тестов, но со стражами | bookgravity 69, vektor 19 | другая культура проверки |
Вывод: «50-100 задач из одного репозитория» (раздел 22) сегодня даёт 28 из одного и 0 из остальных. Второй источник задач - стражи, не тесты; их 88, они уже в плане.
| Пункт v5 | У нас | Состояние |
|---|---|---|
| Архитектура, каталоги | bench/ agent/ providers/ evaluation/ datasets/ experiments/ | есть |
| Схема задачи | bench/zadachi.jsonl: repo, sha, parent, tests, srcs, kod_do | есть, без полей происхождения |
| Модель происхождения (раздел 2) | - | нет, поправка 12 |
| Движок повтора (раздел 13) | sobrat_stend: клон из заготовки, checkout parent, приёмка из sha | есть, доказан |
| Песочница | realpath, разделитель, без оболочки, 6 обходов отбиты | есть |
| Запуск тестов | проверяющий контрольного стенда | есть |
| Защита от подмены тестов (раздел 8) | агенту была разрешена запись в scripts/, где лежит приёмка | дыра, закрыта сегодня: приёмка сверяется с коммитом, расхождение = вердикт «подмена» |
| Слой моделей | providers/, третий исход | есть |
| Оценка | progon.py, razbor.py, приватный набор 25 | есть; без ярусов train/val/test/holdout |
| Журнал экспериментов | experiments/ZHURNAL.md | есть |
| Версии наборов (раздел 21) | - | нет, поправка 12 |
| Траектории агента (раздел 9, 11) | журнал шагов *.jsonl: вызовы, проверки, отказы, починки | есть как сырьё; попыток «провал-провал-зачёт» уже 5 в пилоте |
| Модель стоимости | замер токенов, $ за попытку | есть по факту пилота |
solution_origin обязательно, значение claude_code означает «не для весов».dataset-v0.N с манифестом включений и исключений. Ярусы train / validation / test / holdout делятся по репозиторию и по времени, holdout никогда не в обучении.EXP-2026-001b, 5 из 10 прогонов: все отказы на пределе 20 шагов. GLM-5.3 дважды не написала ни строки, Kimi K3 и DeepSeek V4 Pro дошли до проверки (1 и 2 раза) и не успели починить. Это уже материал раздела 11 v5 - «попытка провалилась, попытка провалилась» - и это первые честные цифры про то, где ломаются открытые веса на нашей задаче.