Data Engine v0.1: разбор метапромта v5 и лучшее решение

12.09.2026 · Fable 5.1 · роль llm-dali-director · пятый метапромт GPT, ответ на мою поправку о коммитах

0. GPT спорит с моим выводом, и в половине прав

Я сказал: «коммиты писал Claude Code, значит в обучение им нельзя». Метапромт v5 отвечает: репозиторий - это не только решения, это задачи + среды + тесты + критерии приёмки, и это самый ценный собственный актив. Он прав. Задача и её приёмка - не «вывод Claude, использованный для обучения модели»: обучаемая модель никогда не получает их как цель, она получает их как условие и проверяется ими. Решение пишет открытая модель, тесты решают, прошло ли. Именно так у нас и построено: 111 кандидатов, 28 проверенных пар «красный до, зелёный после», стенд, который откатывает состояние и гоняет приёмку.

Где v5 неправ: раздел 5 велит использовать исторические решения Claude для «SFT, имитации, дистилляции». Это ровно то, что условия Anthropic запрещают, и никакая метка solution_origin=claude_code этого не меняет. Метка нужна для честности, но она не даёт права. Набор B (исторические решения) остаётся эталонной полкой: базовая оценка «насколько трудна задача», сверка, анализ - не цель обучения.

1. Числа, которые v5 велит считать, а не выдумывать

ЧтоЧислоОткуда
Репозиториев с историей34разведка 11.09
Коммитов в трёх крупнейших16 271bookgravity 5082, сеть 6434, портал 4755
Коммитов с правкой и теста, и кода111110 в body-anchor-engine, 1 в vektor
Проверенных пар (красный до, зелёный после)28 из 110отборщик, выход 25%
Отсеяно как фиктивные (абсолютный путь в приёмке)большинство отсевазадача решалась бы сама
body-anchor-engine: коммитов / трогают тесты / откатов445 / 118 / 1git log
Репозитории без юнит-тестов, но со стражамиbookgravity 69, vektor 19другая культура проверки

Вывод: «50-100 задач из одного репозитория» (раздел 22) сегодня даёт 28 из одного и 0 из остальных. Второй источник задач - стражи, не тесты; их 88, они уже в плане.

2. Что у нас уже есть из восемнадцати пунктов Data Engine v0.1

Пункт v5У насСостояние
Архитектура, каталогиbench/ agent/ providers/ evaluation/ datasets/ experiments/есть
Схема задачиbench/zadachi.jsonl: repo, sha, parent, tests, srcs, kod_doесть, без полей происхождения
Модель происхождения (раздел 2)-нет, поправка 12
Движок повтора (раздел 13)sobrat_stend: клон из заготовки, checkout parent, приёмка из shaесть, доказан
Песочницаrealpath, разделитель, без оболочки, 6 обходов отбитыесть
Запуск тестовпроверяющий контрольного стендаесть
Защита от подмены тестов (раздел 8)агенту была разрешена запись в scripts/, где лежит приёмкадыра, закрыта сегодня: приёмка сверяется с коммитом, расхождение = вердикт «подмена»
Слой моделейproviders/, третий исходесть
Оценкаprogon.py, razbor.py, приватный набор 25есть; без ярусов train/val/test/holdout
Журнал экспериментовexperiments/ZHURNAL.mdесть
Версии наборов (раздел 21)-нет, поправка 12
Траектории агента (раздел 9, 11)журнал шагов *.jsonl: вызовы, проверки, отказы, починкиесть как сырьё; попыток «провал-провал-зачёт» уже 5 в пилоте
Модель стоимостизамер токенов, $ за попыткуесть по факту пилота

3. Лучшее решение: Data Engine как рабочий раздел устава

  1. Репозитории - источник задач, сред и приёмок; исторические решения - эталонная полка, не цель обучения. Поле solution_origin обязательно, значение claude_code означает «не для весов».
  2. Происхождение и версии. Каждая запись несёт task_id, repo, commit, parent, solution_origin, solution_model, verification_status, tests_passed, license_status, dataset_version. Наборы версионируются dataset-v0.N с манифестом включений и исключений. Ярусы train / validation / test / holdout делятся по репозиторию и по времени, holdout никогда не в обучении.
  3. Награда только проверяемая, с защитой от обмана. Тесты, сборка, типы, стражи. Приёмка сверяется с коммитом перед каждым запуском; изменение или удаление теста - вердикт «подмена», не зачёт.
  4. Главный исследовательский вопрос (раздел 27): модель учится решать новое или воспроизводит чужие решения? Ответ измеряется только на holdout: другие репозитории, другое время, исполняемые тесты.
РЕПОЗИТОРИИ ──► задачи + приёмки (наши) исторические решения (полка, не цель) │ ▼ ПОВТОР СОСТОЯНИЯ (клон, parent, приёмка из sha, сверка приёмки) │ ▼ ОТКРЫТЫЕ РЕШАТЕЛИ: DeepSeek V4 (MIT), GLM, Qwen, наша модель │ ▼ ТЕСТЫ РЕШАЮТ (зачёт / отказ / подмена / не проверено) │ ▼ ПРОИСХОЖДЕНИЕ + ДЕДУП + ВЕРСИЯ ──► train / val / test / holdout │ ▼ SFT ──► новая модель ──► holdout ──► новые задачи ──► повтор

4. Что показывает пилот прямо сейчас

EXP-2026-001b, 5 из 10 прогонов: все отказы на пределе 20 шагов. GLM-5.3 дважды не написала ни строки, Kimi K3 и DeepSeek V4 Pro дошли до проверки (1 и 2 раза) и не успели починить. Это уже материал раздела 11 v5 - «попытка провалилась, попытка провалилась» - и это первые честные цифры про то, где ломаются открытые веса на нашей задаче.