# Внешняя состязательная рецензия версии 1 > Перевод даётся для удобства чтения. Нормативным является английский оригинал. ## 1. Протокол рецензирования Версия 1 этого бенчмарка перед публикацией была передана на внешнюю состязательную рецензию. Рецензент - **Codex (GPT-5.2)**, запущенный локально в режиме только для чтения по каталогу инструмента, с единственной инструкцией: выступить враждебным и грамотным методологом, ранжировать находки по тому, насколько сильно каждая угрожает заявленному выводу, и указывать для каждой файл и строку. Рецензия вернула две находки, изменившие результат, и пять, изменивших состав или формулировку утверждений. Величины версии 1 были не исправлены на месте, а выброшены, поскольку две находки затрагивали сам инструмент, а не только его истолкование. Настоящий документ фиксирует каждую находку, её доказательную основу, применённое исправление и влияние на выводы. Бенчмарк, чьи провалы не опубликованы, является маркетинговым артефактом, а не измерением. Находки классифицированы по типу валидности, которому они угрожают, в соответствии со стандартным четырёхчастным делением из раздела 11 методики. ## 2. Сводка | Код | Тип валидности | Находка | Разрешение | |---|---|---|---| | R1 | Конструктная | Воздействие смешивало форму представления с полнотой | Исправлено добавлением условия; исходная гипотеза опровергнута | | R2 | Внутренняя | Причина просадки в условии федерации определена неверно | Исправлено; ошибка была в инструменте, модель была права | | R3 | Конструктная | Показатель назван шире, чем фиксирует | Переименован и ограничен | | R4 | Статистическая | Значимость вычислена по зависимым наблюдениям | Пересчитано; одно заявленное различие не выдержало | | R5 | Конструктная | Круговая зависимость критерия | Принято как ограничение, не устранено | | R6 | Внутренняя | Дефекты на уровне заданий в четырёх местах | Все исправлены и перепроверены | | R7 | Внешняя | Утверждение заявлено шире, чем позволяет схема | Утверждение сужено | ## 3. Находки ### R1. Воздействие смешивало форму представления с полнотой **Находка.** Прозаическое условие не содержало фактов, которые содержало структурированное: ни действовавшего окна ретроспективы, ни даты его смены, ни производственных календарей, ни формулы оценки у контрагента. **Основание.** Прямое сравнение двух блоков контекста. Ни одна модель не выведет произвольное правило в 180 дней из строк транзакций, поэтому недостающие факты не восстанавливались из данных, одинаковых во всех условиях. **Оценка.** Сравнение установило, что полная спецификация превосходит неполную, а это не то утверждение, которое делалось. Утверждение, что версионирование помогает само по себе, схемой вообще не идентифицировалось, поскольку не существовало эквивалентного в остальном неверсионированного условия. **Исправление.** Добавлено условие E: полная проза, несущая ровно те факты, что и условие C. Это оставляет форму представления единственной переменной в сопоставлении C и E. **Влияние на выводы.** Решающее и неблагоприятное. Условие E сравнялось с условием C до десятой доли при p = 1,00. Гипотеза H5 опровергнута, а заголовочное утверждение версии 1 не устояло. ### R2. Причина просадки в условии федерации определена неверно **Находка.** Версия 1 сообщала, что условие федерации теряет точность из-за арифметической деградации, вызванной более длинным контекстом. Это отнесение было неверным. **Основание.** Рецензент прочитал сырые ответы. На двух заданиях модель вернула ровно то значение, которое получается применением правила контрагента к строкам этого контрагента и нашего собственного правила ко всем остальным, и указала на это в собственном пояснении. Поведение было применением правила, а не арифметическим сбоем. **Оценка.** Дефект был в инструменте. Правило федерации гласило "применяется к любому вопросу о договоре C-118 или поставщике HAL", поэтому вопросы внутренней отчётности попадали в его область законно, тогда как эталонные ответы применяли наше собственное определение повсеместно. Договор и поставщик к тому же порождались независимо, так что положительная и отрицательная области действия правила пересекались. Модель следовала выданному ей правилу; эталонный ответ - нет. **Исправление.** Записи федерации теперь применяются только к вопросам, обращённым к контрагенту, и заявляют это явно. Корпус перепорождён так, что области действия пересекаться не могут. Добавлено условие F, отделяющее длину контекста от его содержания, которые исходное объяснение смешивало. **Влияние на выводы.** С исправленным дефектом условие федерации в целом нейтрально и помогает на тех вопросах, для которых предназначено. Объяснение через длину отозвано целиком: условие F не показывает потери точности за счёт добавленной длины при этих объёмах. ### R3. Показатель назван шире, чем фиксирует **Находка.** Показатель с названием "применил неверное определение" фиксирует только точное совпадение с одним заранее заданным альтернативным ответом. **Основание.** Разбор функции подсчёта. **Оценка.** Показатель не способен уловить смешанное применение двух правил, неверный фильтр строк или неверное определение с последующей арифметической ошибкой, а арифметическая ошибка может совпасть с ним случайно. Сопутствующее утверждение, что арифметические ошибки дают произвольные значения, а смысловые - точную альтернативу, из этого не следует. **Исправление.** Переименован в "ответ точно равен ответу заранее заданного конкурирующего определения", с указанием границ применимости везде, где он появляется. Теперь описывается как нижняя граница смысловой ошибки. **Влияние на выводы.** Числовых изменений нет. Направление и величина показателя сохраняются; снижена только сила выводимого из него заключения. ### R4. Значимость вычислена по зависимым наблюдениям **Находка.** Три повтора одного задания на одном промпте трактовались как три независимых наблюдения, а критерий объединял все вызовы. **Основание.** Пересчёт на уровне заданий, выполненный рецензентом независимо и воспроизведённый нами. | Анализ | структура против федерации | |---|---| | по вызовам, как опубликовано в версии 1 | p = 0,027 | | точный знаковый критерий по 34 средним заданий | p = 0,082 | | Макнемар по большинству из трёх на задание | p = 0,057 | **Оценка.** Различие между двумя условиями в 14,7 пункта поправкой не затронуто, его значимость - затронута. При исправленном анализе она не достигает общепринятого порога. Сравнения, несущие главное утверждение исследования, - структура против схемы и против неполной документации, - выдерживают поправку при p = 0,0005 и p = 0,0015 соответственно. **Исправление.** Повторы усредняются внутри задания, парные критерии считаются по заданиям точным знаковым критерием, доверительные интервалы кластеризуются по заданиям. **Влияние на выводы.** Одно заявленное различие отозвано. Основной эффект по величине не изменился и остаётся значимым. ### R5. Круговая зависимость критерия **Находка.** Эталонные ответы выведены из тех же определений, которые получает структурированное условие. **Основание.** Разбор эталонного движка и шаблона промпта. **Оценка.** Утечки ответа нет: в промпт подставляются данные, контекст, вопрос и дата, но никогда не эталонный ответ. Однако структурированное условие получает нечто близкое к исполняемой спецификации, поэтому выбор трактовки сводится преимущественно к извлечению, а остаточная работа - это соединение и агрегация. Успех относительно авторского критерия поэтому не демонстрирует, что слой находит верный деловой смысл. **Исправление.** Отсутствует. Ограничение заявлено в методике и на странице результатов. **Влияние на выводы.** Область каждого утверждения о точности сужается до следования выданной спецификации. Независимо написанные правила со слепым судейством остаются надлежащим следующим шагом. ### R6. Дефекты на уровне заданий **Находка.** Четыре дефекта в наборе заданий и корпусе. 1. Один разграничитель области действия не разграничивал: верный ответ достигался и частично неверным применением правила. 2. Правило счёта рабочих дней нигде не заявлялось, поэтому трактовка границ интервала могла быть принята за выбор календаря. 3. Временное семейство опиралось только на два показателя, и четыре задания делили одно и то же значение ответа. 4. Заказы порождались с датами, предшествующими датам регистрации их клиентов. **Исправление.** Разграничитель перенесён на договор того же поставщика, но вне правила; правило счёта теперь указано в вопросе; добавлен третий версионированный показатель; даты заказов ограничены при порождении. Перепроверено после перегенерации, ноль нарушений. **Влияние на выводы.** Позаданийный шум снижен. Ни одна публикуемая величина версии 2 не зависит от дефектных заданий, которых больше не существует. ### R7. Утверждение заявлено шире, чем позволяет схема **Находка.** Инструменты были отключены во всех прогонах, поэтому исследование измеряет рассуждение над таблицами, находящимися в контексте. **Оценка.** Результаты не описывают рабочего агента с доступом к базе данных. При доступном SQL арифметическая составляющая ошибки меняется, и баланс между условиями может сместиться. **Исправление.** Защищаемое утверждение теперь заявляется узко везде, где приводятся результаты: на этом наборе заданий выдача точного каталога определений улучшает точные ответы этой модели по сравнению с отсутствующей или неполной документацией. ## 4. Чего рецензия не опровергла Преимущество выдачи определений как таковой, по сравнению с одной схемой и с неполной документацией, выдержало исправленный анализ с запасом в несколько порядков по p, и рецензент подтвердил это независимым пересчётом. Разногласие никогда не касалось того, существует ли улучшение. Оно касалось того, чему это улучшение приписать, и условие E ответило на этот вопрос против исходной гипотезы. ## 5. Открыто после версии 2 - Один синтетический корпус. Для внешней валидности нужно несколько независимо порождённых. - Правила написаны авторами исследования. Для закрытия R5 нужны независимо написанные правила со слепым судейством. - Одно семейство моделей на двух уровнях способностей. Другие поставщики не проверялись. - Ни одного прогона с включёнными инструментами.