# Semantic Grounding Benchmark v2: методика > Перевод даётся для удобства чтения. Нормативным является английский оригинал. Версия 2. Дата прогона 2026-09-06. Основная модель `claude-haiku-4-5-20251001`, вторая модель `claude-sonnet-5`. 846 вызовов модели в отчётном исследовании. Ещё 480 вызовов пришлись на версию 1 инструмента, признанную негодной по итогам внешней рецензии; эти данные исключены из всех приводимых здесь результатов и разобраны в записи рецензии. ## 1. Постановка задачи Агент, которому задали количественный вопрос об организации, обязан выбрать трактовку, прежде чем что-либо вычислять. Вопрос "сколько у нас активных клиентов" неотвечаем, пока "активный" не сведён к правилу, а организации регулярно пересматривают такие правила и расходятся в них со своими контрагентами. Исследование выясняет, что даёт агенту выдача этих правил и, в частности, зависит ли выигрыш от того, что правила поданы структурированными версионированными записями, а не обычной документацией. Версия 1 измеряла только точность. Это самое узкое из утверждений о слое определений, и рецензия версии 1 установила, что именно оно хуже всего подтверждается данными. Поэтому версия 2 измеряет пять способностей, из которых точность - одна. ## 2. Термины Каждый термин ниже используется в этом документе и на странице результатов в приведённом значении и ни в каком более широком. | Термин | Значение в этом исследовании | |---|---| | Семантическая привязка | Соответствие между понятием, названным в вопросе, и вычислением, которое агент выполняет, отвечая на него. Ответ привязан, когда вычисление реализует определение, действующее у спрашивающей организации на указанную дату. | | Запись определения | Машиночитаемая формулировка одного определения с идентификатором, версией, датой вступления в силу, ссылкой на заменяемую версию, ответственной ролью и параметрами, достаточными для вычисления. | | Каталог определений | Набор записей определений, выдаваемый в данном условии. | | Прозаическая документация | Тот же предмет, изложенный связным текстом для читателя-человека, без идентификаторов, версий и полей. | | Запись федерации | Запись, объявляющая, чьё из двух организационных определений управляет классом вопросов, и область, в которой это объявление действует. | | Условие | Один из нескольких блоков контекста, вставляемых между таблицами данных и вопросом. Условия различаются этим блоком и ничем иным. | | Задание | Вопрос вместе с его эталонным ответом. Используется как синоним слова "задача". | | Эталонный ответ | Значение, возвращаемое эталонной реализацией действующего определения. Вычисляется кодом и никогда не выдаётся модели. | | Конкурирующее определение | Для данного задания - заранее заданное альтернативное правило, которое разумный читатель мог бы применить вместо основного. | | Разграничивающее задание | Задание, для которого конкурирующее определение даёт численно иной ответ, чем эталонный. Проверено кодом для каждого задания. | | Пробел | Поле, требуемое схемой каталога, которое отсутствует, пусто либо ссылается на несуществующую запись. | | Элицитация | Обнаружение пробела, называние отсутствующего поля и называние роли, ответственной за его заполнение. | | Сборка | Отбор из каталога минимального подмножества записей, требуемых данным вопросом. | | Решение о раскрытии | Суждение о том, может ли одна единица информации быть передана одной названной запрашивающей стороне. | | Критическая ошибка раскрытия | Передача личностей клиентов, условий скидок либо операционных данных одного перевозчика конкуренту этого перевозчика. | ## 3. Гипотезы H1-H4 сформулированы до прогона версии 1. H5 добавлена в ответ на внешнюю рецензию, H6-H9 добавлены вместе с четырьмя треками способностей; все пять, таким образом, апостериорные. Различие указано потому, что гипотеза, сформулированная после знакомства с данными, несёт меньший доказательный вес, чем сформулированная до, а центральный отрицательный результат исследования опирается именно на H5. | | Гипотеза | Задана заранее | |---|---|---| | H1 | Выдача определений в любой форме повышает точность по сравнению с выдачей одной схемы данных. | да | | H2 | Неполная документация не повышает точность и повышает долю ответов, совпадающих с отменённым правилом. | да | | H3 | Преимущество определений максимально на вопросах, дата которых предшествует смене определения. | да | | H4 | Записи федерации повышают точность на вопросах к контрагенту, не снижая её в остальном. | да | | H5 | Структурированные записи повышают точность по сравнению с прозой, несущей те же факты. | нет | | H6 | Только структурированные условия способны назвать применённое определение и его версию. | нет | | H7 | Только структурированные условия способны локализовать пробел и назвать ответственную роль. | нет | | H8 | Структурированная классификация снижает число критических ошибок раскрытия по сравнению с прозаическим регламентом, формулирующим те же правила. | нет | | H9 | Структурированная ответственность повышает долю запросов, доходящих до верного владельца. | нет | ## 4. Материалы ### 4.1 Синтетический корпус Корпус порождается детерминированно из фиксированного зерна и описывает одного поставщика, **Meridian Supply Co**: 24 клиента, 72 заказа, 66 отгрузок, 56 счетов, 10 возвратов. Присутствуют два перевозчика. **Halden Logistics** держит два договора: C-118, которым управляют записи федерации, и C-301, который они явно исключают. C-301 существует для того, чтобы область действия правила федерации проверялась на договоре того же поставщика, но лежащем вне правила, - случай, который никакой признак в данных не различает. **Zen Freight** держит договор C-204 и лежит вне правил целиком. Ограничения порождения соблюдаются и перепроверяются после генерации: ни один заказ не предшествует дате регистрации своего клиента, а договор и поставщик назначаются согласованно, так что положительная и отрицательная области действия правил федерации не пересекаются. ### 4.2 Неоднозначные понятия Неоднозначность несут шесть понятий. Каждое выбрано потому, что это понятие, о котором отделы и торговые партнёры держатся действительно разных и локально обоснованных правил. | Понятие | Ось расхождения | Версионирование | |---|---|---| | активный клиент | окно 365 или 180 дней | v1 → v2 с 2026-04-01 | | чистая выручка | фрахт включён или исключён, минус возвраты | v1 → v2 с 2026-05-01 | | доставлено | подтверждение клиента или скан перевозчика | Meridian и Halden расходятся | | в срок | исходная или пересогласованная дата обещания | v1 → v2 с 2026-02-01 | | стоимость заказа | фрахт исключён или включён | Meridian и Halden расходятся | | рабочий день | два производственных календаря | Meridian и Halden расходятся | ### 4.3 Условия Таблицы данных, около 10 000 знаков CSV, одинаковы во всех условиях. Различается только блок контекста. | Условие | Блок контекста | Роль в схеме | |---|---|---| | A схема | только определения таблиц | Пол. То, что получает агент при отсутствии семантического слоя. | | B проза, неполная | вики-страница того рода, какие организации ведут на практике: без владельцев, без дат, один абзац отменён другим, часть правил отсутствует | Реалистичная документация. | | E проза, полная | те же факты, что в условии C, связным текстом: окна, даты смены, формулы, ответственные роли, оба календаря | Контроль, отделяющий форму представления от полноты. Добавлен после рецензии версии 1. | | C записи | машиночитаемые записи определений с идентификатором, версией, датой вступления в силу, заменой и владельцем | Изучаемое воздействие. | | F записи + балласт | условие C плюс инертное приложение, совпадающее с блоком федерации по длине и месту | Отделяет длину контекста от его содержания. | | D записи + федерация | условие C плюс записи федерации | Межорганизационный слой. | Записи федерации применяются только к вопросам, обращённым к контрагенту, и заявляют это ограничение явно. Внутренняя отчётность исключена поимённо, в том числе когда участвующие строки принадлежат соответствующему договору. В версии 1 это ограничение отсутствовало, с последствием, зафиксированным как находка R2 рецензии. ## 5. Схема исследования Внутрипредметная схема с повторными измерениями. Каждое задание предъявляется во всех условиях, поэтому оно служит собственным контролем, а различия в трудности между заданиями в сравнения не входят. Трек A: 40 заданий x 6 условий x 2 повтора = 480 вызовов. Пять треков вместе дают 846 вызовов: трек A 480, вторая модель 160, B1 60, B2 80, B3 18 и B4 48 в 16 цепочках по три хода. ## 6. Построение заданий 40 заданий в четырёх семействах. - **COMP, 12 заданий.** Вычисление по действующему определению, в рамке внутренней отчётности. - **TEMP, 10 заданий.** Вопрос, дата которого предшествует смене определения, по трём версионированным показателям. Два задания приходятся ровно на дату вступления в силу, где действующее правило зависит от того, включена ли граница. - **XORG, 12 заданий.** Десять вопросов к контрагенту плюс два разграничителя области действия: договор C-301 у того же поставщика и поставщик ZEN, оба вне правил федерации. - **ABST, 6 заданий.** Вопросы, на которые корпус не отвечает ни при каком определении. Верная реакция - отказаться и указать причину. Все 34 отвечаемых задания проверены кодом на разграничивающую способность в смысле раздела 2. Неоднозначности, не входящие в предмет исследования, из текста заданий убраны: каждый внутренний вопрос заявляет, что он внутренний, каждый вопрос к контрагенту называет контрагента, а правило счёта рабочих дней указано в вопросе, а не оставлено на вывод. ## 7. Показатели трека A | Код | Показатель | Знаменатель | |---|---|---| | M1 | Возвращённое значение равно эталонному ответу. | отвечаемые задания | | M2 | В ответе названы идентификатор и версия применённого определения. | отвечаемые задания | | M5 | Отказ на задании, на которое корпус не отвечает. Отказ на отвечаемом задании учитывается отдельно как ложный отказ. | неотвечаемые задания | | M7 | Возвращённое значение точно равно ответу заранее заданного конкурирующего определения. | отвечаемые задания | Два свойства ограничивают трактовку M7. Он фиксирует только точное совпадение с одной заранее заданной альтернативой, поэтому не улавливает смешанное применение двух правил, неверный фильтр строк или неверное определение с последующей арифметической ошибкой; а арифметическая ошибка может совпасть с ним случайно. M7 поэтому является нижней границей смысловой ошибки, а не её мерой. В версии 1 показатель назывался "применил неверное определение", что утверждало больше, чем он фиксирует. M2 конструктивно недостижим в условиях без каталога, поскольку нет идентификаторов и версий, на которые можно сослаться. Это не изъян сравнения, а сама находка: трассируемость есть свойство формы представления, а не модели. ## 8. Треки B1-B4 ### 8.1 B1, элицитация В каталог внесены шесть пробелов: пустой блок `parameters`, отсутствующая `effective_from`, отсутствующий `owner`, `superseded_by` со ссылкой на несуществующую версию, календарь, покрывающий только предыдущий год, и полностью отсутствующее определение. Каждому пробелу сопоставлен вопрос, на который нельзя ответить, пока пробел не закрыт. Четыре контрольных вопроса пробелов не содержат и измеряют долю ложных тревог. Условия: `schema`, `prose_deficient` (те же пробелы в прозе) и `vercy_deficient` (те же пробелы в записях). Показатели: пробел обнаружен, отсутствующее поле названо, ответственная роль названа, доля ложных тревог и точность на контролях. ### 8.2 B2, сборка Каталог увеличен до 41 записи общим объёмом 10 332 знака, из которых любой отдельный вопрос требует одной-двух. Первая стадия: агент отбирает минимальное подмножество. Вторая стадия: тот же вопрос задаётся в трёх условиях сборки - весь каталог, собственный отбор агента и наивный базовый top-5 по ключевым словам. Показатели: точность и полнота отбора относительно известного требуемого набора, размер контекста и точность ответа в каждом условии сборки. ### 8.3 B3, контроль раскрытия Двенадцать единиц информации и три запрашивающие стороны - наш собственный перевозчик, конкурирующий перевозчик и внешний аудитор, - что даёт 72 решения о раскрытии на условие. Условия: без регламента, регламент прозой и записи классификации с полями `classification`, `release_to` и `basis`. Оба регламентных условия формулируют одни и те же правила и различаются только формой представления. Показатели: точность и полнота раскрытия, общая верность решений и отдельно число критических ошибок раскрытия. Два типа ошибок учитываются раздельно, поскольку их цены несимметричны: лишний отказ стоит неудобства, лишняя передача может стоить договора. ### 8.4 B4, совместное дополнение Три хода на цепочку, координатор и четыре ролевых агента-владельца. Координатор обязан обратиться ровно к одному владельцу и запросить конкретное поле. Владелец располагает только своей зоной ответственности и своим фактом, обязан отказать во всём, что вне этой зоны, и при отказе назвать верного владельца. Затем координатор записывает ответ как новую версию и отвечает на исходный вопрос. Показатели: верность маршрутизации, поведение владельца при отказе, корректность оформления полученной записи, верность её даты вступления в силу и итоговая точность ответа. ## 9. Процедура Инструменты отключены, а системный промпт агента заменён нейтральным, чтобы измеряемый эффект относился к блоку контекста, а не к программной обвязке. Ответ - один JSON-объект по фиксированному контракту; доля успешного разбора составила 100% во всех условиях. Порядок вызовов рандомизирован по всему заданию, так что дрейф в поведении сервиса за время прогона не смешивается с условием. ## 10. Статистический анализ Единица анализа - задание, а не вызов. Два повтора одного задания в одном условии не являются независимыми наблюдениями, и обращение с ними как с независимыми завышает видимый объём выборки. Поэтому повторы усредняются внутри задания до применения любого критерия. Парные сравнения условий используют точный двусторонний знаковый критерий по средним заданий. Он не делает предположений о распределении и подходит для ограниченных дискретных позаданийных оценок, которые даёт эта схема. Доверительные интервалы кластеризованы по заданиям. В версии 1 применялся критерий Макнемара на уровне отдельных вызовов, что завышало значимость; величина поправки приведена как находка R4 рецензии. Поправка на множественные сравнения не применяется. Приводятся восемь парных сравнений, поэтому номинальное p = 0,05 не следует читать как 5-процентную групповую вероятность ошибки. Сравнения, несущие выводы, значимы при p < 0,002 либо незначимы при p = 1,00, так что этот выбор ни на один вывод не влияет. ## 11. Угрозы валидности **Конструктная валидность.** Эталонные ответы вычисляются из тех же определений, которые выдаёт условие C. Для бенчмарка исполнения спецификации это нормально, но означает, что исследование измеряет следование спецификации, а не поиск верного делового смысла. Успех относительно авторского критерия показывает, что агент верно применяет выданное правило, а не что слой находит верное правило. Правила написаны авторами. Независимо написанные правила со слепым судейством закрыли бы этот вопрос и не сделаны. **Внутренняя валидность.** Условия различаются только блоком контекста, при неизменных данных, тексте вопроса, параметрах декодирования и порядке вызовов, поэтому различия между условиями относятся к этому блоку. Условие F отделяет длину блока от его содержания и не показывает потери точности за счёт добавленной длины при этих объёмах. Условие E примерно на 1000 знаков короче условия C, поскольку проза плотнее записей; если бы длина вредила, это работало бы в пользу E, так что сравнение C с E консервативно в пользу C. **Внешняя валидность.** Один синтетический корпус, порождённый однократно. Одно семейство моделей на двух уровнях способностей, другие поставщики не проверялись. Инструменты отключены, поэтому результаты описывают агента, рассуждающего над таблицами в контексте, и не описывают рабочего агента с доступом к базе данных, где арифметическая составляющая ошибки изменилась бы и баланс между условиями мог бы сместиться. **Статистическая валидность вывода.** 34 отвечаемых задания и 12 испытаний на пробелах - малые выборки. В треке B2 на каждое условие сборки приходится 20 наблюдений, поэтому номинальное различие в 20 пунктов там приводится как неотличимое от шума, а не как находка. Интервальные оценки соответственно широки и приводятся рядом с каждой точечной оценкой на странице результатов. ## 12. Доступность Генератор, эталонный движок, условия, набор заданий, раннеры и скрипты анализа опубликованы полностью вместе с неотредактированными сырыми прогонами по каждому треку. Публикуемый `result.json` собирается скриптом непосредственно из этих прогонов, поэтому величины на странице результатов не могут разойтись с данными, которые их породили.