Vercy · воспроизводимое исследование

Структура не повысила точность по сравнению с полной прозой.

Цель
Установить, повышает ли выдача агенту версионированных структурированных определений качество его ответов, и объясняется ли прирост структурой либо полнотой сообщённого.
Схема исследования
Один синтетический корпус поставщика с шестью неоднозначными понятиями, правила которых менялись в известные даты и различались у двух организаций. 40 заданий в шести условиях контекста, внутрипредметная схема, плюс четыре трека: поиск пробелов, сборка контекста, контроль раскрытия и совместное закрытие пробела. 846 вызовов модели. Единица анализа - задание, а не вызов.
Основной результат
Прирост точности объясняется полнотой, а не формой подачи. Связный текст с теми же фактами, что и структурированные записи, дал тот же результат: 76,5% против 76,5%, точный двусторонний знаковый критерий по 34 заданиям p = 1,00.
Второстепенные результаты
Только структурированные условия называли применённое правило и его версию (100% против 0%), находили недостающее определение и его владельца (83% против 0%), адресовали запрос верному владельцу (100% против 50%) и приняли все 72 решения о раскрытии без критической ошибки (0 против 2).
Вывод
На этом наборе заданий точность есть функция того, что агенту сообщили, а не того, в какой форме. Структурированное представление отличают трассируемость, обнаружение пробелов, контроль раскрытия и маршрутизация, и ни одного из этих свойств прозаические условия не показали ни на каком уровне.
76,5%полная проза
76,5%версионированные записи
p = 1,00разницы нет

Термины, используемые на этой странице

ТерминЗначение в этом исследовании
УсловиеБлок контекста, вставляемый между данными и вопросом. Условия различаются этим блоком и ничем иным.
Запись определенияМашиночитаемая формулировка одного правила с идентификатором, версией, датой вступления в силу, ссылкой на заменяемую версию и ответственной ролью.
Полная прозаТе же факты, что и в записях, изложенные связным текстом без идентификаторов, версий и полей.
Разграничивающее заданиеЗадание, для которого правдоподобное конкурирующее правило даёт другой верный ответ. Проверено кодом для всех 34 отвечаемых заданий.
Конкурирующий ответОтвет, точно равный значению, которое дало бы заранее заданное конкурирующее правило. Нижняя граница смысловой ошибки, а не её мера.
Критическая ошибка раскрытияПередача личностей клиентов, условий скидок или операционных данных перевозчика его конкуренту.

Схема исследования

Неоднозначность несут шесть понятий: активный клиент, чистая выручка, доставлено, в срок, стоимость заказа и рабочий день. Каждому заданы правила, которые менялись в известные даты и по-разному определяются поставщиком и его перевозчиком. Затем 40 заданий задавались в шести условиях при полностью одинаковых исходных таблицах, так что любое различие между условиями относится только к блоку контекста. Каждое отвечаемое задание проверено кодом на разграничивающую способность.

Трек A. Точность на согласованном смысле

УсловиеТочность (M1)95% ДИНазвано правило и версия (M2)Конкурирующий ответ (M7)
только схема данных26,5%11-420%16,2%
неполная документация29,4%14-440%35,3%
полная проза76,5%65-880%2,9%
версионированные записи76,5%65-88100%1,5%
записи + инертный балласт85,3%78-93100%0,0%
записи + правила федерации77,9%67-8998,5%1,5%

Выдача определений в любой форме подняла точность с 26,5% до 76,5%, и это выдерживает парный точный знаковый критерий по 34 заданиям при p = 0,0005. Условие, где те же факты поданы связным текстом, дало тот же результат, что и структурированное. При этой схеме точность определяется полнотой сообщённого, а не формой подачи.

Два дальнейших результата уточняют первый. Неполная документация оказалась не лучше её отсутствия и вдвое повысила долю ответов, совпадающих с отменённым правилом, с 16,2% до 35,3%: документ, описывающий недействующее правило, хуже отсутствия документа. А условие полной прозы, располагающее всеми фактами структурированного, назвало применённое правило в 0% ответов против 100%. Оно даёт верное значение и не может указать, каким правилом оно получено.

Способности помимо точности

Точность - одна из пяти измеренных способностей. По остальным четырём прозаические условия не показали худшего результата, они не показали результата вовсе. Поэтому сравнения ниже - это различия между наличием и отсутствием, а не различия в степени.

B1. Обнаружение недостающего определения

В каталог внесены шесть пробелов: пустой блок параметров, отсутствующая дата вступления в силу, отсутствующий владелец, ссылка на несуществующую версию, календарь, обрывающийся годом раньше, и полностью отсутствующее определение. Каждому сопоставлен вопрос, на который нельзя ответить, пока пробел не закрыт. Ещё четыре контрольных вопроса пробелов не содержали и измеряют долю ложных тревог.

УсловиеПробел обнаруженПоле названоВладелец названЛожные тревоги
только схема данных0%0%0%0%
проза, те же пробелы0%0%0%0%
записи, те же пробелы83,3%83,3%83,3%0%

Проза с теми же шестью пробелами не обнаружила ни одного за двенадцать испытаний. Структурированный каталог обнаружил десять из двенадцати, каждый раз называя отсутствующее поле и ответственную роль, и не дал ни одной ложной тревоги на четырёх контролях. Оба промаха пришлись на один и тот же пробел - определение, полностью отсутствующее в каталоге: запись с недостающим полем опознать можно, отсутствующую запись нельзя. Это ограничивает способность и указывает следующий шаг - реестр ожидаемых понятий, а не только имеющихся.

B2. Сборка только тех записей, которые нужны вопросу

Каталог увеличен до 41 записи, и агенту предложено отобрать минимальное подмножество перед ответом. Затем тот же вопрос задавался в трёх условиях сборки.

Условие сборкиТочностьРазмер контекста, знаков
весь каталог80,0%10 332
отбор самого агента60,0%473 (5%)
наивный top-5 по словам60,0%1 989 (19%)

Отбор оказался почти безупречным: 100% полноты по нужным записям, 95% точности и в среднем 1,2 записи из 41, что сокращает контекст до двадцатой части каталога. Точность на сокращённом контексте формально ниже, но при 20 наблюдениях на условие различие неотличимо от шума (p = 0,34). Подтверждается двадцатикратное сокращение контекста без измеримой потери точности. Прирост точности не подтверждается.

B3. Решение о допустимости раскрытия

Двенадцать единиц информации и три запрашивающие стороны: наш перевозчик, конкурирующий перевозчик и внешний аудитор, что даёт 72 решения о раскрытии на условие. Прозаический регламент и записи классификации формулируют одни и те же правила и различаются только формой представления.

Форма регламентаТочность раскрытияПолнота раскрытияКритические ошибки, из 72
без регламента39,1%45,0%5
регламент прозой66,7%100%2
записи классификации100%100%0

Обе ошибки при прозаическом регламенте - один и тот же промах: передача операционных данных одного перевозчика его конкуренту. Прозаический регламент запрещает это фразой, структурированный кодирует запрет полем и не ошибся ни разу во всех 72 решениях. Это результат с наиболее прямым практическим следствием, поскольку два типа ошибок несимметричны: лишний отказ стоит неудобства, лишнее раскрытие может стоить договора.

B4. Совместное дополнение определения

Три хода. Координатор обязан обратиться ровно к одному владельцу и запросить конкретное поле; владелец располагает только своей зоной ответственности и своим фактом и обязан отказать во всём остальном; затем координатор записывает ответ как новую версию и отвечает на вопрос.

УсловиеАдресовано верному владельцуКорректная запись версииИтоговый ответ верен
проза, те же пробелы50,0%100%50,0%
записи, те же пробелы100%100%50,0%

Маршрутизация, способность, специфичная для работы между ролями, удвоилась. Прозаическое условие направило не туда запросы об окне активного клиента и о календаре праздников, где ответственность выражена фразой, а не полем. Итоговая точность в обоих условиях одинакова и ограничена арифметикой, а не формой представления.

Вывод

Утверждение, что слой версионированных определений делает агента точнее, этими данными не подтверждается. Точность есть функция полноты, и хорошо написанная документация справляется с ней не хуже. Чего документация не достигла ни при каком качестве письма: определить недостающее определение и его владельца, указать правило и версию, стоящие за значением, и принять решение о раскрытии без ошибки. Именно эти утверждения подтверждаются данными, и они заявляются вместо более широкого.

Ограничения

Один синтетический корпус, порождённый однократно, одно семейство моделей на двух уровнях способностей, другие поставщики не проверялись, инструменты отключены во всех прогонах. Эталонные ответы выведены из тех же определений, которые получает структурированное условие, поэтому исследование измеряет следование выданной спецификации, а не поиск верного делового смысла. В версии 1 инструмента были ошибка области действия в правилах федерации и расчёт значимости по зависимым наблюдениям; обе выявлены внешней состязательной рецензией, обе описаны, а затронутые величины не подправлены, а исключены.

Открыть result.jsonЧитать методикуЧитать внешнюю рецензиюРаннерСырой прогон трека A

Материалы

Инструмент опубликован целиком. world.py детерминированно порождает синтетические организации и содержит эталонный движок, по одной реализации на определение. layers.py содержит шесть условий контекста, tasks.py - 40 заданий, tracks.py - четыре трека способностей. run.py и run_tracks.py выполняют вызовы, analyze.py и analyze_tracks.py считают статистику на уровне заданий. Каждый сырой прогон опубликован без правок: трек A, Sonnet, B1, B2, B3, B4.