Vercy · воспроизводимое исследование

Структура не превзошла полные заметки. Удаление любой её части - превзошло.

Цель
Выяснить, что даёт ассистенту форма представления личных записей человека и какая часть структуры отвечает за какую способность.
Схема исследования
Один синтетический человек: 34 факта с интервалами действия и источниками, 7 контактов, 8 поездок, 5 живых конфликтов между источниками разной надёжности, 3 просроченных документа и 2 действующих. Шесть представлений, все порождаются из одной таблицы фактов. 43 задания в семи семействах, плюс трек раскрытия и трек записи изменения. 570 вызовов модели. Единица анализа - задание.
Основной результат
Утверждение, что структура помогает, не установлено. Хронологические заметки со всеми фактами, датами и источниками дали 93,4% против 100% у структурированного измерения, расхождение в три задания, точный знаковый критерий p = 0,25.
Что действительно разделяет
Каждая абляция структуры оказалась решающей. Удаление интервалов действия обрушило историческую точность со 100% до 0%, а суждение о просроченности со 100% до 20%, при этом вопросы о текущем состоянии остались на 100%. Удаление провенанса обрушило разрешение конфликтов со 100% до 33%, снова не тронув вопросы о текущем состоянии. Только руки с политикой конфликтов смогли назвать применённое правило: 100% против 0%.
Поправка к предыдущему исследованию
Трассируемость не является свойством структуры. Когда заметки несут идентификаторы источников, они цитируют их в 96,4% ответов. Предыдущий бенчмарк показал для прозы 0% потому, что у той прозы не было идентификаторов, а не потому, что она проза.
Вывод
Для набора личных записей такого размера хорошо ведённые заметки почти достаточны, и ценность структуры не в среднем ответе. Она в том, что поля несущие поодиночке: каждое - единственная опора способности, которая без него обрушивается, и представление, потерявшее любое из них, отказывает конкретным предсказуемым образом, а не деградирует плавно.
93%заметки, все факты на месте
100%структурированное измерение
0,25парный знаковый критерий, p

Термины, используемые на этой странице

ТерминЗначение в этом исследовании
ИзмерениеЗаписи, описывающие одного человека: факты, люди и поездки, к которым они отсылают, источники, из которых они пришли, и правило разрешения расхождений.
Интервал действияДаты, между которыми факт был истинным. Открытый интервал означает, что он истинен до сих пор.
Уровень источникаНасколько доверяют виду источника: скан документа 1, синхронизация с устройства 2, письмо 3, собственная запись 4.
Политика конфликтовCP-01: если две записи покрывают одну дату и расходятся, побеждает более низкий уровень источника; внутри уровня побеждает более поздняя запись.
Наивная свежестьПравило, которое сводка без провенанса может реализовать: побеждает последнее записанное значение, каким бы ни был источник.
ПереприсвоениеОтвет на вопрос о прошлой дате значением, действующим сегодня.
АбляцияРука, из которой намеренно удалён один класс полей, чтобы выяснить, какой класс несёт какую способность.

Схема исследования

Субъект - один синтетический человек, чьи записи выглядят как память личного ассистента: адреса, работодатели, телефоны, зарплата, документы, устройства и гарантии, подписки, медицинские данные, банковские реквизиты и диета. Каждый факт несёт даты, между которыми он был истинным, и источник, из которого пришёл, ранжированный по степени доверия. Пять атрибутов несут по две записи, покрывающие сегодняшний день и расходящиеся; три документа просрочены, два нет.

Предыдущий бенчмарк справедливо критиковали за прозаическое условие, которому тихо не хватало фактов, имевшихся у структурированного. Здесь каждое представление порождается из одной таблицы фактов, и проверка, выполняемая перед каждым прогоном, роняет исследование, если любое полное представление потеряло значение, дату или источник, имеющийся у другого. Эта проверка нашла семь пропусков в заметках ещё при сборке инструмента, и они были исправлены до первого вызова. Руки A, B и D полные; руки C, E и F - абляции, удаляющие по одному классу полей, и помечены как таковые.

Основная сетка

ПредставлениеПолноеТочность ответа95% ДИСослалось на записьПереприсвоениеВыдумываниеКонтекст
A заметкида93,4%86-10096,4%2,6%5,3%4 664
B заметки + сводка-профильда93,4%86-10092,9%4,0%5,3%5 242
C плоские записиабляция47,4%31-63-6,6%1,3%2 097
D измерениеда100,0%100-100100,0%0,0%0,0%10 038
E измерение без провенансаабляция86,8%76-98-5,3%5,3%4 903
F измерение без интерваловабляция55,3%39-7193,3%0,0%1,3%6 744

Главное сравнение - рука A против руки D, два полных представления. Заметки ответили верно на 93,4% заданий, измерение на 100%. На 38 отвечаемых заданиях они расходятся в трёх, все в пользу измерения, что точный знаковый критерий оценивает как p = 0,25. На этом наборе заданий структурированное представление не показано более точным, чем полные заметки, и честная формулировка результата - утверждение не установлено, а не опровергнуто.

Три различия всё же переживают малую выборку. Измерение - единственная рука без переприсвоений, то есть оно ни разу не ответило на вопрос о прошлой дате сегодняшним значением, и единственная, которая ни разу не выдала значения, отсутствующего в записях. Его контекст при этом самый большой: 10 038 знаков против 4 664 у заметок, то есть что бы оно ни покупало, оно покупает это примерно вдвое большим контекстом.

По семействам вопросов

Представлениетекущееисторическоеконфликтпросрочкатёзкипо нескольким записямнеотвечаемое
A заметки100,0%100,0%75,0%100,0%100,0%83,3%100,0%
B заметки + сводка-профиль100,0%100,0%75,0%100,0%100,0%83,3%100,0%
C плоские записи100,0%0,0%33,3%20,0%100,0%33,3%100,0%
D измерение100,0%100,0%100,0%100,0%100,0%100,0%100,0%
E измерение без провенанса100,0%100,0%33,3%100,0%100,0%83,3%100,0%
F измерение без интервалов100,0%0,0%83,3%20,0%100,0%33,3%100,0%

Средние скрывают форму результата. Каждое представление отвечает на вопросы о текущем состоянии безупречно, включая то, которое не содержит ничего, кроме текущего состояния. Различия целиком в семействах, требующих поля, которого у урезанных рук нет: история, конфликт и просрочка. Плоские записи, хранящие только истинное сегодня, не отвечают ни на один исторический вопрос и на один из пяти вопросов о просрочке, а также отказываются отвечать на 44,7% заданий.

Какое поле несёт какую способность

Каждая абляция сопровождается контрольным семейством, где удалённое поле по предсказанию не должно ничего менять. Именно это отделяет утверждение о поле от утверждения о размере или о структуре вообще.

Удалённый класс полейСемействоАбляцияПолное измерениеp
интервалы действияисторические вопросы0,0%100,0%0,00781
интервалы действиявопросы о текущем100,0%100,0%1,0
провенанс и политикавопросы о конфликтах33,3%100,0%0,125
провенанс и политикавопросы о текущем100,0%100,0%1,0

Оба предсказания подтверждаются, и оба контроля держатся. Интервалы действия - это то, что вообще делает исторические вопросы отвечаемыми; без них точность на этом семействе равна нулю, а точность на текущем состоянии не меняется. Провенанс - это то, что заставляет работать разрешение конфликтов; без него точность на конфликтах падает на две трети, и снова точность на текущем состоянии не меняется. В семействе конфликтов всего шесть заданий, и само по себе оно не достигает общепринятого порога, но его направление и его контроль оба такие, как предсказано.

Просрочка, ложные тревоги и отказы

Три документа просрочены, два нет. Два действующих служат контролем: представление, делающее просрочку видимой, не должно начать помечать записи, которые ещё в порядке.

ПредставлениеПросрочка определена верноЛожные тревогиОтказалось от вопроса, на который могло ответить
A заметки70,0%3,0%0,0%
B заметки + сводка-профиль60,0%0,0%0,0%
C плоские записи50,0%0,0%44,7%
D измерение90,0%0,0%0,0%
E измерение без провенанса90,0%0,0%5,3%
F измерение без интервалов60,0%9,1%39,5%

Измерение верно судит о просрочке в 90% испытаний без ложных тревог, против 70% у заметок и 60% у сводки-профиля. Урезанные руки выглядят на этой метрике прилично только потому, что часто отказываются: плоские записи отказались от 44,7% отвечаемых заданий, а рука без интервалов действия от 39,5%, против 0% у обоих полных представлений. Отказ - верная реакция на отсутствующие сведения, и именно поэтому точность этих рук следует читать как меру того, чего их представление не может выразить, а не того, как рассуждает модель.

Решение о том, что можно передать

Двенадцать единиц информации и три запрашивающие стороны: сестра субъекта как ближайший родственник, отдел кадров работодателя и непроверенная веб-форма. Прозаический регламент и записи классификации формулируют одни и те же правила и различаются только формой представления.

Форма регламентаТочность раскрытияПолнота раскрытияВерность решенийКритические ошибки
без регламента95,2%58,8%79,2%1 из 72
регламент прозой100,0%79,4%90,3%0 из 72
записи классификации100,0%88,2%94,4%0 из 72

Предсказание, что структурированная классификация снизит критические ошибки, не подтвердилось. Обе формы регламента дали ноль: короткого, ясно написанного прозаического регламента оказалось достаточно. Структурированная форма дала другое - она реже отказывала зря, выдав 88,2% того, на что запрашивающий имел право, против 79,4% у прозы, при точности 100% в обоих случаях. Единственная критическая ошибка за весь трек пришлась на условие вообще без регламента, которое передало медицинскую подробность работодателю. Это иной исход, чем в предыдущем исследовании, где прозаический регламент допустил две утечки; здешний регламент короче и покрывает меньше случаев, и это наиболее вероятная причина.

Запись изменения

Приходят шесть новых сведений: переезд, обновлённый паспорт, отменённая подписка, новый номер, лабораторное исправление и продлённая страховка. Агент должен записать каждое, не разрушив то, что было истинным раньше.

ПредставлениеНовое значение верноДата начала вернаЗакрыта нужная записьДата окончания вернаИстория сохраненаВсе четыре верны
A заметки100,0%83,3%0,0%100,0%100,0%0,0%
C плоские записи100,0%100,0%0,0%75,0%100,0%0,0%
D измерение100,0%100,0%75,0%75,0%100,0%66,7%

Каждая рука выдала верное новое значение, и каждая заявила, что сохранила историю. Только измерение смогло назвать замещаемую запись - в 75% сценариев, - и только оно получило все четыре части обновления верными, в 66,7%. Заметки и плоские записи получают ноль в этом столбце потому, что у их записей нет идентификаторов, которые можно назвать; это свойство формы представления, а не рассуждения модели: обновление нельзя выразить как замещение, когда нечего замещать по имени. Даже измерение получает всё обновление верным лишь в двух третях случаев, так что это способность, которую форма делает возможной, а не гарантирует.

Вывод

Два исследования теперь сходятся в одном неудобном пункте: по средней точности полную и хорошо ведённую неструктурированную запись трудно превзойти. Что добавляет это исследование - так это место, где различие действительно живёт. Каждый класс полей структуры - единственная опора одной способности, и провал при его отсутствии не плавный спад, а обвал в ноль ровно на тех вопросах, которым это поле служит. Личный ассистент, чья память хранит только текущее состояние, ответит на любой вопрос про сегодня и не ответит ни на один про прошлый год. Именно это утверждение подтверждается данными.

Два дефекта, найденные и исправленные по ходу прогона

Метрика провенанса изначально принимала только идентификатор источника. В руках, несущих ещё и идентификаторы фактов, модель называла факт, что отвечает на заданный вопрос ровно так же однозначно, поэтому метрика штрафовала руки с большим числом идентификаторов; она показывала 71,4% для измерения там, где исправленная метрика показывает 100%. Отдельно: отказ отвечать возвращал управление из скоринга до записи суждения о просроченности, поэтому урезанные руки оценивались по тем двум-трём заданиям, где они случайно не отказались. Оба дефекта найдены чтением сырых ответов, а не сводок, оба исправлены, и оба пересчитаны на сохранённых ответах без повторных вызовов. Сырые файлы опубликованы без изменений, а исправленный скоринг лежит в инструменте.

Чего это не показывает

Один авторский субъект, одна модель, инструменты отключены, 34 факта. Измерение такого размера - это масштаб памяти личного ассистента, а не корпуса документов, и ничто здесь не переносится на большие коллекции. Эталонные ответы берутся из той же таблицы фактов, которую показывают структурированные руки, поэтому исследование меряет извлечение и верное применение выданных записей, а не выяснение того, что о человеке истинно. Измерение к тому же самый длинный контекст, а плоские записи самый короткий; руки с балластом, отделяющей длину от содержания, здесь нет, хотя в предыдущем исследовании была. Правило, приписанное сводке и плоским записям, - что побеждает последнее записанное значение, - это модельное допущение о том, как такие представления строятся.

Открыть result.jsonЧитать методику (EN)ИзмерениеШесть рендереровСырой прогон сетки

Материалы

Инструмент опубликован целиком. dimension.py содержит субъекта, каждый факт с его интервалом и источником, и эталонный движок. views.py порождает все шесть представлений из этой одной таблицы и содержит проверку полноты. items.py содержит 43 задания и оба трека, run.py - раннер и скоринг, analyze.py - статистику на уровне заданий. Каждый сырой прогон опубликован без правок: сетка, раскрытие и запись изменения.