Vercy · воспроизводимое исследование
Структура не превзошла полные заметки. Удаление любой её части - превзошло.
- Цель
- Выяснить, что даёт ассистенту форма представления личных записей человека и какая часть структуры отвечает за какую способность.
- Схема исследования
- Один синтетический человек: 34 факта с интервалами действия и источниками, 7 контактов, 8 поездок, 5 живых конфликтов между источниками разной надёжности, 3 просроченных документа и 2 действующих. Шесть представлений, все порождаются из одной таблицы фактов. 43 задания в семи семействах, плюс трек раскрытия и трек записи изменения. 570 вызовов модели. Единица анализа - задание.
- Основной результат
- Утверждение, что структура помогает, не установлено. Хронологические заметки со всеми фактами, датами и источниками дали 93,4% против 100% у структурированного измерения, расхождение в три задания, точный знаковый критерий p = 0,25.
- Что действительно разделяет
- Каждая абляция структуры оказалась решающей. Удаление интервалов действия обрушило историческую точность со 100% до 0%, а суждение о просроченности со 100% до 20%, при этом вопросы о текущем состоянии остались на 100%. Удаление провенанса обрушило разрешение конфликтов со 100% до 33%, снова не тронув вопросы о текущем состоянии. Только руки с политикой конфликтов смогли назвать применённое правило: 100% против 0%.
- Поправка к предыдущему исследованию
- Трассируемость не является свойством структуры. Когда заметки несут идентификаторы источников, они цитируют их в 96,4% ответов. Предыдущий бенчмарк показал для прозы 0% потому, что у той прозы не было идентификаторов, а не потому, что она проза.
- Вывод
- Для набора личных записей такого размера хорошо ведённые заметки почти достаточны, и ценность структуры не в среднем ответе. Она в том, что поля несущие поодиночке: каждое - единственная опора способности, которая без него обрушивается, и представление, потерявшее любое из них, отказывает конкретным предсказуемым образом, а не деградирует плавно.
Термины, используемые на этой странице
| Термин | Значение в этом исследовании |
|---|---|
| Измерение | Записи, описывающие одного человека: факты, люди и поездки, к которым они отсылают, источники, из которых они пришли, и правило разрешения расхождений. |
| Интервал действия | Даты, между которыми факт был истинным. Открытый интервал означает, что он истинен до сих пор. |
| Уровень источника | Насколько доверяют виду источника: скан документа 1, синхронизация с устройства 2, письмо 3, собственная запись 4. |
| Политика конфликтов | CP-01: если две записи покрывают одну дату и расходятся, побеждает более низкий уровень источника; внутри уровня побеждает более поздняя запись. |
| Наивная свежесть | Правило, которое сводка без провенанса может реализовать: побеждает последнее записанное значение, каким бы ни был источник. |
| Переприсвоение | Ответ на вопрос о прошлой дате значением, действующим сегодня. |
| Абляция | Рука, из которой намеренно удалён один класс полей, чтобы выяснить, какой класс несёт какую способность. |
Схема исследования
Субъект - один синтетический человек, чьи записи выглядят как память личного ассистента: адреса, работодатели, телефоны, зарплата, документы, устройства и гарантии, подписки, медицинские данные, банковские реквизиты и диета. Каждый факт несёт даты, между которыми он был истинным, и источник, из которого пришёл, ранжированный по степени доверия. Пять атрибутов несут по две записи, покрывающие сегодняшний день и расходящиеся; три документа просрочены, два нет.
Предыдущий бенчмарк справедливо критиковали за прозаическое условие, которому тихо не хватало фактов, имевшихся у структурированного. Здесь каждое представление порождается из одной таблицы фактов, и проверка, выполняемая перед каждым прогоном, роняет исследование, если любое полное представление потеряло значение, дату или источник, имеющийся у другого. Эта проверка нашла семь пропусков в заметках ещё при сборке инструмента, и они были исправлены до первого вызова. Руки A, B и D полные; руки C, E и F - абляции, удаляющие по одному классу полей, и помечены как таковые.
Основная сетка
| Представление | Полное | Точность ответа | 95% ДИ | Сослалось на запись | Переприсвоение | Выдумывание | Контекст |
|---|---|---|---|---|---|---|---|
| A заметки | да | 93,4% | 86-100 | 96,4% | 2,6% | 5,3% | 4 664 |
| B заметки + сводка-профиль | да | 93,4% | 86-100 | 92,9% | 4,0% | 5,3% | 5 242 |
| C плоские записи | абляция | 47,4% | 31-63 | - | 6,6% | 1,3% | 2 097 |
| D измерение | да | 100,0% | 100-100 | 100,0% | 0,0% | 0,0% | 10 038 |
| E измерение без провенанса | абляция | 86,8% | 76-98 | - | 5,3% | 5,3% | 4 903 |
| F измерение без интервалов | абляция | 55,3% | 39-71 | 93,3% | 0,0% | 1,3% | 6 744 |
Главное сравнение - рука A против руки D, два полных представления. Заметки ответили верно на 93,4% заданий, измерение на 100%. На 38 отвечаемых заданиях они расходятся в трёх, все в пользу измерения, что точный знаковый критерий оценивает как p = 0,25. На этом наборе заданий структурированное представление не показано более точным, чем полные заметки, и честная формулировка результата - утверждение не установлено, а не опровергнуто.
Три различия всё же переживают малую выборку. Измерение - единственная рука без переприсвоений, то есть оно ни разу не ответило на вопрос о прошлой дате сегодняшним значением, и единственная, которая ни разу не выдала значения, отсутствующего в записях. Его контекст при этом самый большой: 10 038 знаков против 4 664 у заметок, то есть что бы оно ни покупало, оно покупает это примерно вдвое большим контекстом.
По семействам вопросов
| Представление | текущее | историческое | конфликт | просрочка | тёзки | по нескольким записям | неотвечаемое |
|---|---|---|---|---|---|---|---|
| A заметки | 100,0% | 100,0% | 75,0% | 100,0% | 100,0% | 83,3% | 100,0% |
| B заметки + сводка-профиль | 100,0% | 100,0% | 75,0% | 100,0% | 100,0% | 83,3% | 100,0% |
| C плоские записи | 100,0% | 0,0% | 33,3% | 20,0% | 100,0% | 33,3% | 100,0% |
| D измерение | 100,0% | 100,0% | 100,0% | 100,0% | 100,0% | 100,0% | 100,0% |
| E измерение без провенанса | 100,0% | 100,0% | 33,3% | 100,0% | 100,0% | 83,3% | 100,0% |
| F измерение без интервалов | 100,0% | 0,0% | 83,3% | 20,0% | 100,0% | 33,3% | 100,0% |
Средние скрывают форму результата. Каждое представление отвечает на вопросы о текущем состоянии безупречно, включая то, которое не содержит ничего, кроме текущего состояния. Различия целиком в семействах, требующих поля, которого у урезанных рук нет: история, конфликт и просрочка. Плоские записи, хранящие только истинное сегодня, не отвечают ни на один исторический вопрос и на один из пяти вопросов о просрочке, а также отказываются отвечать на 44,7% заданий.
Какое поле несёт какую способность
Каждая абляция сопровождается контрольным семейством, где удалённое поле по предсказанию не должно ничего менять. Именно это отделяет утверждение о поле от утверждения о размере или о структуре вообще.
| Удалённый класс полей | Семейство | Абляция | Полное измерение | p |
|---|---|---|---|---|
| интервалы действия | исторические вопросы | 0,0% | 100,0% | 0,00781 |
| интервалы действия | вопросы о текущем | 100,0% | 100,0% | 1,0 |
| провенанс и политика | вопросы о конфликтах | 33,3% | 100,0% | 0,125 |
| провенанс и политика | вопросы о текущем | 100,0% | 100,0% | 1,0 |
Оба предсказания подтверждаются, и оба контроля держатся. Интервалы действия - это то, что вообще делает исторические вопросы отвечаемыми; без них точность на этом семействе равна нулю, а точность на текущем состоянии не меняется. Провенанс - это то, что заставляет работать разрешение конфликтов; без него точность на конфликтах падает на две трети, и снова точность на текущем состоянии не меняется. В семействе конфликтов всего шесть заданий, и само по себе оно не достигает общепринятого порога, но его направление и его контроль оба такие, как предсказано.
Просрочка, ложные тревоги и отказы
Три документа просрочены, два нет. Два действующих служат контролем: представление, делающее просрочку видимой, не должно начать помечать записи, которые ещё в порядке.
| Представление | Просрочка определена верно | Ложные тревоги | Отказалось от вопроса, на который могло ответить |
|---|---|---|---|
| A заметки | 70,0% | 3,0% | 0,0% |
| B заметки + сводка-профиль | 60,0% | 0,0% | 0,0% |
| C плоские записи | 50,0% | 0,0% | 44,7% |
| D измерение | 90,0% | 0,0% | 0,0% |
| E измерение без провенанса | 90,0% | 0,0% | 5,3% |
| F измерение без интервалов | 60,0% | 9,1% | 39,5% |
Измерение верно судит о просрочке в 90% испытаний без ложных тревог, против 70% у заметок и 60% у сводки-профиля. Урезанные руки выглядят на этой метрике прилично только потому, что часто отказываются: плоские записи отказались от 44,7% отвечаемых заданий, а рука без интервалов действия от 39,5%, против 0% у обоих полных представлений. Отказ - верная реакция на отсутствующие сведения, и именно поэтому точность этих рук следует читать как меру того, чего их представление не может выразить, а не того, как рассуждает модель.
Решение о том, что можно передать
Двенадцать единиц информации и три запрашивающие стороны: сестра субъекта как ближайший родственник, отдел кадров работодателя и непроверенная веб-форма. Прозаический регламент и записи классификации формулируют одни и те же правила и различаются только формой представления.
| Форма регламента | Точность раскрытия | Полнота раскрытия | Верность решений | Критические ошибки |
|---|---|---|---|---|
| без регламента | 95,2% | 58,8% | 79,2% | 1 из 72 |
| регламент прозой | 100,0% | 79,4% | 90,3% | 0 из 72 |
| записи классификации | 100,0% | 88,2% | 94,4% | 0 из 72 |
Предсказание, что структурированная классификация снизит критические ошибки, не подтвердилось. Обе формы регламента дали ноль: короткого, ясно написанного прозаического регламента оказалось достаточно. Структурированная форма дала другое - она реже отказывала зря, выдав 88,2% того, на что запрашивающий имел право, против 79,4% у прозы, при точности 100% в обоих случаях. Единственная критическая ошибка за весь трек пришлась на условие вообще без регламента, которое передало медицинскую подробность работодателю. Это иной исход, чем в предыдущем исследовании, где прозаический регламент допустил две утечки; здешний регламент короче и покрывает меньше случаев, и это наиболее вероятная причина.
Запись изменения
Приходят шесть новых сведений: переезд, обновлённый паспорт, отменённая подписка, новый номер, лабораторное исправление и продлённая страховка. Агент должен записать каждое, не разрушив то, что было истинным раньше.
| Представление | Новое значение верно | Дата начала верна | Закрыта нужная запись | Дата окончания верна | История сохранена | Все четыре верны |
|---|---|---|---|---|---|---|
| A заметки | 100,0% | 83,3% | 0,0% | 100,0% | 100,0% | 0,0% |
| C плоские записи | 100,0% | 100,0% | 0,0% | 75,0% | 100,0% | 0,0% |
| D измерение | 100,0% | 100,0% | 75,0% | 75,0% | 100,0% | 66,7% |
Каждая рука выдала верное новое значение, и каждая заявила, что сохранила историю. Только измерение смогло назвать замещаемую запись - в 75% сценариев, - и только оно получило все четыре части обновления верными, в 66,7%. Заметки и плоские записи получают ноль в этом столбце потому, что у их записей нет идентификаторов, которые можно назвать; это свойство формы представления, а не рассуждения модели: обновление нельзя выразить как замещение, когда нечего замещать по имени. Даже измерение получает всё обновление верным лишь в двух третях случаев, так что это способность, которую форма делает возможной, а не гарантирует.
Вывод
Два исследования теперь сходятся в одном неудобном пункте: по средней точности полную и хорошо ведённую неструктурированную запись трудно превзойти. Что добавляет это исследование - так это место, где различие действительно живёт. Каждый класс полей структуры - единственная опора одной способности, и провал при его отсутствии не плавный спад, а обвал в ноль ровно на тех вопросах, которым это поле служит. Личный ассистент, чья память хранит только текущее состояние, ответит на любой вопрос про сегодня и не ответит ни на один про прошлый год. Именно это утверждение подтверждается данными.
Два дефекта, найденные и исправленные по ходу прогона
Метрика провенанса изначально принимала только идентификатор источника. В руках, несущих ещё и идентификаторы фактов, модель называла факт, что отвечает на заданный вопрос ровно так же однозначно, поэтому метрика штрафовала руки с большим числом идентификаторов; она показывала 71,4% для измерения там, где исправленная метрика показывает 100%. Отдельно: отказ отвечать возвращал управление из скоринга до записи суждения о просроченности, поэтому урезанные руки оценивались по тем двум-трём заданиям, где они случайно не отказались. Оба дефекта найдены чтением сырых ответов, а не сводок, оба исправлены, и оба пересчитаны на сохранённых ответах без повторных вызовов. Сырые файлы опубликованы без изменений, а исправленный скоринг лежит в инструменте.
Чего это не показывает
Один авторский субъект, одна модель, инструменты отключены, 34 факта. Измерение такого размера - это масштаб памяти личного ассистента, а не корпуса документов, и ничто здесь не переносится на большие коллекции. Эталонные ответы берутся из той же таблицы фактов, которую показывают структурированные руки, поэтому исследование меряет извлечение и верное применение выданных записей, а не выяснение того, что о человеке истинно. Измерение к тому же самый длинный контекст, а плоские записи самый короткий; руки с балластом, отделяющей длину от содержания, здесь нет, хотя в предыдущем исследовании была. Правило, приписанное сводке и плоским записям, - что побеждает последнее записанное значение, - это модельное допущение о том, как такие представления строятся.
Материалы
Инструмент опубликован целиком. dimension.py содержит субъекта, каждый факт с его интервалом и источником, и эталонный движок. views.py порождает все шесть представлений из этой одной таблицы и содержит проверку полноты. items.py содержит 43 задания и оба трека, run.py - раннер и скоринг, analyze.py - статистику на уровне заданий. Каждый сырой прогон опубликован без правок: сетка, раскрытие и запись изменения.