Vercy · estudio reproducible

La estructura no superó a unas notas completas. Quitarle cualquier parte, sí.

Objetivo
Determinar qué aporta al asistente la representación de los registros propios de una persona, y qué parte de una representación estructurada sostiene cada capacidad.
Diseño
Una persona sintética: 34 hechos con intervalos de validez y fuentes, 7 contactos, 8 viajes, 5 conflictos vivos entre fuentes de fiabilidad desigual, 3 documentos caducados y 2 vigentes. Seis representaciones, todas generadas de la misma tabla de hechos. 43 ítems en siete familias, más una pista de divulgación y otra de registro de cambios. 570 llamadas al modelo. La unidad de análisis es el ítem.
Resultado principal
La afirmación de que la estructura ayuda no quedó establecida. Las notas cronológicas con todos los hechos, fechas y fuentes obtuvieron un 93,4% frente al 100% de la dimensión estructurada, con tres ítems de diferencia, prueba de signos exacta p = 0,25.
Lo que sí separó
Cada ablación de la estructura fue decisiva. Quitar los intervalos de validez llevó la exactitud histórica del 100% al 0% y el juicio sobre caducidad del 100% al 20%, dejando intactas las preguntas sobre el presente en el 100%. Quitar la procedencia llevó la resolución de conflictos del 100% al 33%, de nuevo sin tocar el presente. Solo los brazos con una política de conflicto pudieron nombrar la regla aplicada: 100% frente a 0%.
Corrección al estudio anterior
La trazabilidad no es una propiedad de la estructura. Cuando las notas llevan identificadores de fuente, los citan en el 96,4% de las respuestas. El benchmark anterior informó de un 0% para la prosa porque aquella prosa no tenía identificadores que citar, no porque fuera prosa.
Conclusión
Para un conjunto de registros personales de este tamaño, unas notas bien llevadas se acercan a ser suficientes, y el valor de la estructura no está en la respuesta media. Está en que los campos son portantes uno a uno: cada uno es el único soporte de una capacidad que se derrumba sin él, y una representación que prescinde de cualquiera falla de forma concreta y predecible en lugar de degradarse suavemente.
93%notas, con todos los hechos
100%dimensión estructurada
0,25prueba de signos pareada, p

Términos usados en esta página

TérminoSignificado en este estudio
DimensiónLos registros que describen a una persona: hechos, las personas y viajes a los que remiten, las fuentes de las que vienen y la regla para resolver discrepancias.
Intervalo de validezLas fechas entre las que un hecho fue cierto. Un intervalo abierto significa que sigue siéndolo.
Nivel de fuenteCuánto se confía en un tipo de fuente: escaneo de documento 1, sincronización de dispositivo 2, correo 3, declarado por uno mismo 4.
Política de conflictoCP-01: cuando dos registros cubren la misma fecha y discrepan, gana el nivel de fuente más bajo; dentro de un nivel, gana la captura más reciente.
Recencia ingenuaLa regla que un resumen sin procedencia puede implementar realmente: gana el valor capturado más recientemente, sea cual sea su fuente.
SobreafirmaciónResponder a una pregunta sobre una fecha pasada con el valor que rige hoy.
AblaciónUn brazo al que se le quita a propósito una clase de campo, para hallar qué clase sostiene qué capacidad.

Diseño

El sujeto es una persona sintética cuyos registros se parecen a la memoria de un asistente personal: direcciones, empleadores, teléfonos, salario, documentos de identidad, dispositivos y garantías, suscripciones, datos de salud, cuenta bancaria y dieta. Cada hecho lleva las fechas entre las que fue cierto y la fuente de la que vino, ordenada por cuánto se confía en ese tipo de fuente. Cinco atributos llevan dos registros que cubren hoy y discrepan; tres documentos han caducado y dos no.

Al benchmark anterior se le criticó, con razón, por una condición en prosa a la que le faltaban en silencio hechos que la condición estructurada sí tenía. Aquí cada representación se genera de una única tabla de hechos, y una comprobación que corre antes de cada ejecución hace fallar el estudio si a alguna representación completa le falta un valor, una fecha o una fuente que otra sí lleva. Esa comprobación encontró siete omisiones en las notas mientras se construía el instrumento, y se corrigieron antes de la primera llamada. Los brazos A, B y D son completos; los brazos C, E y F son ablaciones que quitan una clase de campo cada una, y así se etiquetan.

La rejilla principal

RepresentaciónCompletaExactitudIC 95%Citó el registroSobreafirmaciónInvenciónContexto
A notas93,4%86-10096,4%2,6%5,3%4.664
B notas + resumen de perfil93,4%86-10092,9%4,0%5,3%5.242
C registros planosablación47,4%31-63-6,6%1,3%2.097
D dimensión100,0%100-100100,0%0,0%0,0%10.038
E dimensión sin procedenciaablación86,8%76-98-5,3%5,3%4.903
F dimensión sin validezablación55,3%39-7193,3%0,0%1,3%6.744

La comparación principal es el brazo A contra el brazo D, las dos representaciones completas. Las notas acertaron el 93,4% de los ítems, la dimensión el 100%. En 38 ítems respondibles discrepan en tres, todos a favor de la dimensión, lo que una prueba de signos exacta sitúa en p = 0,25. En este conjunto de ítems no se demuestra que la representación estructurada sea más exacta que unas notas completas, y el enunciado honesto del resultado es que la afirmación no quedó establecida, no que quedara refutada.

Tres diferencias sí sobreviven a la muestra pequeña. La dimensión es el único brazo sin sobreafirmaciones, es decir, nunca respondió a una pregunta sobre una fecha pasada con el valor de hoy, y el único que nunca produjo un valor ausente de los registros. Su contexto es además el mayor, 10.038 caracteres frente a 4.664 de las notas, así que lo que compre, lo compra con aproximadamente el doble de contexto.

Por familia de preguntas

Representaciónpresentehistóricoconflictocaducidadmismo nombrevarios registrosno respondible
A notas100,0%100,0%75,0%100,0%100,0%83,3%100,0%
B notas + resumen de perfil100,0%100,0%75,0%100,0%100,0%83,3%100,0%
C registros planos100,0%0,0%33,3%20,0%100,0%33,3%100,0%
D dimensión100,0%100,0%100,0%100,0%100,0%100,0%100,0%
E dimensión sin procedencia100,0%100,0%33,3%100,0%100,0%83,3%100,0%
F dimensión sin validez100,0%0,0%83,3%20,0%100,0%33,3%100,0%

Las medias ocultan la forma del resultado. Toda representación responde perfectamente a las preguntas sobre el presente, incluida la que no guarda más que el presente. Las diferencias están enteramente en las familias que necesitan un campo que los brazos ablacionados no tienen: historia, conflicto y caducidad. Los registros planos, que guardan solo lo cierto hoy, no responden a ninguna pregunta histórica y a una de cada cinco sobre caducidad, y declinan el 44,7% de los ítems que se les plantearon.

Qué campo sostiene qué capacidad

Cada ablación va emparejada con una familia de control donde se predice que el campo quitado no cambia nada. Eso es lo que separa una afirmación sobre un campo de una afirmación sobre el tamaño o sobre la estructura en general.

Clase de campo quitadaFamiliaAblacionadoDimensión completap
intervalos de validezpreguntas históricas0,0%100,0%0,00781
intervalos de validezpreguntas del presente100,0%100,0%1,0
procedencia y políticapreguntas de conflicto33,3%100,0%0,125
procedencia y políticapreguntas del presente100,0%100,0%1,0

Ambas predicciones se sostienen y ambos controles también. Los intervalos de validez son lo que hace respondibles las preguntas históricas; sin ellos la exactitud en esa familia es cero, y la del presente no cambia. La procedencia es lo que hace funcionar la resolución de conflictos; sin ella la exactitud en conflictos cae dos tercios, y de nuevo la del presente no cambia. El contraste de conflicto tiene solo seis ítems y por sí solo no alcanza el umbral convencional, pero su dirección y su control son los predichos.

Caducidad, falsas alarmas y declinar

Tres documentos han caducado y dos no. Los dos vigentes son controles: una representación que hace visible la caducidad no debe empezar a marcar registros que siguen siendo buenos.

RepresentaciónCaducidad juzgada correctamenteFalsas alarmasDeclinó una pregunta que podía responder
A notas70,0%3,0%0,0%
B notas + resumen de perfil60,0%0,0%0,0%
C registros planos50,0%0,0%44,7%
D dimensión90,0%0,0%0,0%
E dimensión sin procedencia90,0%0,0%5,3%
F dimensión sin validez60,0%9,1%39,5%

La dimensión juzga la caducidad correctamente en el 90% de los ensayos sin falsas alarmas, frente al 70% de las notas y el 60% del resumen de perfil. Los brazos ablacionados parecen respetables en esta métrica solo porque declinan mucho: los registros planos declinaron el 44,7% de los ítems respondibles y el brazo sin intervalos de validez el 39,5%, frente al 0% de ambas representaciones completas. Declinar es la respuesta correcta a una información que no se tiene, y por eso la exactitud de esos brazos debe leerse como una medida de lo que su representación no puede expresar y no de cómo razona el modelo.

Decidir qué puede entregarse

Doce elementos de información y tres partes solicitantes: la hermana del sujeto como pariente más cercano, el departamento de personal del empleador y un formulario web no verificado. La política en prosa y los registros de clasificación enuncian las mismas reglas y difieren solo en la representación.

Representación de la políticaPrecisión al divulgarCobertura al divulgarExactitud de decisiónErrores críticos
sin política95,2%58,8%79,2%1 de 72
política en prosa100,0%79,4%90,3%0 de 72
registros de clasificación100,0%88,2%94,4%0 de 72

La predicción de que la clasificación estructurada reduciría los errores críticos no quedó respaldada. Ambas formas de política produjeron cero: una política en prosa corta y claramente escrita bastó. Lo que sí hizo la forma estructurada fue negar menos innecesariamente, entregando el 88,2% de lo que el solicitante tenía derecho a recibir frente al 79,4% de la prosa, con una precisión del 100% en ambas. El único error crítico de toda la pista vino de la condición sin política alguna, que entregó un detalle de salud al empleador. Es un resultado distinto del estudio anterior, donde una política en prosa filtró dos veces; la política de aquí es más corta y cubre menos casos, y esa es la razón más probable.

Registrar un cambio

Llegan seis informaciones nuevas: una mudanza, un pasaporte renovado, una suscripción cancelada, un número nuevo, una corrección de laboratorio y una póliza renovada. El agente debe registrar cada una sin destruir lo que era cierto antes.

RepresentaciónValor nuevo correctoFecha de inicio correctaCerró el registro correctoFecha de fin correctaHistoria conservadaLos cuatro correctos
A notas100,0%83,3%0,0%100,0%100,0%0,0%
C registros planos100,0%100,0%0,0%75,0%100,0%0,0%
D dimensión100,0%100,0%75,0%75,0%100,0%66,7%

Todos los brazos produjeron el valor nuevo correcto y todos dijeron haber conservado la historia. Solo la dimensión pudo nombrar el registro que sustituía, en el 75% de los escenarios, y fue el único que acertó las cuatro partes de la actualización, en el 66,7%. Las notas y los registros planos puntúan cero en esa columna porque sus registros no tienen identificadores que nombrar, lo cual es una propiedad de la representación y no del razonamiento del modelo: una actualización no puede expresarse como sustitución cuando no hay nada a lo que sustituir por su nombre. Incluso la dimensión acierta la actualización entera solo dos de cada tres veces, así que es una capacidad que la representación hace posible y no garantiza.

Conclusión

Dos estudios coinciden ya en el mismo punto incómodo: en exactitud media, un registro no estructurado completo y bien llevado es difícil de superar. Lo que este estudio añade es dónde vive realmente la diferencia. Cada clase de campo de la estructura es el único soporte de una capacidad, y el fallo cuando falta no es un declive suave sino un desplome a cero exactamente en las preguntas a las que ese campo sirve. Un asistente personal cuya memoria guarda solo el estado presente responderá a toda pregunta sobre hoy y no podrá responder a una sola sobre el año pasado. Esa es la afirmación que estos datos sostienen.

Dos defectos hallados y corregidos durante la ejecución

La medida de procedencia aceptaba al principio solo el identificador de la fuente. En los brazos que además llevan identificadores de registro el modelo citaba el registro, lo que responde a la pregunta planteada con idéntica falta de ambigüedad, de modo que la medida penalizaba a los brazos con más identificadores; informaba de un 71,4% para la dimensión donde la medida corregida informa del 100%. Por separado, una abstención salía del evaluador antes de registrar el juicio sobre caducidad, así que los brazos ablacionados se puntuaban en los dos o tres ítems en los que casualmente no declinaban. Ambos se hallaron leyendo respuestas en bruto en lugar de resúmenes, ambos se corrigieron y ambos se recalcularon a partir de las respuestas guardadas sin repetir una llamada. Los ficheros en bruto se publican sin modificar y el evaluador corregido es el que está en el instrumento.

Lo que esto no muestra

Un sujeto redactado, un modelo, herramientas desactivadas, 34 hechos. Una dimensión de este tamaño es la escala de la memoria de un asistente personal y no la de un corpus documental, y nada de esto se transfiere a colecciones grandes. Las respuestas de referencia salen de la misma tabla de hechos que muestran los brazos estructurados, así que el estudio mide la recuperación y la aplicación correcta de registros entregados, no el descubrimiento de lo que es cierto sobre una persona. La dimensión es además el contexto más largo y los registros planos el más corto; no hay aquí un control de relleno que separe la longitud del contenido, cosa que el estudio anterior sí tenía. La regla atribuida a los brazos de resumen y planos, que gana el valor capturado más recientemente, es un supuesto de modelado sobre cómo se construyen esas representaciones.

Abrir result.jsonLeer los métodos (EN)La dimensiónLos seis generadoresEjecución bruta

Materiales

El instrumento se publica completo. dimension.py contiene al sujeto, cada hecho con su intervalo y su fuente, y el motor de referencia. views.py genera las seis representaciones a partir de esa única tabla y contiene la comprobación de integridad. items.py contiene los 43 ítems y ambas pistas, run.py el ejecutor y la puntuación, analyze.py la estadística a nivel de ítem. Cada ejecución bruta se publica sin editar: la rejilla, divulgación y registro de cambios.