Vercy · estudio reproducible
La estructura no mejoró la exactitud frente a la prosa completa.
- Objetivo
- Determinar si entregar a un agente definiciones versionadas y estructuradas mejora sus respuestas, y si la mejora es atribuible a la estructura o a la integridad de lo entregado.
- Diseño
- Un corpus sintético de proveedor con seis constructos ambiguos cuyas reglas cambian en fechas conocidas y difieren entre dos organizaciones. 40 ítems preguntados bajo seis condiciones de contexto en un diseño intra-ítem, más cuatro pistas que miden detección de huecos, ensamblado de contexto, control de divulgación y compleción entre roles. 846 llamadas al modelo. La unidad de análisis es el ítem, no la llamada.
- Resultado principal
- La ganancia de exactitud se debe a la integridad de la información y no a su representación. La prosa continua con los mismos hechos que los registros estructurados obtuvo idéntico resultado, 76,5% frente a 76,5%, prueba de signos exacta bilateral sobre 34 ítems p = 1,00.
- Resultados secundarios
- Solo las condiciones estructuradas citaron la regla y la versión aplicadas (100% frente a 0%), localizaron una definición ausente y nombraron a su responsable (83% frente a 0%), dirigieron la petición al responsable correcto (100% frente a 50%) y resolvieron las 72 decisiones de divulgación sin un error crítico (0 frente a 2).
- Conclusión
- En este conjunto de ítems la exactitud es función de lo que se le dice al agente y no de cómo se representa. Lo que distingue a la representación estructurada es la trazabilidad, la detección de huecos, el control de divulgación y el encaminamiento, y ninguna de estas capacidades la alcanzaron las condiciones en prosa a ningún nivel.
Términos usados en esta página
| Término | Significado en este estudio |
|---|---|
| Condición | Un bloque de contexto insertado entre los datos y la pregunta. Las condiciones difieren en ese bloque y en nada más. |
| Registro de definición | Enunciado legible por máquina de una regla, con identificador, versión, fecha de entrada en vigor, la versión que sustituye y el rol responsable. |
| Prosa completa | Los mismos hechos que los registros, escritos como documentación corrida sin identificadores, versiones ni campos. |
| Ítem discriminante | Ítem para el que una regla rival plausible da una respuesta correcta distinta. Verificado en código para los 34 ítems respondibles. |
| Respuesta rival | Respuesta exactamente igual al valor que produciría la regla rival prefijada. Es una cota inferior del error de interpretación, no una medida de él. |
| Error crítico de divulgación | Entrega de identidades de clientes, condiciones de descuento, o datos operativos de un transportista a un competidor suyo. |
Diseño
Seis constructos concentran la ambigüedad: cliente activo, ingreso neto, entregado, a tiempo, valor del pedido y día hábil. A cada uno se le asignaron reglas que cambian en fechas conocidas y que el proveedor y su transportista definen de forma distinta. Después se preguntaron 40 ítems bajo seis condiciones con las tablas de datos idénticas en todos los casos, de modo que cualquier diferencia entre condiciones es atribuible solo al bloque de contexto. Todo ítem respondible se verificó en código como discriminante.
Pista A. Exactitud sobre un significado acordado
| Condición | Exactitud (M1) | IC 95% | Citó regla y versión (M2) | Respuesta rival (M7) |
|---|---|---|---|---|
| solo el esquema | 26,5% | 11-42 | 0% | 16,2% |
| documentación incompleta | 29,4% | 14-44 | 0% | 35,3% |
| prosa completa | 76,5% | 65-88 | 0% | 2,9% |
| registros versionados | 76,5% | 65-88 | 100% | 1,5% |
| registros + relleno inerte | 85,3% | 78-93 | 100% | 0,0% |
| registros + reglas de federación | 77,9% | 67-89 | 98,5% | 1,5% |
Entregar definiciones en cualquier forma elevó la exactitud del 26,5% al 76,5%, y ello resiste una prueba de signos exacta pareada sobre 34 ítems con p = 0,0005. La condición que lleva los mismos hechos como documentación corrida puntuó igual que la estructurada. Bajo este diseño la exactitud queda determinada por la integridad de lo entregado y no por su representación.
Dos resultados adicionales matizan el primero. La documentación incompleta no fue mejor que ninguna y duplicó la proporción de respuestas coincidentes con una regla derogada, del 16,2% al 35,3%: un documento que describe una regla ya no vigente es peor que la ausencia de documento. Y la condición de prosa completa, que posee todos los hechos de la estructurada, citó la regla aplicable en el 0% de las respuestas frente al 100%. Produce el valor correcto y no puede indicar qué regla lo produjo.
Capacidades distintas de la exactitud
La exactitud es una de las cinco capacidades medidas. En las otras cuatro las condiciones en prosa no rindieron peor que las estructuradas: no rindieron en absoluto. Las comparaciones siguientes son por tanto diferencias entre presencia y ausencia, no diferencias de grado.
B1. Detectar una definición ausente
Se introdujeron seis huecos en el catálogo: un bloque de parámetros vacío, una fecha de entrada en vigor ausente, un responsable ausente, una referencia a una versión inexistente, un calendario que termina un año antes y una definición ausente por completo. Cada uno se emparejó con una pregunta que no puede responderse hasta llenar el hueco. Otras cuatro preguntas de control no contenían hueco y miden la tasa de falsas alarmas.
| Condición | Hueco detectado | Campo nombrado | Responsable nombrado | Falsas alarmas |
|---|---|---|---|---|
| solo el esquema | 0% | 0% | 0% | 0% |
| prosa, los mismos huecos | 0% | 0% | 0% | 0% |
| registros, los mismos huecos | 83,3% | 83,3% | 83,3% | 0% |
La prosa que contenía esos mismos seis huecos no detectó ninguno en doce ensayos. El catálogo estructurado detectó diez de doce, nombrando en cada caso el campo ausente y el rol responsable, sin ninguna falsa alarma en los cuatro controles. Los dos fallos correspondieron al mismo hueco, la definición ausente por completo del catálogo: un registro con un campo que falta puede identificarse, un registro ausente no. Esto acota la capacidad e indica el paso siguiente, un registro de conceptos esperados y no solo de los presentes.
B2. Reunir solo los registros que la pregunta requiere
El catálogo se amplió a 41 registros y se pidió al agente que seleccionara un subconjunto mínimo antes de responder. Después se repitió la misma pregunta bajo tres condiciones de ensamblado.
| Condición de ensamblado | Exactitud | Contexto entregado, caracteres |
|---|---|---|
| catálogo entero | 80,0% | 10.332 |
| selección del propio agente | 60,0% | 473 (5%) |
| top-5 ingenuo por palabras | 60,0% | 1.989 (19%) |
La selección resultó casi perfecta: 100% de cobertura de los registros necesarios, 95% de precisión y una media de 1,2 registros elegidos de 41, lo que reduce el contexto a la veinteava parte del catálogo. La exactitud con el contexto reducido es nominalmente menor, pero con 20 observaciones por condición la diferencia no se distingue del ruido (p = 0,34). Lo que queda respaldado es una reducción de contexto de veinte veces sin coste medible en exactitud. Una ganancia de exactitud no queda respaldada.
B3. Decidir qué puede divulgarse
Doce elementos de información y tres partes solicitantes, nuestro propio transportista, un transportista competidor y un auditor externo, lo que da 72 decisiones de divulgación por condición. La política en prosa y los registros de clasificación enuncian las mismas reglas y difieren solo en la representación.
| Representación de la política | Precisión al divulgar | Cobertura al divulgar | Errores críticos, de 72 |
|---|---|---|---|
| sin política | 39,1% | 45,0% | 5 |
| política en prosa | 66,7% | 100% | 2 |
| registros de clasificación | 100% | 100% | 0 |
Los dos errores bajo la política en prosa fueron el mismo fallo: entregar los datos operativos de un transportista a un competidor suyo. La política en prosa lo prohíbe en una frase; la estructurada lo codifica en un campo, y no cometió ningún error en las 72 decisiones. Es el resultado con la consecuencia operativa más directa, porque los dos tipos de error no son simétricos: una negativa innecesaria cuesta fricción, una entrega innecesaria puede costar un contrato.
B4. Completar una definición entre roles
Tres turnos. Un coordinador debe dirigirse a exactamente un responsable y pedir un campo concreto; ese responsable posee solo su propia competencia y su propio dato y debe rechazar todo lo demás; después el coordinador registra la respuesta como una versión nueva y contesta la pregunta.
| Condición | Dirigido al responsable correcto | Registro de versión bien formado | Respuesta final correcta |
|---|---|---|---|
| prosa, los mismos huecos | 50,0% | 100% | 50,0% |
| registros, los mismos huecos | 100% | 100% | 50,0% |
El encaminamiento, la capacidad propia del trabajo entre roles, se duplicó. La condición en prosa dirigió mal las peticiones sobre la ventana de cliente activo y sobre el calendario de festivos, donde la responsabilidad se expresa como frase y no como campo. La exactitud final fue idéntica en ambas condiciones y estuvo limitada por la aritmética, no por la representación.
Conclusión
La afirmación de que una capa de definiciones versionadas hace más exacto a un agente no queda respaldada por estos datos. La exactitud es función de la integridad de la información, y una documentación bien escrita la consigue igual. Lo que la documentación no consiguió con ningún nivel de calidad es identificar una definición ausente y a su responsable, citar la regla y la versión detrás de un valor, y resolver una decisión de divulgación sin error. Esas son las afirmaciones que estos datos sostienen, y se enuncian en lugar de la más amplia.
Limitaciones
Un solo corpus sintético generado una vez, una sola familia de modelos en dos niveles de capacidad, ningún otro proveedor y herramientas desactivadas en todas las ejecuciones. Las respuestas de referencia se derivan de las mismas definiciones que recibe la condición estructurada, de modo que el estudio mide la adhesión a una especificación entregada y no el descubrimiento del significado de negocio correcto. La versión 1 de este instrumento contenía un defecto de alcance en sus reglas de federación y calculaba la significación sobre observaciones no independientes; ambos los identificó una revisión adversarial externa, ambos están documentados, y las cifras afectadas se descartaron en lugar de corregirse sobre la marcha.
Materiales
El instrumento se publica completo. world.py genera las organizaciones sintéticas de forma determinista y contiene el motor de referencia, una implementación por definición. layers.py contiene las seis condiciones de contexto, tasks.py los 40 ítems, tracks.py las cuatro pistas de capacidad. run.py y run_tracks.py lanzan las llamadas, analyze.py y analyze_tracks.py hacen la estadística a nivel de ítem. Cada ejecución bruta se publica sin editar: pista A, Sonnet, B1, B2, B3, B4.