# Semantic Grounding Benchmark v2: métodos > Esta traducción se ofrece por comodidad. El texto normativo es el original en inglés. Versión 2. Fecha de ejecución 2026-09-06. Modelo principal `claude-haiku-4-5-20251001`, modelo secundario `claude-sonnet-5`. 846 llamadas al modelo en el estudio que se publica. Otras 480 llamadas se destinaron a la versión 1 del instrumento, que una revisión externa invalidó; esos datos quedan excluidos de todos los resultados aquí presentados y se analizan en el registro de la revisión. ## 1. Propósito Un agente al que se le hace una pregunta cuantitativa sobre una organización debe elegir una interpretación antes de poder calcular nada. "Cuántos clientes activos tenemos" no es respondible hasta que "activo" queda fijado a una regla, y las organizaciones revisan esas reglas con regularidad y discrepan sobre ellas con sus contrapartes. Este estudio pregunta qué gana un agente cuando se le entregan esas reglas y, en particular, si la ganancia depende de que se entreguen como registros estructurados y versionados en lugar de como documentación ordinaria. La versión 1 medía solo la exactitud. Es la más estrecha de las afirmaciones que se hacen sobre una capa de definiciones y, según estableció la revisión de la versión 1, la que los datos menos sostienen. La versión 2 mide por tanto cinco capacidades, de las cuales la exactitud es una. ## 2. Términos Cada término se emplea en este documento y en la página de resultados con el sentido que se le da aquí, y con ningún otro más amplio. | Término | Significado en este estudio | |---|---| | Anclaje semántico | Correspondencia entre el concepto que nombra una pregunta y el cálculo que el agente realiza al responderla. Una respuesta está anclada cuando ese cálculo implementa la definición que la organización que pregunta considera vigente en la fecha indicada. | | Registro de definición | Enunciado legible por máquina de una definición, con identificador, versión, fecha de entrada en vigor, referencia a la versión que sustituye, rol responsable y parámetros suficientes para calcularla. | | Catálogo de definiciones | Conjunto de registros de definición entregados en una condición dada. | | Documentación en prosa | La misma materia escrita como texto continuo para lectores humanos, sin identificadores, versiones ni campos. | | Registro de federación | Registro que declara cuál de las definiciones de dos organizaciones rige una clase de preguntas, junto con el alcance en que esa declaración se aplica. | | Condición | Uno de varios bloques de contexto insertados entre las tablas de datos y la pregunta. Las condiciones difieren en ese bloque y en nada más. | | Ítem | Una pregunta junto con su respuesta de referencia. Se usa indistintamente con "tarea". | | Respuesta de referencia | Valor devuelto por la implementación de referencia de la definición vigente. Se calcula en código y nunca se entrega al modelo. | | Definición rival | Para un ítem dado, una regla alternativa prefijada que un lector razonable podría aplicar en su lugar. | | Ítem discriminante | Ítem para el que la definición rival da una respuesta numéricamente distinta de la de referencia. Verificado en código para todos los ítems. | | Hueco | Campo que el esquema del catálogo exige y que está ausente, vacío, o que remite a un registro inexistente. | | Elicitación | Detectar un hueco, nombrar el campo ausente y nombrar el rol responsable de aportarlo. | | Ensamblado | Seleccionar del catálogo el subconjunto mínimo de registros que una pregunta dada requiere. | | Decisión de divulgación | Juicio sobre si un elemento de información puede entregarse a una parte solicitante nombrada. | | Error crítico de divulgación | Entrega de identidades de clientes, de condiciones de descuento, o de los datos operativos de un transportista a un competidor suyo. | ## 3. Hipótesis H1 a H4 se especificaron antes de ejecutar la versión 1. H5 se añadió como respuesta a la revisión externa, y H6 a H9 se añadieron junto con las cuatro pistas de capacidad; las cinco son por tanto posteriores a los datos. La distinción se hace constar porque una hipótesis formulada después de ver los datos tiene menos peso probatorio que una formulada antes, y el resultado negativo central de este estudio descansa sobre H5. | | Hipótesis | Prefijada | |---|---|---| | H1 | Entregar definiciones en cualquier forma eleva la exactitud por encima de entregar solo el esquema de datos. | sí | | H2 | La documentación incompleta no eleva la exactitud y aumenta la proporción de respuestas que coinciden con una regla derogada. | sí | | H3 | La ventaja de las definiciones es mayor en preguntas cuya fecha precede a un cambio de definición. | sí | | H4 | Los registros de federación elevan la exactitud en preguntas dirigidas a la contraparte sin reducirla en el resto. | sí | | H5 | Los registros estructurados elevan la exactitud por encima de la prosa que lleva los mismos hechos. | no | | H6 | Solo las condiciones estructuradas pueden identificar la definición y la versión aplicadas. | no | | H7 | Solo las condiciones estructuradas pueden localizar un hueco y nombrar a su rol responsable. | no | | H8 | La clasificación estructurada reduce los errores críticos de divulgación frente a una política en prosa que enuncia las mismas reglas. | no | | H9 | La responsabilidad estructurada eleva la proporción de peticiones que llegan al responsable correcto. | no | ## 4. Materiales ### 4.1 Corpus sintético El corpus se genera de forma determinista a partir de una semilla fija y describe un proveedor, **Meridian Supply Co**: 24 clientes, 72 pedidos, 66 envíos, 56 facturas, 10 devoluciones. Aparecen dos transportistas. **Halden Logistics** tiene dos contratos: C-118, que los registros de federación rigen, y C-301, que excluyen explícitamente. C-301 existe para que el alcance de una regla de federación pueda probarse contra un contrato del mismo proveedor pero situado fuera de la regla, un caso que ninguna señal en los datos distingue. **Zen Freight** tiene el contrato C-204 y queda fuera de las reglas por completo. Las restricciones de generación se aplican y se vuelven a comprobar después: ningún pedido precede a la fecha de alta de su cliente, y contrato y proveedor se asignan de forma consistente, de modo que los alcances positivo y negativo de las reglas de federación no se solapan. ### 4.2 Constructos ambiguos Seis constructos concentran la ambigüedad. Cada uno se eligió por ser un concepto sobre el que departamentos y socios comerciales sostienen reglas genuinamente distintas y defendibles en su contexto. | Constructo | Eje de discrepancia | Versionado | |---|---|---| | cliente activo | ventana de 365 o de 180 días | v1 a v2 el 2026-04-01 | | ingreso neto | flete incluido o excluido, menos devoluciones | v1 a v2 el 2026-05-01 | | entregado | confirmación del cliente o escaneo del transportista | Meridian y Halden difieren | | a tiempo | fecha de promesa original o renegociada | v1 a v2 el 2026-02-01 | | valor del pedido | flete excluido o incluido | Meridian y Halden difieren | | día hábil | dos calendarios de festivos | Meridian y Halden difieren | ### 4.3 Condiciones Las tablas de datos, unos 10 000 caracteres de CSV, son idénticas en todas las condiciones. Solo difiere el bloque de contexto. | Condición | Bloque de contexto | Función en el diseño | |---|---|---| | A esquema | solo definiciones de tablas | Suelo. Lo que recibe un agente cuando no existe capa semántica. | | B prosa, incompleta | una página de wiki del tipo que las organizaciones mantienen en la práctica: sin responsables, sin fechas, con un párrafo derogado por otro y varias reglas ausentes | Documentación realista. | | E prosa, completa | los mismos hechos que la condición C escritos como prosa continua: ventanas, fechas de cambio, fórmulas, roles responsables, ambos calendarios | El control que separa la representación de la integridad de la información. Añadido tras la revisión de la versión 1. | | C registros | registros de definición legibles por máquina con identificador, versión, fecha de entrada en vigor, sustitución y responsable | El tratamiento estudiado. | | F registros + relleno | la condición C más un apéndice inerte igualado al bloque de federación en longitud y posición | Separa la longitud del contexto de su contenido. | | D registros + federación | la condición C más los registros de federación | La capa entre organizaciones. | Los registros de federación se aplican solo a preguntas dirigidas a la contraparte y declaran esa restricción de forma explícita. Los informes internos quedan excluidos por su nombre, incluso cuando las filas implicadas pertenecen al contrato en cuestión. La versión 1 omitía esa restricción, con la consecuencia registrada como hallazgo R2 de la revisión. ## 5. Diseño Diseño intra-ítem de medidas repetidas. Cada ítem se presenta bajo todas las condiciones, de modo que cada ítem sirve de control de sí mismo y la variación de dificultad entre ítems no entra en las comparaciones. La pista A comprende 40 ítems x 6 condiciones x 2 réplicas = 480 llamadas. Las cinco pistas juntas suman 846 llamadas: pista A 480, modelo secundario 160, B1 60, B2 80, B3 18 y B4 48 en 16 cadenas de tres turnos. ## 6. Construcción de los ítems 40 ítems en cuatro familias. - **COMP, 12 ítems.** Cálculo bajo la definición vigente, enmarcado como informe interno. - **TEMP, 10 ítems.** Pregunta cuya fecha de referencia precede a un cambio de definición, sobre tres medidas versionadas. Dos ítems caen exactamente en una fecha de entrada en vigor, donde la regla aplicable depende de si el límite es inclusivo. - **XORG, 12 ítems.** Diez preguntas dirigidas a la contraparte, más dos discriminadores de alcance: el contrato C-301 del mismo proveedor y el proveedor ZEN, ambos fuera de las reglas de federación. - **ABST, 6 ítems.** Preguntas que el corpus no puede responder bajo ninguna definición. La respuesta correcta es declinar e indicar por qué. Los 34 ítems respondibles se verificaron en código como discriminantes en el sentido de la sección 2. Las ambigüedades ajenas al objeto de estudio se eliminaron del texto: cada pregunta interna declara que lo es, cada pregunta dirigida a la contraparte la nombra, y la convención de conteo de días hábiles se enuncia en la pregunta en lugar de dejarse a la inferencia. ## 7. Medidas de la pista A | Código | Medida | Denominador | |---|---|---| | M1 | El valor devuelto es igual a la respuesta de referencia. | ítems respondibles | | M2 | La respuesta nombra el identificador y la versión de la definición aplicable. | ítems respondibles | | M5 | La respuesta declina en un ítem que el corpus no puede responder. Declinar en un ítem respondible se registra aparte como abstención indebida. | ítems no respondibles | | M7 | El valor devuelto es exactamente igual al que produciría la definición rival prefijada. | ítems respondibles | Dos propiedades limitan la interpretación de M7. Detecta únicamente la igualdad exacta con una alternativa prefijada, por lo que no detecta la aplicación mezclada de dos reglas, un filtro de filas incorrecto, ni una definición equivocada seguida de un error aritmético; y un error aritmético puede coincidir con ella por azar. M7 es por tanto una cota inferior del error de interpretación y no una medida de él. En la versión 1 esta medida se denominaba "usó la definición equivocada", lo que afirmaba más de lo que detecta. M2 es inalcanzable por construcción en las condiciones sin catálogo, porque no hay identificadores ni versiones que citar. No es un defecto de la comparación sino el hallazgo mismo: la trazabilidad es una propiedad de la representación y no del modelo. ## 8. Pistas B1 a B4 ### 8.1 B1, elicitación Se introducen seis huecos en el catálogo: un bloque `parameters` vacío, un `effective_from` ausente, un `owner` ausente, un `superseded_by` que remite a una versión inexistente, un calendario que solo cubre el año anterior y una definición ausente por completo. Cada hueco se empareja con una pregunta que no puede responderse hasta llenarlo. Cuatro preguntas de control no contienen hueco y miden la tasa de falsas alarmas. Condiciones: `schema`, `prose_deficient` (los mismos huecos expresados en prosa) y `vercy_deficient` (los mismos huecos expresados en registros). Medidas: hueco detectado, campo ausente nombrado, rol responsable nombrado, tasa de falsas alarmas y exactitud en los controles. ### 8.2 B2, ensamblado El catálogo se amplía a 41 registros que suman 10 332 caracteres, de los cuales cualquier pregunta requiere uno o dos. Primera etapa: el agente selecciona un subconjunto mínimo. Segunda etapa: la pregunta se repite bajo tres condiciones de ensamblado, a saber, el catálogo completo, la selección del propio agente y una línea base de top-5 ingenuo por palabras clave. Medidas: precisión y cobertura de la selección frente al conjunto requerido conocido, tamaño del contexto y exactitud de la respuesta en cada condición. ### 8.3 B3, control de divulgación Doce elementos de información y tres partes solicitantes, a saber, nuestro propio transportista, un transportista competidor y un auditor externo, lo que da 72 decisiones de divulgación por condición. Condiciones: sin política, la política en prosa, y registros de clasificación con los campos `classification`, `release_to` y `basis`. Las dos condiciones con política enuncian las mismas reglas y difieren solo en la representación. Medidas: precisión y cobertura de la entrega, exactitud global de las decisiones y, por separado, el recuento de errores críticos de divulgación. Los dos tipos de error se informan por separado porque sus costes son asimétricos: una negativa innecesaria cuesta fricción, una entrega innecesaria puede costar un contrato. ### 8.4 B4, compleción colaborativa Tres turnos por cadena, con un coordinador y cuatro agentes responsables con rol. El coordinador debe dirigirse a exactamente un responsable y pedir un campo concreto. El responsable posee solo su propia competencia y su propio dato, debe rechazar todo lo que quede fuera de ella y debe nombrar al responsable correcto al rechazar. Después el coordinador registra la respuesta como versión nueva y contesta la pregunta original. Medidas: corrección del encaminamiento, conducta de rechazo del responsable, buena formación del registro producido, corrección de su fecha de entrada en vigor y exactitud de la respuesta final. ## 9. Procedimiento Las herramientas se desactivaron y el prompt de sistema del agente se sustituyó por uno neutro, de modo que el efecto medido sea atribuible al bloque de contexto y no a un armazón de programación. Las respuestas son un único objeto JSON contra un contrato fijo; el éxito de análisis sintáctico fue del 100% en todas las condiciones. El orden de las llamadas se aleatorizó en todo el trabajo, para que la deriva del servicio a lo largo de la ejecución no quede confundida con la condición. ## 10. Análisis estadístico La unidad de análisis es el ítem, no la llamada. Dos réplicas de un ítem bajo una condición no son observaciones independientes, y tratarlas como tales infla el tamaño muestral aparente. Las réplicas se promedian por tanto dentro del ítem antes de aplicar cualquier prueba. Las comparaciones pareadas entre condiciones usan la prueba de signos exacta bilateral sobre medias de ítem. No asume distribución alguna y se ajusta a las puntuaciones acotadas y discretas por ítem que produce este diseño. Los intervalos de confianza se agrupan por ítem. La versión 1 aplicó la prueba de McNemar a nivel de llamadas individuales y sobrestimó en consecuencia la significación; la corrección se cuantifica como hallazgo R4 de la revisión. No se aplica corrección por comparaciones múltiples. Se informan ocho comparaciones pareadas, de modo que un p nominal de 0,05 no debe leerse como una tasa de error familiar del 5%. Las comparaciones que sostienen las conclusiones son significativas con p < 0,002 o no significativas con p = 1,00, así que esta elección no afecta a ninguna conclusión. ## 11. Amenazas a la validez **Validez de constructo.** Las respuestas de referencia se calculan a partir de las mismas definiciones que entrega la condición C. Es lo normal en un benchmark de ejecución de especificaciones, pero implica que el estudio mide la adhesión a una especificación y no el descubrimiento del significado de negocio correcto. El éxito frente a un criterio definido por los autores muestra que un agente aplica correctamente una regla entregada, no que la capa encuentre la regla correcta. Las políticas las redactaron los autores. Políticas redactadas de forma independiente con adjudicación ciega abordarían esto y no se han realizado. **Validez interna.** Las condiciones difieren solo en el bloque de contexto, con datos, texto de la pregunta, parámetros de decodificación y orden de llamadas constantes, por lo que las diferencias entre condiciones son atribuibles a ese bloque. La condición F separa la longitud del bloque de su contenido y no muestra penalización de exactitud por la longitud añadida a estos tamaños. La condición E es unos 1 000 caracteres más corta que la C, porque la prosa es más densa que los registros; si la longitud perjudicara, eso favorecería a E, de modo que la comparación de C frente a E es conservadora a favor de C. **Validez externa.** Un solo corpus sintético, generado una vez. Una sola familia de modelos en dos niveles de capacidad, y ningún otro proveedor. Las herramientas estaban desactivadas, así que los resultados describen a un agente que razona sobre datos tabulares presentes en el contexto, y no describen a un agente operativo con acceso a base de datos, donde el componente aritmético del error cambiaría y el equilibrio entre condiciones podría desplazarse. **Validez de conclusión estadística.** 34 ítems respondibles y 12 ensayos de hueco son muestras pequeñas. La pista B2 tiene 20 observaciones por condición de ensamblado, razón por la cual una diferencia nominal de 20 puntos se informa allí como indistinguible del ruido y no como hallazgo. Las estimaciones por intervalo son en consecuencia amplias y se informan junto a cada estimación puntual en la página de resultados. ## 12. Disponibilidad El generador, el motor de referencia, las condiciones, el conjunto de ítems, los ejecutores y los guiones de análisis se publican íntegros, junto con las ejecuciones brutas sin editar de cada pista. El `result.json` publicado se construye directamente a partir de esas ejecuciones mediante un guion, de modo que las cifras de la página de resultados no pueden apartarse de los datos que las produjeron.