# Revisión adversarial externa de la versión 1 > Esta traducción se ofrece por comodidad. El texto normativo es el original en inglés. ## 1. Protocolo de revisión La versión 1 de este benchmark se sometió a revisión adversarial externa antes de publicarse. El revisor fue **Codex (GPT-5.2)**, ejecutado en local en modo de solo lectura sobre el directorio del instrumento, con una única instrucción: actuar como metodólogo hostil y competente, ordenar los hallazgos según la gravedad con que cada uno amenaza la conclusión declarada, y citar archivo y línea en cada caso. La revisión devolvió dos hallazgos que cambiaron el resultado y cinco que cambiaron lo que podía afirmarse o cómo estaba redactado. Las cifras de la versión 1 se descartaron en lugar de corregirse sobre la marcha, porque dos de los hallazgos afectaban al instrumento mismo y no solo a su interpretación. Este documento registra cada hallazgo, su base probatoria, el remedio aplicado y el efecto sobre las conclusiones. Un benchmark cuyos fallos no se publican es un artefacto de marketing y no una medición. Los hallazgos se clasifican por el tipo de validez que amenazan, siguiendo la división estándar en cuatro categorías empleada en la sección 11 de los métodos. ## 2. Resumen | ID | Validez amenazada | Hallazgo | Disposición | |---|---|---|---| | R1 | Constructo | La manipulación confundía representación con integridad de la información | Remediado añadiendo una condición; la hipótesis original quedó refutada | | R2 | Interna | La causa de la caída en federación se atribuyó mal | Remediado; el fallo estaba en el instrumento, el modelo tenía razón | | R3 | Constructo | Una medida se nombraba más allá de lo que detecta | Renombrada y acotada | | R4 | Conclusión estadística | Significación calculada sobre observaciones no independientes | Reanalizado; un efecto declarado no sobrevivió | | R5 | Constructo | Circularidad del criterio | Aceptado como limitación, no remediado | | R6 | Interna | Defectos a nivel de ítem en cuatro puntos | Todos remediados y verificados de nuevo | | R7 | Externa | La afirmación se enunciaba más ampliamente de lo que el diseño sostiene | Afirmación acotada | ## 3. Hallazgos ### R1. La manipulación confundía representación con integridad de la información **Hallazgo.** La condición en prosa no contenía hechos que la condición estructurada sí contenía: ni la ventana vigente, ni la fecha en que cambió, ni los calendarios de festivos, ni la fórmula de valoración de la contraparte. **Evidencia.** Comparación directa de ambos bloques de contexto. Ningún modelo infiere una política arbitraria de 180 días a partir de filas de transacciones, de modo que los hechos faltantes no eran recuperables de los datos mantenidos constantes entre condiciones. **Valoración.** La comparación estableció que una especificación completa supera a una incompleta, que no era la afirmación que se hacía. La afirmación de que el versionado ayuda por sí mismo no quedaba identificada en absoluto por el diseño, porque no existía una condición equivalente sin versionar. **Remedio.** Se añadió la condición E: prosa completa que lleva exactamente los hechos de la condición C. Esto deja la representación como única variable en el contraste entre C y E. **Efecto sobre las conclusiones.** Decisivo y adverso. La condición E igualó a la C hasta el decimal con p = 1,00. La hipótesis H5 quedó refutada y la afirmación titular de la versión 1 no sobrevivió. ### R2. La causa de la caída en la condición de federación se atribuyó mal **Hallazgo.** La versión 1 informaba de que la condición de federación perdía exactitud por degradación aritmética causada por un contexto más largo. Esa atribución era errónea. **Evidencia.** El revisor leyó las respuestas en bruto. En dos ítems el modelo devolvió exactamente el valor que se obtiene aplicando la regla de la contraparte a las filas de esa contraparte y nuestra propia regla al resto, y así lo indicó en su propia nota explicativa. El comportamiento fue aplicación de una regla, no fallo aritmético. **Valoración.** El defecto estaba en el instrumento. La regla de federación decía "se aplica a cualquier pregunta sobre el contrato C-118 o el proveedor HAL", de modo que las preguntas de informe interno caían legítimamente dentro de su alcance, mientras que las respuestas de referencia aplicaban nuestra propia definición en todos los casos. Además, contrato y proveedor se generaban de forma independiente, así que los alcances positivo y negativo de la regla se solapaban. El modelo siguió la regla que se le dio; la respuesta de referencia no. **Remedio.** Los registros de federación se aplican ahora solo a preguntas dirigidas a la contraparte y lo declaran explícitamente. El corpus se regeneró para que los alcances no puedan solaparse. Se añadió la condición F para separar la longitud del contexto de su contenido, que la explicación original confundía. **Efecto sobre las conclusiones.** Corregido el defecto, la condición de federación es neutra en conjunto y ayuda en las preguntas para las que está pensada. La explicación basada en la longitud se retiró por completo: la condición F no muestra penalización de exactitud por la longitud añadida a estos tamaños. ### R3. Una medida se nombraba más allá de lo que detecta **Hallazgo.** La medida denominada "usó la definición equivocada" solo detecta la igualdad exacta con una respuesta alternativa prefijada. **Evidencia.** Inspección de la función de puntuación. **Valoración.** La medida no puede detectar la aplicación mezclada de dos reglas, un filtro de filas incorrecto, ni una definición equivocada seguida de un error aritmético, y un error aritmético puede coincidir con ella por azar. La afirmación acompañante, según la cual los errores aritméticos producen valores arbitrarios mientras que los de interpretación producen la alternativa exacta, no se sigue de ahí. **Remedio.** Renombrada como "la respuesta es exactamente igual a la que da la definición rival prefijada", con sus límites indicados allí donde aparece. Ahora se describe como cota inferior del error de interpretación. **Efecto sobre las conclusiones.** Ningún cambio numérico. La dirección y la magnitud de la medida se mantienen; solo se redujo la fuerza de la inferencia extraída de ella. ### R4. La significación se calculó sobre observaciones no independientes **Hallazgo.** Tres réplicas de un ítem con un mismo prompt se trataban como tres observaciones independientes, y la prueba agrupaba todas las llamadas. **Evidencia.** Reanálisis a nivel de ítem, realizado de forma independiente por el revisor y reproducido por nosotros. | Análisis | estructurado frente a federación | |---|---| | por llamada, tal como se publicó en la versión 1 | p = 0,027 | | prueba de signos exacta sobre 34 medias de ítem | p = 0,082 | | McNemar sobre la mayoría de tres por ítem | p = 0,057 | **Valoración.** La diferencia de 14,7 puntos entre ambas condiciones no cambia con la corrección; su significación sí. Bajo el análisis corregido no alcanza el umbral convencional. Las comparaciones que sostienen la afirmación principal del estudio, estructurado frente a esquema y frente a documentación incompleta, sobreviven a la corrección con p = 0,0005 y p = 0,0015 respectivamente. **Remedio.** Las réplicas se promedian dentro del ítem, las pruebas pareadas se aplican entre ítems mediante la prueba de signos exacta, y los intervalos de confianza se agrupan por ítem. **Efecto sobre las conclusiones.** Un efecto declarado quedó retirado. El efecto principal no se vio afectado en magnitud y sigue siendo significativo. ### R5. Circularidad del criterio **Hallazgo.** Las respuestas de referencia se derivan de las mismas definiciones que recibe la condición estructurada. **Evidencia.** Inspección del motor de referencia y de la plantilla del prompt. **Valoración.** No hay filtración de la respuesta: el prompt interpola datos, contexto, pregunta y fecha, y nunca la respuesta de referencia. Pero la condición estructurada recibe algo cercano a una especificación ejecutable, de modo que elegir la interpretación se reduce en gran medida a recuperación, y el trabajo restante es la unión y la agregación. El éxito frente a un criterio definido por los autores no demuestra por tanto que la capa descubra el significado de negocio correcto. **Remedio.** Ninguno. La limitación se declara en los métodos y en la página de resultados. **Efecto sobre las conclusiones.** El alcance de toda afirmación sobre exactitud queda acotado a la adhesión a una especificación entregada. Políticas redactadas de forma independiente con adjudicación ciega siguen siendo el paso siguiente adecuado. ### R6. Defectos a nivel de ítem **Hallazgo.** Cuatro defectos en el conjunto de ítems y en el corpus. 1. Un discriminador de alcance no discriminaba: la respuesta correcta también se alcanzaba mediante una aplicación parcialmente incorrecta de la regla. 2. La convención de conteo de días hábiles nunca se enunciaba, de modo que una interpretación de los extremos del intervalo podía confundirse con una elección de calendario. 3. La familia temporal se apoyaba solo en dos medidas, y cuatro ítems compartían un mismo valor de respuesta. 4. Había pedidos generados con fechas anteriores a la de alta de sus clientes. **Remedio.** El discriminador se trasladó a un contrato del mismo proveedor pero fuera de la regla; la convención de conteo se enuncia ahora en la pregunta; se añadió una tercera medida versionada; y las fechas de los pedidos quedan acotadas en la generación. Verificado tras la regeneración, con cero infracciones. **Efecto sobre las conclusiones.** Ruido a nivel de ítem reducido. Ninguna cifra publicada de la versión 2 depende de los ítems defectuosos, que ya no existen. ### R7. La afirmación se enunciaba más ampliamente de lo que el diseño sostiene **Hallazgo.** Las herramientas estuvieron desactivadas en todo momento, de modo que el estudio mide el razonamiento sobre datos tabulares presentes en el contexto. **Valoración.** Los resultados no describen a un agente operativo con acceso a base de datos. Con SQL disponible, el componente aritmético del error cambia y el equilibrio entre condiciones puede desplazarse. **Remedio.** La afirmación defendible se enuncia ahora de forma acotada allí donde aparecen resultados: en este conjunto de ítems, entregar un catálogo preciso de definiciones mejora las respuestas exactas de este modelo frente a documentación ausente o incompleta. ## 4. Lo que la revisión no derribó La ventaja de entregar definiciones, frente al esquema solo y frente a documentación incompleta, sobrevivió al análisis corregido por varios órdenes de magnitud en p, y el revisor lo confirmó con un recálculo independiente. La discrepancia nunca fue sobre si la mejora existía. Fue sobre a qué atribuirla, y la condición E respondió a esa pregunta en contra de la hipótesis original. ## 5. Abierto tras la versión 2 - Un solo corpus sintético. Para la validez externa hacen falta varios generados de forma independiente. - Políticas redactadas por los autores del estudio. Para cerrar R5 hacen falta políticas escritas de forma independiente con adjudicación ciega. - Una sola familia de modelos en dos niveles de capacidad. Otros proveedores sin probar. - Ninguna ejecución con herramientas activadas.