Vercy · estudio reproducible

Las herramientas no cerraron la brecha. La ampliaron.

Objetivo
Todos los estudios de esta serie desactivaron las herramientas y lo declararon como su principal limitación: con una shell y un fichero de datos cambia el componente aritmético del error y el equilibrio entre representaciones podría desplazarse. Esto lo comprueba.
Diseño
El benchmark publicado, repetido sin cambios salvo que las cinco tablas salen del prompt al disco como ficheros CSV y el agente recibe Bash, Read, Glob y Grep en un directorio de trabajo nuevo por llamada. Las mismas seis condiciones, los mismos 40 ítems, las mismas respuestas de referencia y el mismo evaluador. 240 llamadas, una réplica por ítem, mediana de 55 segundos cada una.
Resultado principal
Las herramientas eliminaron el error aritmético solo donde se conocía el significado. Las cuatro condiciones con definiciones completas subieron a entre el 97,1% y el 100%. Las dos sin ellas no se movieron: solo esquema pasó del 26,5% al 23,5%, y la documentación incompleta del 29,4% al 32,4%.
La parte incómoda
Donde faltaban definiciones, las herramientas hicieron al agente equivocarse con más confianza. La tasa de responder exactamente con el número de una regla derogada subió del 16,2% al 29,4% con solo esquema y del 35,3% al 47,1% con documentación incompleta, y la abstención correcta cayó del 83,3% al 50,0% y al 66,7%.
Conclusión
La limitación queda resuelta en la dirección contraria a la expectativa habitual. Las herramientas no sustituyen a saber qué significan las palabras: elevan el coste de no saberlo. La brecha entre tener definiciones y no tenerlas pasó de 50 puntos sin herramientas a 74 con ellas.
97%registros versionados, con herramientas
24%solo esquema, con herramientas
29%solo esquema, respuestas con regla derogada

Qué cambió y qué no, a propósito

Cambió: las cinco tablas salen del prompt al disco y el agente recibe una shell en un directorio nuevo por llamada. Así es un despliegue real y ese es todo el objetivo. No cambió: las seis condiciones, los 40 ítems, las respuestas de referencia, el contrato de salida y el evaluador son los publicados, y el contexto sigue llegando en el prompt, porque el contexto es el tratamiento. Llevarlo también a un fichero cambiaría dos cosas a la vez.

Exactitud, antes y después

CondiciónDefinicionesSin herramientasCon herramientasCambio
A solo esquemaausentes o incompletas26,5%23,5%-2,9
B documentación, incompletaausentes o incompletas29,4%32,4%+2,9
E prosa, completacompletas76,5%100,0%+23,5
C registros versionadoscompletas76,5%97,1%+20,6
F registros + relleno inertecompletas85,3%100,0%+14,7
D registros + reglas de federacióncompletas77,9%100,0%+22,1

La división es nítida. Toda condición que sabe qué significan las palabras llega al techo; ninguna de las que no lo saben se mueve. Una shell calcula lo que le pidas, y qué calcular es justo lo que responde una definición.

Los dos tipos de error

La exactitud es aquí la columna menos interesante. Importan otras dos: con qué frecuencia el agente devolvió exactamente el número de una regla derogada o rival, y con qué frecuencia declinó correctamente una pregunta que los datos no pueden responder.

CondiciónRespuesta con regla derogada, sin herramientascon herramientasAbstención correcta, sin herramientascon herramientas
A solo esquema16,2%29,4%83,3%50,0%
B documentación, incompleta35,3%47,1%83,3%66,7%
E prosa, completa2,9%0,0%66,7%50,0%
C registros versionados1,5%0,0%58,3%66,7%
F registros + relleno inerte0,0%0,0%66,7%50,0%
D registros + reglas de federación1,5%0,0%66,7%83,3%

Ambas se mueven en la dirección equivocada donde faltan definiciones. Con una calculadora y sin definición, el agente calcula algo, y lo que calcula es más a menudo el número que daría una regla derogada. También deja de decir que no puede responder: la abstención correcta con solo esquema cayó un tercio. Donde hay definiciones, la tasa de regla derogada baja a cero en todas las condiciones.

Por familia de preguntas, con herramientas

Condicióncálculoa fecha pasadahacia la contraparteno respondibles
A solo esquema41,7%20,0%8,3%50,0%
B documentación, incompleta41,7%50,0%8,3%66,7%
E prosa, completa100,0%100,0%100,0%50,0%
C registros versionados100,0%100,0%91,7%66,7%
F registros + relleno inerte100,0%100,0%100,0%50,0%
D registros + reglas de federación100,0%100,0%100,0%83,3%

Las condiciones con definiciones son perfectas o casi en las tres familias respondibles. La familia no respondible es donde las herramientas perjudican: el agente tiene una shell, así que produce un número en vez de declinar.

Las comparaciones sobre las que se apoyaba el estudio anterior

Comparaciónp sin herramientasDesde, con herramientasHasta, con herramientasp con herramientas
A solo esquema frente a C registros versionados0,0005523,5%97,1%0,0
B documentación, incompleta frente a C registros versionados0,0015132,4%97,1%0,0
E prosa, completa frente a C registros versionados1,0100,0%97,1%1,0
C registros versionados frente a D registros + reglas de federación1,097,1%100,0%1,0
A solo esquema frente a E prosa, completa0,0015123,5%100,0%0,0

El hallazgo que sostenía el estudio original, que lo que eleva la exactitud es entregar definiciones, sobrevive y se refuerza: 25 ítems mejor y ninguno peor. El hallazgo que iba en nuestra contra también sobrevive: la prosa completa y los registros versionados siguen siendo indistinguibles, ahora en 100% y 97,1%, con el único ítem discordante a favor de la prosa.

Conclusión

Las herramientas resuelven la limitación que los estudios anteriores declararon, y la resuelven en contra de la suposición común. No compensan la falta de semántica: hacen el fallo más silencioso y más seguro de sí, porque un agente que puede calcular deja de decir que no puede responder. La lectura práctica es que dar a un agente acceso a la base sin darle las definiciones es peor de lo que parece, y parece mejor de lo que es.

Lo que esto no muestra

Una réplica por ítem en vez de dos, así que no hay promediado dentro del ítem y las estimaciones son más ruidosas que en el estudio original. Un modelo, un mundo sintético, y una shell con ficheros CSV locales en lugar de una base de datos real con planificador de consultas y permisos. El uso de herramientas costó unas cinco veces más tiempo: mediana de 55 segundos por llamada frente a unos 10 sin ellas. Las condiciones de contexto siguen llegando en el prompt; un despliegue que pusiera también las definiciones en disco podría comportarse de otro modo, y eso es lo próximo que hay que probar.

Abrir result.jsonEl ejecutorEjecución brutaEl estudio original