Vercy · estudio reproducible
Las herramientas no cerraron la brecha. La ampliaron.
- Objetivo
- Todos los estudios de esta serie desactivaron las herramientas y lo declararon como su principal limitación: con una shell y un fichero de datos cambia el componente aritmético del error y el equilibrio entre representaciones podría desplazarse. Esto lo comprueba.
- Diseño
- El benchmark publicado, repetido sin cambios salvo que las cinco tablas salen del prompt al disco como ficheros CSV y el agente recibe Bash, Read, Glob y Grep en un directorio de trabajo nuevo por llamada. Las mismas seis condiciones, los mismos 40 ítems, las mismas respuestas de referencia y el mismo evaluador. 240 llamadas, una réplica por ítem, mediana de 55 segundos cada una.
- Resultado principal
- Las herramientas eliminaron el error aritmético solo donde se conocía el significado. Las cuatro condiciones con definiciones completas subieron a entre el 97,1% y el 100%. Las dos sin ellas no se movieron: solo esquema pasó del 26,5% al 23,5%, y la documentación incompleta del 29,4% al 32,4%.
- La parte incómoda
- Donde faltaban definiciones, las herramientas hicieron al agente equivocarse con más confianza. La tasa de responder exactamente con el número de una regla derogada subió del 16,2% al 29,4% con solo esquema y del 35,3% al 47,1% con documentación incompleta, y la abstención correcta cayó del 83,3% al 50,0% y al 66,7%.
- Conclusión
- La limitación queda resuelta en la dirección contraria a la expectativa habitual. Las herramientas no sustituyen a saber qué significan las palabras: elevan el coste de no saberlo. La brecha entre tener definiciones y no tenerlas pasó de 50 puntos sin herramientas a 74 con ellas.
Qué cambió y qué no, a propósito
Cambió: las cinco tablas salen del prompt al disco y el agente recibe una shell en un directorio nuevo por llamada. Así es un despliegue real y ese es todo el objetivo. No cambió: las seis condiciones, los 40 ítems, las respuestas de referencia, el contrato de salida y el evaluador son los publicados, y el contexto sigue llegando en el prompt, porque el contexto es el tratamiento. Llevarlo también a un fichero cambiaría dos cosas a la vez.
Exactitud, antes y después
| Condición | Definiciones | Sin herramientas | Con herramientas | Cambio |
|---|---|---|---|---|
| A solo esquema | ausentes o incompletas | 26,5% | 23,5% | -2,9 |
| B documentación, incompleta | ausentes o incompletas | 29,4% | 32,4% | +2,9 |
| E prosa, completa | completas | 76,5% | 100,0% | +23,5 |
| C registros versionados | completas | 76,5% | 97,1% | +20,6 |
| F registros + relleno inerte | completas | 85,3% | 100,0% | +14,7 |
| D registros + reglas de federación | completas | 77,9% | 100,0% | +22,1 |
La división es nítida. Toda condición que sabe qué significan las palabras llega al techo; ninguna de las que no lo saben se mueve. Una shell calcula lo que le pidas, y qué calcular es justo lo que responde una definición.
Los dos tipos de error
La exactitud es aquí la columna menos interesante. Importan otras dos: con qué frecuencia el agente devolvió exactamente el número de una regla derogada o rival, y con qué frecuencia declinó correctamente una pregunta que los datos no pueden responder.
| Condición | Respuesta con regla derogada, sin herramientas | con herramientas | Abstención correcta, sin herramientas | con herramientas |
|---|---|---|---|---|
| A solo esquema | 16,2% | 29,4% | 83,3% | 50,0% |
| B documentación, incompleta | 35,3% | 47,1% | 83,3% | 66,7% |
| E prosa, completa | 2,9% | 0,0% | 66,7% | 50,0% |
| C registros versionados | 1,5% | 0,0% | 58,3% | 66,7% |
| F registros + relleno inerte | 0,0% | 0,0% | 66,7% | 50,0% |
| D registros + reglas de federación | 1,5% | 0,0% | 66,7% | 83,3% |
Ambas se mueven en la dirección equivocada donde faltan definiciones. Con una calculadora y sin definición, el agente calcula algo, y lo que calcula es más a menudo el número que daría una regla derogada. También deja de decir que no puede responder: la abstención correcta con solo esquema cayó un tercio. Donde hay definiciones, la tasa de regla derogada baja a cero en todas las condiciones.
Por familia de preguntas, con herramientas
| Condición | cálculo | a fecha pasada | hacia la contraparte | no respondibles |
|---|---|---|---|---|
| A solo esquema | 41,7% | 20,0% | 8,3% | 50,0% |
| B documentación, incompleta | 41,7% | 50,0% | 8,3% | 66,7% |
| E prosa, completa | 100,0% | 100,0% | 100,0% | 50,0% |
| C registros versionados | 100,0% | 100,0% | 91,7% | 66,7% |
| F registros + relleno inerte | 100,0% | 100,0% | 100,0% | 50,0% |
| D registros + reglas de federación | 100,0% | 100,0% | 100,0% | 83,3% |
Las condiciones con definiciones son perfectas o casi en las tres familias respondibles. La familia no respondible es donde las herramientas perjudican: el agente tiene una shell, así que produce un número en vez de declinar.
Las comparaciones sobre las que se apoyaba el estudio anterior
| Comparación | p sin herramientas | Desde, con herramientas | Hasta, con herramientas | p con herramientas |
|---|---|---|---|---|
| A solo esquema frente a C registros versionados | 0,00055 | 23,5% | 97,1% | 0,0 |
| B documentación, incompleta frente a C registros versionados | 0,00151 | 32,4% | 97,1% | 0,0 |
| E prosa, completa frente a C registros versionados | 1,0 | 100,0% | 97,1% | 1,0 |
| C registros versionados frente a D registros + reglas de federación | 1,0 | 97,1% | 100,0% | 1,0 |
| A solo esquema frente a E prosa, completa | 0,00151 | 23,5% | 100,0% | 0,0 |
El hallazgo que sostenía el estudio original, que lo que eleva la exactitud es entregar definiciones, sobrevive y se refuerza: 25 ítems mejor y ninguno peor. El hallazgo que iba en nuestra contra también sobrevive: la prosa completa y los registros versionados siguen siendo indistinguibles, ahora en 100% y 97,1%, con el único ítem discordante a favor de la prosa.
Conclusión
Las herramientas resuelven la limitación que los estudios anteriores declararon, y la resuelven en contra de la suposición común. No compensan la falta de semántica: hacen el fallo más silencioso y más seguro de sí, porque un agente que puede calcular deja de decir que no puede responder. La lectura práctica es que dar a un agente acceso a la base sin darle las definiciones es peor de lo que parece, y parece mejor de lo que es.
Lo que esto no muestra
Una réplica por ítem en vez de dos, así que no hay promediado dentro del ítem y las estimaciones son más ruidosas que en el estudio original. Un modelo, un mundo sintético, y una shell con ficheros CSV locales en lugar de una base de datos real con planificador de consultas y permisos. El uso de herramientas costó unas cinco veces más tiempo: mediana de 55 segundos por llamada frente a unos 10 sin ellas. Las condiciones de contexto siguen llegando en el prompt; un despliegue que pusiera también las definiciones en disco podría comportarse de otro modo, y eso es lo próximo que hay que probar.