Vercy · investigación
Investigación.
Lo que la memoria estructurada aporta a un agente, medido en lugar de afirmado. Los resultados negativos se quedan en la página.
2026-09-06
Personal Dimension Benchmark
- Pregunta
- En los registros propios de una persona, ¿qué aporta la representación al asistente que los lee, y qué parte de una representación estructurada sostiene cada capacidad?
- Resultado
- La estructura no superó a unas notas completas: las notas cronológicas con todos los hechos, fechas y fuentes obtuvieron un 93,4% frente al 100% de la dimensión estructurada, con tres ítems de diferencia, p = 0,25. Cada ablación sí fue decisiva. Sin intervalos de validez la exactitud histórica cayó del 100% al 0% y el juicio sobre caducidad al 20%, sin tocar las preguntas sobre el presente. Sin procedencia, la resolución de conflictos cayó del 100% al 33%. Cada clase de campo es el único soporte de una capacidad.
2026-09-06
Semantic Grounding Benchmark
- Pregunta
- ¿Una capa de definiciones versionadas hace más exacto a un agente cuando dos organizaciones definen las mismas palabras de forma distinta?
- Resultado
- No. La prosa continua con los mismos hechos igualó exactamente a los registros versionados, 76,5% frente a 76,5%, p = 1,00: la exactitud sigue a la integridad de la información, no a su representación. Solo las condiciones estructuradas citaron la regla aplicada, localizaron una definición ausente y a su responsable, dirigieron la petición al responsable correcto y resolvieron 72 decisiones de divulgación sin un error crítico.
2026-08
Recuperación de memoria
- Pregunta
- ¿La recuperación sobre una Dimensión estructurada supera a las notas planas al recordar la historia de un proyecto?
- Resultado
- Empate en exactitud: las 15 preguntas correctas en ambas condiciones en tres ejecuciones nuevas. La recuperación entregó un 57,9% menos de contexto. El resultado es un empate y se publica como tal.
Cómo se publican
Cada estudio publica el instrumento que lo produjo, las ejecuciones brutas sin editar de todas las llamadas al modelo, y el registro de cualquier revisión que invalidara una versión anterior. Donde una afirmación no sobrevivió a los datos, se cambió la afirmación y no los datos. Un benchmark cuyos fallos no se publican es un artefacto de marketing y no una medición.