Vercy · 研究

研究。

结构化记忆能为智能体做什么,用测量说话而不是用断言说话。否定性结果留在页面上。

2026-09-06

Personal Dimension Benchmark

问题
对于一个人自己的记录,表示形式为读取它们的助手带来了什么,结构中的哪一部分承载哪一项能力?
结果
结构并未胜过完整的笔记:承载全部事实、日期与来源的时序笔记得到 93.4%,结构化维度为 100%,相差三个题项,p = 0.25。但每一次消融都是决定性的。去掉有效期区间后,历史问题的准确率从 100% 降到 0%,过期判断降到 20%,而当前状态问题毫发无损。去掉来源后,冲突解决从 100% 降到 33%。每一类字段都是某一项能力的唯一支撑。

2026-09-06

Semantic Grounding Benchmark

问题
当两家机构对同样的词给出不同定义时,版本化的定义层能否让智能体更准确?
结果
不能。承载同样事实的连贯散文与版本化记录完全持平,76.5% 对 76.5%,p = 1.00:准确率取决于完整,而不是表示形式。只有结构化条件说明了所用规则、定位到缺失的定义及其责任人、把请求发给正确的责任人,并在 72 次披露决策中没有出现严重错误。

2026-08

记忆检索

问题
在回忆一个项目自身的历史时,基于结构化维度的检索能否胜过普通笔记?
结果
准确率持平:三次全新运行中,两种条件下 15 个问题全部答对。检索所提供的上下文少 57.9%。结果是平局,也按平局发布。

这些研究如何发布

这里的每项研究都会公开产生它的工具、所有模型调用未经编辑的原始运行,以及任何推翻早期版本的评审记录。当某个主张没能经受住数据的检验时,改的是主张,而不是数据。一项不公布自身失败的基准,是营销制品而不是测量。