Vercy · 可复现研究

结构并未比完整散文提高准确率。

目的
确定向智能体提供版本化的结构化定义是否改善其回答,以及这种改善应归因于结构本身,还是归因于所提供信息的完整。
设计
一个合成的供应商语料,含六个歧义概念,其规则在已知日期发生变更,并且两家机构的定义各不相同。40 个题项在六种上下文条件下提问,采用题项内设计;另有四条赛道,分别测量缺口发现、上下文组装、披露控制与跨角色补全。共 846 次模型调用。分析单位是题项,不是调用。
主要结果
准确率的提升来自完整而非表示形式。承载与结构化记录相同事实的连贯散文得到完全相同的结果,76.5% 对 76.5%,对 34 个题项的精确双侧符号检验 p = 1.00。
次要结果
只有结构化条件说明了所用规则及其版本(100% 对 0%)、定位到缺失的定义并指出其责任人(83% 对 0%)、把请求发给正确的责任人(100% 对 50%),并在全部 72 次披露决策中没有出现严重错误(0 对 2)。
结论
在这组题项上,准确率取决于告诉智能体什么,而不取决于以何种形式表示。结构化表示的独到之处在于可追溯、缺口发现、披露控制与路由,而散文条件在任何水平上都没有做到其中任何一项。
76.5%完整散文
76.5%版本化记录
p = 1.00没有差异

本页所用术语

术语本研究中的含义
条件插在数据与问题之间的一段上下文。各条件仅在这段上下文上不同,其余完全一致。
定义记录对一条规则的机器可读陈述,带有标识符、版本、生效日期、所替代的版本以及责任角色。
完整散文与记录相同的事实,写成连贯文档,不含标识符、版本和字段。
判别题项对该题项而言,一条看似合理的竞争规则会给出不同的正确答案。全部 34 个可回答题项均已用代码验证。
竞争答案恰好等于预设竞争规则所产生数值的回答。它是解释错误的下界,而不是对解释错误的度量。
严重披露错误把客户身份、折扣条款,或某承运商的运营数据交给该承运商的竞争对手。

设计

承载歧义的是六个概念:活跃客户、净收入、已交付、准时、订单金额和工作日。每个概念都被赋予在已知日期发生变更的规则,并且供应商与其承运商的定义各不相同。随后在六种条件下提出 40 个题项,底层数据表始终完全一致,因此条件之间的任何差异都只能归因于上下文块。每个可回答题项都用代码验证具有判别性。

赛道 A。在既定含义上的准确率

条件准确率(M1)95% 置信区间说明了规则与版本(M2)竞争答案(M7)
仅有表结构26.5%11-420%16.2%
不完整的文档29.4%14-440%35.3%
完整散文76.5%65-880%2.9%
版本化记录76.5%65-88100%1.5%
记录 + 无关填充85.3%78-93100%0.0%
记录 + 联邦规则77.9%67-8998.5%1.5%

以任何形式提供定义,都把准确率从 26.5% 提高到 76.5%,并在对 34 个题项的配对精确符号检验中以 p = 0.0005 成立。而把同样事实写成连贯文档的那一条件,得分与结构化条件完全相同。在本设计下,准确率取决于所提供信息的完整,而不取决于其表示形式。

另外两项结果限定了上面这条。不完整的文档并不优于没有文档,并把与已废止规则相符的回答比例从 16.2% 翻倍到 35.3%:描述已失效规则的文档比没有文档更糟。而拥有结构化条件全部事实的完整散文条件,说明所用规则的比例为 0%,对方为 100%。它算出正确的数值,却无法指出该数值由哪条规则得出。

准确率之外的能力

准确率是所测五项能力之一。在其余四项上,散文条件并不是表现更差,而是根本没有表现。因此以下比较是有与无之间的差异,而不是程度上的差异。

B1。发现缺失的定义

在目录中引入六处缺口:一个空的参数块、缺失的生效日期、缺失的责任人、指向不存在版本的引用、提前一年结束的日历,以及一个完全缺失的定义。每处缺口都配一个在缺口补上之前无法回答的问题。另有四个对照问题不含缺口,用来测量误报率。

条件发现缺口指出字段指出责任人误报
仅有表结构0%0%0%0%
散文,同样的缺口0%0%0%0%
记录,同样的缺口83.3%83.3%83.3%0%

含有同样六处缺口的散文,在十二次试验中一处也没有发现。结构化目录发现了十二次中的十次,每次都指出缺失的字段和负责的角色,并且在四个对照问题上没有误报。两次失败是同一处缺口,即目录中完全不存在的定义:缺字段的记录可以被指认,缺席的记录不能。这划定了该能力的边界,也指出下一步是建立一份预期概念的登记,而不只是现有概念的登记。

B2。只组装问题所需的记录

目录扩大到 41 条记录,并要求智能体在回答前先选出最小子集。随后同一个问题在三种组装条件下重新提出。

组装条件准确率提供的上下文(字符)
整个目录80.0%10,332
智能体自选60.0%473 (5%)
朴素关键词 top-560.0%1,989 (19%)

选择本身近乎完美:所需记录的召回率 100%,精确率 95%,41 条中平均只选 1.2 条,把上下文压缩到目录的二十分之一。裁剪后上下文的准确率在数值上更低,但每种条件只有 20 次观测,该差异与噪声无法区分(p = 0.34)。得到支持的结论是:上下文缩减二十倍,且没有可测量的准确率代价。准确率提升则得不到支持。

B3。判断什么可以披露

十二项信息与三个请求方,即我们自己的承运商、一家竞争承运商和一位外部审计师,每种条件下共 72 次披露决策。散文形式的制度与分类记录陈述的是同样的规则,仅表示形式不同。

制度的表示形式披露精确率披露召回率严重错误(共 72 次)
没有制度39.1%45.0%5
散文形式的制度66.7%100%2
分类记录100%100%0

散文制度下的两次错误是同一种失误:把一家承运商的运营数据交给了它的竞争对手。散文制度用一句话禁止这样做,结构化制度把它编码为一个字段,并在全部 72 次决策中没有出错。这是运营后果最直接的一项结果,因为两类错误并不对称:多余的拒绝代价是摩擦,多余的交付可能代价是一份合同。

B4。跨角色补全一条定义

三轮。协调方必须只向一位责任人提出请求并索取一个具体字段;该责任人只掌握自己的职权和自己的那条事实,职权之外一律拒绝;随后协调方把答案记为一个新版本,并回答问题。

条件发给了正确的责任人版本记录格式正确最终答案正确
散文,同样的缺口50.0%100%50.0%
记录,同样的缺口100%100%50.0%

路由这项跨角色协作特有的能力翻了一倍。散文条件把关于活跃客户窗口和关于节假日日历的请求发错了对象,而在这两处,责任是用一句话而不是用一个字段表达的。两种条件下的最终准确率相同,其限制来自算术,而不是表示形式。

结论

版本化定义层让智能体更准确这一主张,得不到这些数据的支持。准确率是完整性的函数,写得好的文档同样能达到。文档无论质量多高都没有做到的是:指出缺失的定义及其责任人、说明一个数值背后的规则与版本,以及不出错地作出披露决策。这些才是数据支持的主张,我们以它们取代那个更宽泛的说法。

局限

只有一个一次生成的合成语料、一个模型家族的两个能力档位、没有其他供应商,且全程关闭工具。基准答案由结构化条件所收到的同一批定义推导而来,因此本研究衡量的是对所给规范的遵循,而不是对正确业务含义的发现。本工具的版本 1 在联邦规则中存在作用域缺陷,并在非独立观测上计算显著性;两者都由外部对抗式评审发现,都已记录在案,受影响的数字被整体废弃而不是就地修正。

打开 result.json阅读方法阅读外部评审运行器赛道 A 原始记录

材料

整套工具完整公开。world.py 以确定性方式生成合成机构,并包含基准答案引擎,每个定义一份实现。layers.py 保存六种上下文条件,tasks.py 保存 40 个题项,tracks.py 保存四条能力赛道。run.pyrun_tracks.py 负责发起调用,analyze.pyanalyze_tracks.py 在题项层面完成统计。每一次原始运行都未经编辑地公开:赛道 ASonnetB1B2B3B4