# 对版本 1 的外部对抗式评审 > 译文仅供阅读便利。具有规范效力的是英文原文。 ## 1. 评审规程 本基准的版本 1 在发布前接受了外部对抗式评审。评审者是 **Codex(GPT-5.2)**,以只读模式在 本地跑遍工具目录,只给了一条指令:以怀有敌意且称职的方法学家身份行事,按每项发现对既定结 论的威胁程度排序,并逐条给出文件与行号。 评审返回了两项改变结果的发现,以及五项改变"可以主张什么"或改变措辞的发现。版本 1 的数字被 整体废弃而不是就地修正,因为其中两项发现涉及工具本身,而不只是对工具的解读。本文记录每项 发现、其证据基础、所采取的修正,以及对结论的影响。一项不公布自身失败的基准,是营销制品而 不是测量。 各项发现按其所威胁的效度类型分类,沿用方法第 11 节所采用的标准四分法。 ## 2. 概览 | 编号 | 受威胁的效度 | 发现 | 处置 | |---|---|---|---| | R1 | 构念 | 处理把表示形式与完整性混同 | 通过增加一个条件修正;原假设被推翻 | | R2 | 内部 | 联邦条件下降的原因归因错误 | 已修正;错在工具,模型是对的 | | R3 | 构念 | 一项指标的命名超出其检测范围 | 已改名并界定 | | R4 | 统计结论 | 在非独立观测上计算显著性 | 已重新分析;一项声称的效应未能存活 | | R5 | 构念 | 判准的循环性 | 作为局限接受,未修正 | | R6 | 内部 | 四处题项层面的缺陷 | 全部修正并复检 | | R7 | 外部 | 主张的表述超出设计所能支持的范围 | 主张已收窄 | ## 3. 各项发现 ### R1. 处理把表示形式与完整性混同 **发现。** 散文条件不包含结构化条件所包含的事实:没有当时生效的窗口、没有它变更的日期、没 有节假日日历,也没有交易对方的估值公式。 **证据。** 对两段上下文块的直接比对。没有哪个模型能从交易明细行推断出一条任意的 180 天规 则,因此缺失的事实无法从各条件间保持恒定的数据中还原。 **评估。** 该比较确立的是"完整的规范优于不完整的规范",而这并不是当时所作的主张。至于"版 本化本身是否有帮助"这一主张,设计根本没有加以识别,因为并不存在一个其余条件相同、只是没有 版本的对照条件。 **修正。** 新增条件 E:完整散文,承载与条件 C 完全相同的事实。这样在 C 与 E 的对比中,表示 形式就成了唯一变量。 **对结论的影响。** 决定性且不利。条件 E 与条件 C 打成平手,精确到小数位,p = 1.00。假设 H5 被推翻,版本 1 的标题性主张没有存活下来。 ### R2. 联邦条件下降的原因归因错误 **发现。** 版本 1 报告说,联邦条件的准确率下降源于上下文变长所导致的算术退化。这一归因是 错的。 **证据。** 评审者阅读了原始回答。在两个题项上,模型返回的数值恰好等于"把交易对方的规则用 于该方的数据行、把我们自己的规则用于其余数据行"所得的结果,而且它在自己的说明性备注中就是 这么写的。这一行为是在应用规则,而不是算术失败。 **评估。** 缺陷在工具一侧。联邦规则写的是"适用于关于合同 C-118 或供应商 HAL 的任何问题", 于是内部报告类问题合法地落入其作用域,而基准答案却全程使用我们自己的定义。此外,合同与供 应商是各自独立生成的,因此该规则的正作用域与负作用域发生了重叠。模型遵守了给它的规则,基 准答案没有。 **修正。** 联邦记录现在只适用于面向交易对方的问题,并明确这样声明。语料被重新生成,使作用 域不可能重叠。新增条件 F,把上下文长度与上下文内容分开,而原先的解释正是把两者混同了。 **对结论的影响。** 缺陷修正后,联邦条件总体上是中性的,并在它本应起作用的问题上起作用。基 于长度的解释被完全撤回:在这一体量下,条件 F 并未显示增加长度带来准确率损失。 ### R3. 一项指标的命名超出其检测范围 **发现。** 名为"用错了定义"的指标,只检测与某一个预设替代答案的精确相等。 **证据。** 对评分函数的检视。 **评估。** 该指标无法检测两条规则的混合适用、错误的行过滤,或用错定义之后又出现算术失误; 而算术失误也可能与它偶然巧合。随之而来的那个说法,即算术错误产生任意数值而解释错误产生精 确的替代值,并不能由此成立。 **修正。** 改名为"答案恰好等于预设竞争定义所给出的答案",并在其出现之处标明局限。现在它被 描述为解释错误的下界。 **对结论的影响。** 数值没有变化。该指标的方向与量级不变,减弱的只是从中所作推论的强度。 ### R4. 在非独立观测上计算显著性 **发现。** 同一提示下同一题项的三次重复被当作三次独立观测,而检验把所有调用汇到了一起。 **证据。** 在题项层面重新分析,由评审者独立完成,并由我们复现。 | 分析方式 | 结构化对联邦 | |---|---| | 按调用,即版本 1 所发布的做法 | p = 0.027 | | 对 34 个题项均值的精确符号检验 | p = 0.082 | | 对每题项三取多数的 McNemar | p = 0.057 | **评估。** 两个条件之间 14.7 个百分点的差距不因修正而改变,其显著性则会改变。在修正后的分 析下,它没有达到常规阈值。承载本研究主要主张的那些比较,即结构化对纯表结构、以及对不完整 文档,在修正后仍然成立,分别为 p = 0.0005 与 p = 0.0015。 **修正。** 重复在题项内取平均,配对检验以精确符号检验跨题项进行,置信区间按题项聚类。 **对结论的影响。** 一项声称的效应被撤回。主效应的量级未受影响,仍然显著。 ### R5. 判准的循环性 **发现。** 基准答案由结构化条件所收到的同一批定义推导而来。 **证据。** 对基准答案引擎与提示模板的检视。 **评估。** 不存在答案泄漏:提示中插入的是数据、上下文、问题和日期,从不插入基准答案。但结 构化条件拿到的是接近可执行的规范,因此选择解释在很大程度上退化为检索,剩下的工作是连接与 聚合。所以,在作者自定的判准上取得成功,并不能证明该层能够发现正确的业务含义。 **修正。** 无。该局限在方法与结果页中都已声明。 **对结论的影响。** 所有关于准确率的主张,其范围都被收窄为"对所给规范的遵循"。由他人独立撰 写规则并进行盲评,仍然是恰当的下一步。 ### R6. 题项层面的缺陷 **发现。** 题项集合与语料中的四处缺陷。 1. 有一个作用域判别项并不判别:通过对规则的部分错误适用,同样能得到正确答案。 2. 工作日的计数约定从未写明,因此对区间端点的某种理解可能被误认为是对日历的选择。 3. 时间族只依托两种口径,且有四个题项共用同一个答案数值。 4. 存在生成日期早于其客户注册日期的订单。 **修正。** 判别项移到同一供应商但不在规则之内的合同上;计数约定现已写入问题;新增第三种版 本化口径;订单日期在生成时加以约束。重新生成后复检,零违例。 **对结论的影响。** 题项层面的噪声降低。版本 2 公布的任何数字都不依赖那些有缺陷的题项,它 们已不复存在。 ### R7. 主张的表述超出设计所能支持的范围 **发现。** 工具全程关闭,因此本研究衡量的是对上下文中表格数据的推理。 **评估。** 结果并不描述可访问数据库的实际运行智能体。若可以使用 SQL,错误中的算术成分会变 化,条件之间的平衡也可能移动。 **修正。** 凡出现结果之处,可辩护的主张现在都以收窄的方式表述:在这组题项上,提供一份精确 的定义目录,会使该模型的精确答案优于文档缺失或文档不完整的情形。 ## 4. 评审没有动摇的部分 相对于只有表结构、以及相对于不完整文档,提供定义本身的优势在修正后的分析中以若干个数量级 的 p 值存活了下来,评审者也用独立的重算加以确认。分歧从来不在于改进是否存在,而在于该把改 进归因于什么,而条件 E 对此给出的回答不利于原假设。 ## 5. 版本 2 之后仍然未决 - 只有一个合成语料。外部效度需要若干个独立生成的语料。 - 规则由本研究作者撰写。要关闭 R5,需要由他人独立撰写规则并进行盲评。 - 只有一个模型家族的两个能力档位。其他供应商未测。 - 没有任何一次在开启工具的情况下运行。