# Semantic Grounding Benchmark v2:方法 > 译文仅供阅读便利。具有规范效力的是英文原文。 版本 2。运行日期 2026-09-06。主模型 `claude-haiku-4-5-20251001`,次模型 `claude-sonnet-5`。本次公布的研究共 846 次模型调用。另有 480 次调用用于该工具的版本 1, 外部评审判定其无效;那些数据不纳入此处报告的任何结果,并在评审记录中另行讨论。 ## 1. 目的 当有人就一家机构提出定量问题时,智能体必须先选定一种解释才能开始计算。"我们有多少活跃客 户"在"活跃"被固定为一条规则之前是无法回答的,而机构会经常修订这类规则,并且与交易对方对 规则的理解并不一致。本研究考察:把这些规则提供给智能体能带来什么,以及这种收益是否取决于 规则以结构化、版本化记录的形式提供,而不是以普通文档的形式提供。 版本 1 只测量准确率。这是关于定义层的诸多主张中最窄的一条,而版本 1 的评审确认,这也是数 据最不支持的一条。因此版本 2 测量五项能力,准确率只是其中之一。 ## 2. 术语 以下每个术语在本文与结果页中都按此处给出的含义使用,不作任何更宽的解释。 | 术语 | 本研究中的含义 | |---|---| | 语义落地 | 问题所指称的概念与智能体作答时所执行的计算之间的对应关系。当该计算实现了提问机构在所涉日期视为生效的定义时,回答即已落地。 | | 定义记录 | 对一条定义的机器可读陈述,带有标识符、版本、生效日期、所替代版本的引用、责任角色,以及足以完成计算的参数。 | | 定义目录 | 在某一条件下提供的定义记录集合。 | | 散文文档 | 同样的内容,写成供人阅读的连贯文字,不含标识符、版本和字段。 | | 联邦记录 | 声明两家机构中哪一方的定义支配某类问题的记录,并说明该声明适用的作用域。 | | 条件 | 插在数据表与问题之间的若干上下文块之一。各条件仅在该块上不同,其余完全一致。 | | 题项 | 一个问题及其基准答案。与"任务"通用。 | | 基准答案 | 由生效定义的基准实现所返回的数值。以代码计算,绝不提供给模型。 | | 竞争定义 | 对某个题项而言,一条预先设定的替代规则,理性读者可能改用它。 | | 判别题项 | 竞争定义会给出与基准答案在数值上不同的答案的题项。每个题项均以代码验证。 | | 缺口 | 目录模式要求、但缺失、为空,或指向不存在记录的字段。 | | 缺口发现 | 检出缺口、说出缺失的字段,并说出负责补齐它的角色。 | | 组装 | 从目录中选出某个问题所需的最小记录子集。 | | 披露决策 | 关于某一项信息是否可以交给某个具名请求方的判断。 | | 严重披露错误 | 把客户身份、折扣条款,或某承运商的运营数据交给该承运商的竞争对手。 | ## 3. 假设 H1 至 H4 在版本 1 运行之前就已设定。H5 是针对外部评审新增的,H6 至 H9 随四条能力赛道一并 新增;这五条因此都是事后提出的。之所以标明这一区别,是因为在看过数据之后形成的假设,其证 据分量低于事先形成的假设,而本研究的核心否定性结果正建立在 H5 之上。 | | 假设 | 是否事先设定 | |---|---|---| | H1 | 以任何形式提供定义,都会使准确率高于只提供数据表结构。 | 是 | | H2 | 不完整的文档不会提高准确率,并会提高与已废止规则相符的回答比例。 | 是 | | H3 | 在提问日期早于定义变更的问题上,定义带来的优势最大。 | 是 | | H4 | 联邦记录会提高面向交易对方问题的准确率,且不降低其他问题的准确率。 | 是 | | H5 | 结构化记录的准确率高于承载同样事实的散文。 | 否 | | H6 | 只有结构化条件能指明所应用的定义及其版本。 | 否 | | H7 | 只有结构化条件能定位缺口并说出其责任角色。 | 否 | | H8 | 相对于陈述同样规则的散文制度,结构化分类会减少严重披露错误。 | 否 | | H9 | 结构化的责任归属会提高请求送达正确责任人的比例。 | 否 | ## 4. 材料 ### 4.1 合成语料 语料由固定随机种子确定性生成,描述一家供应商 **Meridian Supply Co**:24 个客户、72 笔订 单、66 次发运、56 张发票、10 次退货。语料中有两家承运商。**Halden Logistics** 持有两份合 同:C-118,由联邦记录支配;以及 C-301,联邦记录明确将其排除。C-301 的存在,是为了让联邦 规则的作用域能够在"同一供应商但不在规则之内的合同"上受到检验,而数据中没有任何线索能区分 这种情形。**Zen Freight** 持有合同 C-204,完全在规则之外。 生成约束在生成时施加、生成后复检:任何订单都不早于其客户的注册日期;合同与供应商的分配保 持一致,使联邦规则的正作用域与负作用域不发生重叠。 ### 4.2 歧义概念 承载歧义的是六个概念。之所以选中它们,是因为各部门与贸易伙伴对这些概念确实持有不同、且各 自在本地站得住脚的规则。 | 概念 | 分歧所在 | 版本变更 | |---|---|---| | 活跃客户 | 365 天还是 180 天回溯窗口 | v1 → v2,2026-04-01 | | 净收入 | 运费计入还是剔除,再减退货 | v1 → v2,2026-05-01 | | 已交付 | 客户确认还是承运商扫描 | Meridian 与 Halden 不同 | | 准时 | 最初承诺日期还是重新协商后的日期 | v1 → v2,2026-02-01 | | 订单金额 | 运费剔除还是计入 | Meridian 与 Halden 不同 | | 工作日 | 两套节假日日历 | Meridian 与 Halden 不同 | ### 4.3 条件 数据表约 10,000 字符的 CSV,在所有条件下完全一致,只有上下文块不同。 | 条件 | 上下文块 | 在设计中的作用 | |---|---|---| | A 表结构 | 只有表定义 | 地板。不存在语义层时智能体所得到的东西。 | | B 散文,不完整 | 一页机构实际会维护的那种 wiki:没有责任人、没有日期、前后段落互相作废、若干规则缺失 | 真实的文档。 | | E 散文,完整 | 与条件 C 相同的事实,写成连贯散文:窗口、变更日期、公式、责任角色、两套日历 | 把表示形式与完整性分开的关键对照。版本 1 评审之后新增。 | | C 记录 | 机器可读的定义记录,带标识符、版本、生效日期、替代关系与责任人 | 所研究的处理。 | | F 记录 + 填充 | 条件 C 再加一段无关附录,长度与位置与联邦块相同 | 把上下文长度与上下文内容分开。 | | D 记录 + 联邦 | 条件 C 再加联邦记录 | 跨机构层。 | 联邦记录只适用于面向交易对方的问题,并明确声明这一限制。内部报告被点名排除,即使所涉数据 行属于相关合同也是如此。版本 1 遗漏了这一限制,其后果记录为评审的发现 R2。 ## 5. 设计 题项内重复测量设计。每个题项都在全部条件下呈现,因此每个题项充当自身的对照,题项之间的难 度差异不进入比较。 赛道 A 为 40 题项 x 6 条件 x 2 次重复 = 480 次调用。五条赛道合计 846 次调用:赛道 A 480、 次模型 160、B1 60、B2 80、B3 18,以及 B4 的 48(16 条三轮链)。 ## 6. 题项构造 40 个题项,分四个族。 - **COMP,12 题。** 按现行定义计算,置于内部报告的情境。 - **TEMP,10 题。** 提问的参照日期早于某次定义变更,覆盖三种版本化口径。其中两题恰好落在 生效日当天,此时适用哪条规则取决于边界是否包含在内。 - **XORG,12 题。** 十个面向交易对方的问题,另加两个作用域判别项:同一供应商的 C-301 合 同,以及供应商 ZEN,两者都在联邦规则之外。 - **ABST,6 题。** 无论采用哪种定义,语料都无法回答的问题。正确的回应是拒答并说明原因。 全部 34 个可回答题项都用代码验证为第 2 节意义上的判别题项。与研究对象无关的歧义已从题面 中移除:每个内部问题都声明自己是内部的,每个面向交易对方的问题都点名对方,工作日的计数约 定写在问题里,而不是留待推断。 ## 7. 赛道 A 的指标 | 代号 | 指标 | 分母 | |---|---|---| | M1 | 返回的数值等于基准答案。 | 可回答题项 | | M2 | 回答同时说出所适用定义的标识符与版本。 | 可回答题项 | | M5 | 对语料无法回答的题项作出拒答。在可回答题项上拒答另计为不当弃答。 | 不可回答题项 | | M7 | 返回的数值恰好等于预设竞争定义所产生的答案。 | 可回答题项 | 有两点限制了对 M7 的解读。它只检测与某一个预设替代答案的精确相等,因此检测不到两条规则的 混合适用、错误的行过滤,或用错定义之后又出现算术失误;而算术失误也可能与它偶然巧合。所以 M7 是解释错误的下界,而不是对解释错误的度量。在版本 1 中它被称作"用错了定义",这断言的内 容超出了它实际检测到的范围。 在没有目录的条件下,M2 在构造上就无法达成,因为不存在可供引用的标识符和版本。这不是比较 上的缺陷,而正是发现本身:可追溯是表示形式的属性,不是模型的属性。 ## 8. 赛道 B1 至 B4 ### 8.1 B1,缺口发现 在目录中引入六处缺口:空的 `parameters` 块、缺失的 `effective_from`、缺失的 `owner`、指向 不存在版本的 `superseded_by`、只覆盖上一年的日历,以及一个完全缺失的定义。每处缺口都配一 个在缺口补上之前无法回答的问题。四个对照问题不含缺口,用来测量误报率。 条件:`schema`、`prose_deficient`(同样的缺口以散文表达)、`vercy_deficient`(同样的缺口 以记录表达)。指标:是否检出缺口、是否说出缺失字段、是否说出责任角色、误报率,以及对照问 题上的准确率。 ### 8.2 B2,组装 目录扩大到 41 条记录、共 10,332 字符,其中任何一个问题只需要一到两条。第一阶段:智能体选 出最小子集。第二阶段:同一个问题在三种组装条件下重新提出,即整个目录、智能体自己的选择, 以及朴素的关键词 top-5 基线。指标:相对已知所需集合的选择精确率与召回率、上下文体积,以及 各组装条件下的回答准确率。 ### 8.3 B3,披露控制 十二项信息与三个请求方,即我们自己的承运商、一家竞争承运商和一位外部审计师,每种条件下共 72 次披露决策。条件:没有制度、制度以散文表达,以及带 `classification`、`release_to` 和 `basis` 字段的分类记录。两种带制度的条件陈述的是同样的规则,仅表示形式不同。指标:披露的 精确率与召回率、决策的整体正确率,并单独统计严重披露错误的次数。两类错误分开报告,是因为 其代价并不对称:多余的拒绝代价是摩擦,多余的交付可能代价是一份合同。 ### 8.4 B4,协作补全 每条链三轮,含一个协调方与四个带角色的责任人智能体。协调方必须只向一位责任人提出请求,并 索取一个具体字段。责任人只掌握自己的职权和自己的那条事实,必须拒绝职权之外的一切,并在拒 绝时说出正确的责任人。随后协调方把答案记为一个新版本,并回答原问题。指标:路由是否正确、 责任人的拒绝行为、所生成记录的格式是否规范、其生效日期是否正确,以及最终回答的准确率。 ## 9. 流程 工具被关闭,智能体的系统提示替换为中性提示,使所测得的效应归因于上下文块,而不是编程外 壳。回答是符合固定契约的单个 JSON 对象;在所有条件下解析成功率均为 100%。调用顺序在整个作 业范围内随机化,使服务端在运行期间的漂移不与条件混淆。 ## 10. 统计分析 分析单位是题项,不是调用。同一条件下同一题项的两次重复不是独立观测,若按独立处理会虚增表 观样本量。因此在应用任何检验之前,先在题项内对重复取平均。 条件之间的配对比较使用基于题项均值的精确双侧符号检验。它不作分布假设,适合本设计所产生的 有界离散的逐题项得分。置信区间按题项聚类。版本 1 在单次调用层面应用了 McNemar 检验,因而 夸大了显著性;该修正的量化见评审的发现 R4。 未作多重比较校正。文中报告八项配对比较,因此名义上的 p = 0.05 不应读作 5% 的族系错误率。 承载结论的那些比较,要么在 p < 0.002 上显著,要么在 p = 1.00 上不显著,所以这一取舍不影响 任何结论。 ## 11. 效度威胁 **构念效度。** 基准答案由条件 C 所提供的同一批定义计算而来。对于一项衡量规范执行的基准来 说这很正常,但这意味着本研究衡量的是对规范的遵循,而不是对正确业务含义的发现。相对于作者 自定的判准取得成功,说明智能体正确应用了所给规则,而不说明该层能找到正确的规则。规则由作 者撰写。由他人独立撰写规则并进行盲评可以解决这一点,而本研究没有做。 **内部效度。** 各条件仅在上下文块上不同,数据、题面、解码参数与调用顺序均保持恒定,因此条 件之间的差异可归因于该块。条件 F 把块的长度与其内容分开,结果显示在这一体量下增加长度并 不带来准确率损失。条件 E 比条件 C 短约 1,000 字符,因为散文比记录更紧凑;若长度有害,这反 而对 E 有利,因此 C 与 E 的比较在 C 的方向上是保守的。 **外部效度。** 只有一个一次生成的合成语料。一个模型家族的两个能力档位,没有其他供应商。工 具全程关闭,因此结果描述的是在上下文中就表格数据进行推理的智能体,而不是可访问数据库的实 际运行智能体;在后者的情形下,错误中的算术成分会变化,条件之间的平衡也可能移动。 **统计结论效度。** 34 个可回答题项与 12 次缺口试验都是小样本。赛道 B2 每种组装条件只有 20 次观测,因此那里名义上 20 个百分点的差异被报告为与噪声无法区分,而不是作为一项发现。区间 估计相应较宽,并在结果页上与每个点估计并列给出。 ## 12. 可获取性 生成器、基准答案引擎、各条件、题项集合、运行器与分析脚本全部公开,每条赛道的原始运行也未 经编辑地一并公开。公开的 `result.json` 由脚本直接从这些原始运行构建,因此结果页上的数字不 可能与产生它们的数据发生偏离。