[Decision] 枚举漂移实测到 3 例,#11817 预裁的 ≥2 分支因此选中 —— 但同一份测量说明,建 C 所依赖的绑定信号测不出来
由 domain:devx PM 席(座位贴 #6023,session session_01Pk26oZ12t5N1hwGW1m1MgC)按 #11817 裁决的预置决策规则上呈。⛔ 一行未实现。测量全文见 #11995(sweep record,13.8k 字)。
预裁原文(⛔ 不可重裁):
≥2 real instances(the known #11347 one counts as the first)→ file a NEW decision card carrying the measured rate; option C(the authored-enumeration regime on the 91 pages)is decided there, on data。
⇒ 实测 3 例(#11347 + 新增 2 例),分支选中,本卡即那张新卡。
os-decision-facets
一、测到的数
| 读数 | 值 |
|---|
| 窗口 | 3a100c9f3..90578117f = 2026-06-15 → 2026-08-31,6008 提交(4214 触 packages/,1290 触 content/docs) |
| 窗口下界的成因 | docs-drift 门禁诞生于 3a100c9f3(#1906),⚠️不是浅检出 —— 另有 847 个可达提交早于门禁存在 |
| 语料 | #11817 树上 91 页 / 448 格 / 1365 span(其自述 91/447/1363,复现) |
| 语料已移动 | 今天 90 页;kernel/contracts/metadata-service.mdx 掉出。历史位置扫 91 集,HEAD 扫 90 集 |
| 实例 | 3(#11347 + 2 新) |
⭐ 窗口由门禁诞生而非浅检出封底,意味着 没有实例能藏在窗口之前 —— 这条比「3」这个数字本身更重要,它把「测量不足」这个反驳堵死了。
二、⛔ 而这才是本卡真正的内容:造 C 要用的那个信号,测不出来
裁决要求「positive control first —— 方法必须先重新找到已知的 #11347,否则别处的任何零都不算数」。控制跑了,而且失败了 —— 并且是作为失败报告的,不是作为零。
| 仪器 | 阳性对照 | 判别力 |
|---|
| A 成员重叠绑定器(产出 identity 的那个) | ❌ 结构性失明:控制树上任一 template.ts 词表与 flows.mdx 16 个枚举格的最大重叠 = 0;修复后的树上 = 6/6 ⇒ 绑定信号只在页面被修好之后才存在 | — |
| B 文件级绑定器 | ✅ 精确命中控制(flows.mdx:1276,靠 5 个残存记法 token 搭桥),阴性对照亦通过 | ❌ 9374 个候选 / 460 格,其中 8647(92.2%)根本不含它所指控遗漏的任何成员 |
⇒ A 看不见这个形状;B 看得见但 92.2% 是噪声。 选项 C 是「在这 90 页上建一套 authored-enumeration 机制」—— 而它要依赖的正是这个绑定信号。
⭐ 佐证不是推演,是已发生过的:sweep 记录里有一个被排除的擦身而过 —— PR #2049 / 4c213c289 同样加宽了 sharingModel、同样没碰文档、同样把格留旧,而 docs-drift 确实点名了那一页 —— 埋在一份 89 页的清单里(#9192 之前的 package-mention 谓词)。因为工具当时不是绿的,它没有计入 3 例;但它正是 #11817 自己为 #6893/#7009 引用过的淹没/脱敏模式。
三、一个方法学发现,影响任何未来重测
⚠️#11347 在 main 上的 squash 提交同时含实现与文档两半(其 message 记载文档是「PM review round」补的第三个提交)。⇒ docs-drift 曾对之为绿的那个「只有实现」的状态,在 main 上从未存在过 —— 任何对 main 的扫描都看不见它。给定的阳性对照,按构造就不可从 main 复现。
另两项已量化的仪器缺陷:内联 z.enum 以属性键命名,故一个文件可含多个同名枚举(实测:component.zod.ts 里 6 个成员集互斥的 variant)⇒ 2025 个加宽事件里只有 193(9.5%) 名称文件内唯一、可靠可评;151 个原始命中经唯一性过滤降到 10,手工分诊为 2 实例 + 4 假阳。另有重命名盲区(ui/pages.mdx 曾为 guides/metadata/page.mdx),已按历史路径手工复核,结论不变。
四、四维
① 实际业务需求:真实但稀疏 —— 6008 提交里 3 例,约每月一次;每一例都是一页公开文档少列了成员。代价真实,频率低。
② 平台长远合理性:C 的价值取决于能否可靠地把代码词表绑到文档格上。实测说不能:唯一能产出 identity 的仪器对该形状失明,能命中的那个 92.2% 是噪声。建一道以此为基的门禁,得到的是第二个 89 页清单 —— 即 #11817 自己引为失败模式的那个东西。
③ 防 AI 写代码犯错:一道经常性假红/淹没的门禁,会训练出「先无视再说」的习惯,并把这个习惯带到真红上。⚠️ 这是负向的:坏门禁比没门禁更糟。
④ 创业阶段不扩散需求:C 是一套新机制、新语料契约、新维护面,为每月一次的缺陷服务。
本席推荐:⛔ 不建 C。 取而代之:B(verdict narrowing,已在 PR #11798 后另行派发)为终局,并把这 3 例按具体缺陷逐张修(第一张已由 dev 立为 #13720 —— 四页仍漏 FLOW_INPUT_SCHEMA_INVALID)。理由是②③:测量没有支持 C 的可行性,它反过来给出了 C 会退化成什么的证据。
⚠️置信缺口(逐条):
- 3 例来自可靠可评的 9.5% 子集;真实总数下界为 3,上界未测 —— 若按可评比例外推会更高,但那个外推本席未做,因为不可评的那 90.5% 里假阳率未知。
- 「docs-drift 当时为绿」这一腿操作化为「该次运行没有列出被证伪的页」,因为该 workflow 是 advisory,VERDICT 从不使 build 失败。
- 本席未独立复算任何一例;核过的是窗口成因、语料复现、以及阳性对照失败这三件事。
Generated by Claude Code
[Decision] 枚举漂移实测到 3 例,#11817 预裁的 ≥2 分支因此选中 —— 但同一份测量说明,建 C 所依赖的绑定信号测不出来
由
domain:devxPM 席(座位贴 #6023,sessionsession_01Pk26oZ12t5N1hwGW1m1MgC)按 #11817 裁决的预置决策规则上呈。⛔ 一行未实现。测量全文见 #11995(sweep record,13.8k 字)。预裁原文(⛔ 不可重裁):
⇒ 实测 3 例(#11347 + 新增 2 例),分支选中,本卡即那张新卡。
os-decision-facets一、测到的数
3a100c9f3..90578117f= 2026-06-15 → 2026-08-31,6008 提交(4214 触packages/,1290 触content/docs)3a100c9f3(#1906),kernel/contracts/metadata-service.mdx掉出。历史位置扫 91 集,HEAD 扫 90 集⭐ 窗口由门禁诞生而非浅检出封底,意味着 没有实例能藏在窗口之前 —— 这条比「3」这个数字本身更重要,它把「测量不足」这个反驳堵死了。
二、⛔ 而这才是本卡真正的内容:造 C 要用的那个信号,测不出来
裁决要求「positive control first —— 方法必须先重新找到已知的 #11347,否则别处的任何零都不算数」。控制跑了,而且失败了 —— 并且是作为失败报告的,不是作为零。
template.ts词表与flows.mdx16 个枚举格的最大重叠 = 0;修复后的树上 = 6/6 ⇒ 绑定信号只在页面被修好之后才存在flows.mdx:1276,靠 5 个残存记法 token 搭桥),阴性对照亦通过⇒ A 看不见这个形状;B 看得见但 92.2% 是噪声。 选项 C 是「在这 90 页上建一套 authored-enumeration 机制」—— 而它要依赖的正是这个绑定信号。
⭐ 佐证不是推演,是已发生过的:sweep 记录里有一个被排除的擦身而过 —— PR #2049 /
4c213c289同样加宽了sharingModel、同样没碰文档、同样把格留旧,而 docs-drift 确实点名了那一页 —— 埋在一份 89 页的清单里(#9192 之前的 package-mention 谓词)。因为工具当时不是绿的,它没有计入 3 例;但它正是 #11817 自己为 #6893/#7009 引用过的淹没/脱敏模式。三、一个方法学发现,影响任何未来重测
另两项已量化的仪器缺陷:内联
z.enum以属性键命名,故一个文件可含多个同名枚举(实测:component.zod.ts里 6 个成员集互斥的variant)⇒ 2025 个加宽事件里只有 193(9.5%) 名称文件内唯一、可靠可评;151 个原始命中经唯一性过滤降到 10,手工分诊为 2 实例 + 4 假阳。另有重命名盲区(ui/pages.mdx曾为guides/metadata/page.mdx),已按历史路径手工复核,结论不变。四、四维
① 实际业务需求:真实但稀疏 —— 6008 提交里 3 例,约每月一次;每一例都是一页公开文档少列了成员。代价真实,频率低。⚠️ 这是负向的:坏门禁比没门禁更糟。
② 平台长远合理性:C 的价值取决于能否可靠地把代码词表绑到文档格上。实测说不能:唯一能产出 identity 的仪器对该形状失明,能命中的那个 92.2% 是噪声。建一道以此为基的门禁,得到的是第二个 89 页清单 —— 即 #11817 自己引为失败模式的那个东西。
③ 防 AI 写代码犯错:一道经常性假红/淹没的门禁,会训练出「先无视再说」的习惯,并把这个习惯带到真红上。
④ 创业阶段不扩散需求:C 是一套新机制、新语料契约、新维护面,为每月一次的缺陷服务。
本席推荐:⛔ 不建 C。 取而代之:B(verdict narrowing,已在 PR #11798 后另行派发)为终局,并把这 3 例按具体缺陷逐张修(第一张已由 dev 立为 #13720 —— 四页仍漏
FLOW_INPUT_SCHEMA_INVALID)。理由是②③:测量没有支持 C 的可行性,它反过来给出了 C 会退化成什么的证据。Generated by Claude Code