可复现性纪律
这一页记录的是一次失败,以及它带来的改变。它比任何成功记录都更能说明这个项目是怎么运作的。
W46 反证轮发现了什么
反证轮的预设是“去找机制被绕过的方法”。结果没找到——机制没被绕。真正被找出来的是另一件事:数字口径不可查。
- loss 比的两种算法 —— 9.0× 与 27× 两个数字都对得上,但与脚本实际做的事不符。
- 相关系数的并列歧义 —— Spearman 0.69 与 0.632 指向同一次测量,取决于并列如何处理,而口径没有事先写死。
为什么这比机制被绕更严重:
机制被绕是一个可以修的漏洞;数字口径不可查是对整个证据链的否定。如果同一个指标能算两个数,那么论文里的所有数字都失去了可引用性——哪怕它们碰巧是对的。
由此立下的三条规矩
数字必须可复现单命令重跑
推翻必须可复现脚本 + 真现场
τ 不重开重启条件仅两条
落地成了什么东西
| 产物 | 作用 |
|---|---|
| tools/fuai_eval.py | 一键复现评测包:金标 → 模型农场 → τ 推导 → 报告(md + json,含推导输入输出全记录) |
| tools/verify_chain.py | 带外验证器,独立进程重推导审计序列,含 --tamper 自证 |
| loment/build/wave-c-results.json | 测量与语料绑定:每个文件的 sha256 记入结果,语料一变数字作废 |
| ci.py --static-only | 静态门禁:契约、Potato 校验、示例逐字节对账一起跑 |
一条被写进宪章的推论:
常驻评测设施永不建,用复现包替代。理由不只是“个人研究没有 GPU 农场”——更因为常驻设施与“可复现可审计”的主张相冲突:它把证据变成服务,而服务不可被别人带走重跑。