文档 AI 层 · FUAI τ 问题
τ 问题
域宽随测量质量变化,而质量要过一个阈值 τ。于是有一个问题绕不开:τ 是一个会被测量收敛出来的数,还是一个由政策定下来的数?如果是前者,它像 π——我们写不完整,但它存在。如果是后者,那么它根本不在世界里,而在决策里。
公式
整套推导是一行损失函数加上它的 argmin。质量 Q ∈ [0,1] 由部署中的模型实测;标签 G/B 是外生的:G = {β > 0} 是值得放宽的候选,B = {β = 0} 是放宽只有风险的那些。
# 经验分布(阶梯函数) F_G(τ) = (1/|G|) · Σ_{q∈G} 1{q ≤ τ} F_B(τ) = (1/|B|) · Σ_{q∈B} 1{q ≤ τ} # 一步期望损失 L(τ; π, C_s, C_w) = (1−π)·C_s·F_G(τ) + π·C_w·(1 − F_B(τ)) # 最优集 argmin_τ L(τ) = ∪_k I_k # 区间的并,不是一个点 # 悔值比 R(τ) = L(τ) / L_min # 配对确认次数 α(τ) = 1 − F_B(τ) # 单窗假加宽率 α^k ≤ ρ_target ⇔ k* ≥ ln(ρ_target) / ln(α)
为什么最优解是一个区间,不是一个点
Q 是在有限个模型上测出来的,所以 F_G 和 F_B 都是阶梯函数。阶梯函数的 argmin 只能是区间:相邻两个支撑点之间损失是常数。把 τ 往右移过一个 B 点,损失降 π·C_w;移过一个 G 点,损失升 (1−π)·C_s。最优集就是“最后一次划算的 B 跨越”到“第一次不再划算的 G 跨越”之间的平台。
这不是样本量不够的临时现象,而是离散支撑的结构性结果。样本再多,支撑点也只是变密——区间会变窄,但每一点仍然是阶梯上的台阶。
v2 批次实测:G 和 B 完全重叠
这一节的数字由 tools/tau_beta_v2.py 从 eval_results_v2/ 直接导出,可在副本里重跑到逐字符一致。13 个模型、金标 280 例,Q = anom/280,β = novel-pos/120。
| 量 | 值 |
|---|---|
| G(值得放宽,β > 0) | 10 个,支撑 [0.429, 0.579] |
| B(只有风险,β = 0) | 3 个,支撑 [0.429, 0.579] |
| π̂ = |B| / 13 | 0.231 |
| argmin 区间 τ* | [0.429, 0.454) |
| 最小损失 L_min | 0.1537 |
| 悔值比 R(0.70) | 5.01× |
在最优阈值上实际发生的是:10% 的好模型被收缩,33% 的坏模型被放宽。这个取舍之所以“最优”,不是因为 Q 指出了分界,而是因为 π̂ = 0.23——坏模型本来就少,容忍它们比误伤好模型便宜。把 τ 抬到 0.70(等于永不放宽)损失 0.7700,是最优值的 5.01 倍。
可识别性:数据只能定到区间
论文把这条写成了显式声明:数据只识别出区间 τ*(π̂, r);在区间内取哪一点是一个声明的 (S3) 政策决定,永远不是一次测量。在没有出现下列两件事之前,“不支持任何点估计”,τ 就冻结在声明的区间内取值。
可以正当重启的只有两件事:一是真实的部署损失记录(那时 C_s/C_w 与 π 从假设变成观测),二是语义金标本身被重新定义——现在的 novel 集是一个生成器的比率窗口。
已经打过一次
2026-09 有一轮独立的反证(W46,攻击套件 a1–a5 可复现,内核与测试在轮次中未改动)。它推翻了 6 条断言、要求重构 3 条措辞,机制核心——能力域门、审计环、确定性规则兜底——原样存活。其中与本节最相关的一条是:金标集可能是构造性可分的——novel 集恰是一个比率窗口,于是 G/B 的划分有可能是构造的产物,而不是模型的真实性质。
这一轮之所以记录在这里而不是抹掉,是因为它恰好是这个问题的一次预演:它攻击的正是“前提”,而不是公式。
三个分支
| 分支 | 成立条件 | τ 的身份 |
|---|---|---|
| 收敛到一点 | 出现一个真正能分离 G/B 的质量信号,区间随测量加密收成一点 | 世界的性质——像 π,但可测 |
| 前提崩塌 | G/B 分离被证明是金标构造的产物,质量与能力不再有单调关系 | 不在世界里——损失式仍然自洽,但它测的是生成器,不是模型 |
| 前提成立,但问题变得不重要 | 阈值照旧可定,但对“系统能走多远”不再构成约束 | 一个工程参数,不是认识论上的边界 |
一、若某一代人真把 τ 算成了一个精确的数,那么这条研究路径走到头也不会出现 AGI。
二、若公式的前提先崩塌,那么 AGI 会出现。
三、或者前提没有崩塌、AGI 照样出现——那样的话,AGI 也不是 AI 研究的终点。
这三句共享一个隐含前提:把「τ 能不能被定死」当作「智能能走多远」的探针。下一节把这个前提本身推一遍。
所以 τ 像 π 吗
不像,而且不是「数据还不够」那种不像。把损失式摊开:τ 往右走,F_G(τ) 上升(越多好模型被误收缩)、1 − F_B(τ) 下降(越少坏模型被误放宽)——这是一条权衡曲线,τ 只是曲线上的一个操作点。取哪个点由 π 与 C_s/C_w 决定,而这两个,一个是政策变量,一个是不可观测的成本比。所以不存在「那个 τ」——一如统计检验里不存在「那个显著性水平 α」。
真正属于世界的量不是 τ,而是那条曲线本身:Q 究竟能不能把 G 和 B 分开。它是可估的,模型越多估得越准,所以它也不是 π 型的。π 有一个确定的值、只是写不完;这里没有任何一个量具有那个性质。
第二句的发现是真的(重叠是实测,W46 也判定金标可能构造性可分),但那是关于仪器的负结论;从「尺子量不准」推不出「智能会出现」。何况 S1 模型无关——它对任何模型成立,前提崩不崩它都在。前提崩塌真正证明的是:S2 在以测量的名义做政策的工作。
第三句没有可观测的证伪条件,它是立场,不是断言。
修正后立得住的是这一句:信任能否在开放情境空间上被预先测量,才是探针。能,则能力有界、可预先刻画,与「通用」张力;不能,则 S2 的自适应主张失去测量基础——系统仍然安全,但「自适应」是政策修辞。它可证伪、有数据(就是上面那张重叠表),问的也是对的问题。