公告

FujoOS公布日延期,以仓库发布为准

文档 AI 层 · FUAI 命题与 S1/S2/S3

命题与 S1/S2/S3

核心公式

safety = α(no out-of-bounds, S1) × DomainWidth = f(S2)

安全 = α(无越界,S1 机制)× 域宽,而域宽是测量质量 S2 的函数。S3 策略边界由人或蒸馏规则画定。

这条公式的用处不在于计算,而在于它把一件容易被糊在一起的事拆成了三件:机制是否正确、测量是否可信、边界画在哪里。三件事的责任人不同,失败模式也不同。

三层各管什么

含义 实现
S1 机制 无越界执行:能力域、隔离、审计。不依赖模型的正确性——这是关键,机制的有效性不能建立在被测对象的良好表现上。 内核能力表 + 审计环;用户态为 SIGSTOP 隔离语义
S2 测量 模型质量的可测量化:金标、探针、质量台账。注意它决定的是域宽而不是权限——测量结果再差,模型也不会因此获得更多权力。 语义金标 v2(280 例)、金标 v3(540 例)、τ 推导与模型农场
S3 策略 边界画在哪里:由人声明,或由蒸馏规则生成。未知指令与越域值一律 fail-closed,不做猜测。 fuai_policy 策略文件;越域即拒绝
模型不能写自己的界。 模型提出动作,S1 决定动作能否发生,S2 决定它被允许有多宽的活动范围,S3 决定这条边界画在哪。四者分离,才谈得上可审计——否则“系统拒绝了模型”和“模型自己决定不做”这两件事在日志里长得一样。
下一步: 机制必须满足的四条写在 A1–A4 公理;域宽怎么随质量变化写在 信任自适应域宽