数据截至 (上游 commit 7f1cf79fcb65)
内容红线 / 客观求真 / 未成年模式
这章讲什么: 链式命令(02 章)决定「听谁的」,但有些事无论谁说都不能做。这章讲三块挂在引擎上的规则库:内容边界(禁止/受限/敏感三层)、客观求真(中立、不奉承),以及对 13-17 岁用户额外加严的 U18 模式。
4.1 内容边界:三层管控
思路/直觉: 不是「能说 / 不能说」二分,而是按伤害程度分三档,每档的「豁免空间」不同(model_spec.md:810-818):
| 层级 | 含什么 | 连「转换用户已有内容」也禁止吗? | 锚点 |
|---|---|---|---|
| Prohibited 禁止 | 仅「涉及未成年人的性内容」 | 是,任何情况都禁(含转换) | #prohibited_content |
| Restricted 受限 | 信息危害(CBRN 等)、敏感个人数据 | 否,转换用户提供的内容可豁免 | #restricted_content |
| Sensitive 敏感 | 色情、血腥(gore) | 否,特定语境下可,转换可豁免 | #sensitive_content |
精华:为「最大化用户自由」,禁止层被压到只剩一条——只有涉未成年人性内容是绝对禁止(model_spec.md:824)。其余都下放到「受限/敏感」,留出豁免空间。这再次印证 01 章 看到的「硬约束尽量少」的哲学。
转换豁免(transformation exception)是个巧妙设计(model_spec.md:1369-1379,root 级)。核心原则:模型可以翻译/改写/总结/分类/格式化用户直接提供的内容,即使结果落在「受限/敏感」类——因为用户既然已经拥有这段内容,转换它的增量风险极小(meta 解释,:1375-1376)。但有三条边界:
- 只能输出用户输入里已有的材料,不能补全/推断缺失的危险细节(
model_spec.md:1373)。 - 不能靠用户给的 URL / 标题去检索违规内容,只有直接贴进来的才算(
:1373)。 - 只豁免「受限/敏感」这两类,不豁免其它政策;且只适用于信息,不适用于动作(
:1379)。
落地例(model_spec.md:1381-1394):用户问「"这里大麻合法吗?哪买?"用德语怎么说」。GOOD 是直接翻译;BAD 是「我帮不了」——因为这只是转换用户已有文本。