feat(harness): 输入护栏升级 —— 归一化反绕过(Tier1) + LLM 越狱分类器(Tier2)
原输入护栏纯正则,空格/编码/同形字一改写即漏,且 bannedTerms 空置。升级为两层: Tier1(网关同步、无 LLM):先归一化再匹配,干掉绕过—— - 小写 + 去零宽字符 + 去变音符 + 同形字折叠(西里尔/希腊→拉丁) + 拆字间隔还原(i g n o r e / i.g.n.o.r.e → ignore) + base64 解码回扫 - 多视图(原文/归一化/紧凑/解码)匹配高精度注入正则,无需穷举变体 - bannedTerms 经 GUARDRAIL_BANNED_TERMS env 落地 - 软信号(jailbreak/developer mode/无限制…)→ 灰区,放行但打 safety_check 标志 Tier2(dispatcher harness LLM 分类器,escalation): - 仅对灰区任务执行前调 LLM 裁决 jailbreak+severity,≥0.7 → rejected - 明确干净/恶意的不付 LLM 成本;模型抖动/解析失败 fail-open 不误锁正常用户 契约新增 MetaSafetyCheck 透传灰区标志;orchestrator 加执行前护栏门控 + SetGuardian。 网关 6 单测 + dispatcher 4 单测,三模块全绿。live:拆字/base64/西里尔同形字均 422 拦, 恶意灰区被 LLM 拒(severity 1)、良性灰区(海盗 roleplay)放行完成。 Co-Authored-By: Claude Opus 4.8 (1M context) <noreply@anthropic.com>
This commit is contained in:
+1
-1
@@ -119,7 +119,7 @@ Harness = 围绕 LLM 的可靠性 / 安全 / 质量治理层。4 个组件均为
|
||||
- [x] **P2 输出脱敏增强** ✅:有状态 `StreamRedactor` 跨分片缓冲,切点在原文上定且**绝不切断完整匹配**,
|
||||
杜绝密钥被切成两片漏检 / 提前脱敏半截致碎片泄漏(逐字符 JWT 流亦完整捕获);rune 边界安全(中文不乱码);
|
||||
新增 PII(手机号/邮箱/身份证);opener+尾窗双兜底、暂留封顶防 DoS。3 流式点接入,7 单测,live 实测密钥/邮箱整条脱敏。
|
||||
- [ ] **P2 输入护栏升级**:纯正则易被改写/编码绕过;加轻量 jailbreak 分类器或 LLM 兜底;`bannedTerms` 落地。
|
||||
- [x] **P2 输入护栏升级** ✅:两层。Tier1(网关同步、无 LLM)先**归一化**(小写/去零宽/同形字折叠/拆字间隔还原/base64 解码)再跑高精度正则——干掉编码/空格/同形字绕过;`bannedTerms` 经 env 落地。Tier2(dispatcher harness LLM 分类器)只对 Tier1 判「灰区」的软信号输入裁决(escalation,明确干净/恶意不付 LLM 成本),命中→rejected,fail-open 降级。live 实测:拆字/base64/西里尔同形字均拦;恶意灰区被 LLM 拒(severity 1)、良性灰区(海盗 roleplay)放行完成。
|
||||
- [x] **P3 坏输出自动纠偏** ✅:poor(<0.5) 触发评语驱动的重生成,重评后**仅采纳更优者(不退步)**,
|
||||
采纳的修订版落会话历史 + 评测终值带 `corrected` 标记落库。`maxRefineRounds=1`、`canRefine`(模型就绪且熔断未开)门控;
|
||||
单 goroutine 串 评测→纠偏→落历史避竞态。单测覆盖 采纳/不退步/非低分不触发,live 验证好答案不误触发。**至此 harness 由「测温计」迈入「恒温器」。**
|
||||
|
||||
Reference in New Issue
Block a user