fix(harness): T0.1 校准评测裁判 —— 让恒温器真触发(此前全 1.00 空转)
诊断:旧评测 LLM judge 恒给 0.94/1.00、从不判 poor → 低分自动纠偏闭环几乎从没 启动。根因两层: 1. 提示词软:只说"严格"但无评分基准、不强制挑毛病 → 模型恒锚定 4–5。 2. 数学更致命:归一 score/5 下限 0.2,叠加无来源 Overall=0.4*rule+0.6*s 的 0.4*rule≈0.4 底 → Overall 恒 ≥0.52、poor(<0.5)对"流畅但跑题/错误"永不可达。 修复: - judge 提示词改对抗性+rubric:默认怀疑、先点缺陷再打分、给死 1–5 评分基准、 要求用满区间;grounded judge 忠实度按编造说法递减(一处编造≤2)。 - 归一 score/5 → normJudge=(v-1)/4(1→0),让低质能压到 poor 触发纠偏。 - 测试:normJudge 区间 + 流畅跑题(judge=1)可达 poor + 好坏区分度;更新两处旧 断言(4→0.75, 2→0.25)。 live 验证(deepseek):跑题→0.40 poor→自动纠偏(0.40→0.55);截断→0.55 warn; 好答案→1.00 ok。校准前三者全 1.00。评测+纠偏的投入由"摆设"变"在用"。 DEPTH_ROADMAP T0.1 ✅。 Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
+9
-7
@@ -15,13 +15,15 @@
|
||||
|
||||
## 🥇 Tier 0 — 激活已有投入(小改动,最高回报)
|
||||
|
||||
### [ ] T0.1 🔴 校准评测裁判 — 让恒温器真触发
|
||||
### [x] T0.1 🔴 校准评测裁判 — 让恒温器真触发 ✅
|
||||
现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。
|
||||
- [ ] `eval.go` judge 改对抗性/rubric 打分(强制按具体维度挑毛病、默认怀疑、给扣分点)
|
||||
- [ ] grounded judge 同样收紧(未被来源支持的说法必须进 Flags 并压分)
|
||||
- [ ] 加校准测试:喂一批已知烂答案(空泛/跑题/拒答/未引用来源)→ 断言判 poor/warn
|
||||
- [ ] 复核分级阈值(poor/warn/ok)与新分布匹配
|
||||
- 验收:已知烂答案被判 poor 并触发一次纠偏;好答案仍 ok。
|
||||
- [x] `eval.go` judge 改对抗性/rubric 打分(默认怀疑、先挑毛病再打分、给死评分基准、用满 1–5)
|
||||
- [x] grounded judge 同样收紧(忠实度按编造数递减,一处编造≤2;未支持说法进 Flags)
|
||||
- [x] **根因更深的数学修复**:归一 `score/5`(下限 0.2) → `(v-1)/4`(1→0),否则 0.4*rule 底使 poor 永不可达
|
||||
- [x] 校准测试:normJudge 区间 + 「流畅但跑题(judge=1)可达 poor」+ 好坏区分度
|
||||
- [x] 复核阈值(poor<0.5 / warn<0.75)与新分布匹配
|
||||
- **验收 ✅ live(deepseek)**:跑题→0.40 poor→**触发纠偏(0.40→0.55)**;截断→0.55 warn;好答案→1.00 ok。
|
||||
校准前这三个全是 1.00→ok,恒温器从没触发。
|
||||
|
||||
### [ ] T0.2 多智能体进 Studio(多智能体 v2)
|
||||
现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。
|
||||
@@ -87,7 +89,7 @@
|
||||
|
||||
| Tier | 完成 / 总 |
|
||||
|---|---|
|
||||
| T0 激活 | 0 / 2 |
|
||||
| T0 激活 | 1 / 2 |
|
||||
| T1 收口 | 0 / 2 |
|
||||
| T2 深化 | 0 / 3 |
|
||||
| T3 硬化 ⏸ | 0 / 5 |
|
||||
|
||||
Reference in New Issue
Block a user