Files
sundynix-agentix/DEPTH_ROADMAP.md
T
Blizzard ef6f525a74 refactor(dispatcher): T1.1 退役 graph.go —— 编排引擎收成单一 compose
compose 已默认数天、HITL/多智能体/评测全在其上真实跑过,soak 充分。删掉自研拓扑
解释器这第二套引擎,消灭"双实现 drift"税:

- 删 runGraph(graph.go 的自研解释器)+ composeEnabled/EINO_COMPOSE 逃生舱开关
  + runConversation(仅 runGraph 用的死代码)。
- executeGraph 直接走 runComposeGraph;compose 编译失败兜底改单轮对话(不再回退
  graph.go);清掉仅 runGraph 用的 import(otel attribute/trace/otelx)。
- 保留 board / 各节点执行器(retriever/tool/agent/branch/approval/map/render/aggregate)
  / 工具函数 —— 它们是 compose 各节点 lambda 复用的,非 graph.go 专属。
- 测试:8 处 runGraph→runComposeGraph;等价测试(对照两引擎)转为 compose 正确性测试;
  runConversation 的开关测试转为「无 ChatModel 降级 runAgent」。

go test ./... 全绿 + vet 干净;冒烟 简单 agent/分支图 跑通。此后每个编排改动不再两边
对齐,成本减半。DEPTH_ROADMAP T1.1 。

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-30 08:53:02 +08:00

103 lines
5.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# sundynix-agentix · 深度路线图
> 目标:**在现有广度下做深度** —— 不加新功能面,把已有的盘活、做实、能交付。
> 用法:完成一项勾一项 `[ ]`→`[x]`,子项同理。每完成一个 Tier 回顾一次。
> 图例:`[ ]` 未做 · `[x]` 完成 · `[~]` 进行中 · 🔴 高杠杆 · ⏸ 暂缓
## 诊断:深度不足分四类(别混排)
- **A 建了没激活/没校准**:评测裁判恒给 ~1.00 → 纠偏闭环空转;多智能体后端通了但 Studio 画不出。
- **B 重复/欠债的税**:两套编排引擎(graph.go + compose);前端测试薄(自评 🔴)。
- **C AI 核心还浅**:单模型无 fallback;RAG 三路部分降级/桩、无检索质量度量;无 prompt 版本管理/输出缓存。
- **D 生产硬化 🔴**:审计日志 / NATS 集群 / DB HA / K8s / TLS —— 是"部署深度"非"产品深度"**无真实流量前暂缓**。
---
## 🥇 Tier 0 — 激活已有投入(小改动,最高回报)
### [x] T0.1 🔴 校准评测裁判 — 让恒温器真触发 ✅
现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。
- [x] `eval.go` judge 改对抗性/rubric 打分(默认怀疑、先挑毛病再打分、给死评分基准、用满 1–5)
- [x] grounded judge 同样收紧(忠实度按编造数递减,一处编造≤2;未支持说法进 Flags)
- [x] **根因更深的数学修复**:归一 `score/5`(下限 0.2) → `(v-1)/4`(1→0),否则 0.4*rule 底使 poor 永不可达
- [x] 校准测试:normJudge 区间 + 「流畅但跑题(judge=1)可达 poor」+ 好坏区分度
- [x] 复核阈值(poor<0.5 / warn<0.75)与新分布匹配
- **验收 ✅ live(deepseek)**:跑题→0.40 poor→**触发纠偏(0.40→0.55)**;截断→0.55 warn;好答案→1.00 ok。
校准前这三个全是 1.00→ok,恒温器从没触发。
### [x] T0.2 多智能体进 Studio(多智能体 v2)✅
现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。
- [x] nodeCatalog 加 `coordinator` 节点(「多智能体协调」,indigo)+ 新 `agentList` 字段类型 + Specialist 接口
- [x] Inspector `AgentListField`:可增删的专家卡片(名/用途/系统提示词/工具逗号分隔)
- [x] dsl 校验:agentList 需 ≥1 个有名字的专家 + 名字不重复
- [x] 运行轨迹「工具调用」面板纳入专家派发(kind=agent)→ 改名「工具/专家」,专家项 indigo 标识
- [x] 后端验证:UI 同款 DSL 结构提交可跑(agents 数组经 exportDsl 透传 → parseSpecialists
- 验收 ✅:Studio 左栏出现「多智能体协调」节点,检查器配专家卡片,导出 DSL 对齐后端;
轨迹/工具面板能看到专家派发。(真机由用户在 wails 窗口确认)
---
## 🥈 Tier 1 — 收口 / 去税
### [x] T1.1 退役 graph.go — 消灭双引擎 ✅
现状:compose 已默认,HITL/多智能体只在 compose 上;graph.go 是逃生舱。
- [x] compose soak(默认跑数天,HITL/多智能体/评测全在其上真实运行)
- [x]`runGraph`(自研拓扑解释器)+ `composeEnabled`/`EINO_COMPOSE` 开关 + `runConversation` 死代码
- [x] compose 编译失败兜底改单轮对话(不再回退 graph.go);清掉仅 runGraph 用的 import(otel)
- [x] 保留 board/各节点执行器/工具函数(compose 各 lambda 复用);8 处测试 runGraph→runComposeGraph
等价测试转为 compose 正确性测试,runConversation 测试转为「无 ChatModel 降级 runAgent」
- 验收 ✅:单引擎,go test ./... 全绿 + vet 干净;冒烟 简单 agent/分支图 跑通;HITL/多智能体/branch/map
全在 compose 上。
### [ ] T1.2 前端深度补齐
- [ ] 评测质量面板(运行页展示 overall/质量/忠实/纠偏/flags,驱动 T0.1 的可见性)
- [ ] HITL 边角(长等待后 token 重连、拒绝分支体验)
- [ ] 补前端测试(自评 🔴 缺失):关键流程(run/审批/多智能体)的组件/逻辑测试
- 验收:后端已有能力在 UI 都可见可操作;前端测试覆盖核心流程。
---
## 🥉 Tier 2 — 把 AI 核心做深(差异化卖点)
### [ ] T2.1 模型路由 + Fallback
现状:单模型,一家 provider 抖动全平台挂(自评 ⚠️缺失)。
- [ ] 多 provider 配置(admin 端)+ 主/备路由
- [ ] 主调用失败/超时自动切备(熔断器联动)
- [ ] 按任务类型/成本选模(可选)
- 验收:杀主 provider,任务自动走备完成。
### [ ] T2.2 RAG 深度
现状:三路混合检索部分降级/桩(Neo4j 图谱降级、Milvus relevance 待 P3),无质量度量。
- [ ] 补 Milvus relevance 排序(记忆 P3 同源)
- [ ] 验证/修复图谱检索路(Neo4j
- [ ] 加检索质量度量(命中率/相关性,离线评测集)
- 验收:三路都真出结果且可度量,能说清"混合检索比单路好多少"。
### [ ] T2.3 Prompt 版本管理 + 输出缓存
- [ ] prompt 版本化(可回溯/对比/灰度)
- [ ] 模型输出缓存(同输入命中,省成本+提速)
- 验收:prompt 可版本切换;重复输入走缓存。
---
## 🗄️ Tier 3 — 生产硬化 ⏸(等有真实流量再上)
- [ ] 审计日志(敏感操作留痕)
- [ ] NATS 集群(3 节点 + JetStream Raft+ DB HA
- [ ] K8s 部署 + 多副本
- [ ] 网络安全(TLS / CORS 严格化)
- [ ] 备份 / DR 演练
---
## 进度回顾
| Tier | 完成 / 总 |
|---|---|
| T0 激活 | 2 / 2 ✅ |
| T1 收口 | 1 / 2 |
| T2 深化 | 0 / 3 |
| T3 硬化 ⏸ | 0 / 5 |
> 推进顺序:T0.1 → T0.2 → T1.1 → T1.2 → T2.* → T3 按需)。