Files
sundynix-agentix/DEPTH_ROADMAP.md
T
Blizzard cb6eec5614 feat(desktop): T0.2 多智能体进 Studio —— coordinator 节点 + 专家卡片 + 派发可观测
把已通的多智能体后端(MULTI_AGENT.md)接上 UI,用户可在画布拖出协调者图。

- nodeCatalog: 新增 `coordinator`「多智能体协调」节点(indigo) + 新字段类型
  `agentList` + Specialist 接口({name,use,system,tools}),与后端 parseSpecialists 对齐。
- Inspector: AgentListField —— 可增删的子智能体卡片(名/用途/系统提示词/工具逗号分隔)。
- dsl 校验: agentList 需 ≥1 个有名字的专家、名字不重复。
- RunsView: 「工具调用」面板纳入专家派发(kind=agent),改名「工具/专家」,专家项
  用 Users 图标 + indigo「专家」徽标区分(此前只筛 kind=tool,漏掉多智能体派发)。
- 导出: agents 数组经 exportDsl 原样透传进 DSL → 后端 parseSpecialists 直接消费。

tsc + vitest(19) 绿;UI 同款结构 DSL 后端可跑(协调链路 live 已验)。
DEPTH_ROADMAP T0.2 ,T0 激活 2/2 完成。

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-29 17:14:14 +08:00

100 lines
5.2 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# sundynix-agentix · 深度路线图
> 目标:**在现有广度下做深度** —— 不加新功能面,把已有的盘活、做实、能交付。
> 用法:完成一项勾一项 `[ ]`→`[x]`,子项同理。每完成一个 Tier 回顾一次。
> 图例:`[ ]` 未做 · `[x]` 完成 · `[~]` 进行中 · 🔴 高杠杆 · ⏸ 暂缓
## 诊断:深度不足分四类(别混排)
- **A 建了没激活/没校准**:评测裁判恒给 ~1.00 → 纠偏闭环空转;多智能体后端通了但 Studio 画不出。
- **B 重复/欠债的税**:两套编排引擎(graph.go + compose);前端测试薄(自评 🔴)。
- **C AI 核心还浅**:单模型无 fallback;RAG 三路部分降级/桩、无检索质量度量;无 prompt 版本管理/输出缓存。
- **D 生产硬化 🔴**:审计日志 / NATS 集群 / DB HA / K8s / TLS —— 是"部署深度"非"产品深度"**无真实流量前暂缓**。
---
## 🥇 Tier 0 — 激活已有投入(小改动,最高回报)
### [x] T0.1 🔴 校准评测裁判 — 让恒温器真触发 ✅
现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。
- [x] `eval.go` judge 改对抗性/rubric 打分(默认怀疑、先挑毛病再打分、给死评分基准、用满 1–5)
- [x] grounded judge 同样收紧(忠实度按编造数递减,一处编造≤2;未支持说法进 Flags)
- [x] **根因更深的数学修复**:归一 `score/5`(下限 0.2) → `(v-1)/4`(1→0),否则 0.4*rule 底使 poor 永不可达
- [x] 校准测试:normJudge 区间 + 「流畅但跑题(judge=1)可达 poor」+ 好坏区分度
- [x] 复核阈值(poor<0.5 / warn<0.75)与新分布匹配
- **验收 ✅ live(deepseek)**:跑题→0.40 poor→**触发纠偏(0.40→0.55)**;截断→0.55 warn;好答案→1.00 ok。
校准前这三个全是 1.00→ok,恒温器从没触发。
### [x] T0.2 多智能体进 Studio(多智能体 v2)✅
现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。
- [x] nodeCatalog 加 `coordinator` 节点(「多智能体协调」,indigo)+ 新 `agentList` 字段类型 + Specialist 接口
- [x] Inspector `AgentListField`:可增删的专家卡片(名/用途/系统提示词/工具逗号分隔)
- [x] dsl 校验:agentList 需 ≥1 个有名字的专家 + 名字不重复
- [x] 运行轨迹「工具调用」面板纳入专家派发(kind=agent)→ 改名「工具/专家」,专家项 indigo 标识
- [x] 后端验证:UI 同款 DSL 结构提交可跑(agents 数组经 exportDsl 透传 → parseSpecialists
- 验收 ✅:Studio 左栏出现「多智能体协调」节点,检查器配专家卡片,导出 DSL 对齐后端;
轨迹/工具面板能看到专家派发。(真机由用户在 wails 窗口确认)
---
## 🥈 Tier 1 — 收口 / 去税
### [ ] T1.1 退役 graph.go — 消灭双引擎
现状:compose 已默认,HITL/多智能体只在 compose 上;graph.go 是逃生舱。
- [ ] compose soak 一段真实流量(无回归)
- [ ] 删 graph.gorunGraph 及其专属分支)+ `EINO_COMPOSE` 开关 + 降级回退
- [ ] 把仅 graph.go 用到的辅助函数收编/删除,等价测试转为只测 compose
- 验收:单引擎,全测试绿,HITL/多智能体/分支/map 全在 compose 上。
### [ ] T1.2 前端深度补齐
- [ ] 评测质量面板(运行页展示 overall/质量/忠实/纠偏/flags,驱动 T0.1 的可见性)
- [ ] HITL 边角(长等待后 token 重连、拒绝分支体验)
- [ ] 补前端测试(自评 🔴 缺失):关键流程(run/审批/多智能体)的组件/逻辑测试
- 验收:后端已有能力在 UI 都可见可操作;前端测试覆盖核心流程。
---
## 🥉 Tier 2 — 把 AI 核心做深(差异化卖点)
### [ ] T2.1 模型路由 + Fallback
现状:单模型,一家 provider 抖动全平台挂(自评 ⚠️缺失)。
- [ ] 多 provider 配置(admin 端)+ 主/备路由
- [ ] 主调用失败/超时自动切备(熔断器联动)
- [ ] 按任务类型/成本选模(可选)
- 验收:杀主 provider,任务自动走备完成。
### [ ] T2.2 RAG 深度
现状:三路混合检索部分降级/桩(Neo4j 图谱降级、Milvus relevance 待 P3),无质量度量。
- [ ] 补 Milvus relevance 排序(记忆 P3 同源)
- [ ] 验证/修复图谱检索路(Neo4j
- [ ] 加检索质量度量(命中率/相关性,离线评测集)
- 验收:三路都真出结果且可度量,能说清"混合检索比单路好多少"。
### [ ] T2.3 Prompt 版本管理 + 输出缓存
- [ ] prompt 版本化(可回溯/对比/灰度)
- [ ] 模型输出缓存(同输入命中,省成本+提速)
- 验收:prompt 可版本切换;重复输入走缓存。
---
## 🗄️ Tier 3 — 生产硬化 ⏸(等有真实流量再上)
- [ ] 审计日志(敏感操作留痕)
- [ ] NATS 集群(3 节点 + JetStream Raft+ DB HA
- [ ] K8s 部署 + 多副本
- [ ] 网络安全(TLS / CORS 严格化)
- [ ] 备份 / DR 演练
---
## 进度回顾
| Tier | 完成 / 总 |
|---|---|
| T0 激活 | 2 / 2 ✅ |
| T1 收口 | 0 / 2 |
| T2 深化 | 0 / 3 |
| T3 硬化 ⏸ | 0 / 5 |
> 推进顺序:T0.1 → T0.2 → T1.1 → T1.2 → T2.* → T3 按需)。