Files
sundynix-agentix/DEPTH_ROADMAP.md
T
Blizzard cc1a2c39aa docs: 深度路线图 DEPTH_ROADMAP.md —— 现有广度下做深度的优先级清单
诊断深度不足分四类:A 建了没激活(评测裁判恒 1.00、多智能体无 UI)、B 重复税
(双引擎、前端测试薄)、C AI 核心还浅(单模型无 fallback、RAG 部分降级/桩)、
D 生产硬化(部署深度,无真实流量前暂缓)。

按"杠杆÷工作量"排:T0 激活(校准评测/多智能体进 Studio) → T1 收口(退役
graph.go/前端补齐) → T2 深化(模型 fallback/RAG/prompt 版本+缓存) → T3 硬化⏸。
完成一项勾一项。

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-29 16:14:09 +08:00

96 lines
4.6 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# sundynix-agentix · 深度路线图
> 目标:**在现有广度下做深度** —— 不加新功能面,把已有的盘活、做实、能交付。
> 用法:完成一项勾一项 `[ ]`→`[x]`,子项同理。每完成一个 Tier 回顾一次。
> 图例:`[ ]` 未做 · `[x]` 完成 · `[~]` 进行中 · 🔴 高杠杆 · ⏸ 暂缓
## 诊断:深度不足分四类(别混排)
- **A 建了没激活/没校准**:评测裁判恒给 ~1.00 → 纠偏闭环空转;多智能体后端通了但 Studio 画不出。
- **B 重复/欠债的税**:两套编排引擎(graph.go + compose);前端测试薄(自评 🔴)。
- **C AI 核心还浅**:单模型无 fallback;RAG 三路部分降级/桩、无检索质量度量;无 prompt 版本管理/输出缓存。
- **D 生产硬化 🔴**:审计日志 / NATS 集群 / DB HA / K8s / TLS —— 是"部署深度"非"产品深度"**无真实流量前暂缓**。
---
## 🥇 Tier 0 — 激活已有投入(小改动,最高回报)
### [ ] T0.1 🔴 校准评测裁判 — 让恒温器真触发
现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。
- [ ] `eval.go` judge 改对抗性/rubric 打分(强制按具体维度挑毛病、默认怀疑、给扣分点)
- [ ] grounded judge 同样收紧(未被来源支持的说法必须进 Flags 并压分)
- [ ] 加校准测试:喂一批已知烂答案(空泛/跑题/拒答/未引用来源)→ 断言判 poor/warn
- [ ] 复核分级阈值(poor/warn/ok)与新分布匹配
- 验收:已知烂答案被判 poor 并触发一次纠偏;好答案仍 ok。
### [ ] T0.2 多智能体进 Studio(多智能体 v2)
现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。
- [ ] nodeCatalog 加 `coordinator` 节点 + 新 `agentList` 字段(子智能体卡片:名/用途/系统提示词/工具多选)
- [ ] StudioView 渲染+编辑 agentList,校验(≥1 专家、名唯一)
- [ ] 运行轨迹:专家派发渲染成可展开子节点(显示 brief + 精炼结论)
- [ ] preview/真机验证:UI 搭两专家协调任务跑通
- 验收:用户能在 Studio 拖出协调者图并运行,轨迹看到并行派发 + 综合。
---
## 🥈 Tier 1 — 收口 / 去税
### [ ] T1.1 退役 graph.go — 消灭双引擎
现状:compose 已默认,HITL/多智能体只在 compose 上;graph.go 是逃生舱。
- [ ] compose soak 一段真实流量(无回归)
- [ ] 删 graph.gorunGraph 及其专属分支)+ `EINO_COMPOSE` 开关 + 降级回退
- [ ] 把仅 graph.go 用到的辅助函数收编/删除,等价测试转为只测 compose
- 验收:单引擎,全测试绿,HITL/多智能体/分支/map 全在 compose 上。
### [ ] T1.2 前端深度补齐
- [ ] 评测质量面板(运行页展示 overall/质量/忠实/纠偏/flags,驱动 T0.1 的可见性)
- [ ] HITL 边角(长等待后 token 重连、拒绝分支体验)
- [ ] 补前端测试(自评 🔴 缺失):关键流程(run/审批/多智能体)的组件/逻辑测试
- 验收:后端已有能力在 UI 都可见可操作;前端测试覆盖核心流程。
---
## 🥉 Tier 2 — 把 AI 核心做深(差异化卖点)
### [ ] T2.1 模型路由 + Fallback
现状:单模型,一家 provider 抖动全平台挂(自评 ⚠️缺失)。
- [ ] 多 provider 配置(admin 端)+ 主/备路由
- [ ] 主调用失败/超时自动切备(熔断器联动)
- [ ] 按任务类型/成本选模(可选)
- 验收:杀主 provider,任务自动走备完成。
### [ ] T2.2 RAG 深度
现状:三路混合检索部分降级/桩(Neo4j 图谱降级、Milvus relevance 待 P3),无质量度量。
- [ ] 补 Milvus relevance 排序(记忆 P3 同源)
- [ ] 验证/修复图谱检索路(Neo4j
- [ ] 加检索质量度量(命中率/相关性,离线评测集)
- 验收:三路都真出结果且可度量,能说清"混合检索比单路好多少"。
### [ ] T2.3 Prompt 版本管理 + 输出缓存
- [ ] prompt 版本化(可回溯/对比/灰度)
- [ ] 模型输出缓存(同输入命中,省成本+提速)
- 验收:prompt 可版本切换;重复输入走缓存。
---
## 🗄️ Tier 3 — 生产硬化 ⏸(等有真实流量再上)
- [ ] 审计日志(敏感操作留痕)
- [ ] NATS 集群(3 节点 + JetStream Raft+ DB HA
- [ ] K8s 部署 + 多副本
- [ ] 网络安全(TLS / CORS 严格化)
- [ ] 备份 / DR 演练
---
## 进度回顾
| Tier | 完成 / 总 |
|---|---|
| T0 激活 | 0 / 2 |
| T1 收口 | 0 / 2 |
| T2 深化 | 0 / 3 |
| T3 硬化 ⏸ | 0 / 5 |
> 推进顺序:T0.1 → T0.2 → T1.1 → T1.2 → T2.* → T3 按需)。