# sundynix-agentix · 深度路线图 > 目标:**在现有广度下做深度** —— 不加新功能面,把已有的盘活、做实、能交付。 > 用法:完成一项勾一项 `[ ]`→`[x]`,子项同理。每完成一个 Tier 回顾一次。 > 图例:`[ ]` 未做 · `[x]` 完成 · `[~]` 进行中 · 🔴 高杠杆 · ⏸ 暂缓 ## 诊断:深度不足分四类(别混排) - **A 建了没激活/没校准**:评测裁判恒给 ~1.00 → 纠偏闭环空转;多智能体后端通了但 Studio 画不出。 - **B 重复/欠债的税**:两套编排引擎(graph.go + compose);前端测试薄(自评 🔴)。 - **C AI 核心还浅**:单模型无 fallback;RAG 三路部分降级/桩、无检索质量度量;无 prompt 版本管理/输出缓存。 - **D 生产硬化 🔴**:审计日志 / NATS 集群 / DB HA / K8s / TLS —— 是"部署深度"非"产品深度",**无真实流量前暂缓**。 --- ## 🥇 Tier 0 — 激活已有投入(小改动,最高回报) ### [ ] T0.1 🔴 校准评测裁判 — 让恒温器真触发 现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。 - [ ] `eval.go` judge 改对抗性/rubric 打分(强制按具体维度挑毛病、默认怀疑、给扣分点) - [ ] grounded judge 同样收紧(未被来源支持的说法必须进 Flags 并压分) - [ ] 加校准测试:喂一批已知烂答案(空泛/跑题/拒答/未引用来源)→ 断言判 poor/warn - [ ] 复核分级阈值(poor/warn/ok)与新分布匹配 - 验收:已知烂答案被判 poor 并触发一次纠偏;好答案仍 ok。 ### [ ] T0.2 多智能体进 Studio(多智能体 v2) 现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。 - [ ] nodeCatalog 加 `coordinator` 节点 + 新 `agentList` 字段(子智能体卡片:名/用途/系统提示词/工具多选) - [ ] StudioView 渲染+编辑 agentList,校验(≥1 专家、名唯一) - [ ] 运行轨迹:专家派发渲染成可展开子节点(显示 brief + 精炼结论) - [ ] preview/真机验证:UI 搭两专家协调任务跑通 - 验收:用户能在 Studio 拖出协调者图并运行,轨迹看到并行派发 + 综合。 --- ## 🥈 Tier 1 — 收口 / 去税 ### [ ] T1.1 退役 graph.go — 消灭双引擎 现状:compose 已默认,HITL/多智能体只在 compose 上;graph.go 是逃生舱。 - [ ] compose soak 一段真实流量(无回归) - [ ] 删 graph.go(runGraph 及其专属分支)+ `EINO_COMPOSE` 开关 + 降级回退 - [ ] 把仅 graph.go 用到的辅助函数收编/删除,等价测试转为只测 compose - 验收:单引擎,全测试绿,HITL/多智能体/分支/map 全在 compose 上。 ### [ ] T1.2 前端深度补齐 - [ ] 评测质量面板(运行页展示 overall/质量/忠实/纠偏/flags,驱动 T0.1 的可见性) - [ ] HITL 边角(长等待后 token 重连、拒绝分支体验) - [ ] 补前端测试(自评 🔴 缺失):关键流程(run/审批/多智能体)的组件/逻辑测试 - 验收:后端已有能力在 UI 都可见可操作;前端测试覆盖核心流程。 --- ## 🥉 Tier 2 — 把 AI 核心做深(差异化卖点) ### [ ] T2.1 模型路由 + Fallback 现状:单模型,一家 provider 抖动全平台挂(自评 ⚠️缺失)。 - [ ] 多 provider 配置(admin 端)+ 主/备路由 - [ ] 主调用失败/超时自动切备(熔断器联动) - [ ] 按任务类型/成本选模(可选) - 验收:杀主 provider,任务自动走备完成。 ### [ ] T2.2 RAG 深度 现状:三路混合检索部分降级/桩(Neo4j 图谱降级、Milvus relevance 待 P3),无质量度量。 - [ ] 补 Milvus relevance 排序(记忆 P3 同源) - [ ] 验证/修复图谱检索路(Neo4j) - [ ] 加检索质量度量(命中率/相关性,离线评测集) - 验收:三路都真出结果且可度量,能说清"混合检索比单路好多少"。 ### [ ] T2.3 Prompt 版本管理 + 输出缓存 - [ ] prompt 版本化(可回溯/对比/灰度) - [ ] 模型输出缓存(同输入命中,省成本+提速) - 验收:prompt 可版本切换;重复输入走缓存。 --- ## 🗄️ Tier 3 — 生产硬化 ⏸(等有真实流量再上) - [ ] 审计日志(敏感操作留痕) - [ ] NATS 集群(3 节点 + JetStream Raft)+ DB HA - [ ] K8s 部署 + 多副本 - [ ] 网络安全(TLS / CORS 严格化) - [ ] 备份 / DR 演练 --- ## 进度回顾 | Tier | 完成 / 总 | |---|---| | T0 激活 | 0 / 2 | | T1 收口 | 0 / 2 | | T2 深化 | 0 / 3 | | T3 硬化 ⏸ | 0 / 5 | > 推进顺序:T0.1 → T0.2 → T1.1 → T1.2 → T2.* → (T3 按需)。