Files
sundynix-agentix/DEPTH_ROADMAP.md
T
Blizzard ef6f525a74 refactor(dispatcher): T1.1 退役 graph.go —— 编排引擎收成单一 compose
compose 已默认数天、HITL/多智能体/评测全在其上真实跑过,soak 充分。删掉自研拓扑
解释器这第二套引擎,消灭"双实现 drift"税:

- 删 runGraph(graph.go 的自研解释器)+ composeEnabled/EINO_COMPOSE 逃生舱开关
  + runConversation(仅 runGraph 用的死代码)。
- executeGraph 直接走 runComposeGraph;compose 编译失败兜底改单轮对话(不再回退
  graph.go);清掉仅 runGraph 用的 import(otel attribute/trace/otelx)。
- 保留 board / 各节点执行器(retriever/tool/agent/branch/approval/map/render/aggregate)
  / 工具函数 —— 它们是 compose 各节点 lambda 复用的,非 graph.go 专属。
- 测试:8 处 runGraph→runComposeGraph;等价测试(对照两引擎)转为 compose 正确性测试;
  runConversation 的开关测试转为「无 ChatModel 降级 runAgent」。

go test ./... 全绿 + vet 干净;冒烟 简单 agent/分支图 跑通。此后每个编排改动不再两边
对齐,成本减半。DEPTH_ROADMAP T1.1 。

Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
2026-06-30 08:53:02 +08:00

5.6 KiB
Raw Blame History

sundynix-agentix · 深度路线图

目标:在现有广度下做深度 —— 不加新功能面,把已有的盘活、做实、能交付。 用法:完成一项勾一项 [ ][x],子项同理。每完成一个 Tier 回顾一次。 图例:[ ] 未做 · [x] 完成 · [~] 进行中 · 🔴 高杠杆 · ⏸ 暂缓

诊断:深度不足分四类(别混排)

  • A 建了没激活/没校准:评测裁判恒给 ~1.00 → 纠偏闭环空转;多智能体后端通了但 Studio 画不出。
  • B 重复/欠债的税:两套编排引擎(graph.go + compose);前端测试薄(自评 🔴)。
  • C AI 核心还浅:单模型无 fallback;RAG 三路部分降级/桩、无检索质量度量;无 prompt 版本管理/输出缓存。
  • D 生产硬化 🔴:审计日志 / NATS 集群 / DB HA / K8s / TLS —— 是"部署深度"非"产品深度"无真实流量前暂缓

🥇 Tier 0 — 激活已有投入(小改动,最高回报)

[x] T0.1 🔴 校准评测裁判 — 让恒温器真触发

现状:LLM judge 恒给 0.94/1.00,从不判 poor,低分自动纠偏闭环几乎从没启动。

  • eval.go judge 改对抗性/rubric 打分(默认怀疑、先挑毛病再打分、给死评分基准、用满 1–5)
  • grounded judge 同样收紧(忠实度按编造数递减,一处编造≤2;未支持说法进 Flags)
  • 根因更深的数学修复:归一 score/5(下限 0.2) → (v-1)/4(1→0),否则 0.4*rule 底使 poor 永不可达
  • 校准测试:normJudge 区间 + 「流畅但跑题(judge=1)可达 poor」+ 好坏区分度
  • 复核阈值(poor<0.5 / warn<0.75)与新分布匹配
  • 验收 live(deepseek):跑题→0.40 poor→触发纠偏(0.40→0.55);截断→0.55 warn;好答案→1.00 ok。 校准前这三个全是 1.00→ok,恒温器从没触发。

[x] T0.2 多智能体进 Studio(多智能体 v2)

现状:coordinator 后端已通(见 MULTI_AGENT.md),但画布拖不出。

  • nodeCatalog 加 coordinator 节点(「多智能体协调」,indigo)+ 新 agentList 字段类型 + Specialist 接口
  • Inspector AgentListField:可增删的专家卡片(名/用途/系统提示词/工具逗号分隔)
  • dsl 校验:agentList 需 ≥1 个有名字的专家 + 名字不重复
  • 运行轨迹「工具调用」面板纳入专家派发(kind=agent)→ 改名「工具/专家」,专家项 indigo 标识
  • 后端验证:UI 同款 DSL 结构提交可跑(agents 数组经 exportDsl 透传 → parseSpecialists
  • 验收 :Studio 左栏出现「多智能体协调」节点,检查器配专家卡片,导出 DSL 对齐后端; 轨迹/工具面板能看到专家派发。(真机由用户在 wails 窗口确认)

🥈 Tier 1 — 收口 / 去税

[x] T1.1 退役 graph.go — 消灭双引擎

现状:compose 已默认,HITL/多智能体只在 compose 上;graph.go 是逃生舱。

  • compose soak(默认跑数天,HITL/多智能体/评测全在其上真实运行)
  • runGraph(自研拓扑解释器)+ composeEnabled/EINO_COMPOSE 开关 + runConversation 死代码
  • compose 编译失败兜底改单轮对话(不再回退 graph.go);清掉仅 runGraph 用的 import(otel)
  • 保留 board/各节点执行器/工具函数(compose 各 lambda 复用);8 处测试 runGraph→runComposeGraph 等价测试转为 compose 正确性测试,runConversation 测试转为「无 ChatModel 降级 runAgent」
  • 验收 :单引擎,go test ./... 全绿 + vet 干净;冒烟 简单 agent/分支图 跑通;HITL/多智能体/branch/map 全在 compose 上。

[ ] T1.2 前端深度补齐

  • 评测质量面板(运行页展示 overall/质量/忠实/纠偏/flags,驱动 T0.1 的可见性)
  • HITL 边角(长等待后 token 重连、拒绝分支体验)
  • 补前端测试(自评 🔴 缺失):关键流程(run/审批/多智能体)的组件/逻辑测试
  • 验收:后端已有能力在 UI 都可见可操作;前端测试覆盖核心流程。

🥉 Tier 2 — 把 AI 核心做深(差异化卖点)

[ ] T2.1 模型路由 + Fallback

现状:单模型,一家 provider 抖动全平台挂(自评 ⚠️缺失)。

  • 多 provider 配置(admin 端)+ 主/备路由
  • 主调用失败/超时自动切备(熔断器联动)
  • 按任务类型/成本选模(可选)
  • 验收:杀主 provider,任务自动走备完成。

[ ] T2.2 RAG 深度

现状:三路混合检索部分降级/桩(Neo4j 图谱降级、Milvus relevance 待 P3),无质量度量。

  • 补 Milvus relevance 排序(记忆 P3 同源)
  • 验证/修复图谱检索路(Neo4j
  • 加检索质量度量(命中率/相关性,离线评测集)
  • 验收:三路都真出结果且可度量,能说清"混合检索比单路好多少"。

[ ] T2.3 Prompt 版本管理 + 输出缓存

  • prompt 版本化(可回溯/对比/灰度)
  • 模型输出缓存(同输入命中,省成本+提速)
  • 验收:prompt 可版本切换;重复输入走缓存。

🗄️ Tier 3 — 生产硬化 ⏸(等有真实流量再上)

  • 审计日志(敏感操作留痕)
  • NATS 集群(3 节点 + JetStream Raft+ DB HA
  • K8s 部署 + 多副本
  • 网络安全(TLS / CORS 严格化)
  • 备份 / DR 演练

进度回顾

Tier 完成 / 总
T0 激活 2 / 2
T1 收口 1 / 2
T2 深化 0 / 3
T3 硬化 ⏸ 0 / 5

推进顺序:T0.1 → T0.2 → T1.1 → T1.2 → T2.* → T3 按需)。