Skip to content

01-anything/JIT-Agent 启发:harness 即产物、可进化——总纲与迭代计划 #41

Description

@miaobyte

来源

doc/jit-agent-reference.md(对照蓝本:reference/JIT,bingreeky/JIT,arXiv 2608.25593)。JIT-Agent 是「即时进化 agent harness」:根据任务描述 + 协议 + 工具注册表 + 检索到的历史 harness,现场生成任务特化的可执行 harness,跑完拿 trace/feedback 修复并更新档案库;harness 在测试时持续进化、生成器冻结。

一句话结论

JIT 给 byteseek 的核心不是新算法,而是一套「harness 即产物、可进化」的工程闭环:生成 → 校验 → repair → best-of-N 择优 → 沉淀档案。byteseek 的 llm·call 已走完第一步(生成 → vet → layout),缺的是后面三步,以及把这套闭环作用在因子化的四模块上(#8)而非单体 mainbrain

现状 ↔ JIT 对照

JIT 机制 byteseek 现状 缺口 → issue
四模块 harness(memory/planning/action/tool_policy) main.kv 单体 mainbrainllm.kv/prompt.kv 只分离了代码脑/提示词 无因子化 → #8
generate→validate→repair 生成一次 → vet 失败回填 error: 就停 无 repair 循环 → #7 前半 / A3
best-of-N(selector.py judge 路由) 生成 1 个候选,跑完即弃 无择优、无档案 → #7 后半
记忆压缩(resum/memobrain/agentfold) engine.talk_push + /session/talk/* 存在但未接入循环 无记忆 → #9/#10/#11 / A4/B4
种子参考库(11 个 descriptions) 只有 kvlangbrief(语法速览) 无结构参考 → kvlangbrief 扩展

迭代计划(依赖序)

依赖关系:0 跑分器 ──► 3 best-of-N 的「尺子」+ 全链路回归;1 四模块 ──► 4 记忆挂载点;2 repair ──► 3 best-of-N

迭代 0 —— agentbench 跑分器(先有尺子)

  • 现状agentbench/00..10 已有 40+ 题 question/answer,但 Makefile 只有 all/install/run/clean,无 test
  • 改动:加 agentbench/run.sh 喂题走完整链路(llm·call → vet → layout → run → println)与 .answer diff,直接调用真实 LLM;make bench 一键跑全量。
  • 验收make bench 一键跑通,后续每迭代重构后仍能对比回归。
  • 绑定:F1/F2(被「收口」项提前,作为红绿信号地基)。

迭代 1 —— 核心循环四模块因子化(#8

  • 改动lib/byteseek/memory / planning / action / tool_policy 四个 lib 块(同一棵树内路径限定名互调,非 import),mainbrain 退化为四模块组装调用。
  • 验收:行为不变、迭代 0 离线题全绿;kvspace tree /lib/byteseek/ 可见四模块可寻址可替换。

迭代 2 —— generate→validate→repair 闭环(#7 前半 / A3)

  • 改动llm·call 内扩有界 repair 循环(生成 → vet → 失败拼回 user prompt 重生成,上限 N=3);byteseek·run 执行后读 /vthread/{vid}/·status 非 0 触发一次 repair。
  • 验收:造必 vet 失败的 prompt,观察多轮 repair 与降级;repair 历史落树。

迭代 3 —— best-of-N 择优 + 档案沉淀(#7 后半)

  • 改动:生成 N 候选(temperature 提高)→ judge 路由(单 LLM strict JSON {"best": i, "reason"},复用 selector.py 的 JUDGE_SYSTEM_PROMPT)选 1 → 跑;agentbench 确定性题用 .answer diff 做硬分;最优者 + 评分写 /lib/byteseek/session/<name>/ 档案库。
  • 验收:同一任务 N=3 跑出 judge 选择 + 评分落树;确定性题硬分全对。

迭代 4 —— 记忆系统(#9/#10/#11 / A4/B4)

  • 改动:会话内两阶段(talk_push 接入循环 + 最近 k 轮薄注入 + 超预算旧轮 resum 摘要落树);跨会话 mem·put/get/search(B4)落固定子树。
  • 验收:长对话请求体不超限,旧轮摘要可观测、跨会话可检索。

迭代 5 —— 种子参考库(kvlangbrief 扩展)

  • 改动:新增 /lib/byteseek.harnessref 写入四模块骨架 + 已收敛策略描述,llm·call 拼进 system prompt。
  • 验收:生成 prompt 含参考库,生成代码更贴合四模块骨架。

推进顺序与边界

  • 主线 0→1→2→3→4→5;0 与 1 可并行,2/3 依赖 1 的四模块骨架,4 依赖 1 的 memory 挂载点。
  • 单一路径:择优只走 judge 路由(logprob 需自托管 vLLM,后置);记忆先落 resum(token-budget 摘要),memobrain 推理图后置。
  • issue 驱动:每迭代一分支 → Closes #N PR → merge。
  • 边界:本次不动 src/ rwir 注册表与 C ABI;01-anything/记忆合并子代理的隔离与并发安全(锁+租约+心跳,沙箱降级) #11 的「合并子代理并发安全」属阶段二,迭代 4 只做单 agent 会话内/跨会话。

子 issue 关系

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions