背景与动机
byteseek 的 rwir/rwfunc 里存在大量 LLM 生成的 prompt 与代码,其写参(writeparam)存在很大的不稳定性:同一需求,LLM 每次生成/改写的实现可能不同、质量参差(漏置 0、类型定宽不符、边界条件缺失等)。当前 llm.call 只有 vet 一道闸门——它只判断"能不能跑",没有"哪个实现更好"的衡量,因此无法沉淀出经过实测的最优实现。
目标
给每个 rwir/rwfunc 引入 版本 + 评分 机制,让它们被反复"生成 n 变体 → 实测验证 → 择优保留"地迭代进化:
- 评估每一个 rwir/rwfunc 的评分(正确性、性能、边界、可观测等维度)。
- 对同一能力,每次都尝试实现 n 个变体(含对应的 prompt),跑测试/真实任务实测验证。
- 记录每个变体的打分,择优成为该能力的新版本,其余淘汰或归档,循环迭代进化。
例子
- 第一次需要一个排序 rwfunc,实现为冒泡排序(能跑、正确)。
- 第二次针对同一能力实现 n 个排序算法(快排/归并/堆排…),统一基准实测,每个都记录打分。
- 最优者成为该 rwfunc 的新版本,其余归档。
运行方式
- 真实任务分解:byteseek 把每次真实任务拆解,识别其中用到的 rwir/rwfunc,触发一次"生成 n 变体 → 实测 → 打分 → 择优"的进化。
- 进化结果落回 kvspace 树:版本、评分、源码、prompt 都可寻址、可持久、可自改。
终局形态
- 通用最优库:汇集各次进化,最终形成一套通用的 rwir/rwfunc 最优实现库(互联网系统工程)。
- 本地最优库:本地部署的 byteseek 也能基于自身真实任务,进化出自己的一套本地最优库。
开放问题(后续拆子任务)
- 评分函数:维度、权重、归一化;评分与版本链如何落在 kvspace 树里。
- 变体生成策略:n 如何取、prompt 如何变分、如何避免退化或过拟合基准。
- 实测基准集:正确性断言 + 性能基准;离线(mock LLM)与真实 LLM 分层。
- 版本模型:每个 rwir/rwfunc 的版本链、回滚、A/B 对比。
- 与现有
vet / layout / llm.call 自改闭环(C3)的衔接。
背景与动机
byteseek 的 rwir/rwfunc 里存在大量 LLM 生成的 prompt 与代码,其写参(writeparam)存在很大的不稳定性:同一需求,LLM 每次生成/改写的实现可能不同、质量参差(漏置 0、类型定宽不符、边界条件缺失等)。当前
llm.call只有vet一道闸门——它只判断"能不能跑",没有"哪个实现更好"的衡量,因此无法沉淀出经过实测的最优实现。目标
给每个 rwir/rwfunc 引入 版本 + 评分 机制,让它们被反复"生成 n 变体 → 实测验证 → 择优保留"地迭代进化:
例子
运行方式
终局形态
开放问题(后续拆子任务)
vet/layout/llm.call自改闭环(C3)的衔接。