Skip to content

01-anything/rwir/rwfunc 版本+评分进化:n 变体实测择优,沉淀通用/本地最优库 #7

Description

@miaobyte

背景与动机

byteseek 的 rwir/rwfunc 里存在大量 LLM 生成的 prompt 与代码,其写参(writeparam)存在很大的不稳定性:同一需求,LLM 每次生成/改写的实现可能不同、质量参差(漏置 0、类型定宽不符、边界条件缺失等)。当前 llm.call 只有 vet 一道闸门——它只判断"能不能跑",没有"哪个实现更好"的衡量,因此无法沉淀出经过实测的最优实现。

目标

给每个 rwir/rwfunc 引入 版本 + 评分 机制,让它们被反复"生成 n 变体 → 实测验证 → 择优保留"地迭代进化:

  1. 评估每一个 rwir/rwfunc 的评分(正确性、性能、边界、可观测等维度)。
  2. 对同一能力,每次都尝试实现 n 个变体(含对应的 prompt),跑测试/真实任务实测验证。
  3. 记录每个变体的打分,择优成为该能力的新版本,其余淘汰或归档,循环迭代进化。

例子

  • 第一次需要一个排序 rwfunc,实现为冒泡排序(能跑、正确)。
  • 第二次针对同一能力实现 n 个排序算法(快排/归并/堆排…),统一基准实测,每个都记录打分。
  • 最优者成为该 rwfunc 的新版本,其余归档。

运行方式

  • 真实任务分解:byteseek 把每次真实任务拆解,识别其中用到的 rwir/rwfunc,触发一次"生成 n 变体 → 实测 → 打分 → 择优"的进化。
  • 进化结果落回 kvspace 树:版本、评分、源码、prompt 都可寻址、可持久、可自改。

终局形态

  • 通用最优库:汇集各次进化,最终形成一套通用的 rwir/rwfunc 最优实现库(互联网系统工程)。
  • 本地最优库:本地部署的 byteseek 也能基于自身真实任务,进化出自己的一套本地最优库。

开放问题(后续拆子任务)

  • 评分函数:维度、权重、归一化;评分与版本链如何落在 kvspace 树里。
  • 变体生成策略:n 如何取、prompt 如何变分、如何避免退化或过拟合基准。
  • 实测基准集:正确性断言 + 性能基准;离线(mock LLM)与真实 LLM 分层。
  • 版本模型:每个 rwir/rwfunc 的版本链、回滚、A/B 对比。
  • 与现有 vet / layout / llm.call 自改闭环(C3)的衔接。

Activity

Sign up for free to join this conversation on GitHub. Already have an account? Sign in to comment

Metadata

Metadata

Assignees

No one assigned

    Labels

    No labels
    No labels

    Type

    No type

    Projects

    No projects

      Milestone

      No milestone

      Relationships

      None yet

      Development

      No branches or pull requests

      Issue actions