个人维护者:holtwood · C++ / CUDA / LLM inference systems
从可验证的 CUDA/Triton kernel 到真实权重推理与 Rust serving 控制面。
paged-serving 控制面 通过受测试的同进程 C ABI 调用 tiny-llm 数据面:
HTTP/SSE → continuous batching → Paged KV/block tables
⇅ C ABI
GGUF/W8A16 → CUDA decode
这是一个端到端项目,用两个仓库表达控制面/数据面边界,不是两个孤立 demo。
| 角色 | 仓库 | 重点 | 状态 |
|---|---|---|---|
| CUDA 深挖 | cuflash | FlashAttention 前后向、Tensor Core、FlashDecoding | stable |
| CUDA 基础 | cuda-foundations | SGEMM 优化阶梯与可复用推理组件 | stable |
| Triton 对照 | trifuse | 融合算子、参考实现、torch.library |
stable |
| 旗舰数据面 | tiny-llm | 真实权重、量化、decode、KV、C ABI | active |
| 旗舰控制面 | paged-serving | 调度、Paged KV、HTTP/SSE、serving 评测 | active |
- 可追溯性能证据:数字绑定硬件、commit、复现命令、原始结果与限制
- 差分测试:优化实现与独立参考实现做数值对比
- 不变量验证:检查 KV Cache 资源守恒、调度状态机与跨语言布局
- 边界先于宣传:CPU 参考、本地 smoke 和真实 GPU Serving 结果分开表述