Skip to content
@open-infra-ai

Open Infra AI

Open-source infrastructure, tools, and systems for building and running AI. | 面向 AI 构建与运行的开源基础设施、工具与系统

open-infra-ai

个人维护者:holtwood · C++ / CUDA / LLM inference systems

从可验证的 CUDA/Triton kernel 到真实权重推理与 Rust serving 控制面。

旗舰系统

paged-serving 控制面 通过受测试的同进程 C ABI 调用 tiny-llm 数据面

HTTP/SSE → continuous batching → Paged KV/block tables
                                      ⇅ C ABI
                              GGUF/W8A16 → CUDA decode

这是一个端到端项目,用两个仓库表达控制面/数据面边界,不是两个孤立 demo。

深度与对照

角色 仓库 重点 状态
CUDA 深挖 cuflash FlashAttention 前后向、Tensor Core、FlashDecoding stable
CUDA 基础 cuda-foundations SGEMM 优化阶梯与可复用推理组件 stable
Triton 对照 trifuse 融合算子、参考实现、torch.library stable
旗舰数据面 tiny-llm 真实权重、量化、decode、KV、C ABI active
旗舰控制面 paged-serving 调度、Paged KV、HTTP/SSE、serving 评测 active

从哪里开始

工程原则

  • 可追溯性能证据:数字绑定硬件、commit、复现命令、原始结果与限制
  • 差分测试:优化实现与独立参考实现做数值对比
  • 不变量验证:检查 KV Cache 资源守恒、调度状态机与跨语言布局
  • 边界先于宣传:CPU 参考、本地 smoke 和真实 GPU Serving 结果分开表述

Popular repositories Loading

  1. cuda-foundations cuda-foundations Public

    可验证的 CUDA 学习主线:SGEMM、通用 GPU 算子、性能优化与轻量推理组件

    C++ 5

  2. trifuse trifuse Public

    面向 Transformer 推理的可验证 Triton 融合算子与 torch.library 集成

    Python 4

  3. ai-infra-interview-prep ai-infra-interview-prep Public

    证据驱动的 12 周 AI Infra 转型计划:能力矩阵、简历、面试、社区贡献与云 GPU 实验手册

    Python 2

  4. paged-serving paged-serving Public

    Rust LLM Serving 控制面:Paged KV、continuous batching、OpenAI SSE、C ABI 后端与可信压测

    Rust 1

  5. cuflash cuflash Public

    cuflash — FlashAttention from scratch in CUDA C++: scalar → WMMA tensor-core forward, FlashDecoding/Split-KV, Roofline analysis. FP16/BF16/FP32 fwd/bwd, sm_70–sm_90.

    Cuda

  6. tiny-llm tiny-llm Public

    CUDA/C++ LLM 推理运行时:GGUF、W8A16、tokenizer、Paged KV、CUDA Graph 与可复现基准

    C++

Repositories

Showing 8 of 8 repositories

Top languages

Loading…

Most used topics

Loading…