开源项目 kimi-k3-in-c,用 176KB 的可移植 C99 代码跑超大 MoE,不依赖 CUDA、PyTorch、BLAS,甚至不需要 GPU。
1️⃣ 896 个专家,每个 Token 只激活 16 个
2️⃣ 模型放 NVMe,剩余权重按需流式加载
3️⃣ 8GB 内存下生成一个 Token 约 26~32 秒
4️⃣ 不同内存配置下,输出结果保持字节级一致
当然,它目前更像一个极限条件下的技术实验,不是拿来日常聊天的。
但它证明了一件挺有意思的事:超大 MoE 模型,不一定非得整套塞进内存。
🔗 https://github.com/FareedKhan-dev/kimi-k3-in-c