查看: 5|回复: 0

2.78 万亿参数,8GB 内存,单 CPU。 这个组合确实有点离谱。

[复制链接]

18

主题

2

回帖

68

积分

注册会员

积分
68
发表于 1 小时前 | 显示全部楼层 |阅读模式
2.78 万亿参数,8GB 内存,单 CPU。 这个组合确实有点离谱。

开源项目 kimi-k3-in-c,用 176KB 的可移植 C99 代码跑超大 MoE,不依赖 CUDA、PyTorch、BLAS,甚至不需要 GPU。

1️⃣ 896 个专家,每个 Token 只激活 16 个
2️⃣ 模型放 NVMe,剩余权重按需流式加载
3️⃣ 8GB 内存下生成一个 Token 约 26~32 秒
4️⃣ 不同内存配置下,输出结果保持字节级一致
当然,它目前更像一个极限条件下的技术实验,不是拿来日常聊天的。

但它证明了一件挺有意思的事:超大 MoE 模型,不一定非得整套塞进内存。
🔗 https://github.com/FareedKhan-dev/kimi-k3-in-c

本帖子中包含更多资源

您需要 登录 才可以下载或查看,没有账号?立即注册

×
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

关注公众号

相关侵权、举报、投诉及建议等,请发 E-mail:2776601884@qq.com

Powered by Discuz! X5.0 © 2001-2026 Discuz! Team.|青ICP备2025004122号-1

在本版发帖
关注公众号
返回顶部