Escha 2-bit Qwen3.8-27B 已上线!

Escha 2-bit Qwen3.8-27B 已上线!


完整模型占用磁盘空间 10.15GB,在单个 RTX 5090 上使用我们的自定义 SGLang 运行时,以 82.6 tok/s 的速度运行,并在我们目前运行的 8 个基准测试中平均达到 FP8 性能的约 100%。

我们希望尽快将它交到大家手中,基准测试的时间有限。对于我们运行的那些测试,一个令人惊讶的发现是 LiveCodeBench v6:

Escha W2: 86.81
FP8: 85.16

这是之前 2-bit Qwen3.6-35B MoE 在测试中唯一出现裂痕的基准(62.6 vs. 67.0 FP8)。随着我们持续改进,这是一个不错的胜利!

模型: http://t.cn/AX0V8gtc…
运行时: http://t.cn/AX0V8gtt…
Apache-2.0 模型和运行时。

我们还计划开源完整的运行时栈,27B 稠密模型和 35B MoE 模型的 GGUF 版本即将发布。

一如既往,请分享你们的结果。我们想看到那些炸裂的表现和失败的尝试——两者都能帮助我们打造下一个更好的版本。

http://t.cn/AX0V8gtV
分类