1.5TB → 214GB。缩小七倍,几乎没有影响。


1.5TB → 214GB。缩小七倍,几乎没有影响。

这就是 Hy4 预览版。诀窍在于 Sherry —— 我们的量化方法,将权重压缩到每个仅 1.25 位。(图片展示了其原理。)

它还开启了一种全新的运行方式:将您现有的 GPU
跨机器拼接,它们就能作为一个整体工作。

GGUF (量化版): http://t.cn/AX0GMA5v
原始模型:
引用:We compressed Hy4-preview from 1.5TB to ~200GiB GGUF and it still works well !

Meet MIX-STQ1_0.The trick isn’t just going low, it’s deciding where: calibration data picks each layer’s bit-width, some down to 1.31-bit STQ1_0, some up to 2.06-bit IQ2_XXS. Same budget, lower x.com/TencentHunyuan…

http://t.cn/AX0GMA5z
分类