🔥低成本本地部署方案,12GB RTX3060 跑通 MiMo-V2.6-Distill-Qwen-9B,262K 超长上下文本地推理。
采用 Q5_K_M 量化,搭配 Q8 KV 缓存、Flash Attention。
性能:解码约 47 tok/s,预填充约 1600 tok/s。
模型基于 Qwen3.5-9B 蒸馏,吸收大模型教师的推理能力,SWE-Pro 得分由 32.0 提升至 44.6。
单卡就能承载长上下文编码 Agent,不用堆砌多卡或 70B 大模型。 http://t.cn/AXOFYFQY