Strata 引擎开源:12GB 显存跑 125B 模型,5070 输出 94 词元每秒

开发者 Niko1221 开源的 Strata 引擎,让 12GB 显存消费级显卡跑起 125B 的 Qwen3.8-Flash-Next:MoE 放内存、高频专家进显存加投机解码,5070 实测 94 词元每秒。

开源社区出现了一个新的推理方案:Strata 引擎把 1250 亿参数级别的模型放进了 12GB 显存的消费级显卡里运行。该方案由开发者 Niko1221 开源,所加载的模型是阿里 Qwen 团队的 Qwen3.8-Flash-Next——一个 125B 参数的多模态 MoE 压缩版本,原生支持 262K token 上下文。

104031.jpg

其技术路线由三部分组成:MoE 模型主体驻留在内存中,被频繁调用的专家层放进显存,再借助一个轻量模型完成投机解码。

实测数据方面,RTX 5070 运行 2 比特量化版本时,输出速度为每秒 94 词元;RX 9070 XT 同样可以达到每秒 60 词元。

这套方案把硬件门槛拉到了消费级:此前需要上万元级别的显卡才能运行的工作负载,如今单张 5070 即可承担。

分享 微博

弹幕

还没有弹幕,来说一句。

到此一游

共 0 条

还没有人留下足迹,来签个到。

    评论 共 0 条

      昵称 —