一个名为Swiftlet的新开源Swift/Metal运行时按需从磁盘流式加载混合专家权重:注意力层、路由器和常用'专家'缓存驻留内存,其余部分从存储中取用。结果是Qwen3-Next-80B在M5 Mac上仅用约4.3GB内存以每秒4.5-5个token运行,350亿参数模型在iPhone 17上以每秒约1个token运行。代价依然存在:大模型需要42GB空闲磁盘,作者也提醒,这类稀疏模型'聊天像大模型,记事实却像小模型'。该项目一天内登顶Hacker News,GitHub星标超过280。
✓ 已核实 · 2个来源