aiminute. ← 全部AI新闻
新模型 AI Minute Newsroom 2026-08-12

4500万参数、14兆字节,还能调用工具——一个跑在单片机上的模型

4500万参数、14兆字节,还能调用工具——一个跑在单片机上的模型

Cactus于8月10日发布Needle 2:一个4500万参数的语言模型,专为智能体任务而建——工具调用、操作设备、从文本中抽取结构化数据——以14 MB的二进制文件交付,整个会话仅需约28 MB内存。诀窍在于量化从训练一开始就贯穿其中,而不是事后加上。Cactus将权重、激活值和KV缓存全程以2比特训练,于是部署的模型与训练的模型完全一致,绕开了这个体量下事后2比特压缩造成的质量崩塌。它在树莓派5上解码速度超过每秒500个token,预填充超过800;在VR头显上为400至1500,在200美元以下的安卓手机上为300至700;可运行于ESP32-S3单片机、Meta Quest 3S和Apple Vision Pro。在五项公开的工具调用基准上,它与体量大5到70倍、以全精度运行的模型互有胜负:Mobile Actions上得分63.7%,Liquid AI的LFM2.5 230M为69.1%,FunctionGemma 270M为64.0%。权重以Apache 2.0许可发布在Hugging Face和GitHub上。

为什么重要?今天门铃、汽车或耳机里的几乎每一个语音助手,都是别人数据中心的一个瘦客户端——这就是它们断网即失灵、每次交互都让厂商付费、你说的话都要经过服务器的原因。这种体量的模型改变了这道算术题,因为14 MB塞得进几美元硬件的闪存里。Needle 2并不聪明,也不会聊天;它被造出来是为了听懂一条指令并按对按钮,而这恰恰是这些设备真正需要的大部分能力。Apache 2.0意味着任何人都可以把它装进产品里。有意思的结果不是更聪明的小玩意,而是断网之后仍然能用、并且保持沉默的小玩意。
#AI智能体

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

Mistral本月将免费放出万亿参数模型。
2026-10-06
同一个任务跑二十遍,最好的智能体分数掉了三分之一。
2026-10-06
TikTok把购物机器人放进了你正在看的视频里。
2026-10-06
Reflection要免费放出一个5010亿参数的模型。
2026-10-06
维基媒体怀疑OpenAI的智能体造成了五月的那次宕机。
2026-10-06