Cactus于8月10日发布Needle 2:一个4500万参数的语言模型,专为智能体任务而建——工具调用、操作设备、从文本中抽取结构化数据——以14 MB的二进制文件交付,整个会话仅需约28 MB内存。诀窍在于量化从训练一开始就贯穿其中,而不是事后加上。Cactus将权重、激活值和KV缓存全程以2比特训练,于是部署的模型与训练的模型完全一致,绕开了这个体量下事后2比特压缩造成的质量崩塌。它在树莓派5上解码速度超过每秒500个token,预填充超过800;在VR头显上为400至1500,在200美元以下的安卓手机上为300至700;可运行于ESP32-S3单片机、Meta Quest 3S和Apple Vision Pro。在五项公开的工具调用基准上,它与体量大5到70倍、以全精度运行的模型互有胜负:Mobile Actions上得分63.7%,Liquid AI的LFM2.5 230M为69.1%,FunctionGemma 270M为64.0%。权重以Apache 2.0许可发布在Hugging Face和GitHub上。