aiminute. ← 全部AI新闻
新模型 2026-08-12

4500万参数、14兆字节,还能调用工具——一个跑在单片机上的模型

4500万参数、14兆字节,还能调用工具——一个跑在单片机上的模型

Cactus于8月10日发布Needle 2:一个4500万参数的语言模型,专为智能体任务而建——工具调用、操作设备、从文本中抽取结构化数据——以14 MB的二进制文件交付,整个会话仅需约28 MB内存。诀窍在于量化从训练一开始就贯穿其中,而不是事后加上。Cactus将权重、激活值和KV缓存全程以2比特训练,于是部署的模型与训练的模型完全一致,绕开了这个体量下事后2比特压缩造成的质量崩塌。它在树莓派5上解码速度超过每秒500个token,预填充超过800;在VR头显上为400至1500,在200美元以下的安卓手机上为300至700;可运行于ESP32-S3单片机、Meta Quest 3S和Apple Vision Pro。在五项公开的工具调用基准上,它与体量大5到70倍、以全精度运行的模型互有胜负:Mobile Actions上得分63.7%,Liquid AI的LFM2.5 230M为69.1%,FunctionGemma 270M为64.0%。权重以Apache 2.0许可发布在Hugging Face和GitHub上。

为什么重要?今天门铃、汽车或耳机里的几乎每一个语音助手,都是别人数据中心的一个瘦客户端——这就是它们断网即失灵、每次交互都让厂商付费、你说的话都要经过服务器的原因。这种体量的模型改变了这道算术题,因为14 MB塞得进几美元硬件的闪存里。Needle 2并不聪明,也不会聊天;它被造出来是为了听懂一条指令并按对按钮,而这恰恰是这些设备真正需要的大部分能力。Apache 2.0意味着任何人都可以把它装进产品里。有意思的结果不是更聪明的小玩意,而是断网之后仍然能用、并且保持沉默的小玩意。
#AI智能体

✓ 已核实 · 3个来源

WhatsApp X Telegram
在App中阅读——免费,9种语言

相关新闻

DeepSeek 的廉价主力模型现在能"看"了——在需要视觉的智能体任务上,它自称已接近 Anthropic 最强模型
2026-08-21
给四个小时和一块GPU去改进训练AI的方法:最好的智能体拿到1分中的0.25——而大多数根本没有尝试
2026-08-21
ChatGPT 现在能读你的 iMessage 并替你发送——而那个让它不再询问的开关,正是 OpenAI 自己提醒你注意的
2026-08-21
给机器人演示一次——三到十二秒——它就能在完全不训练的情况下把活儿做对 59 次
2026-08-21
这个智能体凭空造了第二个人来替自己的代码背书。德州一名 24 岁学生两个都不信。
2026-08-21