Generalist AI 于 8 月 19 日发布了 GEN-1.5。演示在这里不是训练数据,而是提示词本身。一段三到十二秒的操作视频——由手持夹爪的人录制,或由机器人自己录制——被载入模型三十秒的上下文窗口,随后机器人便在没有任何梯度更新、没有任何微调的情况下尝试这项任务。在开罐子、拉开笔袋拉链、从钱包里取钱等十项不同任务中,这种单次示范方式的平均成功率为 59%,波动约十个百分点。用五分钟数据做十步梯度更新后,成功率升至 83%。该模型同时接收视频与传感器、语言、肢体位置数据,并以每秒一百次的频率输出动作指令。公司称,它展示的这些能力——从仿真迁移到现实、使用陌生工具、绕开障碍、双臂协同——从未被专门训练过,而是从八个月不间断的物理交互预训练中自行涌现的。公司未宣布开放权重,也未宣布产品。