Skild AI 发布了 S1,一个用视频而非语言来下达任务的机器人基础模型:你给它看一个人做某件事的视频,它就在训练中从未见过的场景和任务上生成动作。公司称在 10 万小时预训练规模下,面对未见过的任务成功率为 66%,而同一模型用文字下达指令时只有 9%;一次演示的价值大致相当于 380 段后训练数据。这是首个被展示能撑住十分钟、包含数十个操作步骤的长任务的此类模型——煮咖啡、给植物换盆、煎薄饼——Skild 说它不是照搬视频,而是在出错时临场调整。当条件变化到需要完全不同的策略时,表现仍会明显下滑。