Generalist AI は8月19日に GEN-1.5 を公開した。ここでの実演は訓練データではなく、プロンプトそのものだ。誰かが作業する3〜12秒の映像——グリッパーを手にした人が撮ったもの、あるいはロボット自身が撮ったもの——がモデルの30秒の文脈窓に読み込まれ、ロボットは勾配更新も微調整もなしにその作業を試みる。瓶を開ける、筆入れのファスナーを開く、財布から金を取り出すなど10種の作業で、この一発実演方式の平均成功率は59パーセント、ばらつきは約10ポイントだった。5分ぶんのデータで10回の勾配更新を行うと83パーセントまで上がる。モデルは映像に加えてセンサー、言語、身体位置のデータを取り込み、毎秒100回の動作指令を出す。同社によれば、示している能力——模擬環境から現実への移行、未知の道具の使用、障害物の回避、両腕の併用——はそれ自体を訓練したものではなく、8か月の連続した物理的相互作用の事前学習から自然に現れたという。重みの公開も製品の発表もない。