aiminute. ← AIニュース一覧
ツール AI Minute Newsroom 2026-08-23

3億パラメータのモデルが、大きいほうの次の一言を当てる——MacBookの応答が2.87倍速くなった

3億パラメータのモデルが、大きいほうの次の一言を当てる——MacBookの応答が2.87倍速くなった

Liquid AIは8月20日にDSparkを公開した。約3億パラメータの小さなドラフトモデルを、LFM2.5ファミリー(1.2B Instruct、2.6B、8B-A1B)と一対一で組み合わせる方式である。ドラフトが9トークン分のブロックを先に提案し、本物のモデルがそのブロック全体を一度の順伝播で検証し、同意しない部分は捨てる。貪欲デコーディングのもとでは出力されるテキストは大モデル単独の場合と完全に同一であり、ベンチマーク精度はまったく動かない。動くのは時間だ。H100で最大3.18倍、M4 Max搭載MacBook Proで最大2.87倍。2.6BモデルはそのノートPCで毎秒およそ140トークンを超え、複数ツールを使うテストでは平均で57パーセントの遅延低減となる。落とし穴は受理率にある。MATH500では8B-A1Bのドラフトが提案した10トークンのうち8.27が受理され、これが3.18倍に相当する。GSM8Kでは4.02にとどまり1.29倍——同じハードウェア、同じモデルで、利得はおよそ3分の1になる。

なぜ重要か投機的デコーディングは、品質をめぐる議論がついてこない珍しい最適化だ。出力が同じテキストであることを証明できるので、残る問いは小さいモデルがどれだけ当てるかだけである。だからこそ、売り込まれる高速化の数字を信じる前に理解しておく価値がある。「3倍速い」と言う業者は自社にとって最良の作業負荷を語っている。実際に得られるものを決めるのはあなたの作業負荷であり、ここでの3.18倍と1.29倍の隔たりこそが教訓のすべてだ。とりわけAPI経由ではなく自分の機械でモデルを動かす人に関係する。この種の改善こそが、ローカルモデルを「遅すぎて使う気にならない」から「開いたままにできるほど速い」へ移すからである。

✓ 検証済み · 2ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

グーグルは打ち込んだ一文から遊べるゲームを組み立てる。
2026-10-08
ChatGPTは答えだけでなく画面の形もモデルに決めさせる。
2026-10-08
MetaとSierraが買い物エージェントの共通ログイン規則を出した。
2026-10-07
AIが小さな言語モデルを動かす公開チップを設計した。
2026-10-07
OpenAIの新しいAPIが150ミリ秒で選択肢を一つ選ぶ。
2026-10-07