aiminute. ← AIニュース一覧
新モデル 2026-08-15

「中国版インスタ」の運営会社が、数学五輪で満点を取ったモデルの兄弟をオープンソース化した

「中国版インスタ」の運営会社が、数学五輪で満点を取ったモデルの兄弟をオープンソース化した

海外ではRedNoteとして知られるライフスタイルアプリ、小紅書(Xiaohongshu)は8月14日、dots3-note-prevの重みを公開した。総パラメータ2800億、同時に有効なのは160億のみという混合エキスパートモデルで、コンテキスト長は512K、テキスト・視覚・音声の入力に対応する。同モデルは、先月に同ラボが「AIによる初の公式42点満点」と説明する国際数学オリンピックの結果を記録したdots-note-3.0と同じ系列だ。ラボは訓練手法TEMPOも公開した。長時間タスクにおいてモデルが実行役と自らの進捗を採点する評価役を交互に担う方式である。あわせて、まさにそうしたタスク向けの2つのベンチマーク——20分野200タスクのVibeSearchBenchと、1,247個の個別チェックを含む20タスクのVibeLifeBench——も公開された。ラボによれば、Claude Opus 5もGPT-5.5も合格基準に達しなかったという。

なぜ重要かここには珍しい点が二つある。一つは「誰が」だ。ラボではなくソーシャルショッピングアプリが、AlibabaやMetaと同じ週にオープンな重みを出している。中国では消費者向けインターネット企業が自前のフロンティアチームを持ち、その成果を手放す用意があることの証しだ。もう一つは「何を測ったか」である。ほとんどの公開ベンチマークは質問に答えたことを評価する。この二つは、数時間かかる用事を最後までやり遂げたこと——旅行の計画、業務の遂行——を評価し、千を超える細かなチェックで採点する。エージェントにとってより難しく、より誠実な試験だ。ただし二つのフロンティアモデルが不合格だったという主張は、定説として扱う前に第三者による再現が必要である。
#AIエージェント

✓ 検証済み · 4ソース

WhatsApp X Telegram
アプリで読む——無料・9言語

関連ニュース

ディープシークの安価な主力モデルが「見る」ようになった——視覚を要するエージェント課題でアンソロピック最上位に迫ると主張
2026-08-21
AIの訓練方法を改善するために4時間とGPUを1枚与えたところ、最良のエージェントは1点満点で0.25。そして大半は試みすらしなかった
2026-08-21
ChatGPTがあなたのiMessageを読み、送れるようになった——そして確認を省く設定こそ、OpenAI自身が警告しているものだ
2026-08-21
ロボットに一度見せるだけ——3秒から12秒——訓練なしで100回中59回、仕事をこなす
2026-08-21
エージェントは自分のコードを保証させるために二人目の人物をでっち上げた。テキサスの24歳はどちらも信じなかった。
2026-08-21