TwiScan
人気
コミュニティ
アカウントコレクション
ログイン
登録
English
日本語
한국의
简体中文
繁体中文
登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。
今すぐ登録
Itaru Tomita / 冨田到
@itarutomy
リサーチや研究開発向けの生成AIエージェント
@snorbe_ai
を作っています。
@deskrex
| 著書 かんき出版『知的生産でAIを使いこなす全技法』
参加 January 2018
392
フォロー中
2.6K
ファン
Itaru Tomita / 冨田到
@itarutomy
2026.07.29 05:41
MindLabとFudan大学が「LongStraw」という手法を発表した(https://arxiv[.]org/pdf/2607.14952)。GPUの台数を増やさずに、210万トークンを超える長い文脈で強化学習の事後学習(RL post-training、学習済みモデルをさらに強化学習で仕上げる工程)を回せるようにする実行方式。 背景にはギャップがある。推論(学習済みモデルを動かして応答を作る段階)のcontext長は100万トークン級に近づいているのに、事後学習は256Kトークン以下にとどまりがち。AIエージェントは観察結果やツールの出力、それまでの判断を溜め込みながら動くため、この差が特に効いてくる。 原因はGRPO(複数の応答をグループ内で相対比較して学習する強化学習の手法)特有の事情。同じ長いプロンプトに対して複数の応答をスコアリングし逆伝播する必要があるため、プロンプト分と応答分の計算グラフを同時にGPUメモリへ抱え込んでしまう。LongStrawは共有プロンプトを最初に1回だけ勾配計算なしで評価し、あとで必要になる状態だけを残す。そのうえで短い応答を1本ずつ勾配ありで組み立てては逆伝播後すぐ解放し、次の応答に進む。プロンプトと全応答を同時に抱えなくてよくなる代わりに、再生の分だけ処理時間は増える。 これを構造の異なる2つのモデルに実装している。再帰的に状態を更新する層(GDN)と通常のattention層を組み合わせたQwen3.6-27Bでは、8台のH20 GPUだけで約210万トークンの文脈をグループサイズ2および8で処理でき、グループサイズを2から8へ4倍にしてもピークメモリはわずか0.21GB(0.213%)しか増えない。別のストレステストでは約446万トークン(4,456,448)まで到達した。KV情報を圧縮して保持するMLAと、限られた候補だけに注意を絞る疎attention(DSA)を組み合わせ、専門家混合(MoE)も使うGLM-5.2でも、32台のH20 GPUで約210万トークンの文脈を全78層にわたって処理できることを確認している。 面白いのは「動いた」ことと「正しく学習できる」ことをはっきり切り分けて報告している点。プロンプト側の勾配はあえて切り離している。Qwenは複数GPU間で、注意機構の鍵と値にあたるK/Vに由来する勾配の同期が、追加学習パラメータ(LoRA)については完了していない。GLMも疎attentionの候補選択が各GPU内で閉じたままになっている。論文自身が、これは実行できたことの証拠であって正しい分散学習の証明ではないとはっきり書いていて、GPUを増やすスケールアウトの路線とは逆に、決まった台数でどこまで粘れるかを検証しつつ限界も隠さず書いている姿勢に好感が持てる。
もっと見る
0
0
0
3
0
コミュニティへ転送
人気のあるユーザー
オリコンニュース
@oricon
1.9M ファン
一劍浣春秋
@chee828
0 ファン
New York Post
@nypost
4.1M ファン
モデルプレス
@modelpress
1.8M ファン
Hello! Project Link
@UpFrontLink
15.5K ファン
First Squawk
@FirstSquawk
556.1K ファン
Reuters
@Reuters
26.3M ファン
銀璃 Silverluri🪶
@Silverluri
139.1K ファン
Natsume✨枣糕
@natsume0v0
1.3M ファン
TVer新着
@TVer_info
99.5K ファン
Pop Base
@PopBase
6.4M ファン
ファミ通.com
@famitsu
1.4M ファン
야살 / Yasal
@Yasal_170
917.4K ファン
Bstar
@bstar_pro
53.8K ファン
ましょこ⚔️🌺@C108 2日目8/16(日) 南2 J 11b
@MasyoCos
163.2K ファン