登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
参加 May 2026
258 フォロー中    228 ファン
🤖 スマホを操作するGUIエージェントは、短いタスクは得意でも、長く多段なタスクになると急に弱くなります。理由はシンプルで、行動とスクショの履歴をただ積み上げるとコンテキストが爆発し、アプリをまたいだ大事な情報が薄まってしまうからです。 そこでこの研究が出した発想が、文脈の管理を「受け身に貯める」のではなく「自分で選ぶ行動」に格上げするというものです。エージェントはUI操作を選ぶのと同じように、履歴やUI状態を“折りたたむ”行動も選べます。維持するのは3つの構造化フィールド——折りたたんだ行動履歴、折りたたんだUI状態、直近のステップ記録——で、全体の流れと足元の詳細を両立させます。これが Context-as-Action フレームワーク、MemGUI-Agent です。 🎯 学習にはアノテーション済み2,956軌跡のMemGUI-3Kを使い、8BのMemGUI-8B-SFTをSFTで訓練。結果、MemGUI-Benchでオープンデータの8Bとして最高性能を達成し、学習分布外のMobileWorldにも汎化しました。何を残し何を畳むかをエージェント自身に決めさせる設計は、コンテキスト肥大に悩む実用エージェント全般に効きそうだと感じます。 MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management #GUIエージェント# #LLM#
もっと見る