註冊並分享邀請連結,可獲得影片播放與邀請獎勵。

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
加入 May 2026
258 正在關注    228 粉絲
🤖 スマホを操作するGUIエージェントは、短いタスクは得意でも、長く多段なタスクになると急に弱くなります。理由はシンプルで、行動とスクショの履歴をただ積み上げるとコンテキストが爆発し、アプリをまたいだ大事な情報が薄まってしまうからです。 そこでこの研究が出した発想が、文脈の管理を「受け身に貯める」のではなく「自分で選ぶ行動」に格上げするというものです。エージェントはUI操作を選ぶのと同じように、履歴やUI状態を“折りたたむ”行動も選べます。維持するのは3つの構造化フィールド——折りたたんだ行動履歴、折りたたんだUI状態、直近のステップ記録——で、全体の流れと足元の詳細を両立させます。これが Context-as-Action フレームワーク、MemGUI-Agent です。 🎯 学習にはアノテーション済み2,956軌跡のMemGUI-3Kを使い、8BのMemGUI-8B-SFTをSFTで訓練。結果、MemGUI-Benchでオープンデータの8Bとして最高性能を達成し、学習分布外のMobileWorldにも汎化しました。何を残し何を畳むかをエージェント自身に決めさせる設計は、コンテキスト肥大に悩む実用エージェント全般に効きそうだと感じます。 MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management #GUIエージェント# #LLM#
顯示更多