登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 GUIエージェント
GUIエージェント コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
GUIエージェント を含む検索結果
🤖 スマホを操作するGUIエージェントは、短いタスクは得意でも、長く多段なタスクになると急に弱くなります。理由はシンプルで、行動とスクショの履歴をただ積み上げるとコンテキストが爆発し、アプリをまたいだ大事な情報が薄まってしまうからです。 そこでこの研究が出した発想が、文脈の管理を「受け身に貯める」のではなく「自分で選ぶ行動」に格上げするというものです。エージェントはUI操作を選ぶのと同じように、履歴やUI状態を“折りたたむ”行動も選べます。維持するのは3つの構造化フィールド——折りたたんだ行動履歴、折りたたんだUI状態、直近のステップ記録——で、全体の流れと足元の詳細を両立させます。これが Context-as-Action フレームワーク、MemGUI-Agent です。 🎯 学習にはアノテーション済み2,956軌跡のMemGUI-3Kを使い、8BのMemGUI-8B-SFTをSFTで訓練。結果、MemGUI-Benchでオープンデータの8Bとして最高性能を達成し、学習分布外のMobileWorldにも汎化しました。何を残し何を畳むかをエージェント自身に決めさせる設計は、コンテキスト肥大に悩む実用エージェント全般に効きそうだと感じます。 MemGUI-Agent: An End-to-End Long-Horizon Mobile GUI Agent with Proactive Context Management #GUIエージェント# #LLM#
もっと見る
AlibabaのQwenチームが実機重視のGUIエージェント「Qwen-UI-Agent」を発表した(https://arxiv[.]org/html/2607.28227v1)。GUIエージェントとは、画面を見て人間のようにタップや入力を行い、スマホやPCのアプリを操作するAIのこと。 多くのGUIエージェントはシミュレーター上のベンチマークには強くても、実際のスマホやPCで動かすと崩れやすい。Qwen-UI-Agentはこのギャップを埋めるため、実機100台以上・150以上のアプリを使った学習と評価に踏み込んでいるのが特徴。 結果は明確で、実機ベンチマークのMobileWorld-Realで92.2%(Claude Opus 4.8を7.5pt上回る)、AndroidDailyで97.5%を記録。ブラウザ操作のWebArenaも73.6%でOpus 4.8を1.7pt上回りトップ。一方でPC操作のOSWorld-Verifiedは79.5%とOpus 4.8(83.4%)に次ぐ2位で、全ての土俵で首位というわけではない。 行動の出し方にも工夫がある。GUI操作とCLI(コマンドライン、文字でコマンドを打ち込む操作方式)を状況に応じて使い分け、複数の操作をまとめて1ターンで出す「バッチ化」を導入。PC操作タスクではアクションの4割以上がバッチ化され、実行ステップ数を大きく減らしている。 面白いのは「先回り」の発想も持たせている点。フライトキャンセルの通知が届いたら、ユーザーが気づく前に代替便を探し、予定と照らし合わせて提案する、という使い方まで想定している。ベンチマークの数字より先に、実機で本当に使えるかを問うアプローチが徹底している。
もっと見る
TL;DR: 「GUI操作」と「コーディング」を同時に鍛え・測れる、5プラットフォーム対応のエージェント評価環境が登場しました。トップモデルでも見た目の再現度と動作の厳密な正しさには大きな差があることが明らかになりました。 タイトル: RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents URL: ポイント 🖥️ Ubuntu・macOS・Windows・Android・Webの5プラットフォームに対応 🔍 ソースを見せず動いているアプリを観察して一から再実装させる「再現」タスク 🧪 250タスクのRecreationBenchを構築、プログラム検証と視覚検証の両方で採点 📈 3.5万件の再現軌跡で学習したモデルは分布外ベンチマークで最大17.9ポイント改善 🏆 総合1位のGPT-6 Astraでもスコアは58.1% ⚠️ そのGPT-6 Astraでさえ全プログラムテスト通過はわずか2.8% 🔧 ElectronアプリをネイティブGTK/AppKitに置き換えるなど柔軟な実装も観測 見た目の再現力と本当の動作忠実性の間には、まだ大きなギャップがあることを突きつける研究です。 #AIエージェント# #ComputerUse#
もっと見る
TL;DR: 長期エージェントの3大問題(誤差蓄積・コンテキスト腐敗・状態消失)を、Manager-Execute-Audit(MEA)ループで構造的に解決。WeaveBenchで51.8%→80.7%を達成しました。 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks ポイント 🔧 Manager: 実行軌跡の外でタスク状態を明示管理。ゴール・受け入れ基準・制約を含む「サブタスクコントラクト」を生成する ⚡ Executor: 過去の軌跡を持ち込まない、バジェット有界の新鮮コンテキストで各サブタスクを実行する 🔍 Auditor: 実行後に読み取り専用で独立検査。完了・整合性・状態更新を3分類でレポートし、ラウンド間の永続メモリとして機能する 🖥️ GUI/CLIハイブリッド: Managerがタスクに応じてインターフェースを選択。AgentAdapterでClaude Code・Codex CLI等を差し替え可能 📊 WeaveBench: PassRate 51.8%→80.7%、Design+60pp・Spatial/3D+50ppの大幅改善 🤖 OSWorld 2.0: Qwen 3.7-Plusで2.8%→8.3%(3倍)、Claude Opus 4.7で20.6%→35.3% 💻 Terminal-Bench: 69.7%→77.2%、かつトークン消費24%減(オーバーヘッドなし) 💡 Manager cost: 総トークンのたった2〜8%。Auditorが19〜38%でほとんどの追加コストを担う 「エージェント能力はモデル単体でなく、モデル+ハーネス全体の性質」——この視点が長期エージェント設計の出発点になると思います。 #AIAgents# #LLM#
もっと見る
🦢 コード補完で終わらない、ローカル実行の汎用AIエージェント。Rust製でデスクトップ・CLI・APIから使え、GitHubスター48.9kのGooseがLinux Foundation傘下になりました。 タイトル: aaif-goose/goose URL: 📦 概要 Gooseは、任意のLLMでインストール・実行・編集・テストまで行う汎用AIエージェントです。Rustで書かれ、macOS/Linux/Windowsでローカルに動作し、デスクトップGUI・CLI・組み込みAPIの3つの入り口を持ちます。 ❓ 解決する課題 従来のコーディングアシスタントは「コードの提案」に閉じがちでした。Gooseはこれを越え、調査・執筆・自動化・データ分析・日常の生産性まで、エージェントが実際に環境を操作して幅広いタスクをこなします。 🛠 機能の説明 ・15以上のLLMプロバイダ(Anthropic、OpenAI、Google、Ollama、OpenRouter、Azure、Bedrockなど)に対応します ・API キーに加え、既存サブスクリプション(ACP経由)でも認証できます ・オープン標準のMCP(Model Context Protocol)で70以上の外部ツールと接続します ・コードベースの64.4%がRustで、UIはTypeScript中心です 🎯 ユースケース IDEやコード提案に縛られず、ターミナル・デスクトップ・API埋め込みのどこからでもエージェントを呼べます。自動化やデータ分析など、日常ワークフローへAIエージェントを組み込みたい場面に向きます。 📊 実績 ・GitHubスター48.9k、フォーク5.2kという強い採用 ・もともとblock組織のプロジェクトでしたが、Linux FoundationのAgentic AI Foundation(AAIF)へ移管されました ベンダー中立なオープンエージェント基盤としての位置づけが強まっています。 #AIエージェント# #OpenSource#
もっと見る
# Antigravityの機能と実践的な使い方 🚀 ブラウザもIDEも開かず、ターミナルだけでエージェントに開発を任せたい。そんな願いに応えるのが Antigravity CLI(agy)です。 📌 タイトルと機能のURL タイトル: Antigravity CLI URL: 📝 概要 Antigravity CLI は、Antigravity 2.0 と同じエージェントハーネスをコマンドラインから利用できる軽量サーフェスです。GUI を立ち上げずに新しいエージェントを即座に作成でき、SSH 越しのリモートサーバーやコンテナ内でも高速に動作します。コマンドは agy で呼び出します。 🔧 機能の説明 agy は IDE 版と同じ中核を共有しつつ、ターミナルに特化した拡張性を備えています。 ・AGENTS.md をリポジトリ直下に置くことで、プロジェクト共通の指示をエージェントへ読み込ませます(従来の .gemini/ 規約を置き換える新しい仕組みです) ・Agent Skills は ~/.gemini/antigravity-cli/skills/ のグローバルスコープと .agents/skills/ のワークスペーススコープから読み込まれます ・Hooks はツール実行の前後やループ停止条件などのライフサイクルに割り込み、整形や検査を自動化します ・MCP サーバーはローカルプロセス・リモートホストの双方を設定でき、外部データやツールへ接続します ・Subagents や Plugins も第一級の拡張要素として扱われます 🛠 実践的な使い方 ・インストールは macOS/Linux なら curl -fsSL | bash、Windows は PowerShell から実行します ・初回は agy を起動し、Google アカウントまたは GCP プロジェクトで認証します ・agy inspect を実行すると、読み込み中の AGENTS.md・スキル・プラグイン・フック・接続済み MCP サーバーが一覧表示され、想定通りの文脈が入っているか確認できます ・/goal で自律実行、/grill-me で着手前の質問、/schedule で定期実行、/browser でブラウザ機能を明示的に有効化できます 🎯 ユースケース ・SSH やリモート環境で IDE を立てられない場面で、ターミナルから直接エージェントを走らせる ・agy inspect で「なぜスキルが効かないのか」「どの MCP が読み込まれたか」を切り分けてデバッグする ・CI コンテナ内で軽量にエージェント処理を起動する ・AGENTS.md とチーム共通スキルを組み合わせ、リポジトリごとの作法を統一する ⚠️ 注意点 ・既定モデルは Gemini 3.5 Flash(High)で、プレビュー期間の無料枠は寛大ですが、本番ワークロードには課金有効な GCP プロジェクトが必要です ・スキルやフックが効かないときは、まず agy inspect で実際の読み込み状態を確認してから設定を疑うのが定石です ・グローバルスコープとワークスペーススコープでスキルの探索先が異なる点に注意してください #Antigravity# #DevTools#
もっと見る
GUI Codex 最好用,TUI Claude Code 最好用,Design Mode Cursor 最好用。
Waku 可能是 Linux 上最好的 coding agent GUI 了
【二胡Erhu x 竹笛Bamboo flute|山鬼Shan Gui】端午儺面啟,山鬼踏歌來。| 完整视频:
なんか既存ツール渡して操作って、それGUI操作して作ってもらってるということなので本来はクソ非効率なはずなんですけどね。 なのでイラストをアプリ経由で書くというよりそれに特化したアプリにした方が良いのか。 ドット絵とかも。 まあ検証してみるか。
もっと見る