登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ComputerUse
ComputerUse コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ComputerUse を含む検索結果
CodexがTradingViewのチャート画像とCSVデータのダウンロードに失敗してチャート分析全くできてなかった……。 ComputerUseの処理を高速化するために必要な動作まで削ってた
もっと見る
みんな「Astraで作りました!」とか言ってるけどLowなのかMediumなのかHighなのかxhighなのかmaxなのか、CodexなのかWorkなのかChatなのか、CLIなのかMCPなのかPythonなのかComputerUseなのかサーパリ分からん。他人の検証結果見るだけなら自分でトークン溶かさずに済むから見れば見るほどオトクと思ってたけどそろそろ自分で手を動かして(Astraにやらせるだけだろ!)検証しないとダメか
もっと見る
TL;DR: 「GUI操作」と「コーディング」を同時に鍛え・測れる、5プラットフォーム対応のエージェント評価環境が登場しました。トップモデルでも見た目の再現度と動作の厳密な正しさには大きな差があることが明らかになりました。 タイトル: RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents URL: ポイント 🖥️ Ubuntu・macOS・Windows・Android・Webの5プラットフォームに対応 🔍 ソースを見せず動いているアプリを観察して一から再実装させる「再現」タスク 🧪 250タスクのRecreationBenchを構築、プログラム検証と視覚検証の両方で採点 📈 3.5万件の再現軌跡で学習したモデルは分布外ベンチマークで最大17.9ポイント改善 🏆 総合1位のGPT-6 Astraでもスコアは58.1% ⚠️ そのGPT-6 Astraでさえ全プログラムテスト通過はわずか2.8% 🔧 ElectronアプリをネイティブGTK/AppKitに置き換えるなど柔軟な実装も観測 見た目の再現力と本当の動作忠実性の間には、まだ大きなギャップがあることを突きつける研究です。 #AIエージェント# #ComputerUse#
もっと見る
据说 Blender MCP 比用 Computer Use 操作 Blender 效果更好
Microsoftの研究チームが、画面を操作するAIエージェント(computer-use agent)を訓練するための合成環境「Echoverse」を発表した(https://arxiv[.]org/html/2607.28074v1)。 AIエージェントは、自分の操作が実際に何かを変化させる場でしか学習できない。でも本当に鍛えたい相手はメールや銀行、カルテのようにログインが必要で状態が刻々と変わる(stateful)アプリで、本物のサービスを壊すわけにはいかない。そこでデータベースごと丸ごと動く合成環境を代わりに使う。 これまでの手法はこうした合成環境を大量に作ることに力を入れてきたが、この論文は数より深さだと主張する。レシピサイトAllrecipesを模した環境で試したところ、浅い環境で訓練すると実際にベースモデルより性能が落ちてしまった。逆に、権限やエラー処理が本物通りに動き、最初の選択が後の展開を左右するような深い環境で訓練すると、同じドメインで性能が上がった。 合否判定にも工夫があり、スクリーンショットをAIに見せて「できていそうか」を判定させるのではなく、実際のデータベースの差分を正解データと突き合わせる「grounded grading」を採用している。エージェントが完了したふりをしても見抜ける仕組みだ。 結果、先ほど例に挙げたメールや銀行を再現したEchoMailやEchoBankなど10個の業務ドメインに、日付ピッカーなど特定の操作だけを鍛える2個の環境を加えた計12環境、2万1009本の実行履歴を使って90億パラメータのモデル(Qwen3.5-9Bベース)を訓練したところ、14項目の評価平均でベースモデルの36.5%から67.1%まで伸び、この訓練データを作った教師モデルGPT-5.4の80.7%まで14ポイント差に迫った。 面白いのは、EchoStay(民泊予約の模擬環境)で宿泊人数を指定する操作が正しく機能しないというバグを1つ直しただけで、それまで完了できなかった予約タスク24件のうち15件が新たに通るようになったこと。環境のバグ修正が、そのまま多数のタスク改善につながる。 さらにこの合成環境はそのまま強化学習の訓練場にもなる。正確にリセットでき、並列実行でき、報酬がデータベースの状態に基づくため信頼できるからだ。環境の数を増やすより、モデルが実際につまずく場所を見つけて環境ごと直し続けるループが効くという結論。
もっと見る
Gemini 3.5 Flashに画面を認識してクリックや文字入力する能力「computer use」が追加される、PCを操作するエージェントの構築が可能に - GIGAZINE
もっと見る
年末のエジプト旅行用に向けてGPT-6 Astraに評判いい店のリストを作ってもらった。Computer Use速いけど遅いな笑。(動画は8倍速) 最初、GoogleMapクチコミを地道に見ようとしてたので初手は検索した方が早いやろと止めた。でもツール準備しなくてもいいのはやっぱ便利。ものは使いようですね😇
もっと見る
OpenAIはSoraやImage 2.0の時といいマーケティングが本当に上手い。視覚的に魅了できる生成物を皆が楽しんでSNSにアップさせてバイラルを狙う。今回のGPT-6 Astraは3Dモデリングとパソコン操作のComputer Useが肝。 ぶっちゃFableでも近いしことができたが、先行ユーザーの3Dデモに皆んなが釣られて真似をした。インフルエンサーマーケも上手い。Anthropicは研究者・技術者集団のイメージでOpenAIはマーケ・政治が上手い印象。(今回ら技術でも圧倒) ただ、このシーソーゲームは半年おきくらいに定期的に起こるので、特に気にせず自分の実務で如何に使えるかを模索すべきかと。 昔はAnthropic、Open AI、Googleの三つ巴だったが、今はフロンティアモデルは2社の争いですかね、、 GoogleにはOmniなどのワールドモデルで巻き返しを期待したい。 音楽、動画などのマルチモーダルはGoogleならではの強みでもある。
もっと見る
便利だけど知られていないGemini APIの機能 🖥️ 「この画面を見て、ここをクリックして」ができるAI。ブラウザ操作の自動化が変わります。 Geminiの「コンピュータ使用(Computer Use)」は、画面を見てマウスやキーボードを操作するエージェント機能です。UIテストやWeb操作タスクの自動化に新しい可能性を開きます。 📌 タイトル:コンピュータ使用(Computer Use) 🔗 URL: 🧩 概要 従来のUI自動化はDOM構造やセレクタに依存しており、UIが変わると壊れやすいのが難点でした。Computer Useは画面のスクリーンショットを「見て」理解し、クリックやタイプなどの操作を指示できるエージェント機能です。人間がブラウザを操作するのと同じように、視覚ベースでUIを操作できます。 🛠 使い方 スクリーンショットをGeminiに渡し、実行したいタスクを自然言語で指示します。Geminiが画面上のどこをクリック/入力すべきかを判断し、操作アクションを返します。それをブラウザ自動化ツール(Playwright等)と連携して実行する流れです。 🏗 本番システムへの組み込み方 ・E2Eテスト自動化:「ログインして商品をカートに入れて決済まで進めて」のような複雑なフローを自然言語で記述。UIの変更に強いテストに。 ・RPA的業務自動化:社内システムのフォーム入力やデータ転記を、画面を見ながら自動実行。APIがないレガシーシステムにも対応。 ・Web操作エージェント:「この比較サイトで最安値を調べて」のようなタスクを画面操作で完遂。 ・アクセシビリティ検証:画面を視覚的に解釈して、操作性の問題を検出するテストツールに。 💡 ユースケース 🧪 視覚ベースのE2Eテスト自動化 🤖 APIのないシステムのRPA的自動化 🌐 Webブラウジング・情報収集エージェント ♿ アクセシビリティの自動検証 ⚠️ 注意点 画面の解釈に基づくため、操作の正確性は100%ではありません。重要な操作(決済、削除等)には人間の確認ステップを挟むべきです。また、レイテンシが大きめなので、高速な連続操作には不向き。セキュリティ面でも、操作対象のシステムへのアクセス権限管理に注意が必要です。 ✨ 「APIがないからLLMで自動化できない」は過去の話。画面を見て操作するエージェントの世界を、まずは簡単なタスクから試してみてください。 #Gemini# #LLM#
もっと見る
GPT-5.5 proからImages 2.0が使えなくなっている。GPT-5.5 Thinkingに切り替えると使える。Codex / Computer Useのskillsには反映させたけど自分でチャットする時はかなり面倒。
もっと見る