登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Verifiedx
Verifiedx コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Verifiedx を含む検索結果
AlibabaのQwenチームが実機重視のGUIエージェント「Qwen-UI-Agent」を発表した(https://arxiv[.]org/html/2607.28227v1)。GUIエージェントとは、画面を見て人間のようにタップや入力を行い、スマホやPCのアプリを操作するAIのこと。 多くのGUIエージェントはシミュレーター上のベンチマークには強くても、実際のスマホやPCで動かすと崩れやすい。Qwen-UI-Agentはこのギャップを埋めるため、実機100台以上・150以上のアプリを使った学習と評価に踏み込んでいるのが特徴。 結果は明確で、実機ベンチマークのMobileWorld-Realで92.2%(Claude Opus 4.8を7.5pt上回る)、AndroidDailyで97.5%を記録。ブラウザ操作のWebArenaも73.6%でOpus 4.8を1.7pt上回りトップ。一方でPC操作のOSWorld-Verifiedは79.5%とOpus 4.8(83.4%)に次ぐ2位で、全ての土俵で首位というわけではない。 行動の出し方にも工夫がある。GUI操作とCLI(コマンドライン、文字でコマンドを打ち込む操作方式)を状況に応じて使い分け、複数の操作をまとめて1ターンで出す「バッチ化」を導入。PC操作タスクではアクションの4割以上がバッチ化され、実行ステップ数を大きく減らしている。 面白いのは「先回り」の発想も持たせている点。フライトキャンセルの通知が届いたら、ユーザーが気づく前に代替便を探し、予定と照らし合わせて提案する、という使い方まで想定している。ベンチマークの数字より先に、実機で本当に使えるかを問うアプローチが徹底している。
もっと見る
🔞 illustrator 【重要】旧アカウント @jingb_dx は2025年8月に不正利用されました。現在の情報は全て虚偽です。本アカウントのみを信頼ください。 My old account @jingb_dx was hijacked in Aug 2025. Trust ONLY this verified account.
もっと見る
🖥 たった9Bのオープンモデルが、ターミナル操作ベンチでClaude Haiku 4.5に迫る。しかもデータもモデルもコードも全公開です。 タイトル:Tmax: A simple recipe for terminal agents URL: ターミナルエージェントのRL学習に、シンプルで再現可能なレシピを与えたAi2/UWの研究です。注目ポイントを3つに絞って紹介します。 🧩 構成的なデータ生成パイプライン ドメイン・スキル・検証器・ペルソナ・難易度など9つの軸の組み合わせでタスクを大量合成し、Gemini-3-ProがDockerfileとユニットテストまで生成します。高コストな品質検証は省き、RL側でpass率0を弾くだけ。結果として従来比2.5倍超・14,600環境のTmax-15Kを安価に構築し、汚染ゼロかつ最も難しいデータになりました。 ⚙️ シンプルなoutcome-only RLレシピ 報酬は「タスク達成したか」だけ。素朴なGRPOは長期エージェントで崩壊するため、logprobの乖離をマスクするDPPO、FP32のLMヘッド、大きなグループサイズ(32)で安定化します。Qwen 3.5 9BをこのレシピでTerminal-Bench 2.0で27%まで引き上げました。 📈 強さと汎化、そして全公開 2B〜27Bの全サイズでQwenベースラインを改善。さらにSWE-Bench Verifiedが44→53.5、AIMEが73→91と非ターミナル評価でも向上し、ハーネスやモデルファミリを越えて汎化します。データ・モデル・コードはGitHubで完全公開。 オープンなターミナルエージェント研究の強力な土台になりそうです。 #ターミナルエージェント# #強化学習#
もっと見る
推薦システムの検索モデルを一切いじらずに、後付けの軽量な「検証器」を1つ足すだけでRecallが大きく伸びる。Metaのチームがそんな手法を発表しました。 タイトル: Recommendation Retrievers Need Verifiers: Universal Generative Reranking for Sequential Recommendations URL: 既存の検索モデル(ドラフター)を凍結したまま、候補アイテムの識別子トークンを生成的に評価する軽量ベリファイアを追加する「ドラフター・ベリファイア」構成を提案しています。 🌐 注目ポイント1: カタログが大きいほど効く 音楽推薦データセットYaMBDaでは、カタログ規模が大きくなるほど改善幅が拡大しました。最大規模(46億相互作用)ではRecall@10が最大29.8%も向上しています。 🧩 注目ポイント2: どんなドラフターにも刺さる汎用性 自己注意ベースのSASRec、リカレント型のGRU4Rec、畳み込み型のNextItNet、さらにLLMベースのMiniOneRecまで、性質の異なる4種類すべてで同じ訓練レシピが機能しました。 🔬 注目ポイント3: 効いているのは「生成的な検証」そのもの ドラフターに直接コンテンツ情報を注入すると単体性能はむしろ下がりますが、そこにベリファイアを足すと回復します。改善は単純な特徴注入ではなく、出力側の生成的な検証プロセスそのものから生まれていることが実証されました。 検索インデックスを変えずに後付けできる点が、大規模実運用への導入しやすさとして大きいと感じました。 #推薦システム# #機械学習#
もっと見る
AIが自律的に論文を書く時代、「幻引用・メソッドとコードの不整合・再現不可能なスコア」という信頼性の危機が深刻化しています。 タイトル: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence Google CloudのScience One Frameworkは「検証可能性を後付けではなく設計の第一制約とする」というChain-of-Evidence原則で、AI自律研究の信頼性問題を根本から解決します。 🔍 注目ポイント1 — Chain-of-Evidence(CoE)の2原則 「すべての主張が記録された証拠チェーンを持つ(完全性)」「各チェーンがその主張を真に支持する(正確性)」という2原則を定義します。ベースラインシステムで最大21%あったPhantom Referenceを0%に削減し、論文に記述されたメソッドとコードの整合性も全評価システム中で最高水準を達成しています。後付けで検証するのではなく、主張を生成する段階で証拠チェーンを同時に構築する点が従来手法との根本的な違いです。 🏗 注目ポイント2 — 3モジュールアーキテクチャ Problem Investigator(Semantic Scholar APIで最大100本のPDFから引用グラフを構築し、モデル記憶ではなく取得データに根拠付け)、Discovery Engine(並列ブランチで複数解を探索し全評価器出力を不変記録として保持)、Paper Writer & Claim Verifier(専用エージェントが主張を特定のワークスペース成果物に結びつけ、不整合を削除ではなく保守的に修正)という3つのモジュールが科学的誠実性を構造的に担保します。 🏆 注目ポイント3 — MLE-BenchとParameter-Golfでの実績 医療画像・細粒度認識・3D知覚を含むKaggleコンペ5種で金メダル2個・銀メダル2個を獲得。全ベースラインシステムが失敗した3Dオブジェクト検出タスクで優勝しました。厳格なハードウェア・ファイルサイズ制約下でのParameter-Golf LLMコンペでも2026年4月27日時点のSoTAを達成し、ベースラインはいずれも有効な提出物を生成できませんでした。 厳密性と競争力は両立できます。AI Scientist v2・AutoResearchClaw・DeepScientistなど最先端5システムを上回り、検証可能な自律研究の新しい基準を打ち立てています。 #AIResearch# #科学AI#
もっと見る