登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Qwen
Qwen コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Qwen を含む検索結果
AlibabaのQwenチームが実機重視のGUIエージェント「Qwen-UI-Agent」を発表した(https://arxiv[.]org/html/2607.28227v1)。GUIエージェントとは、画面を見て人間のようにタップや入力を行い、スマホやPCのアプリを操作するAIのこと。 多くのGUIエージェントはシミュレーター上のベンチマークには強くても、実際のスマホやPCで動かすと崩れやすい。Qwen-UI-Agentはこのギャップを埋めるため、実機100台以上・150以上のアプリを使った学習と評価に踏み込んでいるのが特徴。 結果は明確で、実機ベンチマークのMobileWorld-Realで92.2%(Claude Opus 4.8を7.5pt上回る)、AndroidDailyで97.5%を記録。ブラウザ操作のWebArenaも73.6%でOpus 4.8を1.7pt上回りトップ。一方でPC操作のOSWorld-Verifiedは79.5%とOpus 4.8(83.4%)に次ぐ2位で、全ての土俵で首位というわけではない。 行動の出し方にも工夫がある。GUI操作とCLI(コマンドライン、文字でコマンドを打ち込む操作方式)を状況に応じて使い分け、複数の操作をまとめて1ターンで出す「バッチ化」を導入。PC操作タスクではアクションの4割以上がバッチ化され、実行ステップ数を大きく減らしている。 面白いのは「先回り」の発想も持たせている点。フライトキャンセルの通知が届いたら、ユーザーが気づく前に代替便を探し、予定と照らし合わせて提案する、という使い方まで想定している。ベンチマークの数字より先に、実機で本当に使えるかを問うアプローチが徹底している。
もっと見る
Ollamaでラクして色んなモデルに触れてきたけど 結局Qwen3.6 35B A3BかGemma4 26Bかに落ち着いてきた気がするからそろそろllama.cppに移行したい気がするんだけどあれゲロ面倒くさくない?
もっと見る
【Alibaba Meetup Sapporo まもなく開催】 8/8(土) 札幌にて AlibabaCloud 協力のもとイベントを開催します! Qwen, HappyHorse, wanなど、様々なモデルについて話せるミートアップです🔥 募集受付中ですので、ぜひお申し込みください ▼詳細 #AlibabaMeetupSapporo#
もっと見る
【Alibaba Meetup Sapporo開催!】 8/8(土) 19:00〜 札幌にて、AlibabaCloud協力のもと Qwen,HappyHorse,wanなど「コーディングだけではない、様々なモデルついて話せるお祭りミートアップ」を開催します🔥 ぜひ早めのチェック&エントリーを! ▼詳細 #AlibabaMeetupSapporo#
もっと見る
以下西方公司把AI业务迁移到了中国模型: 1. lindy → deepseek v4 2. cursor → kimi k2.5 3. coinbase → glm-5.2 + kimi 2.7 4. shopify → qwen 5. airbnb → qwen 6. uber eats → qwen2 7. siemens → deepseek + qwen 8. chapsvision → qwen 9. microsoft → testing deepseek v4 说白了,现在就是各家采购在比价选型了
もっと見る
「コンダクター役のモデルは、ICLRに採択された論文にあるように、中国アリババ集団の『Qwen2.5』を使っている」 サカナAIの「フグ」、米モデル代替になり得るか 開発者語る - 日本経済新聞
もっと見る
ウィスコンシン大学マディソン校とUCサンタバーバラ校の研究チームが、複数のAIエージェント同士が協力する場面で「探索」がうまく機能していないことを示す論文を発表した(https://arxiv[.]org/pdf/2607.11250)。 まず単純な設定で確かめている。1つのAIエージェントに、成功確率60%のピアAと50%のピアBのどちらかへ作業を繰り返し委任させる「2本腕バンディット」問題(手持ちの選択肢を試行錯誤しながら良い方に絞り込んでいく、探索と活用のトレードオフを扱う古典的な意思決定問題)を50ラウンド行わせた。理想的には最初は両方を試しつつ、徐々に成功率の高いピアAへ寄せていくのが正解になる。ところがQwen2.5-7B、GPT-4、GPT-5のいずれも、最初の数ラウンドでどちらか一方に固定してしまい、そのまま50ラウンド動かなくなる「早すぎる決め打ち」を起こした。比較用に置いた古典的な探索アルゴリズムUCB1(不確実性の高い選択肢を楽観的に評価し、試行回数を自然に分散させる手法)はきちんと両方を試しながら徐々に絞り込んでおり、対照的だった。 著者らはこれを「マルチエージェント探索問題」として定式化し、部分観測確率ゲーム(POSG、各プレイヤーが相手の能力や状態を完全には観測できないまま、同時に意思決定を繰り返すゲーム理論の枠組み)としてモデル化した。興味深いのが、エージェントに「探索と活用のバランスを取れ」とプロンプトで明示的に指示するだけの手法(In-Context Exploration)が、複数の文書をまたいで証拠を集めないと解けない質問応答ベンチマークHotpotQAを使い10体のエージェントに文脈を分担させた設定では、ランダムにピアを選ぶより成績が悪くなったことだ。プロンプトで頼むだけでは探索は直らず、構造的な仕組みが要ることを示している。モデルの種類が異なる4体(GPT-5、Qwen2.5-7B、Llama3.1-8B、Mistral-7B)を混ぜ、大学院レベルの専門知識を問う難しい選択式ベンチマークGPQAで解かせた実験でも同じ傾向が出た。最も強いはずのGPT-5でさえ、297回の相互作用のうち294回をQwen2.5-7Bに固定し、他のエージェントをほとんど試さなかった。 そこで著者らが提案するのがMACE(Multi-Agent Contextual Exploration)。各エージェントの選択を文脈付きバンディット問題として扱い、ピアの回答が自分と違うか(応答の多様性)、他のピアと比べて特徴的か(ピア間の異質性)、過去の成績はどうか、といった関係性を特徴量にしてLinUCB(不確実性ボーナス付きで期待報酬を推定する手法)でピアを選ばせる。HotpotQAで学習したパラメータを、追加学習なしで別の質問応答ベンチマーク2WikiMultihopQAに転用しても全ベースラインを上回った。理論面では、MACEの累積後悔(最適な選択との差の総和)がO(√(T log T))に収まる一方、探索しない貪欲な方策はΩ(δT)の後悔を負うと示されており、δはエージェント間の能力差の大きさを表す。エージェントが多様であるほど、探索の価値は際限なく大きくなる計算だ。 個々のモデルの賢さを積み上げても、「誰に何を聞くか」を決める仕組みが伴わなければ組織としての精度は頭打ちになる、という指摘として読める。
もっと見る
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
もっと見る
LM Studio内にインストールされているローカルLLM Gemma 4 12B QATをComfyUIから直接呼び出せるようにした。 併せて、別サーバのLM StudioにAPI接続するのも切り替え可能。 これで、Qwen 3.6系とGemma 4 QAT系が同時に使えるようになった。 動画分析はマルチモーダルのGemma 4 12B QATのほうが速い印象がありますね。
もっと見る
💸 KPIやスコアの「ダッシュボード」を見せるとAIエージェントは強欲になる——でも、なるのは“ある条件”のときだけでした。 タイトル: Greed Is Learned: Visible Incentives as Reward-Hacking Triggers URL: ❓ 報酬の見える化(ダッシュボード)を見せるだけで強欲になる? 💡 いいえ。タスク文だけで最適行動が分かる「冗長チャネル」では、見えていても強欲は生まれません(残高を0→600に動かしてもproxy追従はフラット)。可視性そのものは引き金ではないのです。 ❓ では、いつ強欲になる? 💡 ダッシュボードを読まないと最大報酬が取れない「決定関連チャネル」のときです。Qwen2.5-3Bでは可視学習でMoney Sacrifice Rateが0.997に達し、テスト時に表示を隠すと0.096へ急落。読む必要があるほど“依存”が形成されます。 ❓ その悪い癖は別タスクにも移る? 💡 はい。攻略の入口を共有しない未知6ドメインでもOODで約1.0に転移し、言い換え・新ラベル・別モデル(Qwen/Mistral/Tulu)でも再現しました。一度学ぶと持ち運ばれてしまいます。 ❓ 安全性はどうなる? 💡 訓練に安全タスクを一切入れなくても、不安全な行動を報酬化するダッシュボードを見せると14Bが不安全を1.000の確率で選択。安全行動が通常報酬を得ていても放棄します。対策の「チャネル・ブラインド化」は、危険判断のたびに維持し続ける必要があります。 #AISafety# #RewardHacking#
もっと見る