登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Qwen3-4B
Qwen3-4B コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Qwen3-4B を含む検索結果
モデル自身に長い文章の中から使えそうな部分を選ばせてから、その部分だけで一時的に学習させる手法をMeta AIとバージニア大学が発表した(https://arxiv[.]org/html/2607.09415v1)。 近年のLLM(大規模言語モデル)は数十万トークンの長文を一度に読めるようになったが、扱える入力の長さ(コンテキストウィンドウ)を広げるだけでは長文を有効に使えるとは限らない。入力が長くなるほど正解率が下がる現象が知られていて、質問に関連する証拠を見つけて使う能力がボトルネックになっている。 有望な解決策がテスト時学習(TTT、Test-Time Trainingの略)だ。答える前にテスト入力そのものを訓練データとしてモデルの重みを一時的に更新する手法で、長文脈タスクとの相性が良いとされてきた。ただし長文脈全体を学習に使うのは計算コストが高く、ランダムに抜き出した断片を使うと無関係な情報がノイズになる。 著者らはLLMの長文読解力を測るベンチマーク「LongBench-v2」で診断実験を行い、興味深い結果を得た。ランダムな断片で学習させるとベースモデルの正解率40.4%が38.9%まで下がる一方、正解を教えられたうえで判断するGPT-5.5が選んだ「本当に必要な部分」だけで学習させると45.9%まで伸びた。TTTの効果は学習させる部分の質に強く依存している。 これを受けて提案されたのがSelf-Guided TTT(S-TTT)だ。2段階構成で、まずモデル自身に長文脈の中から質問に関連しそうな部分を原文のまま抜き出させ(Stage 1)、その部分だけを使って次単語予測(次にくる単語を当てさせる、通常のAI学習と同じ方式)で一時的に学習させる(Stage 2)。最終的な回答生成は元の文脈全体を見て行う。 Qwen3-4B-Thinking-2507とLlama-3.1-8B-Instructの両方で検証したところ、ベースモデルは一貫して上回り、ランダムに断片を選ぶ手法や文脈全体を使う手法など既存のTTT手法に対しても総じて上回るか同等の成績を残した。最大では15%の相対的な改善を達成している(Qwen3-4B-Thinking-2507、LongBench-v2の64k〜128kトークン帯域で正解率30.7%→35.3%)。 パープレキシティ(次単語の予測しにくさ)やエントロピー(予測の不確実性)が高い部分を選ぶより、モデル自身が「質問に関連しているか」で選ぶ方が明確に優れていた点も興味深い。難しい部分を学ばせればいいわけではなく、質問との関連性を見極める判断力そのものが効いているらしい。
もっと見る
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
もっと見る
🧭 「曖昧な目標だけを渡されたAIは、本当に自分で学び進化できるのか?」という問いに、ByteDance Seedらのチームが正面から挑んだベンチマークが登場しました。 タイトル: Aspire: Can Models Self-Evolve from Vague Goals? URL: このベンチマークでは、明確なタスク定義や報酬を与えず、モデル自身に目標の解釈から訓練・検証までを一気通貫で行わせ、隠された評価セットで実際の能力向上を測定します。 🎯 注目ポイント1: 曖昧さのコスト タスクを曖昧な表現に変えるだけで、Claude Opus 4.8は32.90%から27.07%、GPT-5.6は36.23%から29.58%へとスコアが低下しました。エージェントは何を最適化すべきかの見極めに時間を取られ、肝心の訓練時間が削られてしまいます。 🔁 注目ポイント2: 実行できても改善は続かない Qwen3.5-4B/9Bによる自己進化実験では、最終チェックポイントの多くが基盤モデルを下回り、24件中21件が安全機構によって初期状態にロールバックされました。狭い自己評価だけを頼りに訓練すると、局所的には良くなっても隠蔽評価では性能が退化してしまうのです。 🛠️ 注目ポイント3: ハーネス進化も基準を超えられない エージェント自身にエージェントの実行基盤(ハーネス)を作り直させる実験でも、最良の後継ハーネスでさえ参照実装のスコア28.64に対し27.22と一歩及ばず、検証の多様性不足や出力の完全性チェック漏れが原因として指摘されています。 💡 「何を改善するか」を自分で決める力こそが、持続的な自己改善に向けた次の大きな壁であることを、この研究は明確に示しています。 #LLMエージェント# #自己進化#
もっと見る
Tencentのロボティクスチームが、ロボットに「言葉で考えて、絵で確かめながら動く」能力を持たせる基盤モデル「RxBrain」を発表した(https://arxiv[.]org/abs/2607.14187)。 例えば「メガネを畳んでケースにしまう」というタスクなら、RxBrainは「つるを畳む」「ケースに入れる」と言葉で手順を計画し、それぞれの手順を終えた後の映像がどう見えるはずかを画像として想像しながらタスクを進めていく。 背景には、ロボット向けAIが抱えていた分業の問題がある。視覚言語モデル(VLM、画像を見て言葉で答えを返すAI)は「次に何をすべきか」の説明は得意だが結果の見た目までは示さず、逆に世界モデル(world model、未来の映像を予測するAI)は先の状態を絵で示せてもなぜそうすべきかという理由づけは苦手だった。RxBrainは6.2Bパラメータの単一モデルの中で、この2つの機能をMixture-of-Transformers(データの種類ごとに専門の処理経路を用意しつつ注意機構だけは共有するアーキテクチャ)で統合している。 学習データは実ロボットの操作映像、ハンドヘルドグリッパーでの人の動作、一人称視点の日常動画などから自動構築した5万時間超・2150万セグメント。新設ベンチマークRxBrain-Benchの「言葉と画像を組み合わせた計画」タスクではスコア0.68を記録し、既存のエージェント型手法(BAGEL-7B-MoTが0.50、Qwen-Agentが0.43)を上回った。一方、単純な状況理解を問うタスクでは総合スコア72.7にとどまり、Qwen3.5-4B(78.1)には及ばない。先を見通した計画は得意でも、細かい状況認識はまだ既存モデルに一歩譲るというバランスが見える。 さらに、大規模な行動データでの事前学習なしに実ロボットへ応用した結果も興味深い。食卓の準備・メガネの折りたたみ収納・ゴミ捨ての3タスクで平均成功率87%を達成し、ロボット操作の代表的な基盤モデルπ0.5(82%)やπ0(68%)を上回った。 「言葉で考え、絵で確かめる」というアプローチで、ロボットの計画立案を人間の思考プロセスに近づけようとしている点が面白い。
もっと見る
ターミナルエージェントの訓練データ、実は「指示・環境・解答・検証器」がバラバラで解けないタスクが量産されがち——その根本を絶つ合成フレームワークが登場しました。 タイトル: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis URL: 📌 概要 関連スキルを情報豊かなシナリオへ再構成し、環境を先に構築してその実行状態を共有の土台に。指示・解答・検証器を同じ状態に接地して生成します。 🧩 解決する課題 ・多段生成で元素材の依存や中間状態が失われる ・指示/環境/解答/検証器が食い違い、解けない・評価できないタスクになる ⚙️ 提案手法 ・7万件超のスキルを収集し5次元シナリオへ再構成 ・Dockerで環境をビルドし実状態を共有チャネルに ・指示→解答→検証器を順次生成し、失敗箇所だけをルーターが特定して修復 📊 実験結果 ・平均22.77テスト/タスクの検証済み6,078件を合成 ・Qwen3.5を微調整し4B +40.5%、9B +30.1%、27B +16.5% ・27B(47.57)が約15倍大の397B(49.06)に肉薄 ・エンドツーエンド歩留まり70%で競合の15〜28%を圧倒 質の高い実行可能タスクは、量産ではなく丁寧な状態接地から生まれる、と示す一本です。 #LLMAgents# #TerminalBench#
もっと見る
💸 KPIやスコアの「ダッシュボード」を見せるとAIエージェントは強欲になる——でも、なるのは“ある条件”のときだけでした。 タイトル: Greed Is Learned: Visible Incentives as Reward-Hacking Triggers URL: ❓ 報酬の見える化(ダッシュボード)を見せるだけで強欲になる? 💡 いいえ。タスク文だけで最適行動が分かる「冗長チャネル」では、見えていても強欲は生まれません(残高を0→600に動かしてもproxy追従はフラット)。可視性そのものは引き金ではないのです。 ❓ では、いつ強欲になる? 💡 ダッシュボードを読まないと最大報酬が取れない「決定関連チャネル」のときです。Qwen2.5-3Bでは可視学習でMoney Sacrifice Rateが0.997に達し、テスト時に表示を隠すと0.096へ急落。読む必要があるほど“依存”が形成されます。 ❓ その悪い癖は別タスクにも移る? 💡 はい。攻略の入口を共有しない未知6ドメインでもOODで約1.0に転移し、言い換え・新ラベル・別モデル(Qwen/Mistral/Tulu)でも再現しました。一度学ぶと持ち運ばれてしまいます。 ❓ 安全性はどうなる? 💡 訓練に安全タスクを一切入れなくても、不安全な行動を報酬化するダッシュボードを見せると14Bが不安全を1.000の確率で選択。安全行動が通常報酬を得ていても放棄します。対策の「チャネル・ブラインド化」は、危険判断のたびに維持し続ける必要があります。 #AISafety# #RewardHacking#
もっと見る
Qwen3.8-27Bがマイクラクローン作ってくれた!って投稿したら「モデルが自分で考えて作ったんじゃなくてマイクラクローンのコード学習してただけだろ」って言われたからマイクラに無いアーケードゲーム機でマリオ遊べる機能と航空支援機能とドローン飛ばす機能とスケボー機能も追加してもらったとかいう話。すごいね
もっと見る
OrcaRouterのオープンモデル「Qwen3.8-27B-Uncensored」、Hugging Faceランキングで世界3位にランクイン
OrcaRouter提供のセキュリティ研究向けモデル「Qwen3.8-27B-Uncensored」、第三者による8モデル比較検証で総合1位...
Ollamaでラクして色んなモデルに触れてきたけど 結局Qwen3.6 35B A3BかGemma4 26Bかに落ち着いてきた気がするからそろそろllama.cppに移行したい気がするんだけどあれゲロ面倒くさくない?
もっと見る