登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 モデル圧縮
モデル圧縮 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
モデル圧縮 を含む検索結果
エージェントのモデルをアップグレードした翌日、なぜか回答の質が静かに落ちている。そんな経験はないでしょうか。 多くのチームは、モデルの入れ替えを「ただの差し替え」だと考えがちです。しかしエージェントが蓄積してきたメモリは、古いモデルの癖や解釈のクセを前提に書かれています。新しいモデルがそのメモリを引き継いだ瞬間、性能はテストに気づかれないまま劣化してしまうことがあります。 そこで研究者たちは、生履歴・RAG・モデル圧縮ノート・固定スキーマの知識グラフという4つのメモリ形式を、実際にモデルを入れ替えて比較しました。結果は形式によって驚くほど異なります。固定スキーマの知識グラフはモデルを替えてもほぼ無傷(変化わずか±0.0004ポイント)だった一方、圧縮ノートは書き手と読み手の組み合わせ次第で最大13.28ポイントも劣化し、埋め込みを中途半端に移行すると得られるはずの改善の58%を静かに失うことも判明しました。 Does Your Agent's Memory Survive a Model Upgrade? A Controlled Study of Memory Portability モデルのアップグレードは、もはや単なる差し替えではなく「メモリの移行プロジェクト」として扱うべき時代が来ているのかもしれません。 #AIエージェント# #メモリ管理#
もっと見る
TL;DR 音声LLMのエンコーダを18層から14層まで削っても精度がほぼ落ちない、XPengの圧縮手法「X-AuT」が公開されました。むしろ16層構成では精度が向上しています。 タイトル: X-AuT: Progressive Audio-Encoder Compression for Speech LLMs with Cross-Scale Distillation URL: ポイント ✂️ 音声エンコーダの層を18→16→14と段階的に削減する「プログレッシブプルーニング」を採用しています 🔍 個々の層の削減スコアだけでは最適なペアが分からず、層同士の相互作用まで評価しているのが面白い点です 🎓 0.6Bの学生モデルを1.7Bの大きな教師モデルで蒸留する「クロススケール蒸留」で自己蒸留より大きく精度を改善しています 📈 16層構成ではパラメータ10.35%削減しつつマクロ平均エラー率5.61%→5.27%に改善 📉 14層構成でもパラメータ20.70%削減で精度低下はわずか+0.14ptに抑えられています 🚗 車載チップ上でエンコーダ処理時間を21.4%、全体レイテンシを4.7%削減しています 🔓 コードとモデルはGitHub・Hugging Faceで公開済み(CC BY-NC 4.0) 層を削るだけでなく「どう賢く削って回復させるか」の設計がよく練られていると感じました。 #音声LLM# #モデル圧縮#
もっと見る
動画生成AIに複数ステップで考える力を持たせる新手法HDR(Hierarchical Denoising for Visual Reasoning)が発表された(https://arxiv[.]org/html/2607.15278v1)。 いまの動画生成AIの多くは拡散モデル(ランダムなノイズを少しずつクリアな映像に近づけていく生成の仕組み)を使っていて、迷路やハノイの塔のような視覚的な推論もできるようになってきた。ただし既存の生成方式には弱点がある。ストリーミング型(過去のフレームだけを見て左から右へ逐次生成する方式、CausVidなど)は速いが、一度生成したフレームを後から直せず序盤の判断ミスを引きずる。双方向型(動画全体を毎ステップまとめてノイズ除去する方式)は前の判断を修正できて賢いが、毎回全フレームを更新するので計算コストが重くストリーミングに向かない。 HDRは動画の潜在表現(モデル内部で圧縮された動画データ)を6段階の木構造の階層に組む。粗いレベルはノイズを多めに残して複数の可能性を保持したまま大枠の計画を立て、細かいレベルに降りるほどノイズを削って具体的な映像へ絞り込む。各階層の中は左から右への逐次生成を保つのでストリーミングの速さはそのまま。SHAP(疎な階層的注意機構、各フレームが近くのフレームと一つ上の階層だけを参照して計算量を抑える仕組み)も導入している。論文では、既存方式が迷路で序盤に間違った分岐を選んで失敗するのに対し、HDRは分岐の判断を保留してから細部を詰めて正解にたどり着く例が紹介されている。 迷路・ハノイの塔・一筆書き・スライドパズル・倉庫番・水注ぎの6タスク、370本の評価動画によるベンチマークでは、ストリーミング型ベースライン(CausalForcing)比で成功率が34.22から60.29へ(76.2%の相対改善)、平均進捗スコアも76.00から89.56へ向上。推論速度は1フレームあたり0.70秒で、双方向型(37.92秒)より54.2倍速いのにストリーミング型ベースライン(0.72秒)とほぼ同速。学習データを2%に絞っても82.9%の成功率を維持できており(双方向型は52.0%まで低下)、データ効率の高さも見どころ。実機ロボットアームの迷路実験でも同じ枠組みが機能したという。
もっと見る
TL;DR: エージェントが失敗するのはモデルの賢さ不足ではなく「実行を取り巻く仕組み」の欠陥。重みを触らず実行環境だけを鍛える「ハーネススケーリング」で、Terminal-Bench 2.1に95.3%・約$15で到達しました。 タイトル: StateM: Reaching 95.3% Raw Accuracy, or a $15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling URL: ポイント 🧠 モデルではなくハーネスを拡張。再訓練なしで失敗から学習させる新パラダイム 📌 永続状態でエピソードをまたいで発見を保持 🎯 フェーズ局所の文脈で意思決定点に関連情報だけを提示 ✅ 検査付き遷移で事前条件を検証し連鎖失敗を防止 📖 回復可能ランブックで失敗を照会可能な知識として再利用 🕒 バージョン管理された手順で戦略を更新・ロールバック 💰 GPT-5.6が95.3%(445試行/全89タスク成功)、$574.68の実行を約$15に圧縮 失敗を毎回「実行可能な事前条件」に変え、信頼性を運用基盤から底上げする一本です。 #AIAgents# #TerminalBench#
もっと見る
🚀 100万トークンのコンテキストを扱いながら、KVキャッシュを従来の4分の1まで絞り込んだモデルが登場しました。DeepSeekの新作です。 タイトル: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression URL: 💡 概要 552Bパラメータのマルチモーダルなミクスチャー・オブ・エキスパート(MoE)モデルで、長時間稼働するエージェント向けの「入力ヘビー」なワークロードを見据え、アーキテクチャと精度の両面からKVキャッシュを徹底的に圧縮しています。 🎯 解決する課題 長いコンテキストを扱うエージェントでは、プレフィル計算だけでなく、永続的なKVキャッシュがGPUメモリ・SSD・I/O帯域幅を圧迫し、デプロイコストの主なボトルネックになっていました。 🛠 方法論と提案手法 前半20層をエンコーダ、後半20層をデコーダとするCausal Encoder-Decoder構造でプレフィル計算量を半減。3モードで層間KVを再利用するCompressed Sparse Attention 2、候補プールに絞った階層型疎インデクサ、FP4量子化などを組み合わせています。 📊 実験結果 グローバルKVフットプリントは1トークンあたり890バイトでV4-Flashの約4分の1、永続KVは約8分の1に削減。コンテキストを4Kから100万へ256倍拡張してもデコードFLOPsは1/4しか増えません。HumanEval 79.4%など主要ベンチマークでも性能向上を確認しています。 #LLM# #KVキャッシュ#
もっと見る
TL;DR 同じ文書が何度も検索されているのに、クエリのたびにまるごと再エンコードするのは無駄ではないでしょうか。DoPRは文書側の計算を一度だけ圧縮して保存し、複数のクエリで使い回すことでLLM再ランキングを高速化します。 タイトル: DoPR: Reusable Compressed Document Prefixes for Efficient LLM Reranking URL: 🔑 注意度に基づいてトップKのサリエントなトークンだけを選び、文書をクエリ非依存の圧縮プリフィックス(KV状態)として一度だけオフラインで計算・保存します ⚡ オンライン再ランキングではクエリとスコアトークンだけを処理すればよく、メモリを最大8.0倍削減、長い文書ではレイテンシを最大8.04倍短縮できました 📊 TREC DL19/DL20やBEIRでNDCG@10の97.1〜99.5%を維持し、モデルサイズが大きいほど圧縮による劣化に強いことも確認されています 🔁 同じ文書を複数クエリで使い回す設定では、DL19でクエリ10件のとき約2倍、長文書中心のCovidデータセットでは5件の時点で3倍超の高速化を達成しました 🧪 アブレーションでは、ランダム選択や先頭K選択よりも注意度ガイドのトップK選択が最良の性能(NDCG@10 71.44)を示し、追加パラメータなしで実現できています 💬 文書コレクションが安定していて繰り返しアクセスされる検索システムほど、この「一度計算して使い回す」発想の恩恵が大きそうです #検索# #LLM#
もっと見る
浙江大学と清華大学の研究チームが、ロボット制御向けの世界モデル(行動を起こすと画像がどう変わるかを予測するモデル)に対して、探索なしで行動を決められる新しい学習法「INTACT」を提案した(https://arxiv[.]org/html/2607.26056v1)。 画像はその全体構成。従来はゴールに近づく行動をCEM(大量の行動候補をランダムに生成してシミュレートし、良さそうなものを選ぶ探索的な計画手法)で毎回探すのが定番で、1回のプランニングに平均1.48秒かかっていた。INTACTは同じオフラインの実演データから「今の状態から実際に起きた変化」と「今の状態からゴールまでの差分」の両方を、1つの共有した行動予測モジュールに同時学習させる。これにより探索を一切使わずにいきなり行動が出せるDirect制御が可能になり、レイテンシは2.9〜5.5ミリ秒まで縮んだ。 PushT/Cube/Reacher/TwoRoomの4タスクをそれぞれ個別に学習したモデルでも、Directだけで成功率85.78%/100.00%/97.67%/97.89%を達成。Direct案の周辺だけをCEMで軽く確認するごく小さな検証(候補384個、CEMの9,000個の23分の1)を足すと、4タスク平均96.86%、最も苦手なタスクでも92.22%まで伸びる。1つのエンコーダ(画像を圧縮した表現に変換する部分)で4タスクを同時に学習させても平均89.39%届き、土台となった従来の世界モデル「LeWM」に対しタスクによっては最大42.44ポイント差をつけた。 興味深いのは、同じ共有エンコーダの設定で行動を出す部分を完全に無効化し、旧来のCEM探索だけで評価しても、INTACTの目的関数で学習した表現のほうが成功率が66.17%から70.08%に伸びる点。行動予測ヘッドを追加しただけでなく、世界モデルの表現そのものを底上げしていることになる。
もっと見る
VideoChat3が発表された(https://arxiv[.]org/html/2607.14935v1)。南京大学や上海AI研究所などの研究チームによる完全オープンソースの動画理解MLLM(マルチモーダル大規模言語モデル)で、パラメータ数はわずか4Bながら、同規模のQwen3-VL-4Bとの直接比較19項目中18項目で上回っている。 動画理解が難しいのは、静止画と違って動きや前後の文脈まで把握する必要があるからだ。既存モデルの多くはフレームを1枚ずつ独立した画像として処理するため、長尺動画やライブ配信でトークン数(モデルが処理する情報の単位)が爆発的に増えて重くなりがちだった。 そこでVideoChat3は視覚エンコーダー(映像を数値情報に変換する部品)にI3D-ViTを導入した。隣接フレームをまとめて空間・時間の両方向で処理してから時間方向に圧縮し、既存の空間圧縮と組み合わせて映像トークン数を全体で16分の1に減らしている。 さらにライブ配信向けにAdaptive Frame Resolutionという仕組みも入れた。サッカー中継で中盤のパス回しは流し見してゴール前だけ集中するのと同じ発想で、「見送り」「注視準備」「応答」の3状態を切り替えながら重要な瞬間だけ高解像度で処理する。ここの学習設計が面白い。素直に全フレームへ同じ重みで学習させると「見送り」ばかり選んでほとんど応答しなくなり(F1スコア5.8)、逆に状態の切り替わる瞬間だけに絞ると、映像を見なくても直前のパターンから「とりあえず応答する」抜け道を覚えてしまい、当たっていたのは11.8%だけだった(見逃しは少なく再現率97.9%なのに)。両者をバランスさせる工夫で、最終的にF1スコアを35.5まで引き上げている。 ベンチマークでもMotionBenchで61.7点、TempCompassで75.6点とオープンモデル最高スコアを記録し、ストリーミング理解のODVBenchではオンライン動画理解に特化したStreamForestを12.4ポイント上回る72.3を出した。長尺動画の処理も速く、2048フレームの動画ではQwen3-VL比でレイテンシを44.4秒から20.4秒に短縮している。 モデルの重みだけでなく学習コード・学習戦略・約300万件のデータセットまで全部公開しているのも特徴で、再現性を重視した設計思想が伝わってくる。
もっと見る
🤖 ロボットの器用な手つきも、結局は「データ量」で伸びることが実証されました。 タイトル: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation URL: 🧩 概要 AgiBot Research Teamが、既存の動画生成モデルを流用せず全コンポーネントをロボット操作データからゼロで学習する「ワールドアクションモデル」GE-Act 2.0を提案しました。未来の視覚状態を予測し、そこから行動を導きます。 ⚙️ 解決する課題 既存手法は再構成品質重視の動画生成器をそのまま使っており、行動予測に必要な情報が保証されない上、視覚生成とインバースダイナミクスの事前学習と接続の関係が未解明でした。 🛠 方法論と提案手法 64倍圧縮の行動特化オートエンコーダ(CoAE)、1回の順伝播で未来映像を生成するSingle-Step Visual Planner、視覚予測と実行動のズレ(妥当性ギャップ)をtop-k選択で解消するKASOという3つの工夫で構成されています。 📊 実験結果 学習データを300時間から3万時間に増やすと、ロボットG1-OPの成功率は17.1%から44.1%へ27.0ポイント向上。データが2%未満しかないG2-90Dでも17.7ポイント向上し、身体をまたいだ知識転移が確認されました。物体・色・位置の指示追従も90%以上の精度を達成しています。 #ロボティクス# #世界モデル#
もっと見る
TL;DR 会話履歴を積み上げ続けるのをやめて「現在の状態」だけを持たせたら、長時間タスクのトークン消費が最大50倍減って精度も上がったそうです。 SKILL.state: Scalable Long-Horizon Agent Skills ポイント 📉 履歴を毎回追記せず、JSON形式の構造化状態だけをモデルに渡す設計でプロンプト長がO(1)に収まります 🧮 累積トークン消費が従来のO(T²)からO(T)に低減し、T=200では実に50.5倍のトークン削減を達成しました 🎯 倉庫管理タスクで精度0.94を維持しつつ平均プロンプトを1,905トークンまで圧縮しています 🛡️ 無関係なノイズイベントが50件混ざっても精度0.98を維持し、履歴型手法の劣化を回避しました 🩹 外部要因で状態が変わっても訂正アラートで即座に更新でき、幻覚からの回復ステップがゼロで済みます 🏆 InterCode CTFでpass@1が54.2%とReActの43.2%を上回り、トークン消費も大幅に削減しました 長い会話を賢く圧縮するのではなく、そもそも履歴を溜めないという発想の転換が印象的でした。 #AIエージェント# #LLM#
もっと見る