登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 SparseAttention
SparseAttention コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
SparseAttention を含む検索結果
1時間級の長尺動画を丸ごと理解し、ツールも検索も使いこなす——総30Bパラメータでも推論時はわずか3Bで動く、効率的なマルチモーダルモデルです🎬 タイトル: Kwai Keye-VL-2.0 Technical Report URL: 🎬 概要 Kuaishou(快手)が開発した、長尺動画理解とエージェント的知能に特化したオープンソースのマルチモーダル基盤モデルです。Mixture-of-Experts(MoE)構成を採用し、総30Bパラメータのうち推論時に活性化するのは3Bのみという効率性を実現しています。 ❓ 解決する課題 時間単位(hour-level)の長い動画を扱うには、膨大な計算が必要になります。 ・フレーム数が多く、長距離の時間依存を捉えるのが難しい ・計算制約に対処しつつ、多様なタスクで高い性能を保つことが課題でした 💡 方法論と提案手法 ・長文脈処理:DeepSeek Sparse Attention(DSA)をGQAベースのアーキテクチャに適応させ、256Kコンテキストのロスレス処理を実現。重要なフレームと長距離の時間依存を捉えます ・インフラ:スケーラブルな動画I/O、異種のViT-LM並列化、カスタムのDSAカーネル ・訓練:マルチタスクのアライメント時に生じる破滅的忘却に対処するため、Cross-Modal Multi-Teacher On-Policy Distillation(MOPD)を、Context-RL・Video-RLと組み合わせます 📊 実験結果 ・同規模のモデルの中で最先端(SOTA)の性能を達成しました ・特に、TimeLensでの細粒度な時間的ローカライズで際立ちます ・Video-MME-v2とLongVideoBenchでの長尺動画理解でも優れています ・Code・Tool・Searchをまたぐマルチモーダルなエージェント協調や、自己修正能力も備えます 🌍 ユースケース 長い動画の理解・検索・モデレーション、動画を扱う自律エージェントの基盤などに向きます。スパースアテンションをこの規模のマルチモーダルに初めて適用した点で、時間単位の動画処理を計算コストを抑えて現実的に回せるのが大きな強みです。 #動画理解# #マルチモーダル#
もっと見る
🚀 100万トークンのコンテキストを扱いながら、KVキャッシュを従来の4分の1まで絞り込んだモデルが登場しました。DeepSeekの新作です。 タイトル: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression URL: 💡 概要 552Bパラメータのマルチモーダルなミクスチャー・オブ・エキスパート(MoE)モデルで、長時間稼働するエージェント向けの「入力ヘビー」なワークロードを見据え、アーキテクチャと精度の両面からKVキャッシュを徹底的に圧縮しています。 🎯 解決する課題 長いコンテキストを扱うエージェントでは、プレフィル計算だけでなく、永続的なKVキャッシュがGPUメモリ・SSD・I/O帯域幅を圧迫し、デプロイコストの主なボトルネックになっていました。 🛠 方法論と提案手法 前半20層をエンコーダ、後半20層をデコーダとするCausal Encoder-Decoder構造でプレフィル計算量を半減。3モードで層間KVを再利用するCompressed Sparse Attention 2、候補プールに絞った階層型疎インデクサ、FP4量子化などを組み合わせています。 📊 実験結果 グローバルKVフットプリントは1トークンあたり890バイトでV4-Flashの約4分の1、永続KVは約8分の1に削減。コンテキストを4Kから100万へ256倍拡張してもデコードFLOPsは1/4しか増えません。HumanEval 79.4%など主要ベンチマークでも性能向上を確認しています。 #LLM# #KVキャッシュ#
もっと見る