登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Technical
Technical コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Technical を含む検索結果
GitHub CopilotのTechnical Previewからもう5年って、ま?そんなたったっけ???
🐡 もう「どのLLMが最強か」を一つに絞って悩む時代は、終わるのかもしれません。 タイトル: Sakana Fugu Technical Report URL: Sakana AI の Fugu は、複数のフロンティア LLM を部下として束ね、タスクに応じて最適な布陣を自動で組む「指揮官(オーケストレータ)モデル」です。注目ポイントを3つに絞って紹介します。 🧭 学習された司令塔 Fugu は事前学習済みバックボーンに軽量な選択ヘッドを載せ、隠れ状態から最適なワーカーモデルをロジットで直接選びます。自己回帰生成を挟まないため、単一のフロンティアモデルを呼ぶのと同等の低遅延を保てるのが巧みです。 🕸️ ワークフローを動的に自作(Fugu-Ultra) 上位版はタスクを自然言語のワークフローとして書き下し、サブタスク分割・担当割り当て・通信戦略まで設計します。最大5ステップで討論型・逐次連鎖・木構造といった多エージェント協調を、問題ごとに組み立てます。 📊 単体モデルを超える成績 SWE-Bench Pro で 73.7 点(Claude Opus 4.8 の 69.2 を上回る)、GPQA-Diamond 95.5、LiveCodeBench 93.2 など主要ベンチで公開モデル最高水準。エージェント型コーディングでは「世代交代級」の 5〜6% の相対改善を達成しました。 巨大化ではなく賢い"指揮"で最先端へ。新しいスケーリング軸を示した一本です。 #SakanaAI# #LLM#
もっと見る
1時間級の長尺動画を丸ごと理解し、ツールも検索も使いこなす——総30Bパラメータでも推論時はわずか3Bで動く、効率的なマルチモーダルモデルです🎬 タイトル: Kwai Keye-VL-2.0 Technical Report URL: 🎬 概要 Kuaishou(快手)が開発した、長尺動画理解とエージェント的知能に特化したオープンソースのマルチモーダル基盤モデルです。Mixture-of-Experts(MoE)構成を採用し、総30Bパラメータのうち推論時に活性化するのは3Bのみという効率性を実現しています。 ❓ 解決する課題 時間単位(hour-level)の長い動画を扱うには、膨大な計算が必要になります。 ・フレーム数が多く、長距離の時間依存を捉えるのが難しい ・計算制約に対処しつつ、多様なタスクで高い性能を保つことが課題でした 💡 方法論と提案手法 ・長文脈処理:DeepSeek Sparse Attention(DSA)をGQAベースのアーキテクチャに適応させ、256Kコンテキストのロスレス処理を実現。重要なフレームと長距離の時間依存を捉えます ・インフラ:スケーラブルな動画I/O、異種のViT-LM並列化、カスタムのDSAカーネル ・訓練:マルチタスクのアライメント時に生じる破滅的忘却に対処するため、Cross-Modal Multi-Teacher On-Policy Distillation(MOPD)を、Context-RL・Video-RLと組み合わせます 📊 実験結果 ・同規模のモデルの中で最先端(SOTA)の性能を達成しました ・特に、TimeLensでの細粒度な時間的ローカライズで際立ちます ・Video-MME-v2とLongVideoBenchでの長尺動画理解でも優れています ・Code・Tool・Searchをまたぐマルチモーダルなエージェント協調や、自己修正能力も備えます 🌍 ユースケース 長い動画の理解・検索・モデレーション、動画を扱う自律エージェントの基盤などに向きます。スパースアテンションをこの規模のマルチモーダルに初めて適用した点で、時間単位の動画処理を計算コストを抑えて現実的に回せるのが大きな強みです。 #動画理解# #マルチモーダル#
もっと見る
🦢 TL;DR: 「聞く・話す・割り込む」のタイミングはトップクラス、でもタスク遂行はまだ発展途上。Tencentが音声・映像・エージェントを1つに統合したomni対話モデルを発表しました。 タイトル: Omni Interaction Agent Technical Report(Gander) URL: 📌 ポイント 🧠 「小脳(対話制御)」と「大脳(Claude/Codexで実行)」の二層構造 🎙 音声・映像をチャンク単位でストリーミング処理、外部VAD不要 ✅ ターンテイキング精度100%でGPT-Realtimeの96%を上回る ⚠️ タスク完遂率(Pass@1)は0.400とGPT-Realtimeの0.600に劣る 🔀 音声認識を介さずテキストを直接渡すとPass@1が0.520に改善 🌐 音声×映像の統合でDaily-Omniが単一モダリティ比+19.13pt向上 📦 モデル重み・学習コード・評価ハーネスを公開予定 対話のテンポの良さと、タスクをやり切る正確さは今のところ別物という現実的な結果が興味深いです。 #マルチモーダルAI# #音声対話AI#
もっと見る