登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 LLMスケーリング
LLMスケーリング コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
LLMスケーリング を含む検索結果
AIエージェントの性能はモデルだけで決まらない——ハーネスの設計次第で大きく変わります。 TL;DR JIT-Agentはタスクの特性に応じてエージェントハーネス(スキャフォールド)をジャストインタイムで自動生成・修復・進化させる専用モデルです。GLM-5.2で+7.7pt、DeepSeek-V4-Flashで+8.8ptの平均向上を達成し、9ベンチマーク中8つでGPT-5.6を含む全フロンティアモデルを上回りました。 タイトル: Scaling Harness Intelligence via Just-in-Time Harness Evolution URL: ポイント 🧩 ハーネスを「学習可能なアーティファクト」として定式化 メモリ・計画・アクション・能力オーケストレーションの4モジュールプロトコル h = (M, P, A, F) でハーネスを形式化。生成空間を制約しつつ13種類の既存ハーネスを全て表現できる設計です。 🎓 教師あり→修復→進化の3段階訓練 ステージIで教師生成ハーネスを学習、ステージIIで実行失敗時の修復を学習(最大2反復)、ステージIIIのEvo-GDPOでパレートフロンティアを前進させる新規ハーネスを進化的に探索します。 📊 精度向上とコスト削減を同時達成 xBench-DeepSearchでスコア78→82(+4pt)の一方、トークン消費は527K→212K(▲60%)、コストは$0.075→$0.039(▲48%)。9ベンチマーク平均で固定ハーネス比36%のトークン削減を実現しています。 ⚡ 複数モデルファミリーに転移可能 JIT生成ハーネスはDeepSeek V4(+10.2pt平均)、Mimo V2.5(+8.6pt)、Qwen 3.6(+4.0pt)でいずれもReActを上回り、ハーネス生成器を再訓練せずに転移できます。 🔄 ストリーミングモードで運用中も進化 デプロイ後もタスクシーケンスをまたいでハーネスを蓄積・更新する「オンライン進化」を実装。静的生成より全評価ベンチマークで上回ります。 ベースモデルのスケーリングと独立した「ハーネス知性」という新たなスケーリング軸の提案として注目です。 #AIエージェント# #LLMスケーリング#
もっと見る
🧵 AIにじっくり考えさせようとすると、考えれば考えるほど1トークンあたりのコストが膨らんでいく。この地味だけど本質的な壁に、ある発見から挑んだ研究があります。 きっかけはシンプルな観察でした。「42+84=126」のような計算ステップは、答えが出た瞬間にその過程はもう要らなくなる。長い推論のなかで本当に重要なのは、最初のタスク指示(プリフィックス)と、いま進行中の直近の思考だけではないか——著者らはそう考えました。 そこで提案されたのがPrefix Sliding。プリフィックスと直近k個のトークンだけをスライディングウィンドウとしてメモリに保持し、それ以外は捨ててしまうというシンプルな発想です。これにより1トークンあたりの生成コストが、どれだけ長く考えても一定に保たれるようになります。 結果は明快でした。追加学習なしで既存モデルを約3倍高速化し、さらに強化学習と組み合わせることで、これまで事実上不可能だった10万トークンを超える推論トレースへのスケーリングを実現しています。「長く考えるほどコストが増える」という当たり前を覆した点が、この研究の核心です。 タイトル: Prefix Sliding for efficient test-time scaling URL: #LLM# #テスト時間スケーリング#
もっと見る
LLMの「残差接続」、実は各層を一律の重みで足しているだけでした➕ 深くなるほど各層の貢献が薄まるこの問題に、アテンションで答える改良です。 タイトル: Attention Residuals URL: ➕ 概要 残差接続の固定重みでの足し合わせを、softmaxアテンションに置き換える手法AttnResの提案です。各層が、学習された入力依存の重みで、それより前の表現を選択的に集約できるようにします。 ❓ 解決する課題 現代のLLMはPreNorm付きの残差接続が標準ですが、各層の出力を固定の等しい重みで足し合わせます。 ・層が深くなるほど隠れ状態が制御不能に増大します ・一律に足すため、個々の層の寄与が深さとともに希薄化します つまり「どの層の表現をどれだけ使うか」を制御できていませんでした。 💡 方法論と提案手法 ・Full AttnRes:すべての先行層の出力にアテンションを適用します ・Block AttnRes:層をブロックに分割し、ブロック単位の表現にのみアテンションして計算を削減します ・キャッシュベースのパイプライン通信と2フェーズの計算戦略を採用 ・Kimi Linearアーキテクチャ(総48B/活性3B)で検証しました 📊 実験結果 ・1.4兆トークンで事前学習 ・深さ方向でより均一な出力の大きさと勾配分布を達成 ・評価したすべての下流タスクで性能が向上 ・スケーリング実験でもモデルサイズをまたいで一貫した改善を確認 #LLM# #アーキテクチャ#
もっと見る
🐡 もう「どのLLMが最強か」を一つに絞って悩む時代は、終わるのかもしれません。 タイトル: Sakana Fugu Technical Report URL: Sakana AI の Fugu は、複数のフロンティア LLM を部下として束ね、タスクに応じて最適な布陣を自動で組む「指揮官(オーケストレータ)モデル」です。注目ポイントを3つに絞って紹介します。 🧭 学習された司令塔 Fugu は事前学習済みバックボーンに軽量な選択ヘッドを載せ、隠れ状態から最適なワーカーモデルをロジットで直接選びます。自己回帰生成を挟まないため、単一のフロンティアモデルを呼ぶのと同等の低遅延を保てるのが巧みです。 🕸️ ワークフローを動的に自作(Fugu-Ultra) 上位版はタスクを自然言語のワークフローとして書き下し、サブタスク分割・担当割り当て・通信戦略まで設計します。最大5ステップで討論型・逐次連鎖・木構造といった多エージェント協調を、問題ごとに組み立てます。 📊 単体モデルを超える成績 SWE-Bench Pro で 73.7 点(Claude Opus 4.8 の 69.2 を上回る)、GPQA-Diamond 95.5、LiveCodeBench 93.2 など主要ベンチで公開モデル最高水準。エージェント型コーディングでは「世代交代級」の 5〜6% の相対改善を達成しました。 巨大化ではなく賢い"指揮"で最先端へ。新しいスケーリング軸を示した一本です。 #SakanaAI# #LLM#
もっと見る
⚙️ 月125兆トークンを捌くLLM推論基盤は、どう信頼性とコストを両立しているのか。リクエスト数ではなく「モデルユニット」でコストを測り、GPUコストを80%削減しつつ安定運用を実現したDatabricksの実戦知です。 タイトル: Reliable LLM Inference at Scale URL: 📝 概要 本記事は、大規模なLLM推論を信頼性高く・コスト効率よく運用するための、Databricksのアーキテクチャと手法を解説します。GPUインフラの不安定さや、予測困難なリクエストコストといった本番特有の課題に、具体的な仕組みで対処しています。 ❓ 解決する課題 ・GPUインフラはCPUより本質的に不安定で、prefill/decodeを分離した構成では単一障害が複数ノードに波及します ・リクエストコストは事前推定が難しく、出力トークン生成がレイテンシを支配する一方、その時間は予測困難です ・高負荷時には、リクエストの組み合わせ次第で健全なサーバが突然不健全状態に陥ります 💡 方法論と提案手法 ・コストを「α×入力トークン+β×出力トークン+γ×マルチモーダル」とモデル化する「モデルユニット」抽象を導入し、係数はモデル/ハードウェアごとの自動ベンチマークで決定します ・自動シャーダーDicerが、キュー長でなくモデルユニットで測ったサーバ負荷でルーティングし、ステートフルセッションでキャッシュヒット率を高めます ・保留リクエスト数でなく「モデルユニット利用率」でオートスケールし、ピーク閾値に近づくと増設します ・ブラックボックスのヘルスチェックでサイレントハングを検知し、ヘルスチェックを最高優先度にして誤検知を防ぎます 🎯 ユースケース Superhumanやコーディングエージェント、サポートボットなど、トラフィックが数時間で急増するマルチテナントのエージェント型アプリを支えます。LLMアプリが単一テナントから共有本番環境へ移る局面に直結します。 📊 実験結果 ・コスト認識オートスケーリングで、静的なピーク見込みプロビジョニング比のGPUコストを80%超削減しました ・ヘルスチェックの誤検知を週数件からゼロへ、サイレント障害の検知・回復は5分未満に収めました ・画像処理をTorchvisionへ切り替え、OMP_NUM_THREADSをコンテナ上限に正しく設定し、同じレプリカ・負荷でスループットを3倍超に跳ね上げました ・月125兆トークンをマルチテナントで処理しています #LLM# #MLOps#
もっと見る
🌐 強いAIエージェントを作る鍵は、実は「エージェントが動く環境の設計」かもしれません。環境エンジニアリングという視点を体系化した、全63ページのサーベイです。 タイトル: Agentic Environment Engineering for Large Language Models: A Survey of Environment Modeling, Synthesis, Evaluation, and Application URL: 📝 概要 LLMエージェントは単独でなく、相互作用する「環境」の中で動きます。本サーベイは、その環境そのものを工学的に設計・構築する「環境エンジニアリング」という観点から、研究の全体像を体系化しています。 ❓ 解決する課題 これまで「環境の作り方」は断片的に語られてきました。エージェント能力の向上が良い環境設計に大きく依存するにもかかわらず、それを統一的に整理する枠組みがなかったのです。 💡 方法論と提案手法 環境を開発ライフサイクルに沿って4つの柱で分類します。 ・環境モデリング:代表的な環境の特徴づけとコア能力の評価 ・環境合成:シンボリック合成とニューラル合成の2パラダイム ・環境評価:合成パラダイムに整合したドメイン固有の評価 ・環境応用:記憶中心・ワークフロー中心・軌跡中心・探索中心という、エージェントと環境の共進化4経路 🎯 ユースケース エージェント研究者が自分の取り組みを地図上に位置づけ、抜けている観点を見つける指針になります。環境合成・評価・自己進化の設計を考える際の出発点としても有用です。 📊 トレンドと展望 ・進化のアプローチを、ニューラル駆動・難易度駆動・スケーリング駆動の3系統で整理しています ・8つの属性と8つの応用ドメインを軸に分析しています ・今後の方向性として、Environment-as-a-Service、マルチエージェント、ニューラル・シンボリック統合を挙げています #AIエージェント# #LLM#
もっと見る
🖥️ エージェントの学習用「実行環境」は軌跡の何百分の一しかない、という不均衡をひっくり返す発想の論文です。 タイトル: Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments URL: 蓄積済みのコードエージェント軌跡からファイル操作履歴を読み解き、実行可能な検証環境を自動で逆算復元し、そこから新たな学習タスクを大量に合成するフレームワークです。 注目ポイント 🔄 軌跡から環境を逆算復元 軌跡内のread/write/edit操作をリプレイして部分的なワークスペースを再現し、補完エージェントが欠けているファイルや依存関係を補います。さらに読み取り専用ツールで充分性を判定し、質の低い環境を除外します。 🌐 幅と深さの二軸でタスクを拡張 複数リポジトリの依存関係を使うCross-WS合成で「幅」を、ユーザーからの追加要望に応じるMulti-Round対話で「深さ」を広げます。Multi-Roundは平均4.51ラウンド、失敗から修正するパターンが69.6%を占めます。 📈 二桁ポイントの性能向上を実証 Qwen3.5-27Bをこのデータで学習させ、Terminal-Bench 2.1で+11.9pt、EvoCode-Bench v2で+13.8ptと大幅に改善。同規模の既存手法もすべて上回りました。 蓄積された軌跡という「余っているリソース」を検証可能な学習環境に転換する、地に足のついたスケーリング手法だと感じます。 #エージェント学習# #LLM#
もっと見る
LLM費用は1人30万円/月 コミットベースでの開発速度は3倍 #BetAIDay#
LLMで保守がめちゃくちゃ楽になったんだけど、Wineなんかも今後安定して保守できるんだろうな
LLMの能力の爆発的向上を前提にした上で、それでもなお、自分らしい言葉、表現を大切にするならば、その要求レベルは高いものにならざるを得ない。まずは、自分の人生の固有の経験を大切にすること。自分の感覚を見つめること。そして、言葉の微妙なニュアンスの違いの中で自分選択を磨くことだ。
もっと見る