登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 vLLM
vLLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
vLLM を含む検索結果
長いコンテキストのLLM推論、KVキャッシュをディスクに逃がすべきかGPUで再計算すべきか、実は「常に正解」は存在しません。それを定量的に判断する仕組みを作った論文です。 タイトル: Building py-kvcache: A Performance Characterization of External KV Caching for vLLM with NVMe SSDs URL: 📝 概要 vLLM向けの外部KVキャッシュシステム「py-kvcache」を提案。io_uringによる非同期I/OでPython実装ながらSSDの読取帯域13.5GB/sをほぼフルに引き出します。 ❗ 解決する課題 既存の外部KVキャッシュ(LMCacheなど)は「いつ使うべきか」の判断基準を持たず、短いプリフィクスや高速GPUでは再計算の方が速いのに無条件にディスクから読み込んでしまう問題がありました。 ⚙️ 方法論 リクエストの待機時間中にディスク読込を先行させる「スケジューラ認識プリロード」と、TTFT改善が見込めない場合はロードを拒否する「ブレークイーブンゲート」を導入しています。 📊 実験結果 LongBenchのマルチ文書QAでGPU再計算比6.02〜7.43倍、LMCache比2.77〜3.64倍高速化。マルチターンのSCBenchでは、ネイティブvLLMのディスク読取3.4TBに対しpy-kvcacheは85GBに抑え、完了時間も1200秒超から480秒へ短縮しました。 🖥️ ユースケース H100のような高性能GPUでは外部キャッシュなしでも十分高速なのに対し、RTX 4000 Adaのような手元のGPUでは外部キャッシングが明確に有効という、ハードウェア次第の判断指針も提供しています。 #LLM推論# #vLLM#
もっと見る
LocalAIが一部の推論エンジンをPythonではなくC/C++で自作しているというブログエントリ。 ・LocalAIは基本的には既存の推論エンジンをラップして使っている ・ただ、18個のバックエンドはC/C++を使ってゼロから自作している ・理由は、数GBのPython環境への依存や特定のGPU環境への縛りを避けるため ・実際、vLLMのPython環境は9.1GBに達する ・だが、C++で移植したvllm.cppはわずか66MBの単一バイナリで済む ・しかも推論速度は元のvLLMとほぼ同等で、出力結果も完全に一致する ・とはいえ、すべてのエンジンを自作するわけではない ・各エンジンの保守コストは高く、GPU最適化で専用ライブラリに劣ることも ・llama.cppのような優秀なプロジェクトは、引き続きラップして使う
もっと見る
TL;DR 質問を待たず、毎秒「黙る/話す/委譲する」を自分で決める8BのビジョンファーストVLM。監視・実況・翻訳など“タイミングが命”のタスクで、DoubaoやGeminiに人手評価で勝ち越しました👀 タイトル: JoyAI-VL-Interaction: Real-Time Vision-Language Interaction Intelligence URL: ポイント 🟢 毎秒3値判断:(見守り)/(発話)/(背景処理へ委譲)をモデル内部で決める 🎞️ AdaCodecで予測符号化:シーン変化時だけフルViTトークン、間は約16トークンに圧縮し無限ストリームを処理 ⏱️ 時間認識:経過時間マーカー(例 <4.0 seconds>)と1Hzサンプリングで秒単位に応答を紐付け 🧠 記憶階層:短期100秒→中期500秒→長期7,500秒、vLLMプレフィックスキャッシュで2時間超もサブ秒 📊 学習:沈黙を第一級カテゴリ化、重み付きFT+GRPO(誤報や遅延を罰則化)、400万超の時刻整列クリップ 🏆 6シナリオ58ケースの人手評価で総合勝率 Doubao比77.6%/Gemini比87.9%、アラートは満点 ✨ 未学習の創発能力:画面変化のユーザー誘導やスライドからの即興プレゼンも観測 「いつ話すか」を外部トリガーでなくモデルの中に持たせる設計が、常時稼働の見守りプロダクトに効きそうだと感じます。 #マルチモーダル# #リアルタイムAI#
もっと見る
🫀・ 。 + 💗∴。 ・゚* 。 + ・   ・ 🫀 *゚。 *   ゚ *。・゚+ 。💗   ・ 。° *. ゚ . 🫀 . * 。 * 。 + 。 * +・。. 💗..+ #INIとパルす#
もっと見る
🔎97万4,980円の箱が価格.comのデスクトップ2位に入った | NVIDIAが700ドル上げた理由も、買われる理由もメモリだ $NVDA $MU 価格.comのデスクトップパソコン売れ筋ランキング、8月14日から20日の集計で2位に入っているのは97万4,980円の製品だ。1位はHPの12万5,170円のタワー。約5万件が並ぶカテゴリで、その2位にレビューは1件も無い。 NVIDIA $NVDA のDGX Spark である。GB10 Grace Blackwell Superchipを積み、FP4で1 PFLOPを出す机上のAI開発機だ。このランキングは実売台数ではなく、製品ページのアクセス数とショップへの遷移から推定した販売数を週ごとに足したものだ。税込97万4,980円は7店舗の最安値になる。それでも、10万円台が並ぶ表の2番目に100万円近い箱が座っている。 この機械の値段がメモリでいくら動いたかを、NVIDIA自身が一度だけ金額で言っている。 2026年2月、同社は開発者フォーラムに「2/23/2026 Price Change Announcement」と題した告知を出し、DGX Spark Founders Editionの希望小売価格を3,999ドルから4,699ドルへ改定した。 > The MSRP for DGX Spark (Founders Edition) has been adjusted from $3,999 to $4,699 due to memory supply constraints > (NVIDIA Developer Forums, 2026年2月) 同じ告知に、ハードウェアや構成の変更は一切ないと明記されている。既存の注文には旧価格を適用するとも書いた。中身が1バイトも変わらないまま、700ドル、率にして17.5%が乗った。 会社はどの部材とも書いていない。この機械にHBMは載っておらず、積んでいるのは128GBのLPDDR5x、273GB/sだ。スマートフォンやノートパソコンに入るのと同じ系列になる。TrendForceが5月14日に置いた見通しでは、2026年4〜6月期のLPDDR5Xの契約価格は前四半期比78〜83%高い。予測値だが、700ドルを乗せた後も同じ系列が上を向いていたことは示す。 その128GBが、いま買われている理由でもある。 Poolsideのコーディングモデル Laguna S 2.1 は、総パラメータ117.6B、1トークンあたり8.5Bが動くMoEだ。NVFP4に量子化した重みは約71GB。Hugging Faceのモデルカードは、これが128GBの1台で動くと書く。vLLMでNVFP4のまま回した生成速度は、コードで毎秒22〜24トークンだ。71GBを載せるのに64GBでは届かない。128GBという刻みが要る。値上げの理由に会社が挙げたのはメモリで、買う理由になっているのもメモリの容量だ。 日本の店頭も動いた。日経クロステックは4月27日に「販売店にもよるが、2026年3月末時点では大体70万〜80万円といったところだ」と書いている。その5か月弱あとの最安値が97万4,980円だ。希望小売価格は2月の改定以降4,699ドルのままで、その後の改定は公表されていない。パソコンの値段は普通、発売から時間が経つほど下がる。 700ドルの反対側にいるのがMicron $MU だ。5月28日に締めた四半期で、スマートフォンとPC向けを合算したMobile and Client Business Unitの売上は115億2,100万ドル、全社414億5,600万ドルの27.8%を占めた。前年同期は32億5,500万ドルで、セグメントの粗利率は24%から87%へ動いている。LPDDR5X単体の採算ではない。ただし同四半期の製品ハイライトには、1-gamma 16Gb LPDDR5Xの量産立ち上げが並ぶ。量産している主な会社はSamsung、SK hynix、Micronの3社で、四半期ごとにドル建てで数字が出るのはMicronだ。 決算の設備投資額は、数量と単価を分けて書かない。買った側の損益計算書では、多く買ったぶんも、同じ量を高く買ったぶんも、一つの金額に溶ける。 分けて読める数字が一つだけ、店頭にある。中身は変えていないと会社自身が書いた製品に乗った700ドルだ。 崩れる場所もはっきりしている。8月末に締まるMicronの第4四半期でMobile and Client Business Unitの粗利率が87%から落ち、同じ時期にDGX Sparkの店頭価格も緩むなら、主導権は売り手から買い手へ動き始めている。粗利率は製品構成でも動くので、片方だけでは決まらない。 それまでは、増えた投資額のどこまでが同じ量への値上げなのかを、決算より先に机の上の値札が教える。 🤘情報提供 Stock Slayer :
もっと見る
AIエージェントの回答を「検証可能で説明できる事実」に根拠づける——ナレッジグラフ+GraphRAG+エージェントのフルスタックをまるごとオープンソースで提供する基盤です🕸️ タイトル: trustgraph-ai/trustgraph URL: 🕸️ 概要 AIエージェントのためのオープンソースのセマンティック・デプロイメント基盤です。コアは「コンテキストグラフ」(ドメイン知識を構造化しクエリ可能にした表現)。コンテキストグラフ・メモリ・検索・オーケストレーション・推論を、決定論的なエージェント向けにフルスタックで提供します。 ❓ 解決する課題 LLM単体では、なぜその答えになったのかを辿りにくく、ハルシネーションのリスクもあります。 ・エージェントの回答を、検証可能で説明可能な事実に根拠づけるのが難しい ・TrustGraphはナレッジグラフ構築とGraphRAGを組み合わせ、意味的に豊かで検証可能なコンテキストにアクセスできるようにします ・しかも主権的に管理できるプライベート環境で実現します 💡 主な特徴 ・マルチモデルDB(表・KV・ドキュメント・グラフ・ベクトル)とマルチモーダル対応、エンティティ/関係の自動抽出 ・DocumentRAG・GraphRAG・OntologyRAGのパイプラインと、3D GraphVizによる可視化 ・単一/マルチエージェント、ReAct・Plan-then-Execute・Supervisorパターン、MCP統合 ・Context Cores:スキーマ・グラフ・埋め込み・エビデンス・検索ポリシーを束ね、コンテキストをコードのようにバージョン管理 🌍 技術スタック / 使い方 ストレージはCassandra・Qdrant・Garage、メッセージングはPulsar等、LLMはAnthropic/OpenAI/Google等+ローカル推論(vLLM/Ollama等)に対応。npx @trustgraph/configで構成し、ポート8888のUIから利用できます。Apache 2.0ライセンスです。 #GraphRAG# #ナレッジグラフ#
もっと見る
💡HBFを積んだGPU1枚が、HBM8枚ぶんのモデルを丸ごと抱えられる | 同じ金額と電力で並べ直すと帯域は6割弱だ $SNDK HBFを積んだGPUが1枚、同じく4枚、そしてHBMを積んだGPUが8枚。SanDiskが8月13日の投資家説明会で見せた比較図には、この3つが並んでいる。1枚対8枚は同じモデルを走らせるのに要る最小構成の差で、会社はこれを設備投資効率8倍と呼んだ。4枚が8枚に並ぶのはトークンの出力量のほうで、こちらはGPU効率2倍。どちらも社内試験の数字で、グラフにトークン毎秒の目盛りは入っていない。 Hot Chips 2026で、同じ技術に別の問いを立てた数字が出た。 出したのはOxmiq Labs。Intelのチーフアーキテクトを務めたRaja Koduriが作った会社で、売っているのはライセンス提供のチップアーキテクチャとソフトウェアであって、メモリではない。 問いはこうだ。同じ金額と同じ電力を使うなら、トークンはどちらが安く出せるか。 条件はGPU 72枚のラック1本、1兆パラメータのKimi-K2をFP4で走らせ、入力100万トークン・出力1,000トークンのデコード中心。HBMだけで組むと容量20.7TB、帯域の合計1,584TB/s。同じ金額と電力でHBFに置き換えると、容量は294.9TBへ約14倍に増え、帯域合計は922TB/sへ6割弱に下がる。混ぜると89.3TBで、帯域は条件次第で279〜1,418TB/sに散る。 容量が枚数を決めているうちは、HBFの側が勝つ。HBFなら1枚でKimi-K2を丸ごと抱えられるので、ラック1本に72インスタンスが入る。HBMだと1インスタンスに8枚要るから9インスタンスで止まり、束ねた8枚の演算は容量のために遊ぶ。ここまではSanDiskの図と同じ向きだ。 向きが変わるのは、同時に使う人と1秒あたりの生成量が増えたときだ。帯域が律速になった時点から、トークン1個あたりの原価はHBMの側が下になる、というのがOxmiqの試算である。安くなるのは1ギガバイトの値段であって、1トークンの値段ではない。 Oxmiqの結論は一行に収まっている。ラックにはHBM、箱にはHBF。 SanDiskは投資家説明会で3つの置き方を並べていた。HBMを補う、HBMの枠をそのまま置き換える、そして切り離してデコードの重みとKVキャッシュを持たせ、小さいHBMをキャッシュに使う。Oxmiqが残したのは3つ目に近い。HBFが引き取るのはホスト側のDRAMが持っていた分で、そこへ回すのはMoEのエキスパートとKVキャッシュだ。Oxmiqが例に挙げたKimi-K3は、重み1.56TBのうち1.45TB、93%がエキスパートの重みで、トークンごとに呼ばれるのはその一部にすぎない。 置き分けはソフトウェアの仕事になる。最大の帯域を出すには64KB単位で読み、1MB単位で書く。データはDMAで動かすので、CPUやGPUのキャッシュ階層を通らない。どの重みをHBMに残しどれをHBFへ回すかも、書き換え寿命の残りも、ホスト側が管理する。Chips and Cheeseはこれを、ホストのソフトウェアがSSDコントローラの仕事を引き受けることだと書いた。vLLMには専用の実装が要る。 その実装を出すのは、仕様を書いた2社ではない。HBMとHBFの間でデータを動かす仕組みはドライバとランタイムの層にあり、そこを持っているのはNVIDIAとAMDだ。Oxmiqの見立てでは利点が一部の用途に限られるので、メモリ階層をもう一段抱える手間を負ってまで全面的に支える理由は、両社の側に強くない。 SanDiskの直近四半期(7月3日締め)の売上は89億6,500万ドル、研究開発費は3億4,800万ドルだった。HBFが生んだ売上はまだ1ドルもない。8月13日に見せたのはダイのテープアウトで、推論製品のサンプルは2027年に置いてある。1年前の同社は、最初のHBFサンプルを2026年後半、HBFを使う推論機器を2027年前半と言っていた。 仕様を書いたもう一方はSK hynixで、こちらはHBMも売っている。ラックにHBMが残る限り、SK hynixはそこでも売る側に立つ。SanDiskはHBMを売っていない。 だから2027年のサンプルより手前に、見えるものがある。vLLMにHBF用の割り当てと配置が入るか。NVIDIAとAMDが、HBMとHBFの間のデータ移動をドライバで出すか。歩留まりも積層も耐久性の認定もSanDiskの側に残っているが、この2つが動かない限り、そこを越えても採用は広がらない。 🤘情報提供 Stock Slayer :
もっと見る