登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 FLOP
FLOP コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
FLOP を含む検索結果
flip-flops、新曲「3nough?」をリリース エレクトロを基盤に、ギターリフと自由なボーカルのアプローチを発展させた複雑でスピード感のある一曲。輪郭を曖昧にしたボーカルが独特の没入感を与える。吉祥寺の<武蔵野万博2026>への出演も決定 @fareast_emo @friends_hipland
もっと見る
渋原FES in SHIBUYA SUMMER PARK 2026 ✨DAY3 -MAIN STAGE-✨ FLOP FLOW ( @FLOP_FLOW_ ) ご出演いただきありがとうございました! #渋原FES# #MAINSTAGE# #SHIBUYASUMMERPARK2026#
もっと見る
⚡ TL;DR: あなたのモデル、ハードの限界に対して「あと何倍」速くできるか即答できますか? SOLARはPyTorch/JAXのコードから理論上の最速値(Speed-of-Light)を自動かつ検証付きで導き出します。 タイトル: SOLAR: AI-Powered Speed-of-Light Performance Analysis URL: 📌 ポイント ・🤖 LLMがコードを中間表現に翻訳→元コードと数値比較で正しさを検証する「生成して検証」方式 ・🧮 添字(einsum)構造だけから計算量とメモリ往復量を閉形式で算出する決定論的バックエンド ・🎚 非融合・融合・キャッシュ考慮の3段階でルーフライン上限を多段解析 ・✅ KernelBench 270問で演算子カバレッジ100%、SOL違反ゼロ(既存FLOPカウンタは75〜84%) ・🚀 ヘッドルームはL3で最大54.6倍、融合解析でさらに7.8倍の余地を発見 ・🦾 Jetson Thor上のロボット3モデルは全てメモリバウンド、500Hz制御には現状の19.7倍の帯域が必要 ・🔄 逆ルーフラインで目標レイテンシに必要な最低ハード性能を逆算 🌍 一言: 生成AIの柔軟さと数式計算の厳密さを組み合わせ、性能チューニングとハード選定を実機なしで加速できる実用的な土台だと感じます。 #DeepLearning# #Performance#
もっと見る
🚀 100万トークンのコンテキストを扱いながら、KVキャッシュを従来の4分の1まで絞り込んだモデルが登場しました。DeepSeekの新作です。 タイトル: DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression URL: 💡 概要 552Bパラメータのマルチモーダルなミクスチャー・オブ・エキスパート(MoE)モデルで、長時間稼働するエージェント向けの「入力ヘビー」なワークロードを見据え、アーキテクチャと精度の両面からKVキャッシュを徹底的に圧縮しています。 🎯 解決する課題 長いコンテキストを扱うエージェントでは、プレフィル計算だけでなく、永続的なKVキャッシュがGPUメモリ・SSD・I/O帯域幅を圧迫し、デプロイコストの主なボトルネックになっていました。 🛠 方法論と提案手法 前半20層をエンコーダ、後半20層をデコーダとするCausal Encoder-Decoder構造でプレフィル計算量を半減。3モードで層間KVを再利用するCompressed Sparse Attention 2、候補プールに絞った階層型疎インデクサ、FP4量子化などを組み合わせています。 📊 実験結果 グローバルKVフットプリントは1トークンあたり890バイトでV4-Flashの約4分の1、永続KVは約8分の1に削減。コンテキストを4Kから100万へ256倍拡張してもデコードFLOPsは1/4しか増えません。HumanEval 79.4%など主要ベンチマークでも性能向上を確認しています。 #LLM# #KVキャッシュ#
もっと見る
深層学習の歴史を振り返ると、AlexNetが「手作業で工程を分けるより、入力から出力まで丸ごと1つのモデルで学習させる(end-to-end)方が強い」ことを示したのが革命の始まりだった。ところが生成AIだけはこの流れに乗り切れていない、という指摘から始まる論文が公開された(https://arxiv[.]org/html/2607.27372v1)。 拡散モデルや自己回帰モデル(要素を1つずつ順番に予測して生成するモデル)など、今の生成AIはどれも「生成の手順を細かいステップに分解する」ことで動いている。拡散モデルなら、ノイズだらけの画像を少しずつクリアにしていく数百ステップだ。これは「1つの入力に無数の正解がありうる」多峰性(複数の正解パターンがある)分布を、各ステップではほぼ一意な予測に絞り込むための工夫だが、この分解のせいで学習時(1ステップだけ予測)と推論時(数百ステップ繰り返す)でやっていることが食い違い、end-to-end(学習と推論の手順を完全一致させる訓練方式)にはなっていなかった。 この論文の「Explorative Modeling(探索的モデリング)」は逆転の発想で、生成の手順は分解せず学習ループ自体を分解する。各学習ステップでモデルに複数の候補を生成させ、正解データに一番近いものだけを使って学習する(best-of-k方式)。候補が1個だとモデルの最善手はすべての正解の平均になりぼやけた画像しか出せないが、候補をk個に増やすとそれぞれが別々の正解パターンを担当できるようになる。論文中の犬画像の比較が分かりやすく、候補1個ではほぼ完全にぼやけた模様、候補50個まで増やすと元画像とほぼ見分けがつかない鮮明さになっている。 この「探索の量」はパラメータ数・データ量に続く第三のスケーリング軸として機能し、画像・動画・言語のすべてで性能が単調に向上する。しかも効果はスケールが大きくなるほど強く、データ量を増やした場合の改善幅は7%から36%へ、モデルサイズを増やした場合は13%から23%へ拡大した。効率面ではFLOP(計算量)効率が4.1倍、サンプル効率が6.2倍、パラメータ効率が47%改善し、最強の画像生成レシピではImageNet 256×256でガイダンスなし1.43 FID(生成画像の品質指標、小さいほど良い)というほぼ最先端の性能に到達している。動画生成では過学習も抑えられ、FVD(動画品質指標、小さいほど良い)の最良値が探索なしの37.5から探索ありで30.0まで改善した。 さらにロボット制御タスクでは単体のend-to-end生成モデルとしても機能し、拡散モデルベースの手法と同等の性能を推論ステップ数16分の1から256分の1で達成した。数百回繰り返していた予測が、たった1回の計算で済むことになる。
もっと見る