登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Inference
Inference コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Inference を含む検索結果
便利だけど知られていないGemini APIの機能 🔄 レイテンシは多少ブレてもいいから、とにかくコストを抑えたい。そんなワークロードありませんか? Geminiの「Flex inference(フレックス推論)」は、低コストでレイテンシが変動する推論ティアです。リアルタイム性よりコスト効率を重視するワークロードに最適な選択肢です。 📌 タイトル:Flex inference(フレックス推論) 🔗 URL: 🧩 概要 通常の推論ティアはレイテンシの安定性を優先しますが、すべてのタスクにそれが必要なわけではありません。Flex inferenceは空きリソースを活用して処理するため、応答時間にブレがある代わりに低コストで利用できます。バッチAPIほどの遅延はなく、かといって通常ティアほどの即時性も求めない「ちょうどいい」位置づけです。 🛠 使い方 リクエスト時に推論ティアとしてFlexを指定するだけ。APIの呼び出し形式やレスポンス形式は通常と同じなので、既存コードの変更はティア指定の追加のみで済みます。レイテンシが許容範囲内かを事前にテストしてから本番導入するのがおすすめです。 🏗 本番システムへの組み込み方 ・バックオフィス処理:社内向けの要約・分類タスクなど、ユーザーが画面の前で待たない処理に。 ・非同期ワーカー:キューから取り出して処理するワーカーで、多少の遅延が許容される場面に。 ・開発/ステージング環境:本番前のテストや実験で、コストを気にせず大量にリクエストを投げたいとき。 ・コンテンツの下書き生成:即座に公開しない下書きや素案の生成に。 💡 ユースケース 📋 社内向けの非リアルタイム処理 🔧 非同期キューベースのワーカー処理 🧪 開発・テスト環境での大量実験 📝 公開前の下書き・素案生成 ⚠️ 注意点 レイテンシが変動するため、ユーザーが応答を待つ対面的なUI(チャットbot等)には不向きです。ピーク時にはレイテンシが大きく伸びることもあるため、SLAが求められる場面ではPriority inferenceの方が適切です。コスト削減の効果は利用パターンによって異なるので、まずは計測から。 ✨ すべてのリクエストに最高速の推論は要りません。コストが効く場面を見極めて、Flexで賢く使い分けてみてください。 #Gemini# #LLM#
もっと見る
⚙️ 月125兆トークンを捌くLLM推論基盤は、どう信頼性とコストを両立しているのか。リクエスト数ではなく「モデルユニット」でコストを測り、GPUコストを80%削減しつつ安定運用を実現したDatabricksの実戦知です。 タイトル: Reliable LLM Inference at Scale URL: 📝 概要 本記事は、大規模なLLM推論を信頼性高く・コスト効率よく運用するための、Databricksのアーキテクチャと手法を解説します。GPUインフラの不安定さや、予測困難なリクエストコストといった本番特有の課題に、具体的な仕組みで対処しています。 ❓ 解決する課題 ・GPUインフラはCPUより本質的に不安定で、prefill/decodeを分離した構成では単一障害が複数ノードに波及します ・リクエストコストは事前推定が難しく、出力トークン生成がレイテンシを支配する一方、その時間は予測困難です ・高負荷時には、リクエストの組み合わせ次第で健全なサーバが突然不健全状態に陥ります 💡 方法論と提案手法 ・コストを「α×入力トークン+β×出力トークン+γ×マルチモーダル」とモデル化する「モデルユニット」抽象を導入し、係数はモデル/ハードウェアごとの自動ベンチマークで決定します ・自動シャーダーDicerが、キュー長でなくモデルユニットで測ったサーバ負荷でルーティングし、ステートフルセッションでキャッシュヒット率を高めます ・保留リクエスト数でなく「モデルユニット利用率」でオートスケールし、ピーク閾値に近づくと増設します ・ブラックボックスのヘルスチェックでサイレントハングを検知し、ヘルスチェックを最高優先度にして誤検知を防ぎます 🎯 ユースケース Superhumanやコーディングエージェント、サポートボットなど、トラフィックが数時間で急増するマルチテナントのエージェント型アプリを支えます。LLMアプリが単一テナントから共有本番環境へ移る局面に直結します。 📊 実験結果 ・コスト認識オートスケーリングで、静的なピーク見込みプロビジョニング比のGPUコストを80%超削減しました ・ヘルスチェックの誤検知を週数件からゼロへ、サイレント障害の検知・回復は5分未満に収めました ・画像処理をTorchvisionへ切り替え、OMP_NUM_THREADSをコンテナ上限に正しく設定し、同じレプリカ・負荷でスループットを3倍超に跳ね上げました ・月125兆トークンをマルチテナントで処理しています #LLM# #MLOps#
もっと見る
Boomi、「Coupa Inspire World Tour Tokyo」にInfluencer Partnerとして協賛
韓国ソウルで開催された アジア7ヵ国400名以上が参加する AIF「Asia Influencer Festival」にて "アジアスター賞"を 受賞させて頂くことができました🖤🖤 まさかこういった賞を頂ける日が 来るとは想像もしていなかったので 本当に嬉しい気持ちでいっぱいです😭 これからもこういった素晴らしい賞を 頂けるように全ての活動に全力で 取り組んでいきたいと思います🙏🏻✨
もっと見る
❣️萌名プロジェクト第3弾❣️ 8/29韓国にて開催される Asia Influencer Festival 「AIF」で 受賞されることとなりました🥹✨✨ 当日はファッションショーにも 出演させていただきます👗 そして......最後に デビュー曲の「ずっと一緒に」も 歌唱させていただきます✨
もっと見る