登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 relatable
relatable コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
relatable を含む検索結果
あとで読む "Building Reliable Agentic AI Systems"
9ターンの会話が60個のメッセージに膨らむエージェントセッション、どこで問題が起きたか一目で追えますか? タイトル: Trajectories now in LangSmith: A readable view of every agent session URL: LangSmithに、スレッド内の全メッセージを時系列に並べ直して読みやすく見せる新機能「Trajectories」が追加されました。 注目ポイント 🔍 ネスト構造をなくした時系列ビュー サブエージェントへのハンドオフやツール呼び出し、リトライを含む複雑な実行トレースを、human・AI・toolのメッセージだけを時系列に並べた1本の流れとして提示します。ツールの無駄な再呼び出しなど、問題箇所を素早く発見できます。 👥 非エンジニアもレビューできるSME向け設計 医療の臨床問診エージェントや金融のコンプライアンス対応、サポートのエスカレーション判断などを、技術的なトレースを読まずに専門家がアノテーションキューでレビューできます。 🎓 ポストトレーニングデータとしての活用 高品質なトラジェクトリをそのまま教師ありファインチューニング用データとしてエクスポートでき、システムプロンプトからツール呼び出しまで本番の挙動をまるごと学習データ化できます。 エージェントのデバッグを、エンジニアだけでなく組織全体で担える民主化への一歩だと感じます。 #LangSmith# #AIエージェント#
もっと見る
TL;DR 信頼できるエージェントAIは「良いモデルやプロンプト」ではなく、コンテキストとオーケストレーションのハーネスを明示設計することで生まれる――Bayer×Thoughtworksの製薬システムPRINCEの実装知です。🧪 タイトル: Building Reliable Agentic AI Systems URL: ポイント 🧭 逐次エージェント+一時停止点:意図確認→Think&Plan→Researcher→Reflection→Writerの流れで段階的に検証 🔁 3種類の内省ループ:プロセス(軌道)・データ(証拠の十分性)・ドラフト(出力の完全性)で別々の失敗を捕捉 🔎 ハイブリッド検索:クエリ拡張n=5、意味0.7+キーワード0.3の加重、bge-rerankerで約20→7件に再ランク 🗃️ 構造化はText-to-SQL:SELECTのみ許可、最大3回の自己修正、1クエリ50件以下に制限 🛟 ハーネス工学:PostgreSQL/DynamoDBで状態永続化、障害点から再開、プロバイダ自動フォールバック 📌 文単位の引用+RAGASとLangfuseで評価。本番トラフィックも毎日バッチでハルシネーション検出 🏷️ NERで試験PDFから実体抽出、信頼度スコアで高信頼は自動更新・低信頼は人手レビューへ 「大きなコンテキスト窓でも選択性は要る」という割り切りが現場感あります。 #AIエージェント# #LLMOps#
もっと見る
⚙️ 月125兆トークンを捌くLLM推論基盤は、どう信頼性とコストを両立しているのか。リクエスト数ではなく「モデルユニット」でコストを測り、GPUコストを80%削減しつつ安定運用を実現したDatabricksの実戦知です。 タイトル: Reliable LLM Inference at Scale URL: 📝 概要 本記事は、大規模なLLM推論を信頼性高く・コスト効率よく運用するための、Databricksのアーキテクチャと手法を解説します。GPUインフラの不安定さや、予測困難なリクエストコストといった本番特有の課題に、具体的な仕組みで対処しています。 ❓ 解決する課題 ・GPUインフラはCPUより本質的に不安定で、prefill/decodeを分離した構成では単一障害が複数ノードに波及します ・リクエストコストは事前推定が難しく、出力トークン生成がレイテンシを支配する一方、その時間は予測困難です ・高負荷時には、リクエストの組み合わせ次第で健全なサーバが突然不健全状態に陥ります 💡 方法論と提案手法 ・コストを「α×入力トークン+β×出力トークン+γ×マルチモーダル」とモデル化する「モデルユニット」抽象を導入し、係数はモデル/ハードウェアごとの自動ベンチマークで決定します ・自動シャーダーDicerが、キュー長でなくモデルユニットで測ったサーバ負荷でルーティングし、ステートフルセッションでキャッシュヒット率を高めます ・保留リクエスト数でなく「モデルユニット利用率」でオートスケールし、ピーク閾値に近づくと増設します ・ブラックボックスのヘルスチェックでサイレントハングを検知し、ヘルスチェックを最高優先度にして誤検知を防ぎます 🎯 ユースケース Superhumanやコーディングエージェント、サポートボットなど、トラフィックが数時間で急増するマルチテナントのエージェント型アプリを支えます。LLMアプリが単一テナントから共有本番環境へ移る局面に直結します。 📊 実験結果 ・コスト認識オートスケーリングで、静的なピーク見込みプロビジョニング比のGPUコストを80%超削減しました ・ヘルスチェックの誤検知を週数件からゼロへ、サイレント障害の検知・回復は5分未満に収めました ・画像処理をTorchvisionへ切り替え、OMP_NUM_THREADSをコンテナ上限に正しく設定し、同じレプリカ・負荷でスループットを3倍超に跳ね上げました ・月125兆トークンをマルチテナントで処理しています #LLM# #MLOps#
もっと見る
名分より実利。 米国の安全保障専門家ビクター・チャ氏が提案する「東アジア安保リスク管理論」とは? 既存の枠組みを超えた現実的なアプローチで、日本周辺の地域安定をコントロールする新たな外交戦略を、4枚のカードニュースで解説します。 Card 1 The Most Realistic Roadmap to Stopping "North Korea's Nuclear Program." The "Pragmatic Security Strategy"—more reliable than mere justification—proposed by Victor Cha, a prominent U.S. hardliner and security strategist on North Korea. Card 2 Our Goal Should Be a "Realistic Nuclear Freeze" Rather Than Justification. While clinging to the premise of complete denuclearization, nuclear tech has only advanced. What is urgently needed right now is a "Nuclear Freeze" to halt further development. Card 3 A "Safety Valve" in the Name of U.S.-North Korea Dialogue. Dialogue is not a concession. It is a diplomatic brake that must be activated to control further development and testing by bringing them into a management system. Card 4 Securing Japan's Safety Through Deterrence (Defense) and Dialogue (Control)! A two-track strategy is required to drive a freeze while maintaining the robust defense of Japan, the U.S., and South Korea. This is the most pragmatic choice for Japan's national interest.
もっと見る