登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ReFLiA
ReFLiA コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ReFLiA を含む検索結果
あとで読む "Building Reliable Agentic AI Systems"
TL;DR 信頼できるエージェントAIは「良いモデルやプロンプト」ではなく、コンテキストとオーケストレーションのハーネスを明示設計することで生まれる――Bayer×Thoughtworksの製薬システムPRINCEの実装知です。🧪 タイトル: Building Reliable Agentic AI Systems URL: ポイント 🧭 逐次エージェント+一時停止点:意図確認→Think&Plan→Researcher→Reflection→Writerの流れで段階的に検証 🔁 3種類の内省ループ:プロセス(軌道)・データ(証拠の十分性)・ドラフト(出力の完全性)で別々の失敗を捕捉 🔎 ハイブリッド検索:クエリ拡張n=5、意味0.7+キーワード0.3の加重、bge-rerankerで約20→7件に再ランク 🗃️ 構造化はText-to-SQL:SELECTのみ許可、最大3回の自己修正、1クエリ50件以下に制限 🛟 ハーネス工学:PostgreSQL/DynamoDBで状態永続化、障害点から再開、プロバイダ自動フォールバック 📌 文単位の引用+RAGASとLangfuseで評価。本番トラフィックも毎日バッチでハルシネーション検出 🏷️ NERで試験PDFから実体抽出、信頼度スコアで高信頼は自動更新・低信頼は人手レビューへ 「大きなコンテキスト窓でも選択性は要る」という割り切りが現場感あります。 #AIエージェント# #LLMOps#
もっと見る
「配信率100%、スキーマ有効性100%、エラー0件」の完璧なパイプラインなのに、同じリクエストを投げ直したら判定結果が変わる。そんな衝撃の負の結果を、事前登録+完全な監査証跡つきで報告した論文です。 タイトル: Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints URL: 🔧 注目ポイント1: エンジニアリングの完璧さは測定の信頼性を保証しない 3,312件の計画済みコールで応答率・スキーマ有効性ともに100%、再試行やエラーも0件という理想的な実行にもかかわらず、繰り返しランキングの一致度(Spearman中央値)はわずか0.400。事前登録した安定性ゲート(閾値0.90)を明確に下回りました。 🎲 注目ポイント2: バイト同一の入力でも出力がドリフトする 同じリクエストを24時間後に再実行しても、全順位の一致率はわずか0.780。しかも面白いことに、同一日内の別ウィンドウ同士でも中央値0.805とほぼ同じ数値になり、これは「翌日ドリフト」ではなく共有エンドポイントの即時的な非決定性であることが判明しました。 📉 注目ポイント3: サンプル数を増やしても解決しない オブザーバー呼び出しを8回から500回(合計74.8万コール)まで増やしても、安定性ゲートの通過率は0/500のまま。候補間のスコア差がノイズフロアより7〜10桁も小さいため、そもそも順位付け不可能なタスクが多いことが根本原因でした。 LLMを評価の「ものさし」として使う前に、そのものさし自体が安定しているかを計測する重要性を教えてくれる一本だと思います。 #LLM評価# #再現性#
もっと見る