登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 BLACKBOX
BLACKBOX コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
BLACKBOX を含む検索結果
#大音智海# 世界初演 一人ミュージカル 『BLACK BOX』 発明家の人生を描く  10月上演 #BLACKBOX# #日豪50周年# #AUJP50# #LUNAHANA # #ミュージカル#
もっと見る
【お知らせ📢】 今日!新宿でイベントです! 当日券用意してもらえたので直接会場にお越しください♪ 初めてのハロウィン個人イベント開催! \初めましての方も大歓迎♪/ 詳細▶︎   「BRICK STUDIO(ブリックスタジオ)」
住所:東京都新宿区新宿1-12-5 Uni-works新宿御苑 B1階 (BLACKBOX³内)
  お喋りやゲーム、ビンゴ大会からチェキ会、スマホでの2ショetc... ファンミなのでいつもよりアットホームなイベントです✨気軽に会いに来てね♪
もっと見る
『NINJA WARS 〜BLACKFOX VS SHOGUN'S NINJA〜』 新宿バルト9での上映が明日6月11日までとなりますー!!! お見逃しなく〜🦈!!! #NINJAWARS#
もっと見る
ハーネスエンジニアリングのアンチパターン AP10. 観測なきブラックボックス(The Unobservable Black Box) 🎯 ポイント 失敗の原因がモデルか、プロンプトか、ツールか、コンテキストか、環境か——誰にも切り分けられない。改善が迷信と勘で行われるハーネスは、改善不能です。 ❗ 発生する課題 失敗をサブシステムに帰属できないため、何を直すべきかが分かりません。改善が迷信と勘で行われ、ハーネスの振り返りループが回らなくなります。単一指標だけを追う「指標モノカルチャー」と結びつくと、測定されていない品質が静かに犠牲になります。 🔍 メカニズムと症状 可観測性は地味なインフラ作業であり、エージェントは「だいたい動く」ため、このアンチパターンは後回しにされがちです。しかし、サブシステムに失敗を帰属できなければ、振り返りループが回せず、ハーネスは改善不能になります。さらに、単一指標(例:成功率だけ)を追うと、測られていない美徳(レビュー時間・リグレッション率・コードの保守性)が静かに犠牲になる「指標モノカルチャー」が発生します。症状としては、「なぜ失敗したか分からない」が頻発する、改善施策が「プロンプトをいじる」一辺倒になる、モデルの問題かハーネスの問題か区別がつかない、成功率は上がっているのにレビュアーの不満が増える、といった現象が見られます。 📋 シナリオ ・エージェントがタスクに失敗するが、原因がモデルの推論ミスか、コンテキストの不足か、ツールのバグか、環境の問題か誰にも分からない。チームは「プロンプトをもう少し詳しくしよう」と対症療法を繰り返す。 ・成功率を唯一の指標として追跡。成功率は80%に向上したが、成功した案件のレビュー時間が3倍に膨れ上がっていることに気づかない。 ・モデルをアップグレードしたが性能が変わらない。原因がモデルの問題なのか、ハーネスの足場が制約しているのか(AP3)切り分けられず、投資判断が迷信になる。 🛡 回避方法 ・決定・ツール呼び出し・コンテキスト変遷をトレースし、7サブシステム(知覚・行為・フィードバック・制御・記憶・ガードレール・インターフェース)に帰属可能化します ・単一指標でなく束で測定します(成功率・介入率・手戻り率・リグレッション率・コスト・レビュー時間・確信度の較正) ・モデルを固定してハーネスの変更をA/Bテストし、改善をハーネスに帰属させます ・ハーネスの可観測性を「地味だが不可欠なインフラ」として投資し、改善ループの基盤を整えてください #HarnessEngineering# #AIAgent#
もっと見る
Day34 手が届けないフリーレン先生 Frieren sensei can't reach the top of the blackboard #葬送のフリーレン# #FrierenBeyondJourneysEnd# #100daysartchallenge# #100日チャレンジ#
もっと見る
「配信率100%、スキーマ有効性100%、エラー0件」の完璧なパイプラインなのに、同じリクエストを投げ直したら判定結果が変わる。そんな衝撃の負の結果を、事前登録+完全な監査証跡つきで報告した論文です。 タイトル: Clean Engineering, Unstable Measurement: A Preregistered Reliability Failure of Black-Box LLM Observers on Shared Endpoints URL: 🔧 注目ポイント1: エンジニアリングの完璧さは測定の信頼性を保証しない 3,312件の計画済みコールで応答率・スキーマ有効性ともに100%、再試行やエラーも0件という理想的な実行にもかかわらず、繰り返しランキングの一致度(Spearman中央値)はわずか0.400。事前登録した安定性ゲート(閾値0.90)を明確に下回りました。 🎲 注目ポイント2: バイト同一の入力でも出力がドリフトする 同じリクエストを24時間後に再実行しても、全順位の一致率はわずか0.780。しかも面白いことに、同一日内の別ウィンドウ同士でも中央値0.805とほぼ同じ数値になり、これは「翌日ドリフト」ではなく共有エンドポイントの即時的な非決定性であることが判明しました。 📉 注目ポイント3: サンプル数を増やしても解決しない オブザーバー呼び出しを8回から500回(合計74.8万コール)まで増やしても、安定性ゲートの通過率は0/500のまま。候補間のスコア差がノイズフロアより7〜10桁も小さいため、そもそも順位付け不可能なタスクが多いことが根本原因でした。 LLMを評価の「ものさし」として使う前に、そのものさし自体が安定しているかを計測する重要性を教えてくれる一本だと思います。 #LLM評価# #再現性#
もっと見る