登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ピークアウト
ピークアウト コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ピークアウト を含む検索結果
「東京は人口が増えている」と言われているが、実質は、外国国籍の方を抜くと、0.4%しか増えてない。 しかも増えている年齢層は「高齢者」。 東京でも15歳〜44歳は2.5%減っている。 団塊世代が後期高齢者になり、日本の高齢者はピークになり、地方はピークアウトして、高齢者が減りつつあるところも多い。 高齢者に向けた施設や建物も、今後は余っていく。
もっと見る
# AIエージェント開発の意思決定ポイント # タイムアウト|Timeout 🎯 ポイント 「全部30秒」のタイムアウト、まだ使っていませんか? AIエージェントでは、ツール呼び出しは数秒、LLM推論は数十秒、セッション全体は数十分。レイテンシ特性が全く異なる操作が組み合わさるため、一律のタイムアウトでは機能しません。層ごとに分けるのが第一歩です。 📋 概要 タイムアウトは、エージェントが特定の操作の完了を待つ最大時間を制御するダイヤルです。従来のWebサービスではHTTPリクエストに30秒程度を設ければ済みましたが、AIエージェントでは1リクエストが長く、レイテンシのばらつきが大きく、プロバイダの可用性も不安定です。 タイムアウトが短すぎると一時的な遅延で正常な処理を殺し、長すぎると障害を隠蔽してリソースを無駄に占有します。操作クラスごとにタイムアウトを分け、さらに観測データに基づいて動的に調整する仕組みが理想です。 🔍 意思決定のポイント タイムアウトの値はlatency_budget(ユーザーや下流システムがどれだけ待てるか)を最も強く反映します。少なくとも3層に分けて設定するのが基本です 📐 1. ツール呼び出し層 — 外部API・DB・ファイル操作。ツール種別ごとにさらに細分化も 2. LLM推論層 — 入力トークン数とモデル負荷で大きく変動。小型/大型モデルで応答時間が10倍異なることも 3. セッション全体層 — 「ユーザーがこのタスクに何分待てるか」から逆算 各操作のP99(99パーセンタイル)を観測し、安全係数1.5〜2.0倍を掛けた値が出発点です。P99がまだない立ち上げ初期は目安値から始め、1〜2週間の運用データで切り替えます。 💡 要点と詳細 目安値 📊 - ツール呼び出し(一般) → 10〜30秒。DBクエリは5秒でも長い場合あり - LLM推論(全体) → 60〜120秒。長文生成タスクは上限引き上げ - LLM推論(トークン間) → 5〜15秒。ストリーミング時のプロバイダ障害早期検出に有効 - LLM推論(TTFT) → 15〜30秒。入力が長いほど延びる - セッション全体 → 数分〜数十分。対話型は短く、調査・分析型は長く ストリーミングを使う場合は、全体タイムアウトよりトークン間タイムアウトの方が本質的な監視指標です 🔍 正常な推論では数百ミリ秒〜数秒間隔でトークンが返るため、15秒の無応答はプロバイダ側の異常を強く示唆します。 ⚖️ トレードオフ タイムアウトが短すぎると、複雑な推論タスクでLLMが高品質な回答を生成している途中で処理が中断されます ⏱️ Chain of Thoughtが深くなる正当なケースや、大量コンテキストの入力処理中にタイムアウトすることも。ピーク時のプロバイダ遅延で断続的に失敗し、リトライの連鎖が始まります。 タイムアウトが長すぎると、プロバイダが応答しないまま数分間スレッドが占有され、他のリクエストが詰まります 🚫 ハングしたツール呼び出しが放置され、ユーザーは「いつ終わるか分からない」最も苦痛な状態に。障害の検出も遅れます。 タイムアウト値の変更はリトライ戦略に直結します。短くすれば発火頻度が上がり、リトライが増えます。リトライ予算やセッション全体の予算と一体で調整する必要があります。 🛠️ ユースケース 対話型チャットアシスタント 💬 ユーザーが数秒以内の応答を期待。ツール3〜5秒、LLM推論15〜30秒(ストリーミングで即座にトークンを返し始める)、セッション全体60〜120秒。体感レイテンシの短縮にストリーミングが効果的です。 調査・分析エージェント 🔬 数分の処理が許容される。ツール10〜60秒、LLM推論60〜180秒、セッション全体5〜30分。タイムアウトよりコスト・ステップ数の予算が主要な制約に。 自動コードレビューエージェント 💻 大きな差分では入力トークンが数万に達し、TTFTが延びる。入力トークン数に応じてTTFTタイムアウトを動的に調整する仕組みが有効です。 タイムアウトとキャンセルは異なります ⚠️ タイムアウトはクライアント側で待つのを止めるだけで、プロバイダ側の処理は続行されている可能性があります。課金はプロバイダ側の処理量に基づくため、キャンセルリクエストも送信することを推奨します。 #AIエージェント# #ソフトウェアアーキテクチャ#
もっと見る
MindLabとFudan大学が「LongStraw」という手法を発表した(https://arxiv[.]org/pdf/2607.14952)。GPUの台数を増やさずに、210万トークンを超える長い文脈で強化学習の事後学習(RL post-training、学習済みモデルをさらに強化学習で仕上げる工程)を回せるようにする実行方式。 背景にはギャップがある。推論(学習済みモデルを動かして応答を作る段階)のcontext長は100万トークン級に近づいているのに、事後学習は256Kトークン以下にとどまりがち。AIエージェントは観察結果やツールの出力、それまでの判断を溜め込みながら動くため、この差が特に効いてくる。 原因はGRPO(複数の応答をグループ内で相対比較して学習する強化学習の手法)特有の事情。同じ長いプロンプトに対して複数の応答をスコアリングし逆伝播する必要があるため、プロンプト分と応答分の計算グラフを同時にGPUメモリへ抱え込んでしまう。LongStrawは共有プロンプトを最初に1回だけ勾配計算なしで評価し、あとで必要になる状態だけを残す。そのうえで短い応答を1本ずつ勾配ありで組み立てては逆伝播後すぐ解放し、次の応答に進む。プロンプトと全応答を同時に抱えなくてよくなる代わりに、再生の分だけ処理時間は増える。 これを構造の異なる2つのモデルに実装している。再帰的に状態を更新する層(GDN)と通常のattention層を組み合わせたQwen3.6-27Bでは、8台のH20 GPUだけで約210万トークンの文脈をグループサイズ2および8で処理でき、グループサイズを2から8へ4倍にしてもピークメモリはわずか0.21GB(0.213%)しか増えない。別のストレステストでは約446万トークン(4,456,448)まで到達した。KV情報を圧縮して保持するMLAと、限られた候補だけに注意を絞る疎attention(DSA)を組み合わせ、専門家混合(MoE)も使うGLM-5.2でも、32台のH20 GPUで約210万トークンの文脈を全78層にわたって処理できることを確認している。 面白いのは「動いた」ことと「正しく学習できる」ことをはっきり切り分けて報告している点。プロンプト側の勾配はあえて切り離している。Qwenは複数GPU間で、注意機構の鍵と値にあたるK/Vに由来する勾配の同期が、追加学習パラメータ(LoRA)については完了していない。GLMも疎attentionの候補選択が各GPU内で閉じたままになっている。論文自身が、これは実行できたことの証拠であって正しい分散学習の証明ではないとはっきり書いていて、GPUを増やすスケールアウトの路線とは逆に、決まった台数でどこまで粘れるかを検証しつつ限界も隠さず書いている姿勢に好感が持てる。
もっと見る
ピークデザインから新シリーズ「シティライン」が登場! 日常に馴染むミニマルな質感にブランドのDNAである高い機能性はしっかりと担保 バックパック(15L/22L) トート(15L) クレセント(6L/12L) スリング(2L) エブリデイラインとの違いや国内価格をまとめました
もっと見る
【海開きピーク】11海水浴場で海開き 根浜海水浴場もにぎわう
スノーピークのステンレス製の保冷剤。コンパクトだけど素早くキンキンに冷えます
発行枚数がピークの4分の1でもマイナカード予算膨張、1枚2000円超の国費発行に財務省が「待った」→2027年度は約445億円、前年比ならぬ前年度比で70億円増を要求 月480万枚の発行能力を維持したまま、実績とのズレが膨らんでいます。
もっと見る