Register and share your invite link to earn from video plays and referrals.

cv usk
@cv_usk
AI / Software Research Notes AI Agent, LLMOps, MLOps, Software Architecture 投稿は個人の意見です。
Joined May 2026
270 Following    313 Followers
ターミナルエージェントの訓練データ、実は「指示・環境・解答・検証器」がバラバラで解けないタスクが量産されがち——その根本を絶つ合成フレームワークが登場しました。 タイトル: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis URL: 📌 概要 関連スキルを情報豊かなシナリオへ再構成し、環境を先に構築してその実行状態を共有の土台に。指示・解答・検証器を同じ状態に接地して生成します。 🧩 解決する課題 ・多段生成で元素材の依存や中間状態が失われる ・指示/環境/解答/検証器が食い違い、解けない・評価できないタスクになる ⚙️ 提案手法 ・7万件超のスキルを収集し5次元シナリオへ再構成 ・Dockerで環境をビルドし実状態を共有チャネルに ・指示→解答→検証器を順次生成し、失敗箇所だけをルーターが特定して修復 📊 実験結果 ・平均22.77テスト/タスクの検証済み6,078件を合成 ・Qwen3.5を微調整し4B +40.5%、9B +30.1%、27B +16.5% ・27B(47.57)が約15倍大の397B(49.06)に肉薄 ・エンドツーエンド歩留まり70%で競合の15〜28%を圧倒 質の高い実行可能タスクは、量産ではなく丁寧な状態接地から生まれる、と示す一本です。 #LLMAgents# #TerminalBench#
Show more