ターミナルエージェントの訓練データ、実は「指示・環境・解答・検証器」がバラバラで解けないタスクが量産されがち——その根本を絶つ合成フレームワークが登場しました。
タイトル: FACET: Preserving Source Intent and Executable State in Terminal Task Synthesis
URL:
📌 概要
関連スキルを情報豊かなシナリオへ再構成し、環境を先に構築してその実行状態を共有の土台に。指示・解答・検証器を同じ状態に接地して生成します。
🧩 解決する課題
・多段生成で元素材の依存や中間状態が失われる
・指示/環境/解答/検証器が食い違い、解けない・評価できないタスクになる
⚙️ 提案手法
・7万件超のスキルを収集し5次元シナリオへ再構成
・Dockerで環境をビルドし実状態を共有チャネルに
・指示→解答→検証器を順次生成し、失敗箇所だけをルーターが特定して修復
📊 実験結果
・平均22.77テスト/タスクの検証済み6,078件を合成
・Qwen3.5を微調整し4B +40.5%、9B +30.1%、27B +16.5%
・27B(47.57)が約15倍大の397B(49.06)に肉薄
・エンドツーエンド歩留まり70%で競合の15〜28%を圧倒
質の高い実行可能タスクは、量産ではなく丁寧な状態接地から生まれる、と示す一本です。
#
LLMAgents# #
TerminalBench#