登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AI4AI_Bench
AI4AI_Bench コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AI4AI_Bench を含む検索結果
🧩 AIエージェントに足りないのはモデルの賢さではなく「現場のノウハウ」だった、という論文です。 タイトル: Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills URL: ❓ 自律型研究エージェントには何が欠けているのですか 💡 「モデル」と「実行ハーネス」の2層だけでは、適切な手法の選び方やAPIの使い方、実装の落とし穴といった運用知識が抜け落ちています。この論文はこれを第三の層として明示的に扱います。 ❓ その知識をどうやって手に入れるのですか 💡 GitHubリポジトリや論文を「Scope→Ground→Construct→Verify」の4段階で処理し、検証済みの「スキル」として蒸留します。1,000リポジトリと153論文から5,353個のスキルを構築しました。 ❓ スキルを使うと実際どれくらい変わるのですか 💡 同じGPT-5.5・同じハーネスのまま、スキルを追加するだけでMLE-benchは31.11%から72.89%へ、PaperBench・FrontierCS・PassNetでも軒並み改善しました。高難度タスクでは4倍以上のスコア向上も見られます。 ❓ 単にリソースを増やしただけではないのですか 💡 トークン数やツール呼び出し回数と改善幅の相関はほぼゼロで、Claude Opus 4.8構成より少ないトークンで高いスコアを出しています。知識そのものが効いているといえます。 #AIエージェント# #機械学習#
もっと見る
大きなモデルの賢さを、小さなモデルへ「再訓練なし」で移せる——しかも推論のその場で。そんな新しい能力転移の研究です。 タイトル: AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses URL: ❓ 蒸留と何が違うの? 💡 蒸留はターゲットの重みを訓練で更新します。本研究は重みを一切いじらず、強いビルダーモデルが推論時の「足場(ハーネス)」を組んで弱いモデルの実行を助けます。能力を推論環境ごしに転移させる発想です。 ❓ 足場って具体的に何をするの? 💡 主に3つです。 ・不安定な推論を決定的なコードに置き換える ・問題の種類ごとに戦略を振り分けるルーティング ・回答を確実にパースする厳格なフォーマット強制 ❓ どれくらい効くの? 💡 心の理論ベンチ4種で、GPT-5.4-miniの精度が0.49から0.91へほぼ倍増。全11ビルダー設定がベースラインを超えました。弱いモデルほど伸びしろが大きく効く一方、すでに強いモデルには逆効果になることもあります。 ❓ 成否を分けるのは? 💡 検証データを大量に探ることではなく、ビルダー自身の推論品質でした。強いビルダーは「タスク能力のコンパイラ」として、一度の推論で構造を手続き化します。 #AIAgents# #TestTimeScaling#
もっと見る
『なぜあなたの感想はふつうなのか』(大島育宙 大和書房)あっという間に読了! 言語化言語化でお腹いっぱい、AIAIでお腹いっぱいになった時こそ読むべき良書だと感じました。 自分の言葉で語ること、大事です。
もっと見る
【9/21(土)22(日)23(祝)3️⃣DAYS開催!】 🔥近代麻雀水着祭ファイナル🔥 👙出演者第4️⃣弾発表❕ ✨犬乃かりん @inu_cats0123 ✨雛なの @nano_cats0923 ✨七森あむり @amuri_cats0108 ✨櫻井みお @mio_cats0520 ✨佐野るか @ruka_aiai #いかなきゃキンマー# #近代麻雀水着祭2024ファイナル#
もっと見る