登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Framework
Framework コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Framework を含む検索結果
WWDC26 What’s new in the Foundation Models framework みはじめた。Foundation Modelsの進化すごいね... #wwdc26#
AIが自律的に論文を書く時代、「幻引用・メソッドとコードの不整合・再現不可能なスコア」という信頼性の危機が深刻化しています。 タイトル: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence Google CloudのScience One Frameworkは「検証可能性を後付けではなく設計の第一制約とする」というChain-of-Evidence原則で、AI自律研究の信頼性問題を根本から解決します。 🔍 注目ポイント1 — Chain-of-Evidence(CoE)の2原則 「すべての主張が記録された証拠チェーンを持つ(完全性)」「各チェーンがその主張を真に支持する(正確性)」という2原則を定義します。ベースラインシステムで最大21%あったPhantom Referenceを0%に削減し、論文に記述されたメソッドとコードの整合性も全評価システム中で最高水準を達成しています。後付けで検証するのではなく、主張を生成する段階で証拠チェーンを同時に構築する点が従来手法との根本的な違いです。 🏗 注目ポイント2 — 3モジュールアーキテクチャ Problem Investigator(Semantic Scholar APIで最大100本のPDFから引用グラフを構築し、モデル記憶ではなく取得データに根拠付け)、Discovery Engine(並列ブランチで複数解を探索し全評価器出力を不変記録として保持)、Paper Writer & Claim Verifier(専用エージェントが主張を特定のワークスペース成果物に結びつけ、不整合を削除ではなく保守的に修正)という3つのモジュールが科学的誠実性を構造的に担保します。 🏆 注目ポイント3 — MLE-BenchとParameter-Golfでの実績 医療画像・細粒度認識・3D知覚を含むKaggleコンペ5種で金メダル2個・銀メダル2個を獲得。全ベースラインシステムが失敗した3Dオブジェクト検出タスクで優勝しました。厳格なハードウェア・ファイルサイズ制約下でのParameter-Golf LLMコンペでも2026年4月27日時点のSoTAを達成し、ベースラインはいずれも有効な提出物を生成できませんでした。 厳密性と競争力は両立できます。AI Scientist v2・AutoResearchClaw・DeepScientistなど最先端5システムを上回り、検証可能な自律研究の新しい基準を打ち立てています。 #AIResearch# #科学AI#
もっと見る
スライド修正で「1枚だけ直したいのに全部作り直されて崩れる」問題、ありますよね。それをメモリの階層化と局所修正で解いた研究です🗂️ タイトル: MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision URL: ❓ 何が新しいの? 💡 スライド生成エージェントに「階層的メモリ」を入れ、恒久的な好み(プロファイル)・セッション単位の作業記憶・再利用可能なツール経験を明確に分離します。さらにデッキ全体を作り直さず、対象スライドだけを直す局所修正を採用しています。 ❓ どうやって局所修正の暴走を防ぐ? 💡 Plan–Act–Guardの3段で進めます。Planで修正を「実行契約」(対象パス・適用ルール・カバレッジ要件)に変換し、Actで共通セレクタのバッチCSSやパッチ操作を使い分け、Guardでコンテンツのハッシュに束縛して全対象が直るまで早期確定をブロックします。 ❓ 一時的な指示が恒久的な好みに化けない? 💡 ジョブ終了時に意図を考慮した統合を行い、安定した信号だけをプロファイルへ書き戻します。「この回だけ」の要求が永続化するのを防ぐ仕組みです。 ❓ 効果は? 💡 ブラインド審査でパーソナライズはDeepPresenter比で全次元改善(Visual +1.66など)。ツール記憶ありだと修正の完了率0.963、初回正答までの時間は609.5→242.5秒で約60%短縮でした。 エージェントのメモリを「種類ごとに役割分担」する設計思想が、多ターン編集タスク全般に効きそうだと感じます。 #AIエージェント# #LLM#
もっと見る
タイなど東南アジア都市に暑熱リスク、英オックスフォード大学研究が警鐘 対象となったのは、2026年5月21日に学術誌「Sustainable Cities and Society」に掲載された論文「Moving beyond exposure: a globally comparable framework for heat risk assessment in cities」です。同論文は、世界の人口100万人以上の都市を対象に、暑さへの曝露、社会的な脆弱性、対応能力を組み合わせ、都市ごとの暑熱リスクを比較したものです。
もっと見る
🏗 一行の関数なら書けるAIも、「アプリ一式をゼロから作って」と言われると途端に崩れます。ファイルをまたいだ設計、噛み合うインターフェース、延々と続く不整合のデバッグ——これは個人技ではなく、チーム戦だからです。 そこで本研究は、AIエージェントに本物の開発チームを演じさせます。まず複数のArchitectが互いに異なる設計案(Software Design Sketch)を競って描き、CTO役が構造の妥当さやインターフェースの整合性を0〜8点で採点して最良案を選定。選ばれた設計は、ファイル所有者・公開API・依存関係・非循環性まで機械が検証できる「契約」へと正規化されます。 実装フェーズでは、Developerたちが依存関係の順に沿って自分の担当ファイルだけを、必要最小限の文脈で書いていきます。協調はGitで軽量に。各自がブランチにコミットする際、変更した公開シンボルや影響先を構造化メモに残すので、ファイル本文を共有せずともインターフェースの変更だけが伝播します。仕上げはQA役が依存レイヤーごとにテストを走らせ、失敗を担当者へ差し戻して直させる。まさに人間のチーム開発そのものです。 この CodeTeam: An LLM-Powered Multi-Agent Framework for Repository-Level Code Generation は、本物のpytestで検証するNL2Repo-Benchで平均42.3%のテスト通過率(SFT設定)を達成し、19リポジトリ中15でベースラインのCodeSに勝利しました。構造の良さが、実際に動くコードの正しさへとつながっている点が見どころです。 URL: #CodeGeneration# #AIAgents#
もっと見る