登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Framework
Framework コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Framework を含む検索結果
WWDC26 What’s new in the Foundation Models framework みはじめた。Foundation Modelsの進化すごいね... #wwdc26#
AIが自律的に論文を書く時代、「幻引用・メソッドとコードの不整合・再現不可能なスコア」という信頼性の危機が深刻化しています。 タイトル: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence Google CloudのScience One Frameworkは「検証可能性を後付けではなく設計の第一制約とする」というChain-of-Evidence原則で、AI自律研究の信頼性問題を根本から解決します。 🔍 注目ポイント1 — Chain-of-Evidence(CoE)の2原則 「すべての主張が記録された証拠チェーンを持つ(完全性)」「各チェーンがその主張を真に支持する(正確性)」という2原則を定義します。ベースラインシステムで最大21%あったPhantom Referenceを0%に削減し、論文に記述されたメソッドとコードの整合性も全評価システム中で最高水準を達成しています。後付けで検証するのではなく、主張を生成する段階で証拠チェーンを同時に構築する点が従来手法との根本的な違いです。 🏗 注目ポイント2 — 3モジュールアーキテクチャ Problem Investigator(Semantic Scholar APIで最大100本のPDFから引用グラフを構築し、モデル記憶ではなく取得データに根拠付け)、Discovery Engine(並列ブランチで複数解を探索し全評価器出力を不変記録として保持)、Paper Writer & Claim Verifier(専用エージェントが主張を特定のワークスペース成果物に結びつけ、不整合を削除ではなく保守的に修正)という3つのモジュールが科学的誠実性を構造的に担保します。 🏆 注目ポイント3 — MLE-BenchとParameter-Golfでの実績 医療画像・細粒度認識・3D知覚を含むKaggleコンペ5種で金メダル2個・銀メダル2個を獲得。全ベースラインシステムが失敗した3Dオブジェクト検出タスクで優勝しました。厳格なハードウェア・ファイルサイズ制約下でのParameter-Golf LLMコンペでも2026年4月27日時点のSoTAを達成し、ベースラインはいずれも有効な提出物を生成できませんでした。 厳密性と競争力は両立できます。AI Scientist v2・AutoResearchClaw・DeepScientistなど最先端5システムを上回り、検証可能な自律研究の新しい基準を打ち立てています。 #AIResearch# #科学AI#
もっと見る
スライド修正で「1枚だけ直したいのに全部作り直されて崩れる」問題、ありますよね。それをメモリの階層化と局所修正で解いた研究です🗂️ タイトル: MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision URL: ❓ 何が新しいの? 💡 スライド生成エージェントに「階層的メモリ」を入れ、恒久的な好み(プロファイル)・セッション単位の作業記憶・再利用可能なツール経験を明確に分離します。さらにデッキ全体を作り直さず、対象スライドだけを直す局所修正を採用しています。 ❓ どうやって局所修正の暴走を防ぐ? 💡 Plan–Act–Guardの3段で進めます。Planで修正を「実行契約」(対象パス・適用ルール・カバレッジ要件)に変換し、Actで共通セレクタのバッチCSSやパッチ操作を使い分け、Guardでコンテンツのハッシュに束縛して全対象が直るまで早期確定をブロックします。 ❓ 一時的な指示が恒久的な好みに化けない? 💡 ジョブ終了時に意図を考慮した統合を行い、安定した信号だけをプロファイルへ書き戻します。「この回だけ」の要求が永続化するのを防ぐ仕組みです。 ❓ 効果は? 💡 ブラインド審査でパーソナライズはDeepPresenter比で全次元改善(Visual +1.66など)。ツール記憶ありだと修正の完了率0.963、初回正答までの時間は609.5→242.5秒で約60%短縮でした。 エージェントのメモリを「種類ごとに役割分担」する設計思想が、多ターン編集タスク全般に効きそうだと感じます。 #AIエージェント# #LLM#
もっと見る
TL;DR: 乱立するベクトル量子化手法を、共通の小さな部品(プリミティブ)の組み合わせとして統一的に扱い、同一条件で比較できるベンチマーク「VQ-bench」をPineconeが公開しました。 タイトル: VQ-bench: a Composable Vector Quantization Framework URL: ポイント 🧩 Center・Normalize・PCA・RandomRotateなど、量子化を構成する共通プリミティブを定義し自由に組み合わせ可能に 🔗 E-RaBitQなどの既存手法も「Center→Normalize→Random Rotation→Angular Cast」の4プリミティブの並びだけで再現 📊 VIBEの5データセット・14種類の量子化器をReconstruction MSE・Recall@10・エンコード時間で横並び比較 🥇 PQとOPQが一貫して最小のReconstruction MSEを記録 ⚡ EDENはPQ/OPQ/E-RaBitQより大幅に高速なエンコードを実現しつつRecallも高水準を維持 🛠️ 新規量子化器の追加は数行のコードで済み、新規プリミティブは既存の全部品と自動的に合成可能 バラバラだった量子化手法の評価が同じ土俵に乗ったことで、用途に応じた選定がしやすくなりそうです。 #ベクトル検索# #ベクトルDB#
もっと見る
タイなど東南アジア都市に暑熱リスク、英オックスフォード大学研究が警鐘 対象となったのは、2026年5月21日に学術誌「Sustainable Cities and Society」に掲載された論文「Moving beyond exposure: a globally comparable framework for heat risk assessment in cities」です。同論文は、世界の人口100万人以上の都市を対象に、暑さへの曝露、社会的な脆弱性、対応能力を組み合わせ、都市ごとの暑熱リスクを比較したものです。
もっと見る