登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 TLブルマー化計画
TLブルマー化計画 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
TLブルマー化計画 を含む検索結果
TL;DR 350年以上未解決だったフェルマーの最終定理を、Claudeがわずか11日間で完全にコンピュータ検証可能な形に形式化しました。数十体のAIエージェントが協力し、証明支援系Leanで検証済みの巨大な証明を作り上げています。 タイトル: Formalizing Fermat's Last Theorem URL: ポイント 🧮 証明した中間定理は29,500個(総数30,300個) 📄 生成したLeanコードは1,300万行、Mathlibの5倍の規模 🤝 数十体のClaudeエージェントが役割分担しながら協調作業 🧩 協調基盤「Prove2Me」が定理の依存関係と状態管理を担当 ⚙️ 使用した公理はLeanの標準3公理のみ 💬 数学者Kevin Buzzard氏も証明の正しさを確認済み 🔁 3人チームが3日間で三素数定理を形式化した先例もあり 一件一件人手で数年かかっていた証明査読の負担を、AIによる形式化が大きく減らせる可能性を示す事例だと感じます。 #Lean# #形式検証#
もっと見る
TL;DR 長いコンテキストを扱えるモデルでも、延々と続く作業を最後まで正しくやり切れるとは限りません。NVIDIAが、その「持続的な実行力」だけを測る新ベンチマークLong-Transductionで検証しました。 タイトル: Staying on Task: Testing the Foundations of Long-Horizon Agent Reliability URL: ポイント 📉 4Kから128Kトークンへのスケールで精度が平均62.8%も相対的に低下 🧮 算術・UUIDソート・変数ルックアップ・CSV表変換の4タスクで持続実行力を測定 📄 128Kトークンで文書を完璧に処理できたのはDeepSeekでも240件中わずか41件(17.1%) 🔀 IDを外すなど入力フォーマットを変えるだけでUUIDソートは最大64.3%低下 🔁 局所的な作業の複雑さが増すだけでも全モデルで精度が一貫して下がる 🤔 モデルは「同じ答えを繰り返す自己一致性」は高いのに正答率は低く、タスクは理解していても文脈から正しい問題を読み取れていない 🛠️ 著者らは安定したIDでの項目化やチェックポイント、タスクの小分けを実務上の対策として提言 対応コンテキスト長やモデル規模の大きさは、網羅的で信頼できる実行を保証しないという指摘が重く響きます。 #AIエージェント# #ベンチマーク#
もっと見る
TL;DR: 数学の未解決問題5問を、マルチエージェントの「証明-検証ループ」で解決した研究です。オークション理論からオンライン学習まで、各分野の専門家による検証も通過しています。 タイトル: Cogentic: Multi-Agent Orchestration for Automated Proof Discovery URL: ポイント 🧠 オーケストレーターが複数の「証明者」を異なる証明の方向性へ割り当て、「すべてのステップは誤りである」という前提で敵対的に検証する、研究グループを模した仕組み 📚 検証済みの中間補題を蓄積する永続的な「台帳」により、ラウンドをまたいで知見を失わずに積み上げる 🎯 オンライン学習・オークション理論・メカニズムデザインの3分野で5つの未解決問題を解決 📊 シンプル対最適収益の近似係数を5.2→3.52へ改善、オートバイディングのPoAを2人入札者で最適値1.5に到達 💰 基盤モデルはGemini。推論コストは多くの問題でGemini呼び出しO(100)回程度と控えめ ✅ 全5件の結果が各分野の専門家による独立検証を通過し、付随論文として発展 適切にオーケストレーションすれば言語モデルが本物の未解決問題を解けることを実証した点に大きな意義を感じます。 #数理科学# #マルチエージェント#
もっと見る
TL;DR 自分で問題を作り自分で答える自己進化型エージェントは、出題者と解答者が同じ間違いで「意気投合」してしまう「共食い」に陥ります。出典を分割して評価する手法でこれを防ぎ、性能を8ポイント以上改善しました。 タイトル: False Frontiers: Diagnosing and Mitigating Co-Cheating in Self-Evolving Search Agents URL: ポイント 🔁 出題者と解答者が同じ出典由来の誤りを共有し、偽の一致が報酬として循環する「共食い」を発見 📉 標準的なDr. Zeroでは偽の一致が6.1%・8.8%発生 ✂️ 出典を2つのフォールドに分割し、互いに相手側で学習した補助解答者が採点するCrossFitを提案 📊 CrossFit単独で偽の一致を3.0%・3.7%に、MSVと併用すると2.0%・1.7%まで削減 🚀 下流タスクの平均Cover-EMはDr. Zero比で8.8・8.4ポイント向上 🧩 マルチホップタスクほど改善幅が大きく、平均10ポイント以上の効果 💰 計算コストはベースラインの1.72〜2.7倍増加するが、半予算の変種でも効果を確認 評価者自身の学習履歴まで監査しないと、見かけの進歩に騙されるという指摘が印象的です。 #自己進化エージェント# #強化学習#
もっと見る
TL;DR: オンポリシー蒸留で教師モデルを超えようとする既存手法は出力空間でのノイズ増幅により不安定になりがちでしたが、RL前後の表現変化を「表現空間」で直接外挿する新手法RIDEが、4つのモデルペア全てで教師超えを達成しました。 タイトル: The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation URL: ポイント 🎯 教師を「目的地」ではなく「方向」として捉え、RL前後の隠れ状態の差分(残差)をさらに外挿したターゲットへ生徒を回帰させる ⚠️ 出力ヘッドは異方性ゆえに変化の大部分を減衰させる。弱い512方向が隠れ状態エネルギーの79.8%を占めるのに出力空間では30.0%しか残らない 📉 出力空間での外挿は分散が(λ-1)²で増幅し不安定化。RIDEの勾配分散はExOPD比12.6倍小さい 📊 4モデルペア全てで教師超え:R1-Distill-1.5Bで56.38、Qwen3-4Bで66.07など、OPRD比+0.97〜4.06ポイント改善 ❌ 出力空間での外挿手法ExOPDは4ペア全てで教師にもOPRDにも劣る結果に 🔬 ランダム方向や逆方向への外挿では性能が伸びず、RL誘発方向そのものが効いていることをアブレーションで確認 「教師を超える」という目標に対し、どこで差分を測るかという設計一つで結果がここまで変わるのは興味深いです。 #蒸留# #強化学習#
もっと見る
TL;DR 画面を操作するAIエージェントの信頼性を、安全性と曖昧性解消の2軸で測るベンチマークをMetaが公開しました。結論は「有能さと安全さを両立したモデルは一つもない」です。 タイトル: ADEPTS-BENCH (facebookresearch/adepts) URL: ポイント 🧪 2,462タスクを完全オフラインで評価。ライブ環境不要で再現しやすい設計です 🎭 脅威は指示文ではなくスクリーンショット内にのみ埋め込まれ、良性版と悪性版を859ペアで対比します ⚖️ 指標のADEPTS ScoreはTSRと(1−ASR)の調和平均なので、片方を捨てて高得点は取れません 📉 デスクトップ最高はGemini 3.1 Proの76.0%、Claude 4.7 Opusが75.4%、GPT-5.4は66.1% 🛒 全モデルが2万5,000ドルの注文の購入確定をクリックし、ラベル偽装された設定も検出できませんでした 🔌 拒否用ツールを外すとフロンティアモデルのASRは10〜23ポイント上昇。安全性の多くは外付け機構に支えられています 🚫 一方で良性タスクの6〜10%を誤って拒否し、実行不可能なタスクの見逃しは30.6%にのぼります 失敗の66.3%が「文脈が曖昧でモデル間の判断が割れる」領域に集中しているという分布は、ガードレール設計の投資先を考えるうえで示唆的です。 #AIエージェント# #AI安全性#
もっと見る
TL;DR コードを書いて画像や動画を生成するAIは、コードの実行が成功しても見た目の要求を満たしているかは別問題です。この「プログラムと視覚のギャップ」を測る評価手法が提案されました。 タイトル: MaLiang-Harness: A Programmable Path to Image and Video Generation URL: ポイント 🖼️ 状態を保持しながら生成物を検査・修正するステートフルなフレームワーク 🔧 コードの変更と映像の結果を対応づける追跡可能な生成プロセスを導入 🎨 Canvas・SVG・Three.jsなど複数バックエンドを共通プロトコルで統一 📊 画像生成50タスクでGPT-6-Astraが成功率100%・品質基準クリア96.0% 🎬 動画生成13タスクでもGPT-6-Astraが成功率100%・品質基準クリア76.9% ⚠️ DeepSeek系は画像で12〜40%、動画では0%と大きく苦戦 🔍 汎用能力スコアが同じ2モデルでも描画品質の合格率は44%対88%と激しく食い違う 汎用ベンチマークのスコアだけではモデルの実力を測れない、という指摘が特に刺さります。 #マルチモーダルAI# #画像生成#
もっと見る
TL;DR: 単一のエージェント・ハーネスではスケールしないという課題に対し、ハーネス自体を自動構築・進化させるオープンソースのマルチエージェント・エコシステム「Raven」が登場しました。 タイトル: Raven: The Harness of Harnesses for Composable Agentic Intelligence URL: ポイント 🧩 モデルとハーネスの組を「構成の単位」として扱い、Host Agentがタスクを分解して専門エージェントへDAG形式で割り当てる 🧠 EverOS(記憶)とSkill Forge(スキルの取得・再利用)で、過去の経験をタスク横断的に活用 🔬 誤り率が操作ごとに単純加算されるという「構成健全性定理」を証明し、XORタスクの具体例で組み合わせが個々のエージェントの能力を超えうることを実証 📊 新設ベンチマークMAOBの4指標すべてで1位。Exact Matchでは最強ベースライン比+10.4〜10.5ポイント改善 🛠️ Raven-Research/Code/Design/Oncallの各専門エージェントもベースラインを一貫して上回る 🔁 実行トレースから失敗を診断しハーネスを自己進化させる仕組みも、モデルを凍結したままドメイン横断で性能向上を確認 理論と実証の両輪でマルチエージェント構成の「なぜ効くのか」を示した点に意義を感じます。 #マルチエージェント# #AIハーネス#
もっと見る
TL;DR DeepAgents・Pydantic AI・Claude Agent SDK・Codex・OpenCodeを、コードを書き直さず1つのPython SDKで切り替えられるようにするツールです。Claude Agent SDKと同じquery()インターフェースを採用しています。 タイトル: LiteAgents (BerriAI/liteagents) URL: ポイント 🔀 harnessパラメータを変えるだけでエージェント基盤を切り替え可能 🌐 LiteLLM連携でOpenAI・Anthropic・Gemini・Groqなど8種以上のモデルに対応 🛠️ 型付きPython関数を渡すだけで各ハーネスのツールスキーマに自動適合 💬 LiteAgentClientで複数回のquery()にまたがる永続的な会話履歴を管理 ⏱️ Temporal連携でクラッシュリカバリ・操作リプレイ・冪等なツール実行を実現 ⚙️ プロファイルはPython・YAML・JSONのいずれでも定義可能 📡 async/awaitとストリーミングにフル対応 ハーネスを乗り換えるたびにコードを書き直す時代が、これで終わるかもしれません。 #AIエージェント# #OSS#
もっと見る
TL;DR: 実カルテは公開できずラベルも不完全という臨床AIベンチマークの根本問題を、完全合成データで解決した研究です。フロンティアモデルでもトップ医師の性能には届きませんでした。 タイトル: Synthetic Hospital: An Open, Verifiable, Physician-Validated Longitudinal EHR Benchmark URL: ポイント 🏥 医学教育教材から1,268人・5,602受診分の完全合成カルテを構築し、個人情報ゼロで公開可能に 🔗 診断・所見・時間関係をICD-10-CM/SNOMED CT/LOINCへ決定的に紐づけ、ラベルは知識グラフから機械的に導出 👨‍⚕️ 医師によるリアリズム検証で、実カルテとの識別精度はほぼチャンスレベルの53% 📊 10モデルを5タスクで評価。患者診断の最高スコアはKimi 2.5-thinkingの重症度加重F1 0.732で医師平均と同水準 ⚠️ トップ医師(0.89)には未到達。要約タスクではどのモデルも所見の約半分を見落とし 🔁 生成モデルを変えても性能変化は0.05以下、臨床状態そのものを測るベンチマークであることを確認 臨床LLMの実力を偽りなく測れる基盤が整った意義は大きいと感じます。 #医療AI# #LLMベンチマーク#
もっと見る