登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AIResearch
AIResearch コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AIResearch を含む検索結果
AIに論文を書かせると、実験もせずに都合の良い数値を書いてしまう——この「もっともらしい捏造」こそ、研究自動化の最大の壁でした。 これまでの自動研究システムは、専用のエージェント基盤を組み上げ、なんとか一本のストーリーを完成させることに注力してきました。けれど、長い生成の途中で事実性がほころび、根拠のない主張がそのまま論文に紛れ込む。派手な成果の裏で、信頼性という土台が抜け落ちていたのです。 そこで発想を変えたのが Spark-to-Paper です。専用基盤を新設せず、Claude Code の中で動く13個の組み合わせ可能なスキルとして論文生成を実装しました。鍵は「分離」です。文脈依存の判断はモデルに任せ、引用検証やLaTeXコンパイルは決定的なコードに任せる。そして実験は、結果を見る前に指標や表の構造を先に確定させ、後付けの評価を封じます。さらに、仮説を支持しない実験を延々と修正し続ける「自己反証ループ」を最大7回で打ち切り、失敗を失敗として記録して別の方向へ進みます。 結果は雄弁です。引用の妥当性は99.5%と人間のプレプリント平均すら上回り、捏造検出率はシングルパスの14%から、敵対的レビューを重ねたフルスタックで92%へ。1論文あたり約8.1ドル・3.2時間で、編集可能な図まで揃った原稿が出来上がります。 すべての試行を成功に見せかけるのではなく、証拠の整合性と「うまくいかない研究もある」という受容を中心に据える。長期タスクを担うAIの信頼性設計として示唆に富む一本です。 Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill #AIResearch# #AgentSkills#
もっと見る
AIが自律的に論文を書く時代、「幻引用・メソッドとコードの不整合・再現不可能なスコア」という信頼性の危機が深刻化しています。 タイトル: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence Google CloudのScience One Frameworkは「検証可能性を後付けではなく設計の第一制約とする」というChain-of-Evidence原則で、AI自律研究の信頼性問題を根本から解決します。 🔍 注目ポイント1 — Chain-of-Evidence(CoE)の2原則 「すべての主張が記録された証拠チェーンを持つ(完全性)」「各チェーンがその主張を真に支持する(正確性)」という2原則を定義します。ベースラインシステムで最大21%あったPhantom Referenceを0%に削減し、論文に記述されたメソッドとコードの整合性も全評価システム中で最高水準を達成しています。後付けで検証するのではなく、主張を生成する段階で証拠チェーンを同時に構築する点が従来手法との根本的な違いです。 🏗 注目ポイント2 — 3モジュールアーキテクチャ Problem Investigator(Semantic Scholar APIで最大100本のPDFから引用グラフを構築し、モデル記憶ではなく取得データに根拠付け)、Discovery Engine(並列ブランチで複数解を探索し全評価器出力を不変記録として保持)、Paper Writer & Claim Verifier(専用エージェントが主張を特定のワークスペース成果物に結びつけ、不整合を削除ではなく保守的に修正)という3つのモジュールが科学的誠実性を構造的に担保します。 🏆 注目ポイント3 — MLE-BenchとParameter-Golfでの実績 医療画像・細粒度認識・3D知覚を含むKaggleコンペ5種で金メダル2個・銀メダル2個を獲得。全ベースラインシステムが失敗した3Dオブジェクト検出タスクで優勝しました。厳格なハードウェア・ファイルサイズ制約下でのParameter-Golf LLMコンペでも2026年4月27日時点のSoTAを達成し、ベースラインはいずれも有効な提出物を生成できませんでした。 厳密性と競争力は両立できます。AI Scientist v2・AutoResearchClaw・DeepScientistなど最先端5システムを上回り、検証可能な自律研究の新しい基準を打ち立てています。 #AIResearch# #科学AI#
もっと見る