登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 AI论文
AI论文 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
AI论文 を含む検索結果
AIに論文を書かせると、実験もせずに都合の良い数値を書いてしまう——この「もっともらしい捏造」こそ、研究自動化の最大の壁でした。 これまでの自動研究システムは、専用のエージェント基盤を組み上げ、なんとか一本のストーリーを完成させることに注力してきました。けれど、長い生成の途中で事実性がほころび、根拠のない主張がそのまま論文に紛れ込む。派手な成果の裏で、信頼性という土台が抜け落ちていたのです。 そこで発想を変えたのが Spark-to-Paper です。専用基盤を新設せず、Claude Code の中で動く13個の組み合わせ可能なスキルとして論文生成を実装しました。鍵は「分離」です。文脈依存の判断はモデルに任せ、引用検証やLaTeXコンパイルは決定的なコードに任せる。そして実験は、結果を見る前に指標や表の構造を先に確定させ、後付けの評価を封じます。さらに、仮説を支持しない実験を延々と修正し続ける「自己反証ループ」を最大7回で打ち切り、失敗を失敗として記録して別の方向へ進みます。 結果は雄弁です。引用の妥当性は99.5%と人間のプレプリント平均すら上回り、捏造検出率はシングルパスの14%から、敵対的レビューを重ねたフルスタックで92%へ。1論文あたり約8.1ドル・3.2時間で、編集可能な図まで揃った原稿が出来上がります。 すべての試行を成功に見せかけるのではなく、証拠の整合性と「うまくいかない研究もある」という受容を中心に据える。長期タスクを担うAIの信頼性設計として示唆に富む一本です。 Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill #AIResearch# #AgentSkills#
もっと見る
今天刷到索尼又在搞黑科技了诶!新出的那个AI摄像头(カメラ)居然能自动识别你的表情然后帮你修图,太强了叭!想到我每次自拍都各种死亡角度,要是有了这个神器,我这种自拍苦手(へた)也能拯救了🥲 顺便,索尼爸爸以后能不能出个帮懒人写论文的AI啊?笑死😆 科技改变生活
もっと見る
AIが自律的に論文を書く時代、「幻引用・メソッドとコードの不整合・再現不可能なスコア」という信頼性の危機が深刻化しています。 タイトル: Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence Google CloudのScience One Frameworkは「検証可能性を後付けではなく設計の第一制約とする」というChain-of-Evidence原則で、AI自律研究の信頼性問題を根本から解決します。 🔍 注目ポイント1 — Chain-of-Evidence(CoE)の2原則 「すべての主張が記録された証拠チェーンを持つ(完全性)」「各チェーンがその主張を真に支持する(正確性)」という2原則を定義します。ベースラインシステムで最大21%あったPhantom Referenceを0%に削減し、論文に記述されたメソッドとコードの整合性も全評価システム中で最高水準を達成しています。後付けで検証するのではなく、主張を生成する段階で証拠チェーンを同時に構築する点が従来手法との根本的な違いです。 🏗 注目ポイント2 — 3モジュールアーキテクチャ Problem Investigator(Semantic Scholar APIで最大100本のPDFから引用グラフを構築し、モデル記憶ではなく取得データに根拠付け)、Discovery Engine(並列ブランチで複数解を探索し全評価器出力を不変記録として保持)、Paper Writer & Claim Verifier(専用エージェントが主張を特定のワークスペース成果物に結びつけ、不整合を削除ではなく保守的に修正)という3つのモジュールが科学的誠実性を構造的に担保します。 🏆 注目ポイント3 — MLE-BenchとParameter-Golfでの実績 医療画像・細粒度認識・3D知覚を含むKaggleコンペ5種で金メダル2個・銀メダル2個を獲得。全ベースラインシステムが失敗した3Dオブジェクト検出タスクで優勝しました。厳格なハードウェア・ファイルサイズ制約下でのParameter-Golf LLMコンペでも2026年4月27日時点のSoTAを達成し、ベースラインはいずれも有効な提出物を生成できませんでした。 厳密性と競争力は両立できます。AI Scientist v2・AutoResearchClaw・DeepScientistなど最先端5システムを上回り、検証可能な自律研究の新しい基準を打ち立てています。 #AIResearch# #科学AI#
もっと見る
AIでCOBOLからJavaへコード移植する方法の提案論文。 ・レガシーなCOBOLからJavaへの移行は、テストデータ不足で隅々まで検証するのが難しい ・そこで Locksmith Loop と呼ばれるAIエージェントによるテスト生成手法を提案 ・COBOLと生成されたJavaの双方にモックを組み込んで実行環境を用意 ・エージェントが入力値の探索と変異を反復し、プログラムの条件分岐の奥深くまで入り込む ・探索がブロックされた条件を特定して突破することで、カバレッジを広げていく ・今回は、430〜4,114行規模の3つのCOBOLプログラムでケーススタディを実施した ・結果として、オープンソースのプログラム2つではほぼ完全な網羅率に到達 ・実稼働相当の内製プログラムでも91.90%の分岐カバレッジを達成した
もっと見る
AIのテックスタートアップは、中国企業以外はほとんど論文を書いていない、という内容。 実際にそのとおりだと思うが、逆に中国企業が異常値でもある。 企業からすると、論文を書くモチベーションは事業目標よりも低いのですよね。もちろんアカデミックと協働したい場合は書くけど。
もっと見る
AIリサーチのテキスト品質に対する意識は「幻滅」から「無視」に転じてしまい、参考文献リストから原著論文に当たって被引用論文を探すためのURL付き単語帳くらいになっているのだけど、システマティックレビューの手続きが浸透している分野(医学とか)で本質的な自動化がどこまで進んだかは気になる
もっと見る
AIのシステムプロンプト(ユーザーには見えない、開発者が事前にAIへ埋め込む行動指示)を、実際に流出・公開された88の商用AI製品から集めて監査した論文が出ていた( 論文はAISPA(Artificial Intelligence System Prompt Assurance)という枠組みを使い、身元の透明性・誠実さ・プライバシー保護・安全な行動など8つの観点から3249個の指示を「ユーザーを守る指示」か「ユーザーの不利益になる指示」かに分類している。 結果、88製品中87製品は最低1つ保護的な指示を持つ一方、8観点すべてをカバーしているのはわずか23.9%。さらに34製品(38.6%)には、ユーザーの利益に反する指示が少なくとも1つ混じっていた。プロンプトの平均文字数も2024年の9千字強から2025年には3万字超へ、保護的な指示の数も15.0個から38.4個へと2倍以上に増えている。 企業ごとの差も大きく、Anthropicは製品あたり平均62.3個の保護的指示・0.1個の問題ある指示ともっとも手厚い一方、Veniceだけは問題ある指示(3.0)が保護的指示(2.0)を上回っていた。 グレーゾーンの指示も見つかっている。あるプロンプトはAIに自らを「友達」と名乗らせ、会話を終えようと提案することを禁じていた。見えない場所でAIの人格は、こうして日々設計されている。
もっと見る
AIが「外部検索なし」でファクトを記憶・更新・忘却する時代が来ました。メモリをモデルに内蔵する新たなパラダイムが論文として公開されています。 タイトル: Metis: Memory Foundation Model 🔍 概要 現在のRAGなど外部メモリモジュールには、バックボーンとの分離・勾配伝播困難・推論レイテンシという3つの根本的限界があります。MetisはこれをTransformerブロック内に「ネイティブメモリ」として統合するアプローチで、Chain-of-ThoughtがLLMにネイティブに組み込まれたように、メモリも外部依存から解放しようとする研究です。 🛠 解決する課題と提案手法 2つのコアコンポーネントを導入します。ローカルメモリブロック(高密度メモリネットワークを推論ステップ間で指数移動平均更新)とハイパーメモリブロック(静的パラメータによるフォワードパスでのメモリ変換)です。4種のメモリ操作(Remember/Update/Forget/Reflect)を、バックグラウンドの勾配更新なしに順伝播計算だけで実行します。 📊 実験結果 コンテキストなし設定のMemOpsベンチマークで、Metis-27Bは24.76%を達成しました。 ・ベースライン Qwen3.5-27B(コンテキストなし): 1.69% ・テスト時訓練 Temp-LoRA-27B: 9.70% ・パラメトリックメモリ δ-Mem: 4.38% 自社テストセットではReflect(マルチホップ推論)で93.44%、平均73.77%を達成。すべての比較手法を大幅に上回っています。 💡 実用的な意義 RAGの検索・ランキング・プリフィリングコストを回避しつつ、パラレル計算でメモリ操作を実行するため推論レイテンシを抑えられます。ポストトレーニングによるドメイン適応も可能で、コードとモデルチェックポイントはGitHub(MemTensor/Metis)とHuggingFaceで公開されています。 #LLM# #AIエージェント#
もっと見る
🧩 AIエージェントに足りないのはモデルの賢さではなく「現場のノウハウ」だった、という論文です。 タイトル: Repo-To-Skill: Distilling GitHub Repositories Into AI4AI Skills URL: ❓ 自律型研究エージェントには何が欠けているのですか 💡 「モデル」と「実行ハーネス」の2層だけでは、適切な手法の選び方やAPIの使い方、実装の落とし穴といった運用知識が抜け落ちています。この論文はこれを第三の層として明示的に扱います。 ❓ その知識をどうやって手に入れるのですか 💡 GitHubリポジトリや論文を「Scope→Ground→Construct→Verify」の4段階で処理し、検証済みの「スキル」として蒸留します。1,000リポジトリと153論文から5,353個のスキルを構築しました。 ❓ スキルを使うと実際どれくらい変わるのですか 💡 同じGPT-5.5・同じハーネスのまま、スキルを追加するだけでMLE-benchは31.11%から72.89%へ、PaperBench・FrontierCS・PassNetでも軒並み改善しました。高難度タスクでは4倍以上のスコア向上も見られます。 ❓ 単にリソースを増やしただけではないのですか 💡 トークン数やツール呼び出し回数と改善幅の相関はほぼゼロで、Claude Opus 4.8構成より少ないトークンで高いスコアを出しています。知識そのものが効いているといえます。 #AIエージェント# #機械学習#
もっと見る
AIは静かに、あなたを操る。 しかも、その方法は金融・健康・公共政策などの文脈や、国・地域によって変わる。 賢くなるAIに、検知技術は追いつけるのか。 1万人以上を対象に、AIの「操作する傾向」と「実際に人を動かす効果」を分けて検証した論文を紹介します。 #AI# #生成AI# #AI安全性# #PaperDigest#
もっと見る