登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 CodingAI
CodingAI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
CodingAI を含む検索結果
今週のメルマガ:Vibe Crafting Vibe Coding——AIにコードを書かせる開発スタイル——は、まだ序の口です。本丸はその先にあります。 私がここ2か月、MulmoClaudeの開発に没頭する中でようやくハッキリ見えてきたのは、「たった一人のユーザーのために、その場で作られるソフトウェア」が当たり前になる世界です。 メルマガの読者数推移をグラフにしたい、観た映画を評価付きで記録したい、子供の習い事の送迎を管理したい——やりたいことを伝えるだけで、その目的だけのために存在する「手作りアプリ」が召喚される。コードを書く必要も、見る必要すらありません。 Karpathyの Vibe Coding がコードをAIに任せることなら、その先にあるこれを、私は「Vibe Crafting」と呼びたいと思っています。自然言語を理解するAIを前提に、ゼロから設計し直されたマン・マシン・インターフェイス。AIネイティブなコンピューティングのあるべき姿です。 一度この場所に立つと、「こうなるのが当たり前だ」としか思えなくなる。その感覚こそが、私にとって未来を見つけた時のサインです。 MulmoClaudeはオープンソースなので、よかったらご自身のPCで動かしてみてください。
もっと見る
🔬 「AIは科学を“発見”できるのか?」を、本物のNature論文90本で厳しく測ったら、最強エージェントでもSOTA超えは2割弱でした。 タイトル: NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? URL: 📋 概要 Nature系ジャーナル由来の90タスク(6ドメイン)で、AIコーディングエージェントが既発表SOTAを再現・超越できるかを検証。元手法を遮断する「情報ファイアウォール」と、タスクごとにコンテナ化する自動環境NatureGymで、統一条件・Web検索禁止の厳密評価を実現しています。 🎯 解決する課題 これまでのエージェント研究ベンチは環境がバラバラで信頼性に欠けていました。本研究は「再現」ではなく「自力発見」を強制し、横断比較できる土俵を整えます。 📐 方法論 SOTA正規化の相対ギャップで採点(g>0.1で超越、g≥0で同等以上)。81種の指標を横断比較し、4時間予算・GPU割当・10エージェントを3ハーネスで評価します。 📊 実験結果 ・最強のClaude Opus 4.7でもSOTA超えは17.8%、同等以上は47.8% ・成功の45.5%は「科学課題を教師あり予測に翻訳しただけ」。真のドメイン推論はわずか8.3% ・失敗の主因は手法選択ミス45.1%と計算資源不足24.4%で、タスク誤解はわずか3.1% ・学際課題ほど成績が落ちる傾向 現状のエージェントは「翻訳」は得意でも「発見」は苦手、という冷静な現在地が見えて示唆に富みます。 #AI4Science# #CodingAgents#
もっと見る