登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 codebase
codebase コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
codebase を含む検索結果
🔬 最上位のAIエージェントでも、科学計算コードの修復タスクは約1/3が1時間以内に解けないという結果が出ました。 タイトル: ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments URL: 🧩 概要 AItonomy・Qwen・PhAI-Labsが、天体物理・海洋モデリングなど27の科学コードベースを、AIエージェントが学習できる実行可能な環境へ変換するインフラ「ScienceIDE」を構築しました。64環境・2,812タスクを整備しています。 ⚙️ 解決する課題 科学コードには数十年分の専門知識が詰まっていますが、断片化したツールチェーンや文書化されていない数値慣習のせいで、信頼できる学習経験に変換するのが困難でした。 🛠 方法論と提案手法 数値許容誤差や保存量を比較する「科学的チェック」でタスクの正当性を検証し、修復・実装など7分類のタスクを生成。強化学習では予算切り捨てへの不当なペナルティを防ぐ「切り捨てマスキング」という工夫も導入しています。 📊 実験結果 1時間予算でのエージェント比較ではFable 5.1が67.1%で最高、Astraが63.1%。ScienceIDEの経験で学習したPhAI-IDEモデルは科学コード修復タスクで最大+33.33ポイント、強化学習ではLAPSタスクの報酬が2.4倍に向上しました。 #AIエージェント# #AI4Science#
もっと見る
LLMエージェントに「脆弱性を探して」と頼むだけでは誤検知が多くなりがちです。Cloudflareはそこに対立的検証という発想を持ち込みました。 タイトル: cloudflare/security-audit-skill URL: 🔍 概要 コーディングエージェントを自動セキュリティ監査ツールとして機能させ、独立した検証と機械可読な脆弱性報告を実現するスキルです。npxコマンド1つでClaude Codeなどに導入できます。 🧭 解決する課題 単純にAIへ脆弱性探索を任せると根拠の薄い誤検知や見落としが発生しがちです。それに対し、探索と検証を別エージェントに分離することで信頼性を高めています。 ⚙️ 方法論・提案手法 偵察→カバレッジ主導の探索→候補検証→構造化出力→独立記録検証→中立的な報告、という6フェーズのパイプラインを構成。新規の独立エージェントが候補と最終クレームをそれぞれ再検証する「対立的検証」が特徴です。 🛠️ ユースケース ・security audit this codebaseのような自然言語指示で起動 ・LLM・プロンプトインジェクションからクラウド・サプライチェーンまで12種類の攻撃クラスに対応 ・validate-findings.cjs等の検証ツールも同梱 📊 実験結果 テストでは単一実行で約50%の脆弱性を検出し、複数回の実行を重ねることでカバレッジが積み上がる設計です。GitHubでは16.3kスター・894フォークを獲得しています。 #セキュリティ# #AIエージェント#
もっと見る
Claude Security 插件正式公測!這不只是又一個掃描工具,而是把「資安研究員級」的能力直接塞進 Claude Code 終端。 它會像真人一樣讀懂你的架構、追蹤跨檔案資料流、建立威脅模型,再用多代理互相驗證,找出傳統靜態掃描器常漏掉的複雜邏輯漏洞與認證繞過。掃完還能直接產出符合你程式風格的修補建議,人審完就能套用。 這代表什麼?AI 正在把高階資安「左移」到每一位開發者的日常工作流。不用再等資安團隊排程、不用把程式碼丟上雲端,提交前就能自己把關。在 AI 加速攻擊的時代,這等於給防禦端裝上同等級的火力。真正讓「安全寫程式」變成預設,而不是事後補救。 👉🏻推薦實戰流程 1. 輸入 /claude-security → 選 Scan codebase(或 Scan changes) 2. 選擇掃描深度(Medium 通常就夠用,High / Max 更深入但較貴) 3. 等掃描完成(會產生 CLAUDE-SECURITY-時間戳/ 資料夾) 4. 看報告(CLAUDE-SECURITY-RESULTS.md) 5. 再輸入 /claude-security → 選 Suggest patches 6. 選擇要修的 finding(例如 F1、F2) 7. 用 git apply 套用產生的 .patch 檔,自己 review 後再 commit 👉🏻小技巧 • 大專案建議先只掃重點目錄,不要一次掃整個 repo • 掃描是非確定性的,同一段程式碼跑兩次結果可能略有不同 • 修補永遠不會自動套用,一定要人審核 這樣就可以直接在終端裡把「資安掃描 + 修補建議」變成日常工作流的一部分了!
もっと見る