登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 LLM
LLM コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
LLM を含む検索結果
LLMエージェントに「脆弱性を探して」と頼むだけでは誤検知が多くなりがちです。Cloudflareはそこに対立的検証という発想を持ち込みました。 タイトル: cloudflare/security-audit-skill URL: 🔍 概要 コーディングエージェントを自動セキュリティ監査ツールとして機能させ、独立した検証と機械可読な脆弱性報告を実現するスキルです。npxコマンド1つでClaude Codeなどに導入できます。 🧭 解決する課題 単純にAIへ脆弱性探索を任せると根拠の薄い誤検知や見落としが発生しがちです。それに対し、探索と検証を別エージェントに分離することで信頼性を高めています。 ⚙️ 方法論・提案手法 偵察→カバレッジ主導の探索→候補検証→構造化出力→独立記録検証→中立的な報告、という6フェーズのパイプラインを構成。新規の独立エージェントが候補と最終クレームをそれぞれ再検証する「対立的検証」が特徴です。 🛠️ ユースケース ・security audit this codebaseのような自然言語指示で起動 ・LLM・プロンプトインジェクションからクラウド・サプライチェーンまで12種類の攻撃クラスに対応 ・validate-findings.cjs等の検証ツールも同梱 📊 実験結果 テストでは単一実行で約50%の脆弱性を検出し、複数回の実行を重ねることでカバレッジが積み上がる設計です。GitHubでは16.3kスター・894フォークを獲得しています。 #セキュリティ# #AIエージェント#
もっと見る
LLMは数学の問題で人間より高い正解率を出せるようになりました。でもそれは「きちんと積み上げて理解している」からでしょうか? タイトル: Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory URL: ❓ LLMは前提知識をきちんと積み上げて正解しているの? 💡 正解率自体は人間79.6%に対しLLM最高92.5%(Qwen3-80B)と上回りますが、前提を完全に満たした上での正解の割合は人間72.7%に対しLLMは48.16%にとどまります。正解していても土台が抜けているケースが多いということです。 ❓ 前提知識をヒントとして教えてあげれば改善する? 💡 実は前提に基づくヒントを与えても、無関係な例を与えた場合とほとんど差が出ませんでした。構造的な前提推論ではなく、表層的なパターンマッチングに頼っている可能性が高いです。 ❓ 賢いモデル同士なら、似たような知識の持ち方をしているはず? 💡 人間の学習者グループ間では知識の重なりが0.9以上と高いのに対し、LLM同士では0.38〜0.6程度しか重なりません。強いモデルほど人間から離れていく傾向も見られました。 ❓ つまりこの研究が示しているのは? 💡 精度という指標だけでは、LLMの「理解の仕方」のズレは見抜けないということです。知識空間理論という新しい評価レンズを使うことで、正解率の裏にある断片的な知識構造が浮かび上がります。 #LLM評価# #数学的推論#
もっと見る
LLMにつまらない回答をされた時「どないやねん」と思ってたけどastraには「俺が悪かった」と思える。
LLMOに取り組んで改めて検索を通してあらゆる接点でブランドを認知して指名検索に跳ね返ってるんだなあということを理解した。 比較サイトやAI Overviews、リスティング広告などありとあらゆるところで目にして認知が形成されていく感じ。 SEOからデジタルPRと広く捉え直した方が良いのかもな。
もっと見る
LLM費用は1人30万円/月 コミットベースでの開発速度は3倍 #BetAIDay#
「LLMOチェキ」、AIが引用する比較記事への"未掲載"を自動検出する「掲載打診リスト」を標準搭載
LLMで保守がめちゃくちゃ楽になったんだけど、Wineなんかも今後安定して保守できるんだろうな
LLMの能力の爆発的向上を前提にした上で、それでもなお、自分らしい言葉、表現を大切にするならば、その要求レベルは高いものにならざるを得ない。まずは、自分の人生の固有の経験を大切にすること。自分の感覚を見つめること。そして、言葉の微妙なニュアンスの違いの中で自分選択を磨くことだ。
もっと見る
LLMに象徴される自然言語の配列の共通性があるにも書かわらず、私たちがある文字列に個性を見たり、紛れもなく自分の文章であると感じるメカニズムは、私たちの記憶、感性、世界モデルの固有性とつながっていて、それ自体がノントリビアルな課題であると言える。ある文章がなぜある人のものになるか
もっと見る
LLMのプライシングは入出力のトークン課金だから不要な出力を減らせば安くなるみたいなハックしようとする人がいるけど、Reasnoning は独り言をブツブツ呟きながら精度を上げる仕組みなので、出力減らすと単に性能落ちますよ
もっと見る