登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 LLM架构
LLM架构 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
LLM架构 を含む検索結果
LLMエージェントに「脆弱性を探して」と頼むだけでは誤検知が多くなりがちです。Cloudflareはそこに対立的検証という発想を持ち込みました。 タイトル: cloudflare/security-audit-skill URL: 🔍 概要 コーディングエージェントを自動セキュリティ監査ツールとして機能させ、独立した検証と機械可読な脆弱性報告を実現するスキルです。npxコマンド1つでClaude Codeなどに導入できます。 🧭 解決する課題 単純にAIへ脆弱性探索を任せると根拠の薄い誤検知や見落としが発生しがちです。それに対し、探索と検証を別エージェントに分離することで信頼性を高めています。 ⚙️ 方法論・提案手法 偵察→カバレッジ主導の探索→候補検証→構造化出力→独立記録検証→中立的な報告、という6フェーズのパイプラインを構成。新規の独立エージェントが候補と最終クレームをそれぞれ再検証する「対立的検証」が特徴です。 🛠️ ユースケース ・security audit this codebaseのような自然言語指示で起動 ・LLM・プロンプトインジェクションからクラウド・サプライチェーンまで12種類の攻撃クラスに対応 ・validate-findings.cjs等の検証ツールも同梱 📊 実験結果 テストでは単一実行で約50%の脆弱性を検出し、複数回の実行を重ねることでカバレッジが積み上がる設計です。GitHubでは16.3kスター・894フォークを獲得しています。 #セキュリティ# #AIエージェント#
もっと見る
LLMは数学の問題で人間より高い正解率を出せるようになりました。でもそれは「きちんと積み上げて理解している」からでしょうか? タイトル: Do LLMs Exhibit Coherent Knowledge Structures in Mathematical Reasoning? A Perspective from Knowledge Space Theory URL: ❓ LLMは前提知識をきちんと積み上げて正解しているの? 💡 正解率自体は人間79.6%に対しLLM最高92.5%(Qwen3-80B)と上回りますが、前提を完全に満たした上での正解の割合は人間72.7%に対しLLMは48.16%にとどまります。正解していても土台が抜けているケースが多いということです。 ❓ 前提知識をヒントとして教えてあげれば改善する? 💡 実は前提に基づくヒントを与えても、無関係な例を与えた場合とほとんど差が出ませんでした。構造的な前提推論ではなく、表層的なパターンマッチングに頼っている可能性が高いです。 ❓ 賢いモデル同士なら、似たような知識の持ち方をしているはず? 💡 人間の学習者グループ間では知識の重なりが0.9以上と高いのに対し、LLM同士では0.38〜0.6程度しか重なりません。強いモデルほど人間から離れていく傾向も見られました。 ❓ つまりこの研究が示しているのは? 💡 精度という指標だけでは、LLMの「理解の仕方」のズレは見抜けないということです。知識空間理論という新しい評価レンズを使うことで、正解率の裏にある断片的な知識構造が浮かび上がります。 #LLM評価# #数学的推論#
もっと見る
LLMにつまらない回答をされた時「どないやねん」と思ってたけどastraには「俺が悪かった」と思える。
LLM費用は1人30万円/月 コミットベースでの開発速度は3倍 #BetAIDay#
LLMで保守がめちゃくちゃ楽になったんだけど、Wineなんかも今後安定して保守できるんだろうな
LLMの能力の爆発的向上を前提にした上で、それでもなお、自分らしい言葉、表現を大切にするならば、その要求レベルは高いものにならざるを得ない。まずは、自分の人生の固有の経験を大切にすること。自分の感覚を見つめること。そして、言葉の微妙なニュアンスの違いの中で自分選択を磨くことだ。
もっと見る
LLMに象徴される自然言語の配列の共通性があるにも書かわらず、私たちがある文字列に個性を見たり、紛れもなく自分の文章であると感じるメカニズムは、私たちの記憶、感性、世界モデルの固有性とつながっていて、それ自体がノントリビアルな課題であると言える。ある文章がなぜある人のものになるか
もっと見る
LLMのプライシングは入出力のトークン課金だから不要な出力を減らせば安くなるみたいなハックしようとする人がいるけど、Reasnoning は独り言をブツブツ呟きながら精度を上げる仕組みなので、出力減らすと単に性能落ちますよ
もっと見る
『LLM/AIエージェントシステムベストプラクティス』が無事発売されました! Kindleが2つフォーマットがあると知らず、2冊買ってしまった。
もっと見る
LLMにおけるハルシネーションは、大きく真偽接地問題と汎化の問題から生じていると整理できる。 真偽接地問題とは、生成した命題の真偽を外界の事実とどのように結びつけるかという問題である。なお、真偽接地問題はここで用いる私の造語である。 言語的なもっともらしさと、外界における命題の真偽は異なる。しかし、通常の言語モデルは主として言語分布を学習しており、この二つを直接区別するようには学習されていない。 これと関連する概念として、記号接地問題がある。記号接地問題とは、記号の意味を外界にどのように結びつけるかという問題である。例えば「りんごは赤い」という文の意味は、単なる「りんご」「赤い」という記号同士の関係だけで決まるのではなく、それらが実世界の対象や知覚とどのように対応しているかによって定まる。 これに対して、ここでいう真偽接地問題は、ある命題の真偽を外界の事実にどう結びつけるかという問題である。例えば、ある会社の代表者として無関係な人物を挙げたり、存在しない製品名を生成したりする場合、その出力は単語列としてはもっともらしくても、外界の事実とは対応していない。 概念的には、 p(true | 命題, 外界) を推定できるかどうかの問題と捉えることができる。 もう一つは、汎化、あるいは平滑化の問題である。言語モデルは有限の訓練データから学習するため、訓練中に観測していない系列に対しても適切に確率を割り当て、汎化する必要がある。 従来の言語モデルでも、一度も学習中に観測していない単語列に確率0を与えてしまうことは大きな問題だった。そのため、頻度ディスカウントや平滑化によって、既観測系列に割り当てられた確率の一部を未観測系列へ移していた。 ニューラル言語モデルは、分散表現による汎化によって、この平滑化問題を驚くほど自然に解決した。訓練中に一度も見ていない単語列であっても、その意味や文脈が既知のものと似ていれば、もっともらしい確率を割り当てることができる。 しかし、この強力な汎化能力は、事実を扱う場合には副作用を持つ。正解が一意に定まる事実についても、観測していない誤った候補に確率を与えてしまうからである。汎化する能力そのものが、ハルシネーションの原因にもなりうる。 さらに、この二つの問題は独立というより、相互に関係している。真偽が十分に接地されていないために正しい候補を識別できず、その不確実性の中で平滑化・汎化が働くことで、もっともらしい誤った候補にも確率が乗る。 真偽接地問題については、学習時に言語表現と外界の状態や検証可能な事実との対応を明示的に与えることで、ある程度解決できる可能性がある。 ただし、外界そのものの定義も単純ではない。現実世界だけでなく、あるゲーム世界、ある人物が信じている世界など、命題の真偽は前提とする世界や文脈によって変わりうる。この点まで含めて、どの世界に対する真偽なのかを接地する必要がある。 一方、汎化の問題も本質的にどこまで解決できるかは分からない。未観測例への汎化は、有限データから学習するために不可欠である。そのため、未知の対象にも確率を与えるという性質そのものをなくすことはできない。 必要なのは、汎化に任せる領域と、厳密な制約や構造化された情報によって扱う領域を組み合わせることだろう。 特にロングテールの情報、すなわち学習中に一度から数回しか観測されない事実を扱う場合、汎化だけによって高い網羅性とほぼ完全な正確性を同時に実現することは難しい。この領域では、ある程度の誤りを受け入れるのか、それとも外部知識・検証器を利用して回答範囲を制限するのか、という選択が必要になる。
もっと見る