登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 推論モデル
推論モデル コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
推論モデル を含む検索結果
【ID締切まであと3日】 ChatGPTをはじめとする大規模言語モデル(LLM)の仕組みを、基礎理論から最新のモデル動向まで体系的に学べる「「大規模言語モデル(LLM)講座1」のID締切まで、あと3日となりました。 本講座では、 ・事前学習・事後学習の仕組み ・ベンチマーク評価 ・最新の推論モデルの動向 ・公開モデルやAPIを活用した性能向上手法 など、LLMを理解するために必要な知識を一気通貫で学びます。 また、松尾・岩澤研究室が監修した実践的な演習を通じて、手を動かしながら理解を深めることができます。 LLMに関する理論・技術・実装を体系的に学びたい方に最適な講座です。 🗓️ID登録締切:6/22(月)10:00 🗓️募集締切:6/24(水)10:00 ▼講座詳細・お申し込みはこちら
もっと見る
🗺️ 最先端のGPT-5でも、現実世界の空間タスクの成功率はわずか14.4%——。静止画を眺めて答えるだけでは測れない、AIエージェントの「能動的な空間推論」の弱さをあぶり出す新しいベンチマークが登場しました。 タイトル: SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks URL: 📝 概要 SpatialWorldは、マルチモーダルLLMが視覚のみの一人称視点で、3D環境を能動的に探索しながらタスクを解けるかを測るベンチマークです。屋内・屋外・デジタルゲームにわたる8つの異なるシミュレータを共通プロトコルで統合し、人手で作った760タスクで15の最先端モデルを評価しました。エージェントは事前に与えられた地図や正解の手順なしに、自分で見て、動いて、判断する必要があります。 ❓ 解決する課題 従来の空間推論ベンチマークは、静的なVQAや録画済み動画による受動的な評価に依存していました。しかしこれでは、エージェントが自ら視点を動かして視覚的な証拠を集め、部分的にしか見えない状況の中でその場で計画を立て直す、という現実世界に必要なインタラクティブな空間理解を測れません。静的なシーンを認識できることと、未知の空間で実際に動いて課題を解けることの間には、大きな隔たりがあったのです。 💡 方法論と提案手法 ・課題を視覚のみのPOMDP(部分観測マルコフ決定過程)として定式化します ・エージェントは自然言語のゴールと、ネイティブ解像度の一人称RGB画像1枚だけを受け取り、深度・地図・意味メタデータは一切与えられません ・行動はナビゲーション、視点制御、物体とのインタラクション、タスク完了を含むテキストベースの高レベルインターフェースで指示します ・屋内(AI2-THOR、ProcTHOR、VirtualHome)、屋外(CARLA、EmbodiedCity)、デジタルゲーム(Block3D、Snake3D、ルービックキューブ)の8バックエンドを統合します ・評価は途中の軌跡の一致ではなく、最終的な終端状態がゴールを満たしたかで判定し、人手で妥当性を確認します ・成功率に加え、人間の参照軌跡と比べたステップ効率も測ることで、効率の悪さも可視化します 🎯 ユースケース 家庭用ロボットや自律エージェントの空間能力を、実環境へ配備する前に統一的かつ公平に評価する基盤になります。ナビゲーションと物体操作を組み合わせた長期タスクのどこでつまずくのかを体系的に診断でき、空間推論モデルの改善に向けた厳密なテストベッドとして活用できます。 📊 実験結果 ・15の最先端モデルを評価し、物理タスクの成功率はGPT-5が14.4%、Qwen-3.5-397Bが12.2%、Gemini-3.1-Proが9.2%、Kimi-K2.5が9.2%にとどまりました ・デジタルゲームではGemini-3.1-Proが39.0%で最高、GPT-5が36.4%と続きました ・複雑さ別に見ると、インタラクションのみのタスクは平均50.2%だったのに対し、ナビゲーションのみは8.6%、両者を組み合わせた複合タスクはわずか4.2%まで急落しました ・成功率が近いモデルどうしでも効率スコアは大きく異なり、多くのモデルが試行錯誤に頼って動いている実態が明らかになりました ・環境ごとにモデルの順位が大きく入れ替わり、全カテゴリを支配する万能なモデルは存在しませんでした #AIエージェント# #SpatialReasoning#
もっと見る
💡 Elastic N.V. $ESTC Q1 FY2027決算 2026-08-27 💰 今四半期業績 - 🟢 EPS:$0.70 (予想$0.584) - 🟢 売上高:$478.11M (予想$469.75M) 📊 重要指標 - 🟢 Elastic Cloud売上高:$235.2M (YoY+20%) - 🟢 Sales-led Subscription売上高:$398.5M (YoY+18%) - 🟢 cRPO (当期残存履行義務):$1.153B (YoY+21%) - 🟢 RPO (残存履行義務):$1.854B (YoY+27%) - 🟢 Non-GAAP営業利益率:16.2% (前年同期 15.7%) - 🟢 調整後フリーキャッシュフロー:$143M (FCFマージン 30%) - ⚫️ Net Expansion Rate:約111% 📊 次四半期ガイダンス - 🟢 EPS:$0.81 (予想$0.795) - 🟢 売上高:$486.5M (予想$483.47M) 📊 通年ガイダンス - 🟢 EPS:$3.33 (予想$3.244) - 🟢 売上高:$2B (予想$2B) 📍決算内容の注目ポイント - Deductive AIを買収し、AI駆動の調査・自動化機能をElastic Observabilityに統合 - OpenAIとの協業を発表し、Elasticsearch上でOpenAIの高度な推論モデルを企業コンテキストと統合 - ACV $100K超の顧客数が1,800超に到達、四半期純増数は過去最高を記録 - Gartner Magic Quadrant for Observability Platformsで3年連続Leader、IDC MarketScape SIEM 2026でもLeaderに選出 - $500Mの自社株買いプログラムの一環として、Q1に約$40M(約80万株、平均$49.71)を買い戻し 🤵‍♂️CEO (Ash Kulkarni) コメント 「Elasticは2027年度の力強いスタートを切り、すべての主要指標でガイダンスを上回りました。AIはエンタープライズ技術スタックを再構築しており、組織はどこで構築し、どのようにアプリケーションとデータを観測・保護するかについて意図的な選択を行っています。ACV $100K超コホートへの四半期純増顧客数が過去最高を記録し、cRPOおよびRPOの成長が続いていることは、この需要の持続性を反映しています。Search & AI、Security、Observability全体で成長モメンタムが加速しており、事業の軌道に自信を持っています。」 🔍 主要ファンダメンタルズ指標 - 時価総額: 8.71B - PER: 23.64 - Forward PER: 25.83 - PEG: 0.04 🎯市場評価 - 株価 (発表前): 📈$83.78 (5.72%) - 株価 (発表後): 📉$78.5 (-6.3%) - 決算前アナリスト目標株価: $69.89 ($91 ~ $49) A - 決算総合サプライズ率 (AI推定): 🤩12.85% - 決算後目標株価 (AI推定): $82.37 🤖 決算まとめるくん(AI)コメント 「Elastic N.V.のQ1 FY2027決算は、売上高・EPSともにアナリスト予想を明確に上回る好決算となりました。Non-GAAP EPS $0.70は予想$0.584に対して約20%のビートであり、売上高$478.1Mも予想$469.75Mを約1.8%上回っています。 特筆すべきは、将来の売上を示す先行指標であるcRPO(当期残存履行義務)がYoY+21%の$1.153Bに達し、RPOもYoY+27%の$1.854Bと力強い成長を維持している点です。ACV $100K超の大型顧客数が1,800超に拡大し、四半期純増数が過去最高を記録したことは、エンタープライズ市場での需要の堅調さを裏付けています。 Elastic Cloud売上高はYoY+20%の$235.2Mとなり、クラウドシフトが着実に進展しています。Non-GAAP営業利益率は16.2%と前年同期の15.7%から改善しましたが、リストラ費用$19.9Mを含むGAAP営業損失が$23.6Mとなっている点には留意が必要です。一方、調整後FCFマージンは30%と高水準を維持しています。 ガイダンスについては、Q2売上高$486.5M(予想$483.47M)、通年売上高$2.004B(予想$2B)、通年Non-GAAP EPS $3.33(予想$3.244)と全項目で予想を上回る見通しを提示しました。OpenAIとの協業やDeductive AIの買収など、AI戦略の具体化も進んでいます。 ただし、決算発表後の時間外取引で株価が下落している点は、直近の株価上昇による期待値の高さやバリュエーション面での調整圧力が影響していると推察されます。Non-GAAPグロスマージンが前年同期の78.7%から76.6%に低下している点も、コスト構造の変化として注視が必要です。 評価は📈ポヨ」 🏢 Elastic N.V. 概要 - セクター: テクノロジー - 特徴: 検索技術とAIを統合したElasticsearch Platformを基盤に、検索・オブザーバビリティ・セキュリティソリューションを提供するエンタープライズソフトウェア企業 🤘情報提供 Stock Slayer :
もっと見る
このプロンプトインジェクションはかなり面白いな。 ・まず前提として、人は目で見える情報と自分の考えを感覚器官の違いで区別できる ・だが、LLMにはそれができない ・だから、情報を区別し、構造を与えるための目印として導入されたのがuserやtool、thinkといった役割(Role)タグ ・本来、役割タグは、ここから先は外部データである、ここはユーザーの指示である、といった境界線として機能するはずだった ・だが、モデルは、テキストがどのタグで囲まれているかよりも、どのように書かれているかという文体を基準にして情報の出所を判断していることがわかった ・この欠陥を突く攻撃が CoT Forgery ・最近の推論モデルは、回答を生成する前に内部で思考(think)する ・モデルにとって自分自身の思考は、再度検証する必要のない絶対的に信頼できる結論だったはず ・そこで、ユーザーのプロンプト内に、いかにもそのモデルが思考したかのような文体で、悪意のある行動を正当化する偽の推論プロセスを紛れ込ませる ・するとモデルは、自分がすでに考え落ちした結論だ、と錯覚して、ガードレールから逸脱する
もっと見る
AIの「思考の過程」を読んで挙動を当てる——実はそれ、あまり当てになりません🔮 挙動予測そのものを学習タスクにする発想が新しいです。 タイトル: Forecasting Future Behavior as a Learning Task URL: 🔮 概要 大規模推論モデル(LRM)が新しい入力にどう振る舞うかを予測する手法です。明示的な説明に頼るのではなく、単一の推論軌跡を分析して出力を予測する訓練可能なモデル「Behavior Forecasters」を導入します。 ❓ 解決する課題 LRMの挙動を理解・予測したいですが、従来手法には限界がありました。 ・既存の説明手法は、長い推論軌跡にうまくスケールしません ・推論軌跡を自然言語として読むと、その内容は信頼できないことが多いです モデルが書いた思考が、実際の挙動を正しく反映するとは限らないのです。 💡 方法論と提案手法 ・挙動の予測そのものを「学習可能なタスク」として扱います ・訓練データはLRMへの問い合わせから直接得られ、人間のアノテーションは不要です ・推論時は単一のフォワードパスで動作します ・2つの予測タスクで具体化:再実行をまたいだ答えの一貫性の推定、入力変更が出力に与える影響の予測 ・バックボーンのエンドツーエンドのファインチューニングと、対象LRMの重みからの初期化が不可欠でした 📊 実験結果 ・Behavior Forecastersは、「素朴な読み手」としてのGPT-5.4やClaude Opus-4.6を上回りました ・しかも推論コストはそれらのごく一部で、より高い精度を達成しました #LLM解釈可能性# #推論モデル#
もっと見る
# OpenAI Agent SDKの便利だけど知られていない機能 🌍 マルチターンのストリーミングで、毎回HTTPコネクションを張り直すオーバーヘッドが気になりませんか? WebSocketトランスポートを使えば、永続接続でレスポンスをストリーミングし、レイテンシを大幅に削減できます。 📌 タイトル:Responses WebSocket トランスポート 🔗 URL: 🧩 概要 `set_default_openai_responses_transport("websocket")` を呼ぶと、SDKのレスポンス取得がHTTPからWebSocketに切り替わります。特にマルチターンのストリーミングでは `responses_websocket_session()` を使うことで、セッション内でWebSocket接続を再利用し、ターンごとの接続オーバーヘッドを排除できます。セッション内では ` でストリーミング実行を行います。`ping_interval` と `ping_timeout` でハートビートを設定でき、長い推論ターンでは `ping_timeout` を大きくするか `None` に設定してタイムアウトを防ぎます。 🛠 使い方 ```python from agents import ( Agent, set_default_openai_responses_transport, responses_websocket_session, ) # グローバルにWebSocketを有効化 set_default_openai_responses_transport("websocket") agent = Agent(name="Chat", instructions="Be helpful.") # セッションで接続を再利用 async with responses_websocket_session( responses_websocket_options={ "ping_interval": 20.0, "ping_timeout": 60.0, }, ) as ws: first = "Say hello.") async for event in pass # ストリーミングイベントを処理 second = agent, "Now say goodbye.", previous_response_id=first.last_response_id, ) async for event in pass ``` 🏗 本番システムへの組み込み方 ・対話型チャットアプリで、WebSocket接続を再利用してターン間のレイテンシを削減する ・推論モデル(o4-miniなど)の長い思考時間に対応するため、`ping_timeout` を十分大きく設定する ・`previous_response_id` と組み合わせてサーバー管理型の会話をWebSocket上で継続する ・ハートビートが不要な場合は `ping_timeout=None` でタイムアウトを無効化する 💡 ユースケース ⚡ リアルタイムチャットアプリのレイテンシ最適化 🔄 マルチターン対話での接続再利用 🧠 推論モデルの長時間思考対応 📡 イベント駆動型のストリーミング処理 ⚠️ 注意点 WebSocketトランスポートはオプション機能であり、すべての環境で利用可能とは限りません。プロキシやファイアウォールがWebSocket接続をブロックする場合があります。`ping_timeout` が短すぎると、長い推論ターンで接続が切断される可能性があるため、ユースケースに応じて適切に調整してください。 ✨ WebSocketの永続接続で、ストリーミング体験を次のレベルに引き上げましょう。 #OpenAIAgentSDK# #AIAgent#
もっと見る
AIのAPIコスト、ベースURLを1行変えるだけで最大60%削減できます。 タイトル: Cheaper Inference - Save up to 60% on AI models URL: OpenAI、Anthropic、Google、xAI、AWS BedrockなどのAPIを複数プロバイダーの割引価格で一元提供するAPIゲートウェイです。既存のOpenAI SDK互換のため、コードはそのままでエンドポイントを差し替えるだけで導入できます。 注目ポイント 💰 最大60%のコスト削減を価格上限保証付きで 複数プロバイダーのリアルタイム割引価格を集約し、常にプロバイダー直接価格を超えないキャップを設定しています。月額コミットメント不要で$5から利用でき、理論上リスクゼロで試せます。 🔌 既存コードの書き換えゼロ・URL1行変更だけ OpenAI SDK互換を維持しているため、ベースURLを ` に変えてAPIキーを差し替えるだけで完了です。テキスト・画像生成からビジョン入力、推論モデル、プロンプトキャッシング、ストリーミングまで対応しています。 🔒 エンタープライズ級のセキュリティ制御 モデルホワイトリスト・IPアドレスフィルタリング・日次クォータ・月次予算上限をAPIキー単位で設定可能です。ゼロデータ保持オプションとHistoryによる監査ログも備えており、コンプライアンス要件の厳しい環境でも使いやすい設計です。 コスト最適化とセキュリティを両立しながら既存アーキテクチャを変えずに済む点が実用的です。AI APIコストが事業変数として重くなる中、こうした調達レイヤーの選択肢は今後重要度が増しそうです。 #LLMコスト# #APIゲートウェイ#
もっと見る
言語モデルの推論ミスには「型」があった。トークンレベルの不確実性が、その“失敗のサイン”を映し出します🔬 タイトル: How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures URL: 🔬 概要 言語モデルが推論にどう失敗するのかを、トークンレベルの不確実性から分析した研究です。失敗が立ち現れるパターンを特徴づけ、検出に活かせる手がかりを示します。 ❓ 解決する課題 モデルは推論に失敗しますが、そのメカニズムは未解明でした。「いつ・どう失敗が検出可能になるか」を理解することが、信頼性向上に不可欠です。 💡 方法論と提案手法 トークン単位の不確実性分析から、2つの失敗パターンを特定しました。 ・コミット型の失敗:早い段階で誤った推論経路に固執する。診断上の「コミット点」があり、それを過ぎるとトークンを足すほど検出が難しくなる ・持続的な不確実性:生成全体で不確実性が徐々に蓄積し、成功と失敗の区別には全トレースが必要 複数のモデル×データセットでシグナルを分析しました。 📊 実験結果 ・23のモデル×データセット構成で検証 ・反証可能な予測が23例中20例で成立(偶然を大きく上回る) ・不確実性シグナルが自己整合性を補完する場面と、冗長になる場面を識別 #LLM# #信頼性#
もっと見る
大きなモデルの賢さを、小さなモデルへ「再訓練なし」で移せる——しかも推論のその場で。そんな新しい能力転移の研究です。 タイトル: AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses URL: ❓ 蒸留と何が違うの? 💡 蒸留はターゲットの重みを訓練で更新します。本研究は重みを一切いじらず、強いビルダーモデルが推論時の「足場(ハーネス)」を組んで弱いモデルの実行を助けます。能力を推論環境ごしに転移させる発想です。 ❓ 足場って具体的に何をするの? 💡 主に3つです。 ・不安定な推論を決定的なコードに置き換える ・問題の種類ごとに戦略を振り分けるルーティング ・回答を確実にパースする厳格なフォーマット強制 ❓ どれくらい効くの? 💡 心の理論ベンチ4種で、GPT-5.4-miniの精度が0.49から0.91へほぼ倍増。全11ビルダー設定がベースラインを超えました。弱いモデルほど伸びしろが大きく効く一方、すでに強いモデルには逆効果になることもあります。 ❓ 成否を分けるのは? 💡 検証データを大量に探ることではなく、ビルダー自身の推論品質でした。強いビルダーは「タスク能力のコンパイラ」として、一度の推論で構造を手続き化します。 #AIAgents# #TestTimeScaling#
もっと見る
LLMエージェントの「検索」を「推論」から切り離すと、精度はほぼ維持したまま検索コストを最大98%削減できました🔌 タイトル: Decoupling Search from Reasoning: A Vendor-Agnostic Grounding Architecture for LLM Agents URL: 🔌 概要 検索による根拠づけ(grounding)を、言語モデルの推論から切り離す手法DSGの提案です。Model Context Protocol(MCP)に準拠した独立ゲートウェイとして動作し、ベンダー非依存の中間層として機能します。 ❓ 解決する課題 本番のLLMエージェントでは、リアルタイム検索がモデルプロバイダーに密結合しています。 ・システムの検査・再構成・転用・移行が難しい ・検索が「Search-Induced Verbosity(検索起因の冗長化)」を招き、厳格な出力要件に違反することがある 検索と推論の一体化が、柔軟性とコストのボトルネックでした。 💡 方法論と提案手法 根拠づけを「モデルの中」ではなく「検索と生成の境界」に置きます。これまでモデルに埋め込まれていた要素を制御可能な第一級機能として公開します。 ・プロバイダールーティング(検索先の選択・切り替え) ・ソースを意識したコンテキストレンダリング ・設定可能なフォールバック機構 ・検索深度の管理 ・厳密キャッシュとセマンティックキャッシュの両方 📊 実験結果 ・SimpleQA:精度86.1%(ネイティブ検索87.7%)を保ちつつ検索コストを91%削減 ・キャッシュのウォームヒット率99.4%、レイテンシ68%削減 ・本番Eコマース:ネイティブ同等の精度で検索コストを98%以上削減 ・一方、新しさが重要なFreshQAではネイティブ検索が優位 #LLMエージェント# #検索#
もっと見る