登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ClaudeOpus
ClaudeOpus コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ClaudeOpus を含む検索結果
【注意】Claude Opus 5において、effort レベルを上げると、逆にコーディングの能力が落ちることがあることが判明しています コーディング用途ではmed(中)や、high(高)ぐらいがちょうど良さそうです!
もっと見る
コーディングエージェントは「どのモデルが賢いか」で選ばれがちだけど、それだと半分しか見てない。同じClaude Opusでも、ある器では77%、別の器では93%とスコアが激変した実測がある。モデルじゃなく、それを動かす器の差で結果が変わるんだ。
もっと見る
「高性能AIは高い」の常識、崩れました。 中国 GLM-5.2 が話題。 ・コーディングでGPT-5.5超えのベンチも ・Claude Opus 4.8に肉薄 ・なのに価格はGPT-5.5の約1/6 ・MITライセンスで商用OK・ローカル実行も 性能と料金を比較表で整理しました🔽
もっと見る
AlibabaのQwenチームが実機重視のGUIエージェント「Qwen-UI-Agent」を発表した(https://arxiv[.]org/html/2607.28227v1)。GUIエージェントとは、画面を見て人間のようにタップや入力を行い、スマホやPCのアプリを操作するAIのこと。 多くのGUIエージェントはシミュレーター上のベンチマークには強くても、実際のスマホやPCで動かすと崩れやすい。Qwen-UI-Agentはこのギャップを埋めるため、実機100台以上・150以上のアプリを使った学習と評価に踏み込んでいるのが特徴。 結果は明確で、実機ベンチマークのMobileWorld-Realで92.2%(Claude Opus 4.8を7.5pt上回る)、AndroidDailyで97.5%を記録。ブラウザ操作のWebArenaも73.6%でOpus 4.8を1.7pt上回りトップ。一方でPC操作のOSWorld-Verifiedは79.5%とOpus 4.8(83.4%)に次ぐ2位で、全ての土俵で首位というわけではない。 行動の出し方にも工夫がある。GUI操作とCLI(コマンドライン、文字でコマンドを打ち込む操作方式)を状況に応じて使い分け、複数の操作をまとめて1ターンで出す「バッチ化」を導入。PC操作タスクではアクションの4割以上がバッチ化され、実行ステップ数を大きく減らしている。 面白いのは「先回り」の発想も持たせている点。フライトキャンセルの通知が届いたら、ユーザーが気づく前に代替便を探し、予定と照らし合わせて提案する、という使い方まで想定している。ベンチマークの数字より先に、実機で本当に使えるかを問うアプローチが徹底している。
もっと見る
AIがロボット犬を人間の助けなしに操り、最速の人間チームより約20倍速くタスクを完遂——物理世界に出てきたエージェントAIの実験です🐕 タイトル: Project Fetch: Phase Two URL: 🐕 概要 Anthropic の Frontier Red Team による研究で、先進的な言語モデルが四足歩行ロボット(ロボット犬)を自律制御し、高度なタスクを完遂できるかを検証した追跡実験(Phase Two)です。 ❓ 解決する課題 2025年8月の初回に続き、次の問いに答えます。 ・新しいClaudeモデルは、前世代(Opus 4.1)よりロボティクスのタスクで優れているか ・人間の助けなしに、自律的に動作できるか 💡 方法論と実験設定 ・Claude Opus 4.7を、Claude Code上で最大の適応的思考の努力レベルに設定し3回試行 ・Phase Oneで人間チームが行ったのと同じタスクに挑戦:映像・LiDARセンサー接続、制御プログラムの記述、経路監視、ビーチボール検出、自律回収 ・人間の関与は最小限(ノートPC接続、最初のプロンプト、コマンド/タスク承認のみ) 📊 実験結果 ・人間の助けなしのClaude Opus 4.7が、最速の人間チームより約20倍速い ・全グループ完了の4タスクで、非Claudeチームより平均37.7倍、Claude支援ありチームより18.9倍速い ・生成コードは1,045行で人間Claudeチーム(10,309行)の約1/10、それで同等以上の結果 ・一方、閉ループのフィードバックを要する精密なボール操作には苦戦 #エージェントAI# #ロボティクス#
もっと見る
ロールプレイAI(キャラになりきって会話するAI)のベンチマークは、実はどのモデルにも同じ「借り物の会話履歴」の続きを書かせて採点しているだけだったという論文(https://arxiv[.]org/abs/2607.27816)。 渡す会話履歴の質を上げただけで同じモデルの採点が平均0.21点(5点満点)上がり、劣化させると0.13点下がることが実験でわかっている。モデル自身の実力ではなく、渡された「お膳立て」の質を測ってしまっているわけだ。 もう一つの問題は採点基準(ルーブリック)が全員共通なこと。じっくり関係を深める会話が好きな人もいれば、テンポよく展開してほしい人もいるので、一律の基準では「その人にとっての満足度」は測れない。 そこでPALATEという新しいベンチマークは、5人の実ユーザーの本物の会話ログ(1人あたり約1,000ターン)でLoRA(モデルの一部だけ軽く追加学習する手法)を作り、「その人らしく話すAI」を再現する。このAIがロールプレイAI候補と自由に会話して、その場で評価用の会話を作るので、借り物の履歴に頼らず公平になる。採点基準もその人の過去の満足度データから個人専用に自動生成していて、論文の図には「そっけない態度の中に見える思いやり(Hard shell, soft care)」のような、人によって全然違う評価軸が並ぶ。 GPT-5.4、Claude Sonnet 4.6、DeepSeek V4 Proなど16モデルで検証したところ、全ユーザーに勝つモデルは1つもなかった。ユーザーごとに一番相性がいいモデルが違い(Qwen3-Max、DeepSeek V4 Pro、Claude Opus 4.8、Claude Sonnet 4.6がそれぞれ別のユーザーで1位)、総合1位はGPT-5.4だったが、これは一言一言の受け答えの質(Generic評価)で強いのが理由で、会話が長く続いたときの一貫性(Session評価)ではClaude Sonnet 4.6が最も高いスコアだった。一言一言の上手さと、長い会話が破綻しないことは別の能力だという指摘で、ロールプレイAIの「強さ」は1本のランキングだけでは測れないという結果になっている。
もっと見る
🐡 もう「どのLLMが最強か」を一つに絞って悩む時代は、終わるのかもしれません。 タイトル: Sakana Fugu Technical Report URL: Sakana AI の Fugu は、複数のフロンティア LLM を部下として束ね、タスクに応じて最適な布陣を自動で組む「指揮官(オーケストレータ)モデル」です。注目ポイントを3つに絞って紹介します。 🧭 学習された司令塔 Fugu は事前学習済みバックボーンに軽量な選択ヘッドを載せ、隠れ状態から最適なワーカーモデルをロジットで直接選びます。自己回帰生成を挟まないため、単一のフロンティアモデルを呼ぶのと同等の低遅延を保てるのが巧みです。 🕸️ ワークフローを動的に自作(Fugu-Ultra) 上位版はタスクを自然言語のワークフローとして書き下し、サブタスク分割・担当割り当て・通信戦略まで設計します。最大5ステップで討論型・逐次連鎖・木構造といった多エージェント協調を、問題ごとに組み立てます。 📊 単体モデルを超える成績 SWE-Bench Pro で 73.7 点(Claude Opus 4.8 の 69.2 を上回る)、GPQA-Diamond 95.5、LiveCodeBench 93.2 など主要ベンチで公開モデル最高水準。エージェント型コーディングでは「世代交代級」の 5〜6% の相対改善を達成しました。 巨大化ではなく賢い"指揮"で最先端へ。新しいスケーリング軸を示した一本です。 #SakanaAI# #LLM#
もっと見る
🔬 「AIは科学を“発見”できるのか?」を、本物のNature論文90本で厳しく測ったら、最強エージェントでもSOTA超えは2割弱でした。 タイトル: NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? URL: 📋 概要 Nature系ジャーナル由来の90タスク(6ドメイン)で、AIコーディングエージェントが既発表SOTAを再現・超越できるかを検証。元手法を遮断する「情報ファイアウォール」と、タスクごとにコンテナ化する自動環境NatureGymで、統一条件・Web検索禁止の厳密評価を実現しています。 🎯 解決する課題 これまでのエージェント研究ベンチは環境がバラバラで信頼性に欠けていました。本研究は「再現」ではなく「自力発見」を強制し、横断比較できる土俵を整えます。 📐 方法論 SOTA正規化の相対ギャップで採点(g>0.1で超越、g≥0で同等以上)。81種の指標を横断比較し、4時間予算・GPU割当・10エージェントを3ハーネスで評価します。 📊 実験結果 ・最強のClaude Opus 4.7でもSOTA超えは17.8%、同等以上は47.8% ・成功の45.5%は「科学課題を教師あり予測に翻訳しただけ」。真のドメイン推論はわずか8.3% ・失敗の主因は手法選択ミス45.1%と計算資源不足24.4%で、タスク誤解はわずか3.1% ・学際課題ほど成績が落ちる傾向 現状のエージェントは「翻訳」は得意でも「発見」は苦手、という冷静な現在地が見えて示唆に富みます。 #AI4Science# #CodingAgents#
もっと見る
💼 AIエージェントに、架空のスタートアップを500日間まるごと経営させてみたらどうなるか。価格設定もマーケも資金繰りも、全部Pythonコードで回す――その壮大なテストの結果が、なかなか痛烈でした。 短いタスクなら、いまのエージェントはもう立派な実行者です。コードを書き、問い合わせに答え、目の前の課題を片付けます。けれど現実のビジネスは、不確実な中で長い時間軸を進み、ノイズだらけの情報から手がかりを拾い、変化に適応し、無数の意思決定を一つのゴールへ束ねる――そんな総合力の勝負です。この「持続的に前進する知性」は、これまでほとんど測られてきませんでした。 そこで著者らは、CEO-Bench: Can Agents Play the Long Game? を提案します。エージェントは人間のCEOと同じ環境に置かれ、相互に絡み合うノイズの多い業績データベースを読み解き、シグナルを戦略に翻訳し、500日ぶんの経営判断をコードで調整していきます。強いエージェントは、顧客コホートをシミュレートして将来のキャッシュを予測したり、過去の交渉履歴を掘って隠れた顧客の好みを当てにいったりと、驚くほど高度なコードを書いてきます。 それでも、ほとんどの最先端モデルがこの環境で苦戦しました。開始残高100万ドルを上回って終えられたのはClaude Opus 4.8とGPT-5.5の2つだけ。しかもどちらも、安定して黒字を出し続けることはできませんでした。短期タスクの満点と、長期経営の成否のあいだには、まだ大きな隔たりがある――それを突きつける一本です。 URL: #AIエージェント# #LLM#
もっと見る