登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 environment
environment コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
environment を含む検索結果
ボッテガ・ヴェネタが没入型アート展「INSIDE OTHER SPACES: ENVIRONMENTS BY WOMEN ARTISTS, 1956-76」を韓国ソウル・リウム美術館にて開催 会期は5月5日〜11月29日
もっと見る
🔬 最上位のAIエージェントでも、科学計算コードの修復タスクは約1/3が1時間以内に解けないという結果が出ました。 タイトル: ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments URL: 🧩 概要 AItonomy・Qwen・PhAI-Labsが、天体物理・海洋モデリングなど27の科学コードベースを、AIエージェントが学習できる実行可能な環境へ変換するインフラ「ScienceIDE」を構築しました。64環境・2,812タスクを整備しています。 ⚙️ 解決する課題 科学コードには数十年分の専門知識が詰まっていますが、断片化したツールチェーンや文書化されていない数値慣習のせいで、信頼できる学習経験に変換するのが困難でした。 🛠 方法論と提案手法 数値許容誤差や保存量を比較する「科学的チェック」でタスクの正当性を検証し、修復・実装など7分類のタスクを生成。強化学習では予算切り捨てへの不当なペナルティを防ぐ「切り捨てマスキング」という工夫も導入しています。 📊 実験結果 1時間予算でのエージェント比較ではFable 5.1が67.1%で最高、Astraが63.1%。ScienceIDEの経験で学習したPhAI-IDEモデルは科学コード修復タスクで最大+33.33ポイント、強化学習ではLAPSタスクの報酬が2.4倍に向上しました。 #AIエージェント# #AI4Science#
もっと見る
🖥️ エージェントの学習用「実行環境」は軌跡の何百分の一しかない、という不均衡をひっくり返す発想の論文です。 タイトル: Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments URL: 蓄積済みのコードエージェント軌跡からファイル操作履歴を読み解き、実行可能な検証環境を自動で逆算復元し、そこから新たな学習タスクを大量に合成するフレームワークです。 注目ポイント 🔄 軌跡から環境を逆算復元 軌跡内のread/write/edit操作をリプレイして部分的なワークスペースを再現し、補完エージェントが欠けているファイルや依存関係を補います。さらに読み取り専用ツールで充分性を判定し、質の低い環境を除外します。 🌐 幅と深さの二軸でタスクを拡張 複数リポジトリの依存関係を使うCross-WS合成で「幅」を、ユーザーからの追加要望に応じるMulti-Round対話で「深さ」を広げます。Multi-Roundは平均4.51ラウンド、失敗から修正するパターンが69.6%を占めます。 📈 二桁ポイントの性能向上を実証 Qwen3.5-27Bをこのデータで学習させ、Terminal-Bench 2.1で+11.9pt、EvoCode-Bench v2で+13.8ptと大幅に改善。同規模の既存手法もすべて上回りました。 蓄積された軌跡という「余っているリソース」を検証可能な学習環境に転換する、地に足のついたスケーリング手法だと感じます。 #エージェント学習# #LLM#
もっと見る
エージェントのベンチマーク、どうやって作ればいいのか?LangChainが実践ノウハウを公開しました。 タイトル: How We Build Agent Environments & Tasks URL: ❓ エージェントの「タスク」って何で構成されているの? 💡 タスクは「インプット・環境・テストスクリプト」の3要素で成り立ちます。環境はエージェントの実行場所を提供し、ルーブリックが採点基準を定義します。複数の関連タスクにまたがる共有知識は「ワールドスペック」としてまとめ、APIスキーマ・データ生成方法・トレース解析スクリプトなどを一元管理します。 ❓ 大量のタスクを効率よく作るにはどうすればいい? 💡 LangChainは2段階パイプラインを採用しています。最初に「スペック生成」フェーズでコーディングエージェントがリポジトリをスキャン・トレースを分析しワールドスペックを自動生成します。次に「Spec2Task」フェーズでそのスペックから実行可能なタスクに変換します。最初のタスク作成時のスペックをベースに、後続のサイクルで反復的に品質を高めていく設計です。 ❓ タスク作成で特に注意すべき落とし穴は? 💡 3点が重要です。 ・実際のエージェントを動かさないと環境の欠陥が見えない(ペーパーテストでは不十分) ・モデルティア間(例: gpt-5.6-Luna vs Sol)で難易度を均等に校正する必要がある ・自由記述にはLLMベースの生成、表形式データにはSQLスクリプトという使い分けを徹底する ❓ ベンチマークは作ったら完成ですか? 💡 いいえ。本番データを使った継続的改善が核心です。コスト分析・プロンプト簡略化の検証・ツール設定テストに本番トレースを活用し、ベンチマーク自体の品質を運用しながら高め続けます。 評価環境の構築を「一度やれば終わり」でなく継続的なエンジニアリングとして捉える姿勢が実践的です。 #AIエージェント# #LLM評価#
もっと見る
# Learning Palantir Foundry 🚀 Put business logic right on the ontology. Functions cure the "numbers don't match across departments" problem by centralizing logic in one place. 📌 Title and Feature URL Title: ファンクション URL: 📝 Overview Functions let you write server-side logic that executes in isolated environments, powering operational apps like dashboards and decision-support tools. They are designed to work with Foundry ontologies, so they can read object properties, traverse links, and perform flexible ontology edits. 🔧 How It Works - Supported languages: TypeScript (full feature support) and Python (beta, with growing support especially for serverless and deployed execution). - Serverless execution: spins up on demand when invoked and bills only during execution, with a 60-second total wall-clock timeout (30s CPU plus a 30s network buffer). Multiple versions can run simultaneously, making upgrades safer. - Deployed execution: reserves dedicated resources for cases serverless cannot meet, runs a single version at a time, and bills continuously while deployed. - Capability differences: ontology read/write, Workshop integration, and external API calls work in both languages. Pipeline Builder is Python, while model embedding and semantic search are TypeScript. 🛠 Practical Usage - Derived properties: display function-computed values as table columns. - Function-backed Actions: implement complex edits spanning multiple objects. - Workshop integration: run functions to compute or display variables. - API gateway: invoke query functions programmatically to reuse the same logic everywhere. 🎯 Use Cases - Implement derived-KPI logic once and return identical results to Workshop, OSDK, and the API. - Query external systems to enrich ontology objects. - Build complex validation or bulk updates as function-backed Actions. ⚠️ Caveats - The 60-second timeout applies uniformly across execution modes, so optimize for efficiency. - Available capabilities depend on the invocation context (for example, model embedding and semantic search are TypeScript only), so decide on language early. #PalantirFoundry# #DataEngineering#
もっと見る
# OpenCodeの機能と実践的な使い方 🔌 エージェントに「外の世界」へ手を伸ばさせたい。Sentryのエラーやライブラリのドキュメントをそのままツールとして使えるのが、OpenCodeのMCPサーバー連携です。 🏷️ タイトル: 外部ツール接続(ローカル/リモート) 🔗 URL: 📘 概要 MCP(Model Context Protocol)サーバーを設定すると、外部サービスのツールがOpenCodeの組み込みツールと並んでエージェントから自動的に使えるようになります。ローカル(プロセス起動)とリモート(HTTPエンドポイント)の両方に対応します。 ⚙️ 機能の説明 設定は `opencode.json` の `mcp` ブロックに、サーバーごとの識別子で記述します。 ・ローカル: `type: "local"` とし、`command` に起動コマンドの配列、必要なら `environment` で環境変数を渡します。`timeout`(既定5000ms)も指定可能です。 ・リモート: `type: "remote"` とし、`url` を指定。認証は `headers` でBearerトークンを渡すか、OAuthを利用します(401を検知して自動フローも可能)。 各サーバーは `enabled` で個別にオン/オフできます。MCPツールはサーバー名を接頭辞として現れ、`tools` のワイルドカード(`*` や `?`)で全体・エージェント単位に有効/無効を切り替えられます。 🛠️ 実践的な使い方 リモートのSentry連携は、`opencode.json` の `mcp` 配下に `sentry` を作り、`type: "remote"`・`url: ""`・`headers` のBearer認証・`enabled: true` を書くだけです。 ローカルなら `"command": ["npx", "-y", "@/modelcontextprotocol/server-everything"]` のように起動します。ドキュメント検索の Context7(` Grep(` mcp auth <名前>` や `opencode mcp list` で認証・状態確認も可能です。 💡 ユースケース Sentryで本番エラーをエージェントに調査させ、Context7で最新ライブラリの正しい使い方を引き、Grepで他リポジトリの実装例を探す、といった「調査から実装まで」を1つのセッションで完結できます。普段は `enabled: false` にしておき、必要な作業のときだけ有効化する運用が安全です。 ⚠️ 注意点 MCPサーバーはコンテキストを消費します。多くのツールを公開するサーバー(GitHub系など)を有効にすると、トークンが急増しコンテキスト上限を圧迫しがちです。使うサーバーは絞り、APIキー運用なら `oauth: false` で自動OAuthを抑止しましょう。リモートは `timeout` 超過で起動失敗する点にも注意してください。 #OpenCode# #MCP#
もっと見る
TL;DR: Issueやコミット履歴を使わず「ソースコードそのもの」だけから、コーディングエージェント用のRL訓練タスクを5,545件も自動生成するパイプラインが登場しました。しかも量より質を優先した設計です。 タイトル: CodeMidas: Scaling Agentic Coding RL Environments from Code Itself URL: ポイント 🏗️ 3,185リポジトリ・23言語・15ドメインから5,545タスクを自動構築 🧪 リファレンス実装を実行して期待値を記録する「実行に基づくテスト」で検証器を自動生成 🛡️ リーク検査・解答一致確認・難易度フィルタの3段構えで環境の質を保証 📈 DeepSWEで+11.7pt、ProgramBenchで+17.0pt、Terminal-Benchで+8.5ptと大幅改善 🔍 フィルタ済み5kタスクがフィルタなし8kタスクを一貫して上回り「質が量に勝る」ことを実証 🧠 訓練後は探索・自己検証の頻度が増加し、外部ベンチマークにもその挙動が転移 開発履歴がなくても、コードさえあればRL訓練環境を作れるという発想がシンプルで実用的だと感じました。 #CodingAgent# #強化学習#
もっと見る
TL;DR: 「GUI操作」と「コーディング」を同時に鍛え・測れる、5プラットフォーム対応のエージェント評価環境が登場しました。トップモデルでも見た目の再現度と動作の厳密な正しさには大きな差があることが明らかになりました。 タイトル: RecreationWorld: Scalable and Verifiable Environments for Hybrid Computer-Use Agents URL: ポイント 🖥️ Ubuntu・macOS・Windows・Android・Webの5プラットフォームに対応 🔍 ソースを見せず動いているアプリを観察して一から再実装させる「再現」タスク 🧪 250タスクのRecreationBenchを構築、プログラム検証と視覚検証の両方で採点 📈 3.5万件の再現軌跡で学習したモデルは分布外ベンチマークで最大17.9ポイント改善 🏆 総合1位のGPT-6 Astraでもスコアは58.1% ⚠️ そのGPT-6 Astraでさえ全プログラムテスト通過はわずか2.8% 🔧 ElectronアプリをネイティブGTK/AppKitに置き換えるなど柔軟な実装も観測 見た目の再現力と本当の動作忠実性の間には、まだ大きなギャップがあることを突きつける研究です。 #AIエージェント# #ComputerUse#
もっと見る