登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 robotic
robotic コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
robotic を含む検索結果
🤖 VLMを一切追加学習させずに、そのままロボットを動かせるとしたら。RoboDawnはこの問いに真正面から挑んだ研究です。 タイトル: Transferring the Intelligence of VLMs to Robotic Control (RoboDawn) URL: 事前学習済みVLMに、人間にも直感的な移動・回転・グリッパーの意味的コマンドと、数回分のデモンストレーションを文脈として与えるだけでロボットアームを操作させる手法です。 注目ポイントは3つあります。 🎮 ゲームのような操作インターフェース 移動・回転・グリッパー開閉といった離散コマンドで制御します。すべてグリッパーの中心点を基準にした相対指示なので、VLMがWeb上ですでに持っている空間操作の知識をそのまま活かせます。 📚 デモ1つで劇的に伸びる パラメータ更新は一切なし。コマンドの効果を示すプライマーとタスクデモを文脈に与えるだけで、RoboTwin 2.0での成功率がゼロショット53.2%からワンショット73.6%まで向上しました。 🏆 訓練済みロボット方策を上回る タスク特化の学習なしで、専用データでフル学習されたπ0.5(46.0%)やLingBot-VLA(50.4%)をゼロショットの時点で凌駕。実機のFrankaロボットでも90%の成功率を記録しています。 ロボット専用データを集めるより、VLMが既に持つ知能を引き出すインターフェース設計こそが鍵になるのかもしれません。 #ロボティクス# #VLM#
もっと見る
🤖 ロボットの器用な手つきも、結局は「データ量」で伸びることが実証されました。 タイトル: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation URL: 🧩 概要 AgiBot Research Teamが、既存の動画生成モデルを流用せず全コンポーネントをロボット操作データからゼロで学習する「ワールドアクションモデル」GE-Act 2.0を提案しました。未来の視覚状態を予測し、そこから行動を導きます。 ⚙️ 解決する課題 既存手法は再構成品質重視の動画生成器をそのまま使っており、行動予測に必要な情報が保証されない上、視覚生成とインバースダイナミクスの事前学習と接続の関係が未解明でした。 🛠 方法論と提案手法 64倍圧縮の行動特化オートエンコーダ(CoAE)、1回の順伝播で未来映像を生成するSingle-Step Visual Planner、視覚予測と実行動のズレ(妥当性ギャップ)をtop-k選択で解消するKASOという3つの工夫で構成されています。 📊 実験結果 学習データを300時間から3万時間に増やすと、ロボットG1-OPの成功率は17.1%から44.1%へ27.0ポイント向上。データが2%未満しかないG2-90Dでも17.7ポイント向上し、身体をまたいだ知識転移が確認されました。物体・色・位置の指示追従も90%以上の精度を達成しています。 #ロボティクス# #世界モデル#
もっと見る
ロボット操作のビデオ世界モデルで「本当に指定した動作をしているか」を検証できるモデルが登場しました。 DreamX-Phi 1.0: Action-Conditioned Video World Model for Robotic Manipulation Wan2.2-TI2V-5Bを基盤に、初期フレームと言語指示、両腕の行動軌道から将来フレームを高精度に予測するビデオ世界モデルです。WorldArena 2.0 Track 1で31チーム中1位(EWMScore-P: 60.65)を達成しました。 🔷 注目ポイント1: PRoPE — SE(3)を直接アテンションへ注入 行動を汎用トークンに変換する従来手法を捨て、エンドエフェクタの位置・回転行列・グリッパー状態をSE(3)変換としてアテンション機構に直接組み込みます。アームごとにヘッドをパーティションし、Kronecker積でトークンワイズ変換を適用することで、グローバル座標系への依存を排除。制御性スコア98.55という驚異的な数値を叩き出しています。 🔶 注目ポイント2: 深度ブランチ + 物体中心監督で「見た目」以上の精度を RGB損失だけでは表面順序やオブジェクト範囲を制約できないという根本問題に、2段構えで対処します。軽量な深度ブランチ(最後のMブロックを複製した一方向クロスアテンション)が幾何学的整合性を担保し、SAM3マスクと凍結V-JEPAティーチャーのグラム行列制約が操作物体の時間的一貫性を保ちます。静的背景が大きなロボット映像において、接触近傍のエラーを損失関数に確実に反映させる仕組みです。 🟣 注目ポイント3: DMD蒸留で多ステップを少ステップへ KL divergenceと非飽和GAN損失を組み合わせた分布マッチング蒸留(DMD)により、推論時のステップ数を大幅に削減。Ego4D・AgiBot World 2026・RoboTwin 2.0など合計約6,000時間超の多様なデータで学習されており、広範な視覚事前知識と行動接地の両立を実現します。 ロボット世界モデルがついに「リアルに見える」から「正確に動く」へ進化した一歩です。 #ロボティクス# #世界モデル#
もっと見る
˗ˏˋ📺テレビOA情報ˎˊ˗ 宮崎マネージャーです💁‍♀️ 本日深夜0:58〜 TBS『#ふるさとの未来』放送です!# 今夜は株式会社Preferred Roboticsをご紹介します🤖 ︎今週もぜひご覧ください💡 #宮崎由加#
もっと見る
ロボット基盤モデルがシミュレーションでは高性能なのに、カメラの位置や照明が変わった途端に失敗する原因、実は「見た目のズル」だったかもしれません。 タイトル: Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models URL: 📝 概要 訓練分布内でたまたま行動と相関しているだけの無関係な視覚手がかりに頼ってしまう「視覚-行動ショートカット」を断ち切る学習手法「Latent Interface Training(LIT)」を提案しています。 ❗ 解決する課題 ロボット基盤モデルは分布内では強いのに、視覚的な分布シフト(カメラ視点・照明・センサノイズなど)が起きると性能が大きく落ち込む問題がありました。 ⚙️ 方法論 まず画像を使わずポーズ目標だけで行動部分を事前学習し、次に100個の潜在トークンを介して視覚情報を必ず経由させ、ポーズ再構成損失で監督する2段階構成になっています。 🤖 ユースケース π0.5・MolmoAct2・FAST-WAM・ImageWAMという4種類の異なるロボット基盤モデルすべてに適用でき、フレームワークを選ばない汎用的な手法です。 📊 実験結果 LIBERO-Plusの分布外評価で全モデルが3.87〜10.70ポイント改善。実世界のロボット操作でも照明変化時に+16.7ポイント、特定タスクでは+60ポイントという大きな改善を達成しています。 見た目に頼らず本質的な空間情報で判断させる発想が、実運用ロボットの信頼性向上に直結しそうです。 #ロボティクス# #VLA#
もっと見る