登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 ロボット学習
ロボット学習 コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
ロボット学習 を含む検索結果
🤖 高価なロボット実演データの不足を、私たちの「一人称視点の日常動画」で補う。人間の手の動きをロボットの行動に変換してVLAを学習させる研究です。 📰 タイトル: ACE-Ego-0: Unifying Egocentric Human and Robotic Data for VLA Pretraining 🔗 URL: 💡 概要 ロボットの実演データと、Ego4DやEPIC-KITCHENSのような一人称視点の人間動画を統一して、Vision-Language-Action(VLA)モデルを事前学習する枠組み「ACE-Ego-0」の提案です。合計6,000時間超のデータで学習しています。 🔍 解決する課題 ロボット実演の収集は高コストですが、人間動画は安価で豊富です。ただし両者は行動空間・身体構造・時間の進み方・教師信号の品質がバラバラで、素朴に混ぜると学習が壊れてしまう点が課題でした。 🛠 方法論と提案手法 ・行動を頭部カメラ座標系の6D回転で統一表現し、人間の手もエンドエフェクタとして扱う ・ロボットのURDFをGNNでモルフォロジートークン化し構造差を吸収 ・固定ステップでなく一定の物理時間でチャンク分割して時間を整列 ・ノイジーな人間動画には信頼性重み付け損失を適用し、信頼できる位置情報に集中 📊 ユースケース / 実験結果 シミュレーションのRoboCasaで平均72.8%(GR00T-N1.6の47.6%を大きく上回る)、RoboTwin 2.0で約91%を達成。実機の両腕ロボットでも平均78.3%(π0.5は71.7%)。特にロボット実演34件しかないタスクで、人間動画419本を足すと成功率が10%→40%へと4倍に改善しました。 #ロボット学習# #VLA#
もっと見る
【ID登録締切まであと3日】 Physical AI 基礎編 知能ロボティクス講座のID登録締切まで、あと3日(講座募集締切はあと5日)となりました。 AI×ロボットや、現実世界で動くAIに関心がある方におすすめの講座です。 本講座では、データ収集、ロボット基盤モデルの学習、シミュレーターなど、 Physical AI領域を支える技術を体系的に学びます。 また、強化学習やロボット学習、実運用時の課題など、 最新研究から実践的な知識まで幅広く扱います。 ※機械学習・深層学習の基礎知識を前提としております。 🗓️ID登録締切 6/15(月)13:00 🗓️募集締切  6/17(水)13:00 ▼講座詳細・ID登録はこちら
もっと見る
🏠 「文章で部屋を説明したら、ロボットがそのまま動かせる物理シーンが丸ごと出てくる」——そんなシステムが ICML 2026 Spotlight に登場しました。MITとToyota Research Instituteの研究です。 タイトル: nepfaff/scenesmith(SceneSmith) URL: 🏠 概要 SceneSmithは、自然言語の説明文から、物理シミュレーションにそのまま使える屋内シーンを自動生成するエージェント型システムです。家具・壁掛けの鏡や絵画・天井のシャンデリア・机の上の小物まで、質量や慣性といった物理特性を備えた形で生成され、ロボットの学習や評価に直接使えます。 ❓ 解決する課題 ロボットシミュレーション向けのリアルな屋内シーンは、これまで手作業のモデリングや面倒な配置作業が必要で、大規模な評価・学習のボトルネックでした。SceneSmithはテキストから多様で文脈的に一貫したシーンを自動生成し、この手間を解消します。 💡 方法論と提案手法 シーン生成は5段階の逐次パイプラインで進みます。 ・フロアプラン生成(壁や床のレイアウト) ・大型家具の配置 ・壁掛けオブジェクト(鏡、絵画、棚、時計) ・天井設備(シャンデリア、ペンダントライト、シーリングファン) ・操作可能な小物 各ステージ後にチェックポイントを自動保存し、途中から再開・分岐できます。シーン推論やタスク分解にはVLMエージェント(GPT-5)を使います。 🎯 ユースケースと技術 ・3Dアセットは高品質なSAM3D(推奨)やHunyuan3D-2で生成、HSSDやObjaverseからの取得にも対応 ・AmbientCGのPBRマテリアルをCLIPの意味検索で適用し、ArtVIPやPartNet-Mobilityの関節付き可動オブジェクトも扱える ・出力はDrake形式に加え、MuJoCoやUSD・Isaac Simへエクスポート可能 📊 注目ポイント ・「ボウルから果物を見つけて皿に置く」のようなタスクから、制約付きの複数シーンを自動生成しロボット評価まで支援 ・151語のプロンプトからコミュニティセンターを生成し、卓球台の近くにラケットとボールを置くなど文脈推論まで実現 ・複数GPUへ分散し、bubblewrapでGPUを隔離してレンダリングのOOMを防止 #ロボティクス# #シーン生成#
もっと見る
「現実世界の良いデータ」をどう集めるか? @XSquareRobotのQUANXTA Zero Seriesは、人間の動作をVRヘッドセット、ヘッドバンド、グリッパーで収集し、ロボットが学習できるデータへ変換する仕組み。 ロボット開発で次に競争になるのは、「学習データをどう量産するか」。
もっと見る
人の動きを学習するロボット、トヨタが40万台更新へ!→2028年以降は毎年1兆円を投資、フィジカルAIで工場をつなぐ Tシャツを畳む動作から学習を始め、工場全体の自動化を狙います。
もっと見る
ロボットが初めて「Wine Bottle in Bowl」を学習したとき、成功率はわずか 15% だった。それがある閾値を超えた瞬間、95% へと跳ね上がる。これはモデルを再訓練したからではない。コードで書かれた「観察と介入の仕組み」が、自ら進化したからだ。 これまでの VLA(Vision-Language-Action)モデルはオープンループだった。ロボットが失敗しても、次のエピソードが終わるまでフィードバックがない。人間がログを見て、パラメータを手動で調整する。そのサイクルは遅く、スケールしない。小さな外乱が連鎖的な失敗へと積み重なっても、システムはそれをリアルタイムで捉えられなかった。 Zetta ζ はその問題を3つの時間スケールで解きます。実行中は高頻度のクリティックが軌跡を監視し、衝突の芽を摘む(アクションレベル)。失敗したエピソードはシグネチャでクラスタリングされ、6層の因果診断でボトルネックを特定してハーネスを最小限に修正する(エピソードレベル)。そして未知の環境でも汎化したスキルだけが、バリデーションゲートを通ってスキルメモリへ永続登録される(イテレーションレベル)。 ベースモデルの重みは一切変えません。進化するのはコードとしてのハーネスだけ。LIBERO-Pro で 34.5% → 90.8%、RoboCasa で 73.6% → 93.6%。推論速度は RPent 比 11.1 倍。スループットは 1.7 → 35.1 エピソード/分(20.6 倍)へ。学習したスキルは PnP-Sink・PnP-Cabinet・PnP-Toaster でゼロショット転移に成功しました。 Zetta ζ: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence #EmbodiedAI# #ロボティクス#
もっと見る
ロボットは動き方を知っていても、何をすべきかの手がかりを必要とする。その「文脈」を扱う研究を100ページ超で整理したサーベイです。 タイトル: In-Context Learning for Robots: Methods and Applications URL: ❓ ロボットの文脈内学習とは何ですか? デプロイ時にニューラルパラメータを固定したまま、デモンストレーションや相互作用を使って既存の能力を方向づける適応のことです。大規模事前学習で動き自体は獲得できても、目の前のシーンでは複数の手順がどれも実行可能に見えたり、素材の反応が未知だったりします。この欠落は運動能力をいくら高めても埋まりません。 ❓ ファインチューニングと何が違うのですか? ファインチューニングは新しい証拠を重みに取り込みますが、文脈内学習は意思決定の瞬間に証拠を利用可能にします。論文は適応の所在を、供給された文脈・再帰的状態・外部メモリ・テスト時の重み更新・永続的な重み更新の5つに分け、前3者がパラメータ固定にあたると整理しています。 ❓ 手法はどう分類されているのですか? 実行が消費する中間表現を軸に4ファミリーへ整理されます。 ・文脈条件付き方策(証拠から行動を直接推論) ・幾何的デモンストレーション転移(参照軌道を位置合わせして実行) ・世界モデルベース制御(未来を予測して計画) ・スキル/エージェントベース実行(スキルやプログラムを選び別のエグゼキュータへ) 同じデモが4つのどれにもなり得る点が重要で、違いは証拠の取り方ではなく実行が必要とする中間表現にあります。 ❓ 評価はどうすればよいのですか? 証拠を取り除く、記憶を消す、検索を止める、重みを戻すといった介入を実行条件を揃えて行い、改善の出どころを特定します。実際、未知の行動規約を自力で発見させる設定では20エピソード中1回しか成功せず、対応関係の推論も23.3%にとどまったと報告されています。 #ロボティクス# #InContextLearning#
もっと見る
🤖 VLMを一切追加学習させずに、そのままロボットを動かせるとしたら。RoboDawnはこの問いに真正面から挑んだ研究です。 タイトル: Transferring the Intelligence of VLMs to Robotic Control (RoboDawn) URL: 事前学習済みVLMに、人間にも直感的な移動・回転・グリッパーの意味的コマンドと、数回分のデモンストレーションを文脈として与えるだけでロボットアームを操作させる手法です。 注目ポイントは3つあります。 🎮 ゲームのような操作インターフェース 移動・回転・グリッパー開閉といった離散コマンドで制御します。すべてグリッパーの中心点を基準にした相対指示なので、VLMがWeb上ですでに持っている空間操作の知識をそのまま活かせます。 📚 デモ1つで劇的に伸びる パラメータ更新は一切なし。コマンドの効果を示すプライマーとタスクデモを文脈に与えるだけで、RoboTwin 2.0での成功率がゼロショット53.2%からワンショット73.6%まで向上しました。 🏆 訓練済みロボット方策を上回る タスク特化の学習なしで、専用データでフル学習されたπ0.5(46.0%)やLingBot-VLA(50.4%)をゼロショットの時点で凌駕。実機のFrankaロボットでも90%の成功率を記録しています。 ロボット専用データを集めるより、VLMが既に持つ知能を引き出すインターフェース設計こそが鍵になるのかもしれません。 #ロボティクス# #VLM#
もっと見る
ロボット基盤モデルがシミュレーションでは高性能なのに、カメラの位置や照明が変わった途端に失敗する原因、実は「見た目のズル」だったかもしれません。 タイトル: Breaking the Vision-Action Shortcut: Latent Interface Training for Generalizable Robotics Foundation Models URL: 📝 概要 訓練分布内でたまたま行動と相関しているだけの無関係な視覚手がかりに頼ってしまう「視覚-行動ショートカット」を断ち切る学習手法「Latent Interface Training(LIT)」を提案しています。 ❗ 解決する課題 ロボット基盤モデルは分布内では強いのに、視覚的な分布シフト(カメラ視点・照明・センサノイズなど)が起きると性能が大きく落ち込む問題がありました。 ⚙️ 方法論 まず画像を使わずポーズ目標だけで行動部分を事前学習し、次に100個の潜在トークンを介して視覚情報を必ず経由させ、ポーズ再構成損失で監督する2段階構成になっています。 🤖 ユースケース π0.5・MolmoAct2・FAST-WAM・ImageWAMという4種類の異なるロボット基盤モデルすべてに適用でき、フレームワークを選ばない汎用的な手法です。 📊 実験結果 LIBERO-Plusの分布外評価で全モデルが3.87〜10.70ポイント改善。実世界のロボット操作でも照明変化時に+16.7ポイント、特定タスクでは+60ポイントという大きな改善を達成しています。 見た目に頼らず本質的な空間情報で判断させる発想が、実運用ロボットの信頼性向上に直結しそうです。 #ロボティクス# #VLA#
もっと見る
【最新】ロボットの導入と運用を一貫支援🤖 (株)アカツキAIテクノロジーズは「フィジカルAIソリューション」を提供開始。 #ロボット# の買い付けや、現場のタスクに合わせた学習・開発、実機データの収集が可能に。 サブスク提供でPoCのコストを抑え、本格導入を推進。 #AI#
もっと見る