🤖 ロボットが「行動する」だけでなく「考えて」「未来を予測してから動く」ようになったら何が変わるでしょうか。37,000時間超のデータで訓練された体現型基盤モデルの発表です。
タイトル: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
URL:
GigaBrain-0.7は、理解・予測・行動を明確に分離しつつ統合する三システムアーキテクチャを提案しています。注目ポイントは次の3つです。
🧠 System 2: 理解と計画
PaliGemma2(3B)をベースに、現在の視覚シーンと長期指示を解釈し、chain-of-thought推論で「ハンガーに掛ける」を「まず赤い帽子を拾う」のように部分タスクへ分解します。
🔮 System 3: 予測と評価
GigaWorld-1ベース(5B)で将来の視覚状態を動画として予測し、最終フレームを「サブゴール画像」として抽出。同時にタスク進捗をスコア化し、行動を導く評価信号として活用します。
🦾 System 1: 行動と制御
Mixture-of-Transformers構成で連続行動チャンクを生成。16種類のロボット形態に対応する統一embodiment表現により、マルチロボットでの汎用性を実現しています。
大規模な事前学習を進めるほど検証損失が一貫して下がり、創発的な体現能力の兆しが見えてきた点が印象的です。
#
ロボティクス# #
身体性AI#