登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 Hunyuan
Hunyuan コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
Hunyuan を含む検索結果
動画生成モデルは「正しい映像を作れる」のか、それとも「もっともらしく見える映像を作れる」だけなのか。 これは似ているようで本質的に異なる問いです。物体を正しく配置し物理法則を守りながら複数ステップのタスクを解くこと——これを「視覚的知性(Visual Grounded Intelligence)」と呼ぶならば、現在のモデルはそれを持っているでしょうか。VGI-Benchはその問いに数字で答えます。 27タスク810インスタンスのベンチマークで9つの動画モデルを評価した結果、最強モデルのSeedance 2.0でも全体スコアは51.0%にとどまりました。物理崩壊(非現実的な変形・物体の貫通)、ルール違反(もっともらしい最終状態を出しながら制約を無視)、物体不整合(時間をまたいだ一貫性の喪失)という3つの失敗モードが繰り返し現れます。オープンソース最高のHunyuanVideoは19.1%と商用モデルを大きく下回りました。 より深刻なのは、デノイジング過程の分析が明らかにしたことです。生成中間ステップでの自己修正は全体の1%未満。「誤り→別の誤り」への遷移がデノイジング中盤で23.1%に達しており、後期デノイジングは初期に固定された仮説を磨くだけで誤りを直せていません。さらに、1M合成サンプルによるファインチューニングは計画・空間スキルを改善する一方で時間的・物理的能力を劣化させるというトレードオフも確認されました。VGI-Benchは視覚推論という軸で動画生成の限界を照らし出しています。 タイトル: VGI-Bench: Probing Visual Intelligence in Video Generation Models URL: #動画生成# #視覚推論#
もっと見る
🎬 「見た目はリアルでも、タスクを達成できているか?」——ビデオ生成の評価がついに結果志向へ進化します。 SemComp-Bench: Benchmarking Semantic Task Completion in Video Generation 💡 概要 参照画像から「料理を作る」「植物を剪定する」などのタスクを達成するビデオを生成する際、既存モデルは手順の再現には長けていますが「最終状態をきちんと達成できているか」の評価が欠けていました。SemComp-Bench は6ドメイン・1,273件のデータセットと、VLM(Doubao-Seed-1.8)を用いた二軸評価フレームワークを導入し、この盲点を埋めます。 ⚠️ 解決する課題 既存ベンチマークは外観の一致性や中間手順を重視し、「タスクの結果達成」と「参照画像との意味論的整合性の維持」を同時に評価する基準がありませんでした。 🔬 評価フレームワーク:2つの独立した次元 ・OA(Outcome Achievement)スコア: 結果実現・意味論的グラウンディング・エンティティ一貫性・視覚的連続性の4基準をすべて通過することが必要 ・GR(Generation Reliability)スコア: 物理的整合性・視覚明瞭度・アーティファクト欠如など5基準の平均 📊 実験結果(詳細指示での成績) ・OA最高: HunyuanVideo-1.5-720P が37.8%(最高でも4割未満) ・GR最高: Seedance 2.0 が91.8%——だがOAは20.0%(4位) ・T2V(テキストのみ)のOAはわずか0.6〜5.0%: 視覚的参照が不可欠 ・最大のボトルネック: Within-Scene Spatiotemporal Coherence(0.328〜0.739) → OAとGRは独立した能力であり、「綺麗に生成できる」ことと「タスクを達成できる」ことは別問題です。 #動画生成# #ベンチマーク#
もっと見る
🏠 「文章で部屋を説明したら、ロボットがそのまま動かせる物理シーンが丸ごと出てくる」——そんなシステムが ICML 2026 Spotlight に登場しました。MITとToyota Research Instituteの研究です。 タイトル: nepfaff/scenesmith(SceneSmith) URL: 🏠 概要 SceneSmithは、自然言語の説明文から、物理シミュレーションにそのまま使える屋内シーンを自動生成するエージェント型システムです。家具・壁掛けの鏡や絵画・天井のシャンデリア・机の上の小物まで、質量や慣性といった物理特性を備えた形で生成され、ロボットの学習や評価に直接使えます。 ❓ 解決する課題 ロボットシミュレーション向けのリアルな屋内シーンは、これまで手作業のモデリングや面倒な配置作業が必要で、大規模な評価・学習のボトルネックでした。SceneSmithはテキストから多様で文脈的に一貫したシーンを自動生成し、この手間を解消します。 💡 方法論と提案手法 シーン生成は5段階の逐次パイプラインで進みます。 ・フロアプラン生成(壁や床のレイアウト) ・大型家具の配置 ・壁掛けオブジェクト(鏡、絵画、棚、時計) ・天井設備(シャンデリア、ペンダントライト、シーリングファン) ・操作可能な小物 各ステージ後にチェックポイントを自動保存し、途中から再開・分岐できます。シーン推論やタスク分解にはVLMエージェント(GPT-5)を使います。 🎯 ユースケースと技術 ・3Dアセットは高品質なSAM3D(推奨)やHunyuan3D-2で生成、HSSDやObjaverseからの取得にも対応 ・AmbientCGのPBRマテリアルをCLIPの意味検索で適用し、ArtVIPやPartNet-Mobilityの関節付き可動オブジェクトも扱える ・出力はDrake形式に加え、MuJoCoやUSD・Isaac Simへエクスポート可能 📊 注目ポイント ・「ボウルから果物を見つけて皿に置く」のようなタスクから、制約付きの複数シーンを自動生成しロボット評価まで支援 ・151語のプロンプトからコミュニティセンターを生成し、卓球台の近くにラケットとボールを置くなど文脈推論まで実現 ・複数GPUへ分散し、bubblewrapでGPUを隔離してレンダリングのOOMを防止 #ロボティクス# #シーン生成#
もっと見る