Skip to content
TopicTracker
出典 HackerNews原文を表示
翻訳言語翻訳言語

Imagin-4D: Image-Guided Controllable Interaction Generation

Imagin-4D is a novel AI framework that generates controllable 4D interactions (3D + time) guided by a single image. It allows users to control the interaction between two objects — such as a person interacting with an object or two animals — by specifying motion trajectories, enabling realistic and editable dynamic scene generation from a static image input.

背景メモ

• Imagin-4Dは、1枚の画像からその物体とインタラクトする人間の3D動作を自動生成する研究プロジェクト。従来はテキスト記述が必要だったが、画像一枚でOKになった。 • 主な技術要素: (1)画像から物体の3D形状を推定、(2)人間と物体の接触点を予測、(3)Planner-Critic方式(計画→批評→修正のループ)で物理的に妥当な動作を生成。 • 「制御可能なインタラクション生成」が特徴で、「座る」「手を置く」「持つ」などの動作タイプを指定できる。また物体を別の画像で置き換える(例: 椅子の画像を変える)だけで動作も自動調整される。 • 発表元は深セン先進技術研究院(SIAT)と香港大学。論文はECCV 2024(トップコンピュータビジョン会議)で発表予定。 • 背景: 3Dの人間-物体インタラクション生成はVR/AR、ゲーム、ロボットシミュレーションなどに重要だが、物体の形状と人間の動作の両方を同時に扱う難しさから発展途上の分野。画像ベースでこれを行えるようにした点が新規性。

関連記事