画像エンコーダ: ViT-B/32, ResNet等 ▪ テキストエンコーダ: トランスフォーマ等 ▪ 推論: 新規の画像(or テキスト)を入力して特徴量に変換 ▪ 多数の応用(DALL·E 2 [Aditya (OpenAI) + 2022/4]等) a photo of a beer bottle satellite imagery of roundabout a photo of a marimba a meme テキスト エンコーダ 画像 エンコーダ
RAL25] ③ 参照表現理解 [Nishimura+ IROS24] ④ タスク成否判定 [Goko+ CoRL24] place a red can on the front right pick up the tissue box next to the sink 「ものを置ける」「通 路ではない」等の言語 で3Dモデルから決定 x4 x16 最大3万枚の画像 を検索可能 →操作者が場所を 記憶しなくて良い