2. 少数ページずつ順番に画像を読み取り l 物語のイベント履歴 3. 読み取りごとに作品全体の情報を更新 l 登場人物の属性と関係性 4. 話ごとに要約、最後に作品全体を要約 l etc… VQAタスク l 学校はなぜ爆発した? l 森男と笑は最初に出会ったとき、それ ぞれどことどこをぶつけた? l etc… 2
テキストでも説明されがちなため 登場人物の外見や絵だけで表現された心理描写は誤答 l 視覚情報で後から補正できないため、誤り訂正能力が低い l 表情と発言が一致していない場面は発言を過信してしまう l 絵だけで心理描写や物語進行を行う作品は認識できない テキストで説明されない視覚情報や、心理描写の理解に視覚情報が必須 7