Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
宮脇+'23 - プログラム生成・実行による構成的推論, LLM Meetup Tokyo #3
Search
Shumpei Miyawaki
July 05, 2023
Technology
870
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
宮脇+'23 - プログラム生成・実行による構成的推論, LLM Meetup Tokyo #3
Shumpei Miyawaki
July 05, 2023
More Decks by Shumpei Miyawaki
See All by Shumpei Miyawaki
AIネイティブな組織を問い直す
smiyawaki0820
15
7.5k
ITエンジニア本大賞_現場で活用するためのAIエージェント実践入門 / 2026.02.19
smiyawaki0820
2
440
著者と読み解くAIエージェント現場導入の勘所 Lancers TechBook#2
smiyawaki0820
24
14k
LLMアプリの地上戦開発計画と運用実践 / 2025.10.15 GPU UNITE 2025
smiyawaki0820
4
2.1k
「高い不確実性」を解消する「高い再現性」 / 2025.09.14 プロダクトヒストリーカンファレンス(YOUTRUST)
smiyawaki0820
2
550
AIエージェントを現場で使う / 2025.08.07 著者陣に聞く!現場で活用するためのAIエージェント実践入門(Findyランチセッション)
smiyawaki0820
10
3k
「良さそう」と「とても良い」の間には 「良さそうだがホンマか」がたくさんある / 2025.07.01 LLM品質Night
smiyawaki0820
8
3.6k
AIエージェント開発における「攻めの品質改善」と「守りの品質保証」 / 2024.04.09 GPU UNITE 新年会 2025
smiyawaki0820
3
1.6k
AIエージェントの地上戦 〜開発計画と運用実践 / 2025/04/08 Findy ランチセッション #19
smiyawaki0820
35
19k
Other Decks in Technology
See All in Technology
日経電子版を支えていく Kasane Design System/fec_fukuoka
nikkei_engineer_recruiting
0
910
アプリをもっと"iOSアプリっぽく"する小さな工夫 / Small Touches That Make Your App Feel More Like an iOS App
matsuji
1
600
Multica × 長期記憶:40個のミニプロジェクト管理
eiei114
1
250
Amazon Quick on DesktopがIAM Identity Centerで動かない理由
yukiogawa
0
160
SQL文一行も書けない人事がCortexもろもろを使って人事業務を楽にしてみる
ponponmikankan
1
220
Snowflakeで実現する全社横断の顧客の声(VOC)分析・活用基盤@Snowflake World Tour Tokyo 2026
yuto16
0
190
例外の正しい扱い方 そのエラー try-catchして大丈夫?
jinwatanabe
3
470
研究開発部の紹介 / Sansan R&D Profile
sansan33
PRO
5
25k
Amazon S3 Tablesに全部任せてみた結果——コンパクション/スナップショット管理は本当に手放せるか
shigeruoda
1
470
ASTを使って影響範囲を特定する
nealle
0
170
AI 駆動 Terraform 開発/SRE_BizReach_MIXI_2
visional_engineering_and_design
4
2.1k
The Agent Builder Loop from Daily Work to OSS
minorun365
PRO
3
130
Featured
See All Featured
Statistics for Hackers
jakevdp
799
230k
Git: the NoSQL Database
bkeepers
PRO
432
67k
Raft: Consensus for Rubyists
vanstee
141
7.7k
A Tale of Four Properties
chriscoyier
163
24k
How to Think Like a Performance Engineer
csswizardry
28
2.8k
Making Projects Easy
brettharned
120
6.7k
Paper Plane (Part 1)
katiecoart
PRO
1
11k
Site-Speed That Sticks
csswizardry
13
1.5k
HDC tutorial
michielstock
2
860
So, you think you're a good person
axbom
PRO
2
2.1k
Technical Leadership for Architectural Decision Making
baasie
3
560
Art, The Web, and Tiny UX
lynnandtonic
304
22k
Transcript
プログラム⽣成・実⾏による構成的推論 Shumpei Miyawaki keywalker,inc. / Tohoku Univ. @catshun_ 地理空間情報 ×
⾃然⾔語処理 への応⽤
P.1 LT ⽬的 • ReAct, function calling とは異なる推論⽅法として プログラムベース構成的推論 を紹介
• 発表を通して「推論⽅法の⻑所・短所の議論」「これ出来そう」のような議論ができると嬉しい https://note.com/catshun_/n/na18e2c470b2f
プログラム⽣成・実⾏による構成的推論 Gupta+’23 - Visual Programming: Compositional Visual Reasoning Without Training
(CVPR 2023 Best Paper) https://github.com/allenai/visprog/tree/main
P.3 構成性 [Marelli+’14; Partee+’84; Frege 1892] ⽂や句の意味は、単語の意味と⽂の構造に従って構成的に理解される プログラム ⽣成・実⾏ による
構成的推論 複雑なタスク は構成性を仮定して サブタスク に分解 [Krishnamurthy+’13; Andreas+’16] (従来)既製パーサ性能 [Andreas+’16]、⾼い学習コスト [Hu+’17] が問題であった (現在)汎⽤性の⾼い LLM の出現 によって 既製パーサ性能依存・学習コスト の問題が緩和 (現在)プロンプトによるタスク分解 [Khot+’22; Dua+’22; Zhou+’23; Press+’23] も有効性が検証されている 参考︓岡崎 (東北⼤) +’15 – 単語の分散表現と構成性の計算モデルの発展 https://www.slideshare.net/naoakiokazaki/20150530-jsai2015
P.4 プログラム ⽣成・実⾏ による 構成的推論 Gupta+'23 - Visual Programming: Compositional
Visual Reasoning Without Training (CVPR) ① 物体検出(ヒト) ② 物体検出(ラクダ) ⑤ 算術演算 2 = 1 + 1 〜 〜 ʢ72"ʣώτͱϥΫμͷ߹ܭʁ 物体1 = localize ( img=画像in , query=“ヒト” ) 物体2 = localize ( img=画像in , query=“ラクダ” ) 個数1 = count ( boxes=物体1 ) 個数2 = count ( boxes=物体2 ) 答え = eval ( expr= “{個数1 } + {個数2 }” ) ① ② ③ ④ ⑤ 1. プログラム⽣成︓ 事前に定義された関数集合を⽤いて LLM がプログラムを⽣成 2. プログラム実⾏︓ ⽣成したプログラムを実⾏し最終出⼒を得る タスク⼊⼒
P.5 プログラム ⽣成・実⾏ による 構成的推論 Gupta+'23 - Visual Programming: Compositional
Visual Reasoning Without Training (CVPR) GPT-3 に few-shot のプログラム事例を与えて 対象タスクのプログラムを⽣成(右図) BMW を Audi に修正、曇り空を晴れ空に修正 ⾚い⾞を⻘い⾞に修正 ⽩い Audi をポップに彩って Nicole Kidman の顔を :p に修正して
P.6 プログラム ⽣成・実⾏ による 構成的推論 Gupta+'23 - Visual Programming: Compositional
Visual Reasoning Without Training (CVPR) ③ の⽂字列を解析 { ”kwargs”: { ”boxes”: ”物体1 ” }, ”function”: ”count”, ”output”: ”個数1 ” } 物体1 = localize ( img=画像in , query=“ヒト” ) 物体2 = localize ( img=画像in , query=“ラクダ” ) 個数1 = count ( boxes=物体1 ) ① ② ③ GPT-3 が⽣成したプログラムを逐次実⾏ 実⾏結果を保存 ”物体1 ”: , ”物体2 ”: , program.state key = kwargs[“boxes”] boxes = program.state[key] program.state[output] = len(boxes) ③ を実⾏ ③ の結果を保存
P.7 結局どれが良いの︖(個⼈的妄想) 推論⽅式 ⾔語 (柔軟性) LLM 呼出 内省・検証 リスク ReAct
ボトムアップ ⾃然⾔語 (⾼い) 思考回数分 Reflexion hallucination snowballing function calling ボトムアップ ⾃然⾔語 (⾼い) 思考回数分 (×1~2) ︖ プログラマ依存 プログラム 構成的推論 トップダウン プログラム⾔語 (低い) プログラム⽣成分 PEARL プログラマ依存 A. タスク設計に応じて柔軟に使い分けるのが良い プログラムベース推論が優れるのは︓ ・タスク間で多くのサブタスクが共通する場合(視覚タスクでいうと detect, crop など) ・⼊⼒と出⼒の型が⼀意に定まる再現性のある処理(読書感想⽂などは不向き)
アプリケーションの簡単な紹介 モチベーション > 詳細 の話をするので共感いただけた⽅、 後ほどお話しできると幸いです︕ https://note.com/catshun_/n/na18e2c470b2f
P.9 どんなアプリケーションか︖ 🙆 ⾸都圏の⼋⽉に⾏われる花⽕⼤会 (動機)地理空間情報の関連タスク(旅⾏計画・マップ作成など)ではサブタスクが共通している (概要)マップ作成アプリケーション(ToDo: 旅⾏計画) 1. ユーザからのクエリ解析 2.
“⾸都圏 ⼋⽉ 花⽕⼤会” で Google 検索 3. 検索結果からクエリに該当する場所情報を取得 4. 各場所に対してジオコーディング 5. 結果を Google Map 上にプロット これらのサブタスクは旅⾏計画等でも共通する → プログラムベース構成的推論 を採⽤
P.10 アプリケーション構成図
P.11 興味︓マルチモーダル × ⾔語媒介推論 ⾔語 Enc 記憶領域 ⾔語 Dec 多くのアプリケーションの対象範囲
実世界の事象 実世界へ投影 ここをやりたい ここ × 時間変化 空間変化 旅⾏先到着など GPS 情報が変化したらユーザ嗜好に合わせて 歴史情報、アニメ聖地、飲⾷店マップ等の旅⾏ガイドを⾃動で作成する → 旅⾏計画~旅先~振り返り をサポートしてくれる旅⾏代理エージェント
P.12 動機︓「検索からマップ表⽰まで」のシームレスな接続をしたい じゃらん AI や Google Map などは素晴らしいアプリケーションだが、 検索結果と地理空間情報が必ずしもマッチしている訳ではない ⾔語
Enc 記憶領域 ⾔語 Dec 実世界の事象 実世界へ投影
P.13 さいごに もしモチベーションに共感された⽅がいましたら、 後ほどお話しできると幸いです︕