Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[Journal club] DIRL:Domain-Invariant Representa...
Search
Semantic Machine Intelligence Lab., Keio Univ.
PRO
May 19, 2022
Technology
1.4k
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[Journal club] DIRL:Domain-Invariant Representation Learning for Sim-to-Realย Transfer
Semantic Machine Intelligence Lab., Keio Univ.
PRO
May 19, 2022
More Decks by Semantic Machine Intelligence Lab., Keio Univ.
See All by Semantic Machine Intelligence Lab., Keio Univ.
[Journal club] Predict Before You Explore: Predictive Planning with Specialized Memory for Embodied Question Answering
keio_smilab
PRO
0
85
[Journal club] PHyCLIP: ๐๐-Product of Hyperbolic Factors Unifies Hierarchy and Compositionality in Vision-Language Representation Learning
keio_smilab
PRO
0
86
[Journal club] ReMEmbR: Building and Reasoning Over Long-Horizon Spatio-Temporal Memory for Robot Navigation
keio_smilab
PRO
0
110
[Journal club] ReLaGS: Relational Language Gaussian Splatting
keio_smilab
PRO
0
120
[Journal club] Flow as the Cross-Domain Manipulation Interface
keio_smilab
PRO
0
98
Mobi-๐: Mobilizing Your Robot Learning Policy
keio_smilab
PRO
0
160
A Gentle Introduction to Transformers
keio_smilab
PRO
16
7k
FlowAR: Scale-wise Autoregressive Image Generation Meets Flow Matching
keio_smilab
PRO
0
60
[Journal club] VLA-Adapter: An Effective Paradigm for Tiny-Scale Vision-Language-Action Model
keio_smilab
PRO
1
150
Other Decks in Technology
See All in Technology
AICoEใงAIใใคใใฃใ็ต็นใธใฎ้ฒๅ
yukiogawa
0
220
AIใๅฝใใๅใฎ็ต็นใง ใจใณใธใใขใฏใฉใ่ฒใคใ
nishihira
1
970
Oracle Exadata Database Service on Cloud@Customer X11M (ExaDB-C@C) ใตใผใในๆฆ่ฆ
oracle4engineer
PRO
2
8.5k
ใใใฏๅฐ็๏ผใคใใๆไผใไฝ้จใใใใจใงใใใผใ ใจใใฆใฎใใ่ฏใๆฏใ่ใใซๆฐใฅใใฏใผใฏใทใงใใ / The stand-up meeting from hell in the game industry
scrummasudar
0
220
ใใใทใฅใใผใ"้็บ"ใซใคใใฆ ใไฝฟใใใใใใทใฅใใผใใฎใคใใใใใ
kimichan
0
200
็บ่กจใจ็ทๆฌ / Presentations and Summary
ks91
PRO
0
190
ๅ จ็คพใงใฎใฝใใใฆใงใขใตใใฉใคใใงใผใณๆปๆๅฏพ็ญใใใฃใฆใฟใ with Takumi Guard
z63d
0
270
ใไผใใ้่ฆใ
smt7174
6
1.6k
ใๅ ฌ้็จใAI_Dev_Ex2026_AI_็ปๅฃ่ณๆ
matsuritechnologies
PRO
1
480
ใใฎใใญใฅใกใณใใ่ชๅๅใใพใใใ๏ผ
yuksew
1
410
ใชใใใใชใใฎAPIใฏไฝฟใใใชใใฎใ๏ผ AXๆไปฃใฎ่จญ่จๅๅใใฌใผใใฌใผใซใ้็จไฝๅถ
yokawasa
1
210
AI_Dev_Day_่ฃฝ้ ๆฅญ้ ๅใงใฎAIๆดป็จใใ่ฆใๆดป็จใฎ็ฝ ใจๆๅใซๅฐใๅฎ่ทต็ฅ.pdf
kintotechdev
0
160
Featured
See All Featured
Measuring & Analyzing Core Web Vitals
bluesmoon
9
900
The Illustrated Children's Guide to Kubernetes
chrisshort
51
53k
Mobile First: as difficult as doing things right
swwweet
225
10k
Practical Orchestrator
shlominoach
191
11k
Between Models and Reality
mayunak
4
380
Google's AI Overviews - The New Search
badams
0
1.1k
Why You Should Never Use an ORM
jnunemaker
PRO
61
9.9k
Ten Tips & Tricks for a ๐ฑ transition
stuffmc
0
150
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
490
How to audit for AI Accessibility on your Front & Back End
davetheseo
0
470
RailsConf 2023
tenderlove
30
1.5k
<Decoding/> the Language of Devs - We Love SEO 2024
nikkihalliwell
1
280
Transcript
Ajay Kumer Tanwai ( University of California, Berkeley ) DIRL
: Domain-Invariant Representation Learning for Sim-to-Real Transfer Tanwani, Ajay Kumar. "DIRL: Domain-Invariant Representation Learning for Sim-to-Real Transfer." CoRL (2020). ๆ ถๆ็พฉๅกพๅคงๅญฆ ๆๆตฆๅญๆ็ ็ฉถๅฎค ็ไธญ้งฟๅนณ
2 โข ใใกใคใณ้ฉๅฟ ( Domain Adaptation )ใฎๆฐใใชใขใซใดใชใบใ DIRL (ใใกใคใณไธๅค่กจ็พๅญฆ็ฟ, Domain-Invariant
Representation Learning ) ใฎๆๆก ๆฆ่ฆ โ ๆตๅฏพ็ๅญฆ็ฟใๅซใ4ใคใฎๆๅคฑ้ขๆฐใฎๅฐๅ ฅ โ Sim-to-Real ใฎๆๆใฟในใฏใง้ซใ็ฒพๅบฆใ็ฒๅพ
3 โข ๆฉๆขฐๅญฆ็ฟใซใใใฆใใใผใฟใซๅๅธใฎๅใ(ใใกใคใณใใคใขใน) ใใใใใจใๅคใ โ ๅคง้ใฎใทใใฅใฌใผใทใงใณใใผใฟ vs ๅฐ้ใฎๅฎๆฉ็ฐๅขใใผใฟ โ ใใกใคใณใใคใขในใ็ก่ฆใใใจ็ฒพๅบฆใๆชๅ
โใใกใคใณ้ฉๅฟ( Domain Adaptation ) ใซใใฃใฆ่งฃๆถ ่ๆฏ๏ผๆฉๆขฐๅญฆ็ฟใใผใฟใซใฏใใกใคใณใใคใขในใๅญๅจใใ Source Domain Target Domain ใคใ ใใณ ใใกใคใณใทใใ
4 ๆขๅญ็ ็ฉถ๏ผๆงใ ใชใขใใญใผใใใใฎใใกใคใณ้ฉๅฟ ๆขๅญๆๆณ ็นๅพด DANN [Ganin+, 2016] โข ๆตๅฏพ็ๅญฆ็ฟใซใใใใกใคใณ้ฉๅฟ โข
Source Domain ใ Target Domainใ่ญๅฅใใใ [Saito+, CVPR2018] โข ใฉใใซใใใณๆกไปถไปใใใกใคใณ้ฉๅฟ โข 2ใคใฎใฏใฉใน่ญๅฅๅจใใใใใฎๆจๅฎ็ตๆใฎไธไธ่ด๏ผdiscrepancy๏ผใซๆณจ็ฎ [Seita+, IROS2020] โข Sim-to-Real Transfer ใฎๆๆณใปใใกใคใณใฉใณใใ ๆณ โข ใใกใคใณ้ใฎไธไธ่ดใใทใใฅใฌใผใทใงใณใใฉใกใผใฟใฎๅคๅใจใใฆๆฑใ [Saito+, CVPR18] DANN[Ganin+, 2016]
5 โข ๆขๅญ็ ็ฉถใฎใใกใคใณ้ฉๅฟใฎๅ้ก่จญๅฎ โ ๅ ฅๅๅๅธ ( ๅจ่พบๅๅธ ) ใๆใใ โ
ๅบๅใฉใใซๅๅธ ( ๆกไปถไปใๅๅธ ) ใฏไธๅค โข ๅบๅใฉใใซๅๅธใๅฎ้ใฏ็ฐใชใ โ cross-label match โ label-shift ๆขๅญ็ ็ฉถใฎๅ้ก็น๏ผๅ ฅๅๅๅธใฎใฟใงใฎใใกใคใณ้ฉๅฟ โ ๅจ่พบๅๅธใจๆกไปถไปใๅๅธใฎไธกๆน ใใใกใคใณ้ฉๅฟใใใ
6 โข Simulator or Source Domain๏ผ ๐ท๐ , ๐๐ ๐๐
๐, ๐๐ ๐ ๐=1 ๐๐ โข Real or Target Domain๏ผ ๐ท๐ , ๐๐ ๐๐ ๐, ๐๐ ๐ ๐=1 ๐๐ ๐๐ โช ๐๐ โข Policy ๐๏ผ๐ณ โ โ ๐ด 0,1, โฆ , ๐พ or โ๐พ โ ใใใงใฎ Policy ใฏ ๐ โ ๐ ๐ โ ๐ ๐ ใซๅฏพๅฟ ๅ้กๆ่ตท๏ผใใกใคใณ้ฉๅฟใซใใใๅ้ก่จญๅฎใป็ฎ็้ขๆฐ Target Domainใงใฎ่ชคๅทฎใๅฐใใใชใใใใช Policy ๐ ใๅญฆ็ฟ โ๐ท๐ = ๐ผ๐~๐ท๐ ๐ ๐ ๐ โ ๐๐ ๐ Target Domain ใฎๆฐใฏ Source Domain ใใใๅฐใชใ
7 โข ๅจ่พบ็ขบ็ๅๅธใปๆกไปถไปใ็ขบ็ๅๅธใฎๆกไปถ โ Pr ๐๐, ๐๐ = Pr ๐๐|๐๐
Pr ๐๐ , Pr ๐๐|๐๐ Pr ๐๐ โข DIRL ใฏ S / T ใฎ2ใคใฎๅๅธใใใใใใใจใ็ฎ็ ๆๆกๆๆณใฎๅ้ก่จญๅฎใป็ฎ็ใฎ็ขบ่ช ๅจ่พบๅๅธใฎ ไธไธ่ดใ ๆกไปถไปใๅๅธใฎ ไธไธ่ดใ ๅจ่พบๅๅธใจๆกไปถไปใๅๅธใฎ ไธกๆนใใใกใคใณ้ฉๅฟใใใ
8 ๆๆกๆๆณ ( 1/5 )๏ผๅ จไฝๅใจ4ใคๆๅคฑ้ขๆฐใ่จญๅฎ โDIRL = policy loss +
marginal alignment loss + conditional alignment loss + soft triplet loss S / T ใใใใใฎ Cross-Entropy ๆๅคฑ้ขๆฐ
9 โข Source / Target Domain ใฎๅจ่พบๅๅธใๆตๅฏพ็ๅญฆ็ฟใซใใฃใฆๆใใ โข Generator ๐(๐)๏ผใใผใฟใ
S / T ๅ ฑๆใฎ็นๅพด็ฉบ้ใซ็ฌฆๅทๅ โ Target Domain ใฎใใผใฟใฎใฟใซ้ขใใ็นๅพดๆฝๅบๅจใ้ฉๅฟ ( โต ๐๐ โช ๐๐ ) โ ็นๅพดๅๅธ ( ๅจ่พบๅๅธ ) ใซใใใฆใS / T ใไธ่ดใใใ โข Discriminator ๐ท(๐)๏ผใใผใฟใ S / T ใฎใฉใกใใใ่ญๅฅ โ ็นๅพดๅๅธ ( ๅจ่พบๅๅธ ) ใซใใใฆใS / T ใไธ่ดใใใชใใใใซใใ ๆๆกๆๆณ ( 2/5 )๏ผMarginal Alignment Loss min ๐ท โ๐๐ ๐ ๐๐ , ๐๐ก , ๐ท ๐๐ , ๐๐ก = โ๐ผ๐๐ ~๐๐ log ๐ท ๐ ๐๐ โ ๐ผ๐๐ก~๐๐ก log 1 โ ๐ท ๐ ๐๐ก min ๐ โ๐๐ ๐ ๐๐ก , ๐ท ๐๐ , ๐๐ก = โ๐ผ๐๐ก~๐๐ก log ๐ท ๐ ๐๐ก
10 โข ๆกไปถไปใๅๅธใซใใใใฉใใซ้ใฎใใใใณใฐใ label shift ใฎๅ้กใ่งฃๆฑบ โข Generator ๐(๐)๏ผๅจ่พบๅๅธใใๅใฏใฉในใฎๆกไปถไปใๅๅธใ็ๆ โ
ๅใฏใฉในใง็ใใใใกใคใณใฎ้่คใๅ้ข โข Discriminator ๐ท(๐)๏ผใฏใฉใน่ญๅฅๅจ โ S / T ใใผใฟใซ้ขใใๆกไปถไปใๅๅธใฎไธไธ่ดใใๆจๅฎใปๆๅฐๅ ๆๆกๆๆณ ( 3/5 )๏ผConditional Alignment Loss min ๐ท โ๐๐๐ ๐ ๐๐ (๐), ๐ ๐ก (๐) , ๐ท ๐๐ (๐), ๐ ๐ก (๐) = โ๐ผ ๐๐ (๐) ~๐๐ log ๐ท ๐ ๐๐ (๐) โ ๐ผ ๐๐ก (๐) ~๐๐ก log 1 โ ๐ท ๐ ๐ก (๐) min ๐ โ๐๐๐ ๐ ๐๐ (๐), ๐ ๐ก (๐) , ๐ท ๐๐ (๐), ๐ ๐ก (๐) = โ๐ผ ๐๐ก (๐) ~๐๐ก log ๐ท ๐ ๐ ๐ก (๐)
11 โข Triplet Loss [Schroff+, CoRR2015] ใฎๅคๅฝขใๅฐๅ ฅ โ ใฏใฉใน้ใฎๅๆฃใๅคงใใใปใฏใฉในๅ ใฎๅๆฃใๅฐใใใใใ โ
ใใใใใๅ ใใใขใณใซใผใปๆญฃไพใป่ฒ ไพใใใใใฎ็นๅพด้ใฎ KL ่ท้ขใ่จ็ฎ โข ๐ฉ าง ๐ ๐๐ , ๐2 ใฏใฌใฆใทใขใณๅๅธใซๅพใ ๆๆกๆๆณ ( 4/5 )๏ผSoft Triplet Loss ๐ฉ าง ๐ ๐๐ ; าง ๐ ๐๐ , ๐2 = exp( โ1 ๐2 าง ๐ ๐๐ โ าง ๐ ๐๐ 2 2) ฯ ๐=1 ๐พ exp( โ1 ๐2 าง ๐ ๐๐ โ าง ๐ ๐๐ 2 2 ) ๐=1 ๐พ โ๐ก๐ = เท ๐=1 ๐ 1 ๐๐ โ 1 เท ๐=1 ๐โ ๐ ๐๐ KL ๐ฉ าง ๐ ๐๐ , ๐2 ||๐ฉ าง ๐ ๐๐ , ๐2 โ 1 ๐๐ เท ๐=1 ๐๐ KL ๐ฉ าง ๐ ๐๐ , ๐2 ||๐ฉ าง ๐ ๐๐ , ๐2 + ฮฑ๐ก๐ + anchors positives negatives
12 ๆๆกๆๆณ ( 5/5 )๏ผ4ใคๆๅคฑ้ขๆฐใฎใพใจใ โDIRL = ฮป1 โ๐๐_๐ ๐ ๐
โ ๐ ๐๐ , ๐๐ , ๐๐ก , ๐๐ก + ฮป2 โ๐๐ ๐ ๐๐ก , ๐ท ๐๐ , ๐๐ก + ฮป3 ฯ ๐=1 ๐ด โ๐๐๐ ๐ ๐๐ (๐), ๐ ๐ก (๐) , ๐ท ๐๐ (๐), ๐ ๐ก (๐) + ฮป4 โ๐ก๐ ๐ ๐๐ , ๐๐ , ๐๐ก , ๐๐ก
13 โข 2ๆฌกๅ ใฎ2ใฏใฉในๅ้กๅ้ก โข SourceใปTarget Domain ใฏใฌใฆในๅๅธใง็ๆ โ Source Domain๏ผๅนณๅ
โ2.5, โ1.5 ใป โ1.0, โ1.0 โ Target Domain ๏ผๅนณๅ 1.0, 1.0 ใป 2.5, 1.5 โ ๅๆฐใฏใใใใ 1000ๅใจ100ๅ โข ๅใขใธใฅใผใซใฏ7ๅใฎใใฅใผใญใณใใใชใ 3ๅฑคใฎ้ ใๅฑคใงๆงๆ โ DIRL ใฏ Target Domain ใซ้ขใใฆใๆญฃใใๅ้ก ๅฎ้จ็ตๆโ ๏ผๆกไปถไปใๅๅธใงใใฏใฉในๅ้กๅฏ่ฝ
14 โข ๅฎๆฉ็ฐๅขใฎใใผใฟใปใใใๅฐใชใ็ถๆ ใงๆๆใฟในใฏใใงใใใใฉใใ ๅฎ้จ็ตๆโก (1/3) ๏ผๆๆใฟในใฏใฎ Sim-to-Real ใฎๅฎ้จ ๐๐ ๐,
๐๐ ๐ ๐=1 ๐๐ ๐๐ = 20,000 โซ ๐๐ = 212 ๐๐ ๐ , ๐๐ ๐ ๐=1 ๐๐
15 ๅฎ้จ็ตๆโก (2/3) ๏ผๆๆใฟในใฏใฎๅฎ้ใฎๆตใ โก็ฉไฝ่ช่ญ โกๅฏพ่ฑก็ฉไฝใฎ ๆๆใฎไฝ็ฝฎใๆจๅฎ โ ใซใกใฉๆฎๅฝฑ โฃใใใฏในใซๆ ผ็ด
16 ๅฎ้จ็ตๆโก (3/3) ๏ผSim-to-Real ใฎๆๅนๆงใ็ขบ่ช โข ็ฉไฝ่ช่ญใฎ็ฒพๅบฆใงๆง่ฝ่ฉไพก โ ๅ่ฉไพกๆๆฐใง ๆใ้ซใ็ฒพๅบฆใ็ฒๅพ
โ ๆๆใใใใฏใผใฏใไฝฟ็จใใๅ ดๅ โ 86.5 % ใฎ็ฒพๅบฆใงๆพใไธใใ โ ใใใใฏใผใฏไธไฝฟ็จใง 76.2 %
17 โข ใใกใคใณ้ฉๅฟ ( Domain Adaptation )ใฎๆฐใใชใขใซใดใชใบใ DIRL (ใใกใคใณไธๅค่กจ็พๅญฆ็ฟ, Domain-Invariant
Representation Learning ) ใฎๆๆก ใพใจใ โ ๆตๅฏพ็ๅญฆ็ฟใๅซใ4ใคใฎๆๅคฑ้ขๆฐใฎๅฐๅ ฅ โ Sim-to-Real ใฎๆๆใฟในใฏใง้ซใ็ฒพๅบฆใ็ฒๅพ