Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
AI最新論文読み会2022年まとめ
Search
医療AI研究所@大阪公立大学
December 07, 2022
Science
620
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
AI最新論文読み会2022年まとめ
AI最新論文読み会2022年まとめ
医療AI研究所@大阪公立大学
December 07, 2022
More Decks by 医療AI研究所@大阪公立大学
See All by 医療AI研究所@大阪公立大学
GPTの解説:ミートアップ用
ailaboocu
0
540
AI最新論文読み会2022年12月
ailaboocu
0
660
AI最新論文読み会2022年11月
ailaboocu
0
640
AI最新論文読み会2022年8月
ailaboocu
0
700
AI最新論文読み会2022年7月
ailaboocu
0
720
AI最新論文読み会2022年6月
ailaboocu
0
750
AI最新論文読み会2022年5月11日
ailaboocu
0
780
AI最新論文読み会2022年4月
ailaboocu
1
810
AI最新論文読み会2022年3月
ailaboocu
0
730
Other Decks in Science
See All in Science
水耕栽培:古代の知恵から宇宙農業まで
grow_design_lab
0
220
機械学習 - 授業概要
trycycle
PRO
0
610
AI bij literatuuronderzoek in de wetenschap
voginip
0
250
20260820_アウトカムが二値のデータに対するCausal Impact@LINEヤフー Data Science Share #2 / Causal Impact for Binary Outcomes
brainpadpr
3
1.3k
機械学習 - K近傍法 & 機械学習のお作法
trycycle
PRO
1
1.6k
ゲームと人工知能
miyayou
0
160
1. CPC理論の展開と集合的知能モデル(JSAI2026 KS-27 集合的予測符号化と新たな知性の時代)
hayashiyus884
1
350
Leitner Inauguration Lecture Chalmers University of Technology
xleitix
0
320
因果探索の発展と展望
sshimizu2006
2
1k
医療 LLM ベンチマークの現在地:多面的評価 と日本ローカライズ
analokmaus
1
670
機械学習 - pandas入門
trycycle
PRO
0
700
データベース03: 関係データモデル
trycycle
PRO
1
810
Featured
See All Featured
Leo the Paperboy
mayatellez
8
2.2k
Fashionably flexible responsive web design (full day workshop)
malarkey
408
67k
RailsConf 2023
tenderlove
30
1.5k
Speed Design
sergeychernyshev
33
2.1k
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
3k
Stop Working from a Prison Cell
hatefulcrawdad
274
21k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2k
Agile Actions for Facilitating Distributed Teams - ADO2019
mkilby
0
270
コードの90%をAIが書く世界で何が待っているのか / What awaits us in a world where 90% of the code is written by AI
rkaga
63
45k
Designing for Timeless Needs
cassininazir
1
460
技術選定の審美眼(2025年版) / Understanding the Spiral of Technologies 2025 edition
twada
PRO
120
120k
Breaking role norms: Why Content Design is so much more than writing copy - Taylor Woolridge
uxyall
1
390
Transcript
େࡕެཱେֶɹ২ాେथ AI࠷৽จಡΈձ 20221·ͱΊ
2022·ͱΊ AI࠷৽จಡΈձ ɾϝΠϯ ConvNeXt (2݄ൃද): ͍͍͢࠷ۙͷߴੑೳϞσϧ GLIDE (1݄ൃද)ɹςΩετtoը૾ੜ Imagic (11݄ൃද)ɹࡉ͔ͳमਖ਼
AudioLM (10݄ൃද): ԻੜϞσϧ Socratic Models (5݄ൃද): ൚༻AI (AGI) ɾͦͷଞ Wav2Vec 2 (7݄ൃද): NeuroAI?Brain-inspired AI (AIͱਓؒͷͷؔΛ୳Δ) Algorithmic Imprint (7݄ൃද): AI࡞ऀͷྙཧ
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech
Socratic model Diffusion
2022·Ͱ·ͱΊ Self-Attention 2017 2018 BERT 2020 DETR ViT GPT3 2021
CLIP wav2vec 2 w2v-BERT BigSSL 2019 GPT2 SwinT DDPM ADM
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV AudioLM Speech Socratic
model Diffusion ConvNeXt
ConvNeXt: CNN x SwinTransformer ը૾ྨϞσϧͷstate-of-the-art
ConvNeXt: CNN x SwinTransformer ͷ·ͱΊ: ϕʔεResNet
ConvNeXt ·ͣॳΊʹɻ
ConvNeXt ֤εςʔδͷ܁Γฦ͠ΛSwinTʹ͚ۙͮΔ
ConvNeXt 4×4 non-overlapping convolution ΈࠐΈͷύονԽ
ConvNeXt Depthwise convolutionಋೖޙɺ෯Λ͛Δ
ConvNeXt Inverted bottleneck(Narrow→Wide→Narrow)ߏͷಋೖ TransformerͰ֦େ4ഒΛ༻ɻ※MobileNetͰ֦େ6ഒɻ શମͱͯ͠ͷܭࢉྔݮΔ͕ɺConvͷԋࢉ૿Ճɻ SwinTͰίί
ConvNeXt Depthwise convolutionͷҠಈ ※Depthwise ConvolutionͰେ͖ͳΧʔωϧαΠζ͏ͨΊ Ұ࣌తʹConvͷԋࢉྔݮগͰੑೳѱԽɻ SwinTͰίί MSAϒϩοΫ͕FFNΑΓઌ಄ʹ͋Δ
ConvNeXt SwinTransformerͷΧʔωϧαΠζ(7)ΛਅࣅΔ Depthwise convolutionͷ ΧʔωϧαΠζେ͖͍ͯ͘͘͠ɻ 7Ͱੑೳ͕(SwinTͱಉ͡) ↓
ConvNeXt ࡉ͔ͳSwinT or ViTͷΛಋೖ ReLU→GELU NormalizationݮΒ͢ BN→LN μϯαϯϓϧΛΓ͠
ConvNeXt ݁Ռ
ConvNeXt ResNetΛSwinTransformerԽͯ͠ɺ CNN͚ͩͰState-of-the-artग़ͨΑɻ
None
2022·ͱΊ Text AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech Socratic model
Diffusion GLIDE, Imagic
GLIDE Stable Di ff usionͷجૅϞσϧ
Diffusion model ੜϞσϧ
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓ ҆ఆԽɺߴղ૾Խ ݴޠΛѻ͏
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓
DDPM: diffusion modelͷ࢝·Γ DNN Image Noise Image +
Noise ਪͨ͠ Noise ࣌ࠁใ ೋޡࠩ ࠷খԽ
Diffusion modelͷྺ࢙ DDPM ADM GLIDE CLIP ↓
ADM: ϞσϧΛ2ͭʹ͚ͯɺߴղ૾Խʹޭɻ Base Upsampler ྨ ߴղ૾ Classi fi er guidance
(CNN)
GLIDE = CLIP x Diffusion model Di ff usion modelͷྺ࢙
DDPM ADM GLIDE CLIP ↓
CLIP: ը૾ͱςΩετͷڮ͠
CLIP: ը૾ͱςΩετͷڮ͠ ը૾ͱςΩετΛൺֱͰ͖ΔΑ͏ʹಛมͰ͖ΔϞσϧ ViT: Image Transformer: Text ίαΠϯྨࣅ
ADM Base Upsampler ྨ ߴղ૾ Classi fi er guidance (CNN)
GLIDE = ADM-basedʹCNNΛCLIPʹมߋ ADM-basedʹCNNΛCLIPʹมߋ Base Upsampler ྨ ߴղ૾ Classi fi
er guidance (CLIP)
Imagic: Stable DiffusionͷվྑςΫχοΫ Stable Di ff usionͷվྑςΫχοΫ
Imagic Overview
None
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt Speech Socratic
model Diffusion AudioLM
AudioLM ԻͷੜϞσϧ
AudioLM = w2v-BERT x SoundStream Overview ɾจষͱΦʔσΟΦͷؒʹҰରଟͷ͕ؔ͋Δɻ ɾΦʔσΟΦςΩετʹൺͯ͠σʔλྔ͕ଟ͍ɻ
SoundStream ԻΛྔࢠԽ͢Δ
w2v-BERT Contrastive LearningͱMasked Language ModelingͷΈ߹Θͤ
None
2022·ͱΊ Text GLIDE, Imagic AGI ࣗવݴޠॲཧΛج൫ͱͨ͠൚ਓೳ(AGI)ͷνϟϨϯδͷ1ɻ CV ConvNeXt AudioLM Speech
Diffusion Socratic model
Socratic models طଘֶशࡁΈϞσϧΛΈ߹Θͤͨ(४ʁ)൚ਓೳϞσϧ
Socratic models Overview Language is an intermediate representation
Socratic models Overview طଘͷVLM (Visual Language Model)ɺLMs (Large Language Model)
ɺ ALMs (Audio Language Model)ͷಉ࢜ が ɺߏԽ͞ΕͨରΛߦ͏ɻ ͦͯ͠ɺ ビデ ΦαʔνɺΩϟ プ γϣϯੜɺ ビデ ΦQ&A (ະͷλεΫ)ɺকདྷͷߦಈ༧ଌΛ͜ͷରۭؒͷ৽͍͠ࢀՃऀͱͯ͠ѻ͏ ɻ
Socratic models ྫࣔ̍ɿجຊฤ
Socratic models ྫࣔ̎ɿԠ༻ฤ
Socratic models ιΫϥςεରͱʁ
None
Others: NeuroAIᶃ ͷػೳͱݴޠϞσϧͷରԠΛ୳Δ
Others: NeuroAIᶃ શମ૾: Wav2Vec 2Λֶश͠ɺͦͷ݁Ռ͔ΒfMRIͷBOLDΛ༧ଌ͢ΔWΛ࡞ɾ݁Ռݕূ
Others: NeuroAIᶃ ฏۉԽͨ͠ͷ׆ੑͷදݱɻ
Others: NeuroAIᶃ ϞσϧͷϨΠϠʔͷਂ͞ͱͷ෦ҐʹରԠ͕͋ͬͨɻ
Others: NeuroAIᶄ ͔ΒݴޠΛੜ͢Δ
Others: NeuroAIᶄ ϞσϧͷτϨʔχϯάηογϣϯ 81िؒʹΘͨΓ50ճͷηογϣϯ ݽཱޠλεΫͱจষλεΫ λʔήοτͷ୯ޠจষ͕ը໘্ͷจࣈͱͯ͠ ඃݧऀʹࢹ֮తʹఏࣔ͞Εඃݧऀ ͦͷ୯ޠจষΛੜ͠Α͏ͱͨ͠ɻ ݽཱޠλεΫͰɺ50ݸͷӳ୯ޠηοτ͔Βݸʑͷ୯ޠΛੜɻ จষλεΫͰɺ50୯ޠηοτ͔ΒͳΔӳޠจ͔Β୯ޠྻΛੜɻ
Others: NeuroAIᶄ Ϟσϧͷ݁Ռ จষ75%ͷਫ਼ ୯ޠ93%ͷਫ਼
None
Others: AI Ethics ྙཧ
Algorithmic Imprint Ξϧ ゴ Ϧ ズ ϜʹΑΔ が ൃੜͨ͠߹ͷҰൠత で
߹ཧతͳରࡦͱͯ͠ɺͦͷ༗ͳӨڹ が ͞Βʹൖ͢ΔͷΛ ぐ ͨΊʹ Ξϧ ゴ Ϧ ズ Ϝͷ༻ఀࢭ が Α͘ߦΘΕΔ が ɺఀࢭ͔ͨ͠Βͱݴͬͯެฏੑɺઆ໌ɺಁ໌ੑɺྙཧͷ が ͳ͘ͳΔ Θ͚ で ͳ͍ →͜ͷ༗ͳΞϧ ゴ Ϧ ズ ϜͷӨڹɺΞϧ ゴ Ϧ ズ ϜআҎ߱͘Өڹ͠ଓ͚Δ(Ξϧ ゴ Ϧ ズ Ϝͷࠟ) ྫ: ӳࠃΛڌͱ͢Δߴߍͷଔۀূॻࢼݧ で ͋ΔGCEࢼݧͷΞϧ ゴ Ϧ ズ ϜʹΑΔධՁΛऔΓר͘(2020) ▪ ど ͷΑ͏ͳࢼݧ͔? ɾ 160͔ࠃҎ্ で ࣮ࢪ͞Ε͍ͯΔ(ͦͷଟ͘ӳࠃͷݩ২ຽ)ࠃࡍతʹೝΊΒΕͨࢼݧ ɾ AϨ ベ ϧͷඞવత で ͋ΓɺେֶͷೖֶʹෆՄܽͳׂΛՌͨ͢ ▪ܦҢ ɾCOVID-19ͷେྲྀߦʹΑΓGCEࢼݧΛಜ͢ΔӳࠃʹຊڌΛஔ͘४ػؔ で ͋ΔOfqualର໘ࢼݧΛதࢭͨ͠ ɾࢼݧͷΘΓʹɺֶߍ で ͷੜెͷաڈͷɺڭࢣͷධՁΛ༻ͯ͠Ξϧ ゴ Ϧ ズ Ϝ で Λ࡞ͨ͠ →݁Ռɺੈքతͳ߅ٞߦಈ が ຄൃ͠ɺΞϧ ゴ Ϧ ズ Ϝআ͞Εͨ ɹڭࢣଆ: ͦͦաڈͷੜెͷධՁΛه͍ͯ͠ͳ͍ ɹੜెଆ: ʹରͯ͠ਅʹऔΓΜ で ͍ͳ͔ͬͨ(ࢼݧ が શͯͳͷ で લͷ30~60ʹษڧ͢Δੜె が ଟ͍) ɾΞϧ ゴ Ϧ ズ Ϝআ͞Εͨ が ɺֶੜͷ࠶ධՁߦΘΕͳ͔ͬͨɻ ͢ͳΘͪɺ࠾ํ๏มΘͬͨ が ɺΞϧ ゴ Ϧ ズ ϜͷӨڹΛେ͖͘ड͚͍ͯͨ(Ξϧ ゴ Ϧ ズ Ϝͷࠟ)
Algorithmic Imprint ▪Algorithmic Imprint(Ξϧ ゴ Ϧ ズ Ϝͷࠟ)Λҙࣝͨ͠Ξϧ ゴ Ϧ
ズ Ϝͷઃܭ ʮΞϧ ゴ Ϧ ズ ϜͷࠟʯΛҙࣝͨ͠ઃܭͷߟ͑ํʹΑΓɺΞϧ ゴ Ϧ ズ Ϝ։ൃ プ ϩηεΛΑΓެฏ で ࣾձٕज़తͳ ใʹج づ ͍ͨͷʹ͢Δ͜ͱ がで ͖Δɻ (1)Ξϧ ゴ Ϧ ズ ϜͷӨڹ Ξϧ ゴ Ϧ ズ Ϝআͨ͠ޙʹརؔऀʹӨڹΛٴ ぼ ͢ɻ։ൃऀͱӡӦऀΞϧ ゴ Ϧ ズ ϜΛআ ͢Δ だ ͚ で ͳ͘ɺΞϧ ゴ Ϧ ズ ϜʹΑΔةΛੋਖ਼͠ɺઆ໌ が ࣋ଓͯ͠ཁٻ͞ΕΔɻ (2)Ξϧ ゴ Ϧ ズ Ϝઃܭͷઆ໌ ։ൃऀʮΞϧ ゴ Ϧ ズ ϜͷࠟʯͷӨڹΛड͚ΔਓʹΛΑΓೝࣝ で ͖ΔΑ͏ʹ͢Δ べ ͖ で ͋Δɻ (3)AIྙཧ ガ バ φϯε で ิڧ͢Δ ٕज़తͳհೖ だ ͚ で Λݮ͢Δ͜ͱ で ͖ͳ͍ɻ ʮΞϧ ゴ Ϧ ズ ϜͷࠟʯΛҙࣝͨ͠Ξϧ ゴ Ϧ ズ ϜઃܭΛ దͳAI ྙཧ ガ バ φϯε で ิ͢Δɻ
None
2023ʹ͍ͭͯ ʮզʑͷݚڀࣨʹ͔͠Ͱ͖ͳ͍͜ͱʯΛɻ Ҿ͖ଓ͖ษڧձ։࠵͢Δɻ ҩֶͷൺॏΛॏ͘͢Δɻ ҩྍը૾ݚڀ༻ϞσϧͷνϡʔτϦΞϧɾϋϯζΦϯ