Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
データ駆動による因果仮説探索
Search
Shohei SHIMIZU
February 09, 2021
Science
4
1.8k
データ駆動による因果仮説探索
JSTワークショップ「人工知能と科学」
Shohei SHIMIZU
February 09, 2021
Tweet
Share
More Decks by Shohei SHIMIZU
See All by Shohei SHIMIZU
Causal discovery based on non-Gaussianity and nonlinearity
sshimizu2006
0
150
統計的因果探索の方法
sshimizu2006
1
1.1k
Non-Gaussian methods for causal discovery
sshimizu2006
0
270
研究・教育・産学連携の循環の実践
sshimizu2006
0
320
データで課題を解決する -因果関係を調べる統計的因果推論-
sshimizu2006
4
1.6k
統計的因果探索の概要と役割
sshimizu2006
0
2.1k
統計的因果探索とAI
sshimizu2006
1
2.3k
統計的因果探索: 領域知識とデータによる因果構造グラフの推測
sshimizu2006
4
2.9k
統計的因果探索: セミパラメトリックアプローチを中心に
sshimizu2006
3
1.2k
Other Decks in Science
See All in Science
All-in-One Bioinformatics Platform Realized with Snowflake ~ From In Silico Drug Discovery, Disease Variant Analysis, to Single-Cell RNA-seq
ktatsuya
0
200
ABEMAの効果検証事例〜効果の異質性を考える〜
s1ok69oo
4
1.9k
Machine Learning for Materials (Lecture 9)
aronwalsh
0
190
20240420 Global Azure 2024 | Azure Migrate でデータセンターのサーバーを評価&移行してみる
olivia_0707
2
860
いまAI組織が求める企画開発エンジニアとは?
roadroller
2
1.2k
ベイズのはなし
techmathproject
0
240
Machine Learning for Materials (Lecture 8)
aronwalsh
0
400
【健康&筋肉と生産性向上の関連性】 【Google Cloudを企業で運用する際の知識】 をお届け
yasumuusan
0
300
多次元展開法を用いた 多値バイクラスタリング モデルの提案
kosugitti
0
180
[NeurIPS 2023 論文読み会] Wasserstein Quantum Monte Carlo
stakaya
0
410
学術講演会中央大学学員会八王子支部
tagtag
0
210
AI Alignment: A Comprehensive Survey
s_ota
0
220
Featured
See All Featured
Bootstrapping a Software Product
garrettdimon
PRO
304
110k
Building a Modern Day E-commerce SEO Strategy
aleyda
37
6.8k
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
37
1.7k
Speed Design
sergeychernyshev
22
470
Web development in the modern age
philhawksworth
205
10k
How to Think Like a Performance Engineer
csswizardry
16
1k
Principles of Awesome APIs and How to Build Them.
keavy
126
17k
Unsuck your backbone
ammeep
667
57k
Product Roadmaps are Hard
iamctodd
PRO
48
10k
Let's Do A Bunch of Simple Stuff to Make Websites Faster
chriscoyier
504
140k
Fight the Zombie Pattern Library - RWD Summit 2016
marcelosomers
230
17k
Building Adaptive Systems
keathley
37
2.1k
Transcript
統計的因果推論と機械学習: データ駆動による因果仮説探索 清水昌平 滋賀大学データサイエンス学系 理化学研究所革新知能統合研究センター 2021.1.22 JSTワークショップ 「人工知能と科学」
統計的因果推論と機械学習 •統計的因果推論 – 介入するとどうなるか? • チョコ消費量を変えると ノーベル賞受賞者の数は変わるのか • どのくらい増えるのか(減るのか) •機械学習
– チョコ消費量がこのくらいだと 受賞者どのくらい? 2 Messerli, (2012), New England Journal of Medicine ! " # $ 賞 受 賞 者 ( 数 相関係数: 0.79 チョコレート消費量
相関関係と因果関係のギャップ 3 チョコ 賞 ? チョコ 賞 or GDP GDP
チョコ 賞 or GDP 複数の因果関係が同じ相関関係を与える 賞 未観測共通原因 未観測共通原因 未観測共通原因 ギャップ ҼՌάϥϑ チョコ
統計的因果推論の手順の例 1. 推定したいものを決める: 介入効果 2. 領域知識を用いて因果構造を表すグラフを描く (実験か観察か含む) 3. どの変数(共通原因)で調整すべきかを理論から導く 4.
(もしあれば) その変数を観測し調整に使い推定 4 チョコ 賞 GDP 𝐸 賞 𝑑𝑜 チョコ = 多い) = 𝐸調整に使う変数 [𝐸 賞 チョコ = 多い, 調整に使う変数)] 𝐸 賞 𝑑𝑜 チョコ = 多い) − 𝐸 賞 𝑑𝑜(チョコ = 少ない))
従来: 因果は扱いにくいもの • 「最近」起こった(広まった)こと – 理論面 (Rubin, Pearl) • 因果の数学的記述
• 領域知識と仮定を表現する道具の整備 • 因果推論のアルゴリズム化 – 適用面 • 機械学習の実用化・普及 – 機械学習では扱えないリサーチクエスチョンが何か明確に – 機械学習モデルの説明性、公平性 • Webサービス、行動経済学での因果推論の活用 – 因果推論によるビジネス、政策立案、適用領域の拡大 • 因果の科学: Causal Science (Pearl, 2020) 5
数学的フレームワーク (Imbens & Rubin, 2015; Pearl, 2001) • 構造的因果モデル (Pearl,
2001) • 因果の数学的表現 6 構造方程式 因果グラフ 構造方程式 因果グラフ 𝑥 = 𝑓) 𝑧, 𝑒) 𝑦 = 𝑓* 𝑥, 𝑧, 𝑒* 𝑥 = 1 𝑦 = 𝑓* 𝑥, 𝑧, 𝑒* 𝑝 𝑦 𝑑𝑜 𝑥 = 1 ≠ 𝑝 𝑦 𝑑𝑜 𝑥 = 0 であれば, 𝑥 causes 𝑦 𝑝 𝑦 𝑑𝑜 𝑥 = 1 𝑑𝑜 𝑥 = 1 𝑥: チョコ 𝑦: 賞 𝑧: GDP 𝑥: チョコ 𝑦: 賞 𝑧: GDP 1
推定可能性の理論 (Pearl, 2001; Spirets et al., 1993; Shimizu, 2014) •
因果グラフが描けたときに介入効果 – どの変数で調整すればよいか • 因果グラフ: 因果仮説探索 – データも使って描く: 例えば、線形性+非ガウス連続分布なら可 7 チョコ 賞 ? チョコ 賞 or GDP GDP チョコ 賞 or GDP x y z w u v q
8 データによる因果グラフ探索の適用例 https://sites.google.com/view/sshimizu06/lingam/lingampapers/applications-and-tailor-made-methods 疫学 経済学 Sleep problems Depression mood Sleep
problems Depression mood ? or OpInc.gr(t) Empl.gr(t) Sales.gr(t) R&D.gr(t) Empl.gr(t+1) Sales.gr(t+1) R&D(.grt+1) OpInc.gr(t+1) Empl.gr(t+2) Sales.gr(t+2) R&D.gr(t+2) OpInc.gr(t+2) (Moneta et al., 2012) (Rosenstrom et al., 2012) 神経科学 化学 (Campomanes et al., 2014) (Boukrina & Graves, 2013)
課題1: 未観測共通原因をどう懐柔するか • 現状: 領域知識により特定し観測する • どこまでデータにより支援できるか? – 例: 線形性と非ガウス連続分布
(Hoyer et al., 2008; Salehkaleybar et al., 2020) • 信号処理の理論: 独立成分分析 • 機械学習の理論: カーネル法 9 チョコ 賞 ? チョコ 賞 or GDP GDP チョコ 賞 or GDP 未観測共通原因 未観測共通原因 未観測共通原因 ҼՌάϥϑ
課題2: 変数をどうとるか • マクロ変数とミクロ変数 – 国レベルと個人レベル – 結果は一致するのか • 領域知識の利用
– (論文)テキストデータ等から抽出 • より一般に、データによる支援は可能? – 介入によるアルゴリズム (Chalupka et al. 2017) 10 Messerli, (2012) Chalupka et al. (2017)
まとめ: データ駆動による因果仮説探索 • 機械学習に加えて、統計的因果推論 – 因果グラフが領域知識で描ける場合は産業応用レベル – 描けない場合のデータによる支援が今後の鍵 • 課題
– 未観測共通原因 – 変数をどうとるか – データによる支援はどこまでできるか • 科学/工学の発展を加速 – 実験・調査、検証の効率化 11
12
因果グラフに関する領域知識の利用 • 領域情報+データから因果グラフを推測 – 製造業 • 製造条件 • その中間の特性 •
最終的な特性: 不良率など – 農業やマーケティングなどでも 13 最終特性 条件1 条件10 中間特性1 中間特性100 … 中間特性82 中間特性8 中間特性66 中間特性66 中間特性16 … … … … 因果探索