unintended memorization:サンプル固有の記憶 例) • John Smith scored 147 points in the 2019 regional bowling championship. • 構文はgeneralizationによって予測できるが、名前、スコア、年は unintended memorizationによってのみ予測できる 4
) = − N * S * log2 V i 真のデータ生成分布がわかるので 系列xの不確実性がわかる! K i ̂ ̂ • モデルθを利用したときの符号長はH (x | θ)の近似値として ̂ | −log2 p(x θ) i i ̂ • つまり、モデルθのデータセットx についての記憶量は i K i i ̂ ̂ mem(x , θ ) = H(x ) − H (x | θ ) = NS log V + log p(x | θ ̂ ) i ↑記憶量 i i 2 2 i ↑系列xの不確実性 ↑モデルが既知な上の不確実性 13
− H (x | θ) . K K ↑系列xの記述長 ↑モデルを使ったときの記述長 ̂ | H (x θ) ≈ − log2 pθ(x) ̂ • 1 S K ̂ | L(x) = − ln p (x) H (x θ) ≈ L(x) ⇨ ̂ θ • S ln 2 K • モデルを使ったときの記述長は系列長(S)一定ならlossの定数倍 • → 各系列の loss を見ることで、モデルが各系列をどの程度短く記述 できるか(圧縮率)を比較する 22