Upgrade to Pro — share decks privately, control downloads, hide ads and more …

Sparse Autoencoder 〜 大規模言語モデルの内部表現を読む 〜 Sparse ...

Avatar for Neurogica Neurogica
September 05, 2026

Sparse Autoencoder 〜 大規模言語モデルの内部表現を読む 〜 Sparse Autoencoder: Understanding LLM's Latent Representations

Avatar for Neurogica

Neurogica

September 05, 2026

More Decks by Neurogica

Other Decks in Technology

Transcript

  1. アジェンダ アジェンダ • はじめに SAE 批判的検討 はじめに ニューロンの多義性と superposition 仮説

    • Sparse Autoencoder Toy Models of Superposition(Elhage et al., 2022) Towards Monosemanticity(Bricken et al., 2023) • 2025年以降の批判的な⽴場 評価指標への疑義、feature の単位性、後継⼿法 • まとめ まとめ
  2. はじめに - polysemanticity アジェンダ はじめに SAE 批判的検討 まとめ polysemanticity(多義性) •

    • • 1つのニューロンが、互いに無関係な複数の⼊⼒ に反応する 例:「猫の顔」, 「⾞の⼀部」の両⽅に反応す るニューロンが存在 「このニューロンは◯◯を検出している」とい う説明がつかない → ニューロンは「意味の単位」ではない 図1. 多義的なニューロンの活性
  3. はじめに - superposition 仮説 アジェンダ はじめに SAE 批判的検討 まとめ なぜニューロンは多義的になるのか

    • • • 概念は空間の「⽅向」として線形に表現される 表現したい概念の数 n は、使える次元数 d よりはるかに多い(n ≫ d) 各概念にニューロン固有の線形結合を割り当て、次元数より多くの特徴を重ねて表現 アラビア⽂字 HTMLヘッダ 猫の顔 DNA
  4. SAEとsuperposition 仮説 アジェンダ はじめに SAE 批判的検討 まとめ Toy Models of

    Superposition (2022) [1] • • 5次元ベクトルを2次元に射影しReLUで復元す るtoy実験(各成分が概念に対応する擬似データ) ベクトルが疎なとき(≒概念が疎なとき) superposition により概念間の⼲渉が少なくな るような埋め込みになる → 疎に重ねられているなら、次元を広げて疎性を 課せばほどけるはず 図3. 疎性と superposition の関係
  5. SAE - 定式化 アジェンダ はじめに SAE 批判的検討 まとめ Sparse Autoencoder

    の構造 • x z 512次元 • ⼊⼒ x は学習済みモデルの中間活性(ℝᵈ) W_dec の各列が 1 つの feature ⽅向 = 概念 再構成 ||x-xʼ||^2 により情報を捨てていないことを保証 4096次元 • MLP, 512次元 L = ‖x − x̂‖² + λ‖z‖₁(再構成 + 疎性) xʼ
  6. SAE アジェンダ はじめに SAE 批判的検討 まとめ Towards Monosemanticity (2023) [2]

    • • • 1層 Transformer の 512 ニューロン MLP 層の活性を、80億データ点で学習 512 ニューロンを 4,000 以上の feature に分解 アラビア⽂字に強く反応する feature を分析すると、実際にアラビア⽂字の8割 に強い反応を⽰す 図4. 抽出された単義的な feature
  7. 批判的検討 - SAE はどこまで信⽤できるのか アジェンダ はじめに SAE 批判的検討 まとめ 2024年をピークに、検証的な研究が積み上がっている

    • • • • 下流タスクで単純なベースラインに勝てない(sparse probing の⽐較)[3] ランダム初期化した Transformer でも同程度に「解釈可能そう」な結果が出る [4] feature splitting / absorption により、1つの概念が割れたり吸収されたりする [5] SAE は解析の「正準な単位」を与えないという指摘 [6] → 「feature が読める」ことと「モデルを理解できた」ことは別
  8. まとめ アジェンダ はじめに SAE 批判的検討 はじめに • • ニューロンは多義的で、意味の単位にならない superposition

    仮説がその説明を与える Sparse Autoencoder • • 概念の疎性を仮定し,NNの次元数を増やすことで概念を分解 実際に feature ごとに概念が分かれることを確認 批判的検討 • • 評価指標の妥当性と feature の単位性が未解決 transcoder など後継⼿法も登場している まとめ
  9. 参考⽂献 アジェンダ はじめに SAE 批判的検討 まとめ [1] Elhage, N., et

    al. "Toy Models of Superposition." Transformer Circuits Thread, 2022. [2] Bricken, T., et al. "Towards Monosemanticity: Decomposing Language Models With Dictionary Learning." Transformer Circuits Thread, 2023. [3] Kantamneni, S., et al. "Are Sparse Autoencoders Useful? A Case Study in Sparse Probing." 2025. [4] Heap, T., et al. "Sparse Autoencoders Can Interpret Randomly Initialized Transformers." 2025. [5] Chanin, D., et al. "A is for Absorption: Studying Feature Splitting and Absorption in Sparse Autoencoders." NeurIPS 2025. [6] Leask, P., et al. "Sparse Autoencoders Do Not Find Canonical Units of Analysis." 2025. [7] Ameisen, E., et al. "Circuit Tracing: Revealing Computational Graphs in Language Models." Transformer Circuits Thread, 2025. [8] Olshausen, B. A., & Field, D. J. "Emergence of simple-cell receptive field properties by learning a sparse code for natural images." Nature, 1996.