「Attentionさえあればいい!」 という言及が研究者に衝撃を与えた。 ➢ 以降、AttentionのみからなるTransformerが 言語モデルにおけるデファクトスタンダードになる。 [1] Ashish Vaswani et al., Attention Is All You Need, arXiv:1706.03762
例えば・・・ Mamba2では、入力に重みを付けて足すことで状態を更新する。 この時に、これまでの入力が長いほど更新量が小さくなりやすい ようにすることで自然な記憶の減衰を可能にしている。 (過去の記憶を適度に忘却しながら更新する) Gated Delta Netでは、Delta則(一般化したHouseholder変換)を用いて、 特定の古い記憶を消してから新しい記憶を状態に加える。 結果として必要な情報を効率的に記憶することが可能になった (加算のみだと忘却が不十分で、記憶が飽和する) 直交的更新で状態が暴れず安定=正確な想起も可能になっている。 ➢ つまり、過去の記憶をどのように忘却するのか、 新しい記憶をどのように圧縮して更新するのかがポイント! [2] Weigao Sun et al., Speed Always Wins: A Survey on Efficient Architectures for Large Language Models, arXiv:2508.09834