Upgrade to Pro — share decks privately, control downloads, hide ads and more …

生成AIなんでも展示会vol6 LT登壇資料 NexteraBERT

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for Rikka Botan Rikka Botan
September 23, 2026

 生成AIなんでも展示会vol6 LT登壇資料 NexteraBERT

生成AIなんでも展示会 vol.6での登壇資料です。

Avatar for Rikka Botan

Rikka Botan

September 23, 2026

More Decks by Rikka Botan

Other Decks in Research

Transcript

  1. NexteraBERT: Input-Dependent Gating Liquid Mixer and Length-Adaptive Attention for Fast,

    Long-Context Bidirectional Encoders 入力依存型Liquid Mixerと長さ適応型Attentionによる 高速な長文対応双方向エンコーダ
  2. 自己紹介 / About us り っ か 六花 ぼ た

    ん 牡丹 Rikka Botan 独立研究者(機械学習 / 代数学 / 数理論理学) Independent researcher (machine learning / algebra / mathematical logic) ◆趣味 お菓子作り・紅茶・クラシック鑑賞・お洋服 ◆最近の活動 Silver Award: Liquid AI Hackathon Series | Tokyo 記事執筆(Mamba, LFM2 (LTCs) 関連) SSE Modelシリーズの公開 X(Twitter) Portfolio
  3. 目録 / Contents 1 主な貢献 / Main Contributions 2 知の架橋

    / Bridging Knowledge 3 知の転換 / A Shift in Thinking 4 経験のユニーク性 / The Uniqueness of Experience
  4. 主な貢献 / Main Contributions 独自のアーキテクチャ(NexteraBERT) からなるモデルをフルスクラッチで構築 下記の点で世界最高クラスの性能を示しました。 ・65k tokensの推論でModernBERT-baseより5.22倍 高速

    (LFM2.5 Encoder 230Mより2.01倍高速) ・15倍少ないtokensでの学習で、GLUEでは ModernBERT-baseと同等、MTEB v2では凌駕 (OptiBERT比では5.27倍) ・学習長の8倍でもほぼ劣化しない外挿性 (損失 +3.8%のみ増加 (他のモデルは+83%増加)) ・Code & Long Retrieval(CodeSearchNet, MultiLongDocRetrieval)でModernBERT-baseを凌駕
  5. 知の架橋 / Bridging Knowledge Self Attentionの非効率性の打開のために、 近年の言語モデルではSelf Attention以外のMixerを 併用するのがデファクトスタンダードになっています。 計算神経科学

    (NexteraBERTでもLiquid Time-Constantsを使用) 制御工学 入力に応じた Mamba, Gated Delta Networks, Kimi Delta Attention, 少ない変数で システムの適応的変化 Liquid Time-Constantsなどは 状態の遷移を表現 言語モデルの文脈から現れたものではなく、 制御工学や計算神経科学(神経生物学) Mamba, GDN LTCs から端を発したものです。 言語モデルという、「枠」に囚われたままでは Transformer 辿り着けない領域であり、 他の学術分野をも活用するという視点が 自然言語処理 新たな効率性への扉を開いています。 言葉の構造と意味を 数値処理で扱う
  6. 知の転換 / A Shift in Thinking エンコーダーモデルの学習において、 多くのモデルがマスク率が 一定で行われてきました。 →本当に一定が適切?

    →マスク率を線形に下げていくと 収束性が高まる。 →より少ない学習で高い性能に到達 前提を疑い、模索することが重要
  7. 12