Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
Sudachi近況報告 at WAP NLP Tech Talk #4
Search
WAP
November 29, 2021
Technology
1
490
Sudachi近況報告 at WAP NLP Tech Talk #4
ワークス徳島人工知能NLP研究所によるSudachi近況報告 at WAP NLP Tech Talk #4です。
WAP
November 29, 2021
Tweet
Share
More Decks by WAP
See All by WAP
単語分散表現と事前学習モデル - chiVe _ chiTra 利活用のための下準備 at WAP NLP Tech Talk #5
waptech
0
1.3k
事前学習モデル chiTra の活用方法 at WAP NLP Tech Talk #5
waptech
0
310
単語分散表現 chiVeの活用方法 at WAP NLP Tech Talk #5
waptech
0
600
Sudachi Family近況報告 at WAP NLP Tech Talk #5
waptech
0
200
日本語形態素解析器 SudachiPy の 現状と今後について
waptech
4
6.9k
企業(ワークスアプリケーションズ)での研究開発の楽しさと苦労
waptech
0
320
Sudachi辞書のつくり方
waptech
4
2.1k
chiVe_実用的な日本語単語ベクトル実現にむけて_20201208.pdf
waptech
2
560
Other Decks in Technology
See All in Technology
データマネジメントのトレードオフに立ち向かう
ikkimiyazaki
6
960
スタートアップ1人目QAエンジニアが QAチームを立ち上げ、“個”からチーム、 そして“組織”に成長するまで / How to set up QA team at reiwatravel
mii3king
2
1.5k
偶然 × 行動で人生の可能性を広げよう / Serendipity × Action: Discover Your Possibilities
ar_tama
1
1.1k
速くて安いWebサイトを作る
nishiharatsubasa
10
12k
エンジニアが加速させるプロダクトディスカバリー 〜最速で価値ある機能を見つける方法〜 / product discovery accelerated by engineers
rince
4
320
オブザーバビリティの観点でみるAWS / AWS from observability perspective
ymotongpoo
8
1.5k
OpenID Connect for Identity Assurance の概要と翻訳版のご紹介 / 20250219-BizDay17-OIDC4IDA-Intro
oidfj
0
270
一度 Expo の採用を断念したけど、 再度 Expo の導入を検討している話
ichiki1023
1
170
データ資産をシームレスに伝達するためのイベント駆動型アーキテクチャ
kakehashi
PRO
2
530
プロダクトエンジニア構想を立ち上げ、プロダクト志向な組織への成長を続けている話 / grow into a product-oriented organization
hiro_torii
1
170
Moved to https://speakerdeck.com/toshihue/presales-engineer-career-bridging-tech-biz-ja
toshihue
2
740
開発スピードは上がっている…品質はどうする? スピードと品質を両立させるためのプロダクト開発の進め方とは #DevSumi #DevSumiB / Agile And Quality
nihonbuson
2
2.9k
Featured
See All Featured
Build your cross-platform service in a week with App Engine
jlugia
229
18k
The Pragmatic Product Professional
lauravandoore
32
6.4k
The Art of Delivering Value - GDevCon NA Keynote
reverentgeek
10
1.3k
Intergalactic Javascript Robots from Outer Space
tanoku
270
27k
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
129
19k
We Have a Design System, Now What?
morganepeng
51
7.4k
Done Done
chrislema
182
16k
Building Your Own Lightsaber
phodgson
104
6.2k
The Power of CSS Pseudo Elements
geoffreycrofte
75
5.5k
Music & Morning Musume
bryan
46
6.3k
The Art of Programming - Codeland 2020
erikaheidi
53
13k
RailsConf & Balkan Ruby 2019: The Past, Present, and Future of Rails at GitHub
eileencodes
133
33k
Transcript
Sudachi近況報告 at WAP NLP Tech Talk #4 ワークス徳島人工知能NLP研究所 高岡一馬
2 Sudachi Sudachi.rsリリース • v0.6.0 SudachiPy • Sudachi.rsのバインディングとして再構成 • Pure
Python, Cythonは今後メンテナンスしない
3 Rust 爆速でした MeCab/UniDic 2.2.0 Sudachi Java 0.5.3 Sudachi.rs 0.6.0
SudachiPy 0.5.4 SudachiPy 0.6.0 0.31 1 0.39 0.68 13.11 Java版を1としたときの 処理速度
4 Sudachi (Java) 今後の予定 高速化 API改良 • JSONではない個別設定APIの新設 • ユーザ辞書の動的な追加、削除
その他 • ユーザ辞書に自由記述項目を追加 • 必ず切る分割単位の新設 v1.0に向けて非互換な変更をいれていく予定
5 Sudachi辞書 12月リリースに向けて鋭意作業中 形態素辞書 • 語彙追加 • カタカナ外来語の正規化見直し • 用言の正規化見直し
• 同義語グループIDの見直し 同義語辞書 • 語彙追加
6 Elasticsearchプラグイン Esのバージョンを指定したビルド • バイナリリリースしていないバージョンでもビルドが簡単に $ ./gradlew -PelasticsearchVersion=7.15.2 build 今後の予定
• Sudachi同義語辞書による同義語展開フィルタの開発 Synonym token filter / synonym graph token filterの代替 Sudachi / Chikkarの利用で高速に
7 内部処理可視化ツール ViSudachi
8 chiTra Sudachiを利用した事前学習言語モデルプロジェクト Sudachi Transformers: chiTra [tʃiːtaɾa] 学習・推論環境 • Hugging
FaceでのSudachi利用環境の整備、公開 • OSSとして誰でもつかえるように 事前学習モデルの構築・公開 • 日本語の特徴にあったtransformerモデルの探求
9 日本語の特徴にあったtransformerモデル 日本語の書記法により適したトークナイズ • 語構成や字種を考慮したサブワード化 多様な異表記への対応 • Sudachi形態素辞書をもちいた正規化 多様な文書への対応 •
超大規模Webコーパス (NWJC) での学習 多様な表現への対応 • Sudachi同義語辞書をもちいたデータ拡張
10 日本語の書記法により適したトークナイズ 従来手法 • 文字単位で統計的にトークナイズ 言語ごとの書字特性は明示的に考慮されない 英文では有効だが日本語では? 日本語の書記法の特徴を生かす • Sudachi形態素辞書の語構成情報を利用
• 字種により分割方法をかえる • より日本語に適した処理を追及
11 多様な異表記への対応 同じ語でも表記がことなる • 送り仮名、漢字 / ひらがな、異体字など • Sudachiの機能をつかって統制 •
より高性能になる統制方法の開発 活用形を保持したままの用言正規化
12 まとめ • Sudachi.rs / SudachiPy v0.6.0 リリース • Sudachi
v1.0 に向けて • Sudachi辞書12月リリース • Elasticsearch同義語展開フィルタ準備中 • chiTra準備中 くわしい情報は開設予定の徳島研究所技術ブログにて