Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
テキスト埋め込み色々あるけどどれがいいの?
Search
ディップ株式会社
PRO
June 18, 2025
Technology
40
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
テキスト埋め込み色々あるけどどれがいいの?
ディップ株式会社
PRO
June 18, 2025
More Decks by ディップ株式会社
See All by ディップ株式会社
_型ガードしたのにnullable_から卒業する.pdf
dip_tech
PRO
0
49
はじめての環境構築!デプロイ〜Docker基礎を学べるワークショップ!
dip_tech
PRO
0
46
【TSKaigi2026登壇資料】決定論的な型チェックへ Go 製コンパイラによる10倍速の裏側で stableTypeOrdering から見える並列化への挑戦
dip_tech
PRO
2
450
【TSKaigi2026登壇資料】バイトル」のTypeScriptリニューアル — 積み上がったレガシーとパフォーマンスに挑む現在地
dip_tech
PRO
1
800
【新卒研修】ライブデモ + compose.yaml読解_講義資料
dip_tech
PRO
0
350
【ディップ|26年新卒研修資料】OpenAPI/Swagger REST API研修
dip_tech
PRO
0
500
【ディップ|26年新卒研修資料】Docker_ハンズオン研修
dip_tech
PRO
0
470
【ディップ|26年新卒研修資料】TDD実装演習
dip_tech
PRO
0
520
ハッカソンや個人開発で何作る? テーマ発見〜アイデア発想ハンズオン! 技育CAMPアカデミア
dip_tech
PRO
0
100
Other Decks in Technology
See All in Technology
データ活用研修 問いの発見と仮説構築【MIXI 26新卒技術研修】
mixi_engineers
PRO
1
320
全社でのソフトウェアサプライチェーン攻撃対策をやってみた with Takumi Guard
z63d
0
310
そのドキュメント、自動化しませんか?
yuksew
1
440
2年前に削除したPHPクラスが、 ある日突然決済をエラーにした
ykagano
1
840
AIツールを導入しても生産性はあがらない? カオナビが直面した 3つの壁と乗り越え方。/ Overcoming 3 Barriers to AI-Driven Productivity at kaonavi
kaonavi
0
310
探索・可視化・自動化を一本化 Amazon Quickでデータ活用スピードを上げる方法
koheiyoshikawa
0
210
Git 研修【MIXI 26新卒技術研修】#2
mixi_engineers
PRO
1
250
AI驚き屋発見器
yama3133
1
330
「待ち時間」の消滅と「自我消耗」の加速:生成AI時代のエンジニアを救うメンタル・リソース管理
poropinai1966
0
200
AI研修(Day1)【MIXI 26新卒技術研修】
mixi_engineers
PRO
1
1.3k
テックカンファレンス三大ステークホルダーの文化人類学 ─ 違いを認め合う関係性作り
bash0c7
2
720
「顧客の声を聞かなければ何も始まらない」 ── 顧客の声から生まれた『AI返信補助機能』の開発プロセス / AICon2026_shikata_imai
rakus_dev
1
290
Featured
See All Featured
Utilizing Notion as your number one productivity tool
mfonobong
4
460
How Fast Is Fast Enough? [PerfNow 2025]
tammyeverts
3
660
Design in an AI World
tapps
1
270
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
230
Hiding What from Whom? A Critical Review of the History of Programming languages for Music
tomoyanonymous
3
1k
Designing Experiences People Love
moore
143
24k
Conquering PDFs: document understanding beyond plain text
inesmontani
PRO
4
2.9k
Ecommerce SEO: The Keys for Success Now & Beyond - #SERPConf2024
aleyda
1
2.1k
Fireside Chat
paigeccino
42
4k
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
190
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
133
19k
Being A Developer After 40
akosma
91
590k
Transcript
テキスト埋め込み色々あるけどどれがいいの? ディップ株式会社 AI Embedded課 有田智也 (ARITA Tomoya) 1
アジェンダ 2 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
dip AI とは? • AIとの対話を通じて求職者が自分にあったバ イトを探せるサービス ◦ 検索ロジックはフィルタリングとベクトル検索の ハイブリッド
3
dip AI の検索のつらみ 4 1. フィルタ条件の影響が支配的 • ベクトル検索のうまみを活かせていない •
思ったような案件を出そうとするとどうしてもフィルタになる 2. 検索クエリとお仕事内容のギャップ • シンプルにcos類似度をとってもうまくいかない この課題 に着目
検索クエリとお仕事内容のギャップ 5 ベクトル検索の課題 • 意味的な類似度で検索してくるだけではうまくいかないことが多い ◦ クエリとコーパスの埋め込み空間にはギャップがある
*text embedding3 smallで評価
Retrieval でのギャップを埋める方法 6 1. クエリの内容をコーパスに寄せる HyDE:クエリに回答する仮の文章をLLMで生成してベクトル検索 2. モデルを学習させる
• クエリと回答のペアを学習させる • 最近はLLMで作成した合成データセットを学習して、LLMの知識を蒸留す るのがブーム ◦ 最近公開されたAmber, Ruri, GeckoなどのEncoderモデルは合成 データセットを利用している
アジェンダ 7 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Gecko: Versatile Text Embeddigs from Lage Language Models 概要
8 • LLMで合成データを作成(FRet)、Transfromer言語モデルを Pre-finetuningとfine-tuningで学習 ◦ Pre-finetuning: 様々な形式の教師なしのテキストペアを Contrastive Learningで学習 ▪ query側テキストの先頭には”question answering“や”search result”などの 識別子がデータセットに基づいて付与される ◦ fine-tuning:後述のFRetデータセットと学術的データセットを混ぜて教師あり 学習
FRet 9 モチベーション • ラベルづけされた大量のデータを用意する のはコストが高い😢 →LLMを活用して擬似データセット作成 1.
LLMにWebの文書を与えタスクの説明と関 連するクエリを生成させる 2. embedding modelをRetriverとして1.の クエリに関連するパッセージを検索し正例、 負例を作成 • 検索結果とパッセージの関連性を LLM で計算 • 関連性がより高いパッセージが存在す る場合正例を変える(約15%) →660万件のデータセットを作成 https://arxiv.org/pdf/2403.20327より引用
Gecko でテキストのギャップは埋まるのか 10 *text-multilingual-embedding-002で評価 完璧に解ける訳ではないものの相対的な類似度は気持ち上がっている
アジェンダ 11 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Retrieval 性能評価用データセット 12 • 文ベクトルの性能を測るためにJaGovFaqs-22k*を利用 ◦ Questionに対するAnswerの候補を10件予測してNDCGで評価 * JaGovFaqs-22kは日本の官公庁のWebサイトのQAデータセット
参照)https://huggingface.co/datasets/matsuxr/JaGovFaqs-22k
検索評価指標の NDCG簡単解説 13 • アイテムの出現順序を考慮した評価尺度 ◦ 理想的な順序に近いほど値が1に近づく この場合DCGは
1 / log_2(4) = 0.5 NDCGはDCGを理想的な DCGで割った値で 0.5 / 1 = 0.5
Retrieval 性能評価結果 14 • 最近のオープンな日本語に特化した埋め込みモデルはクローズな埋め込みモデ ルに匹敵する能力がある • ruri-v3-310mの検索性能が低パラメータ数にもかかわらず最も高い SentenceTransformerのInformation
Retrieval Evaluatorを利用してcos類似度で評価