Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
テキスト埋め込み色々あるけどどれがいいの?
Search
ディップ株式会社
PRO
June 18, 2025
Technology
42
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
テキスト埋め込み色々あるけどどれがいいの?
ディップ株式会社
PRO
June 18, 2025
More Decks by ディップ株式会社
See All by ディップ株式会社
_型ガードしたのにnullable_から卒業する.pdf
dip_tech
PRO
0
54
はじめての環境構築!デプロイ〜Docker基礎を学べるワークショップ!
dip_tech
PRO
0
49
【TSKaigi2026登壇資料】決定論的な型チェックへ Go 製コンパイラによる10倍速の裏側で stableTypeOrdering から見える並列化への挑戦
dip_tech
PRO
2
470
【TSKaigi2026登壇資料】バイトル」のTypeScriptリニューアル — 積み上がったレガシーとパフォーマンスに挑む現在地
dip_tech
PRO
1
890
【新卒研修】ライブデモ + compose.yaml読解_講義資料
dip_tech
PRO
0
420
【ディップ|26年新卒研修資料】OpenAPI/Swagger REST API研修
dip_tech
PRO
0
570
【ディップ|26年新卒研修資料】Docker_ハンズオン研修
dip_tech
PRO
0
520
【ディップ|26年新卒研修資料】TDD実装演習
dip_tech
PRO
0
580
ハッカソンや個人開発で何作る? テーマ発見〜アイデア発想ハンズオン! 技育CAMPアカデミア
dip_tech
PRO
0
110
Other Decks in Technology
See All in Technology
認知負荷をGemini で溶かす — GKE 基盤「Orbit」における AI エージェントの実践
sansantech
PRO
1
320
モバイルアプリ開発概論2026
recruitengineers
PRO
6
660
Sets in Go
ramalho
1
1k
まちスペース®とデジタルツインと「まちづくり」
hiro_ogi
0
130
ボトムアップ文化が強い組織で セキュリティをどう根付かせていくかの現在進行形の話 / Making Security Stick in a Bottom-Up Organization
yamaguchitk333
0
240
[ChatGPT Work LT]事務作業が苦手な人のための バックオフィスの「半」自動化
chimaki_iot
0
320
도구에서 동료까지: 10년차 AI 스타트업의 AI 적응기
inureyes
PRO
0
190
TypeScript入門 2026
recruitengineers
PRO
3
690
Data Hubグループ 紹介資料
sansan33
PRO
0
3.2k
会社紹介資料 / Sansan Company Profile
sansan33
PRO
24
430k
Invisible to AI? Making TYPO3 Sites Quotable by AI Search Systems
wolfgangwagner
0
230
ガバメント AI 源内を地方自治体は活用できるのか可能性と課題、期待について
takeda_h
2
450
Featured
See All Featured
Ethics towards AI in product and experience design
skipperchong
2
350
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.5k
Java REST API Framework Comparison - PWX 2021
mraible
34
9.7k
AI in Enterprises - Java and Open Source to the Rescue
ivargrimstad
0
1.4k
We Analyzed 250 Million AI Search Results: Here's What I Found
joshbly
1
1.8k
Building Flexible Design Systems
yeseniaperezcruz
330
40k
Fantastic passwords and where to find them - at NoRuKo
philnash
52
3.8k
Agile that works and the tools we love
rasmusluckow
331
22k
Building Adaptive Systems
keathley
44
3.2k
A Soul's Torment
seathinner
6
3.4k
State of Search Keynote: SEO is Dead Long Live SEO
ryanjones
0
250
Responsive Adventures: Dirty Tricks From The Dark Corners of Front-End
smashingmag
254
22k
Transcript
テキスト埋め込み色々あるけどどれがいいの? ディップ株式会社 AI Embedded課 有田智也 (ARITA Tomoya) 1
アジェンダ 2 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
dip AI とは? • AIとの対話を通じて求職者が自分にあったバ イトを探せるサービス ◦ 検索ロジックはフィルタリングとベクトル検索の ハイブリッド
3
dip AI の検索のつらみ 4 1. フィルタ条件の影響が支配的 • ベクトル検索のうまみを活かせていない •
思ったような案件を出そうとするとどうしてもフィルタになる 2. 検索クエリとお仕事内容のギャップ • シンプルにcos類似度をとってもうまくいかない この課題 に着目
検索クエリとお仕事内容のギャップ 5 ベクトル検索の課題 • 意味的な類似度で検索してくるだけではうまくいかないことが多い ◦ クエリとコーパスの埋め込み空間にはギャップがある
*text embedding3 smallで評価
Retrieval でのギャップを埋める方法 6 1. クエリの内容をコーパスに寄せる HyDE:クエリに回答する仮の文章をLLMで生成してベクトル検索 2. モデルを学習させる
• クエリと回答のペアを学習させる • 最近はLLMで作成した合成データセットを学習して、LLMの知識を蒸留す るのがブーム ◦ 最近公開されたAmber, Ruri, GeckoなどのEncoderモデルは合成 データセットを利用している
アジェンダ 7 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Gecko: Versatile Text Embeddigs from Lage Language Models 概要
8 • LLMで合成データを作成(FRet)、Transfromer言語モデルを Pre-finetuningとfine-tuningで学習 ◦ Pre-finetuning: 様々な形式の教師なしのテキストペアを Contrastive Learningで学習 ▪ query側テキストの先頭には”question answering“や”search result”などの 識別子がデータセットに基づいて付与される ◦ fine-tuning:後述のFRetデータセットと学術的データセットを混ぜて教師あり 学習
FRet 9 モチベーション • ラベルづけされた大量のデータを用意する のはコストが高い😢 →LLMを活用して擬似データセット作成 1.
LLMにWebの文書を与えタスクの説明と関 連するクエリを生成させる 2. embedding modelをRetriverとして1.の クエリに関連するパッセージを検索し正例、 負例を作成 • 検索結果とパッセージの関連性を LLM で計算 • 関連性がより高いパッセージが存在す る場合正例を変える(約15%) →660万件のデータセットを作成 https://arxiv.org/pdf/2403.20327より引用
Gecko でテキストのギャップは埋まるのか 10 *text-multilingual-embedding-002で評価 完璧に解ける訳ではないものの相対的な類似度は気持ち上がっている
アジェンダ 11 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Retrieval 性能評価用データセット 12 • 文ベクトルの性能を測るためにJaGovFaqs-22k*を利用 ◦ Questionに対するAnswerの候補を10件予測してNDCGで評価 * JaGovFaqs-22kは日本の官公庁のWebサイトのQAデータセット
参照)https://huggingface.co/datasets/matsuxr/JaGovFaqs-22k
検索評価指標の NDCG簡単解説 13 • アイテムの出現順序を考慮した評価尺度 ◦ 理想的な順序に近いほど値が1に近づく この場合DCGは
1 / log_2(4) = 0.5 NDCGはDCGを理想的な DCGで割った値で 0.5 / 1 = 0.5
Retrieval 性能評価結果 14 • 最近のオープンな日本語に特化した埋め込みモデルはクローズな埋め込みモデ ルに匹敵する能力がある • ruri-v3-310mの検索性能が低パラメータ数にもかかわらず最も高い SentenceTransformerのInformation
Retrieval Evaluatorを利用してcos類似度で評価