Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
テキスト埋め込み色々あるけどどれがいいの?
Search
Sponsored
·
Ship Features Fearlessly
Turn features on and off without deploys. Used by thousands of Ruby developers.
→
ディップ株式会社
PRO
June 18, 2025
Technology
51
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
テキスト埋め込み色々あるけどどれがいいの?
ディップ株式会社
PRO
June 18, 2025
More Decks by ディップ株式会社
See All by ディップ株式会社
【Findyテック文化祭ワークショップ】新卒エンジニア&採用担当と作る、 なりたい姿と今やるべき一歩
dip_tech
PRO
0
160
【iOSDC登壇】Kotlin Multiplatformを軸にした技術戦略
dip_tech
PRO
1
580
_型ガードしたのにnullable_から卒業する.pdf
dip_tech
PRO
0
64
はじめての環境構築!デプロイ〜Docker基礎を学べるワークショップ!
dip_tech
PRO
0
54
【TSKaigi2026登壇資料】決定論的な型チェックへ Go 製コンパイラによる10倍速の裏側で stableTypeOrdering から見える並列化への挑戦
dip_tech
PRO
2
520
【TSKaigi2026登壇資料】バイトル」のTypeScriptリニューアル — 積み上がったレガシーとパフォーマンスに挑む現在地
dip_tech
PRO
1
1k
【新卒研修】ライブデモ + compose.yaml読解_講義資料
dip_tech
PRO
0
630
【ディップ|26年新卒研修資料】OpenAPI/Swagger REST API研修
dip_tech
PRO
0
840
【ディップ|26年新卒研修資料】Docker_ハンズオン研修
dip_tech
PRO
0
740
Other Decks in Technology
See All in Technology
使いこなすために知っておきたい Azure SRE Agent アンチパターン
torumakabe
2
310
Codex概要
ymiya55
0
350
FinTech 1-2 : Overview of FinTech
ks91
PRO
0
140
AI Made Us Faster at Solving the Wrong Problems
marceloancelmo
0
160
インバスケット試験対策アプリを 作って見えたAIエージェント構築 ナレッジ2選
shichijoyuhi
1
120
大阪オフィスに Unitree Go2 がやってきたので Physical AI やってみた
dafujii
0
300
生成AIで高い生産性を求められて、 悩み、乗り越えた話
mot_techtalk
2
120
[2026 Oracle Technical Deep Dive] VMwareワークロードのOCI移行実践ガイド - OCVSでの継続利用からOCIコンピュートへの移行まで (2026年9月17日開催)
oracle4engineer
PRO
0
120
私の推しは「聞いてから進む」AIです -AI-DLCに一人でアプリを作らせた話
yama3133
1
170
1万名の社員が使う認証基盤で どう信頼性を担保するか?
kairim0
0
200
【データ横丁主催】AI Agentがコンテキストを使って仕事をした後、何が残るのか― 組織の経験を次の判断に引き継ぐ「Agent Memory」
shisyu_gaku
2
330
サーバーフルコンピューティング?AWS Lambda
iwatatomoya
1
240
Featured
See All Featured
JavaScript: Past, Present, and Future - NDC Porto 2020
reverentgeek
52
6.1k
The browser strikes back
jonoalderson
0
1.8k
Designing for Timeless Needs
cassininazir
1
520
Navigating Algorithm Shifts & AI Overviews - #SMXNext
aleyda
1
1.6k
How People are Using Generative and Agentic AI to Supercharge Their Products, Projects, Services and Value Streams Today
helenjbeal
1
350
Leveraging Curiosity to Care for An Aging Population
cassininazir
1
520
Scaling GitHub
holman
464
140k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2.1k
The Illustrated Children's Guide to Kubernetes
chrisshort
51
53k
HTML-Aware ERB: The Path to Reactive Rendering @ RubyCon 2026, Rimini, Italy
marcoroth
5
770
Leadership Guide Workshop - DevTernity 2021
reverentgeek
1
380
16th Malabo Montpellier Forum Presentation
akademiya2063
PRO
0
390
Transcript
テキスト埋め込み色々あるけどどれがいいの? ディップ株式会社 AI Embedded課 有田智也 (ARITA Tomoya) 1
アジェンダ 2 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
dip AI とは? • AIとの対話を通じて求職者が自分にあったバ イトを探せるサービス ◦ 検索ロジックはフィルタリングとベクトル検索の ハイブリッド
3
dip AI の検索のつらみ 4 1. フィルタ条件の影響が支配的 • ベクトル検索のうまみを活かせていない •
思ったような案件を出そうとするとどうしてもフィルタになる 2. 検索クエリとお仕事内容のギャップ • シンプルにcos類似度をとってもうまくいかない この課題 に着目
検索クエリとお仕事内容のギャップ 5 ベクトル検索の課題 • 意味的な類似度で検索してくるだけではうまくいかないことが多い ◦ クエリとコーパスの埋め込み空間にはギャップがある
*text embedding3 smallで評価
Retrieval でのギャップを埋める方法 6 1. クエリの内容をコーパスに寄せる HyDE:クエリに回答する仮の文章をLLMで生成してベクトル検索 2. モデルを学習させる
• クエリと回答のペアを学習させる • 最近はLLMで作成した合成データセットを学習して、LLMの知識を蒸留す るのがブーム ◦ 最近公開されたAmber, Ruri, GeckoなどのEncoderモデルは合成 データセットを利用している
アジェンダ 7 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Gecko: Versatile Text Embeddigs from Lage Language Models 概要
8 • LLMで合成データを作成(FRet)、Transfromer言語モデルを Pre-finetuningとfine-tuningで学習 ◦ Pre-finetuning: 様々な形式の教師なしのテキストペアを Contrastive Learningで学習 ▪ query側テキストの先頭には”question answering“や”search result”などの 識別子がデータセットに基づいて付与される ◦ fine-tuning:後述のFRetデータセットと学術的データセットを混ぜて教師あり 学習
FRet 9 モチベーション • ラベルづけされた大量のデータを用意する のはコストが高い😢 →LLMを活用して擬似データセット作成 1.
LLMにWebの文書を与えタスクの説明と関 連するクエリを生成させる 2. embedding modelをRetriverとして1.の クエリに関連するパッセージを検索し正例、 負例を作成 • 検索結果とパッセージの関連性を LLM で計算 • 関連性がより高いパッセージが存在す る場合正例を変える(約15%) →660万件のデータセットを作成 https://arxiv.org/pdf/2403.20327より引用
Gecko でテキストのギャップは埋まるのか 10 *text-multilingual-embedding-002で評価 完璧に解ける訳ではないものの相対的な類似度は気持ち上がっている
アジェンダ 11 1. 良いテキスト埋め込みを求めるモチベーション 2. 良いテキスト埋め込みを得るための事例紹介
3. テキスト埋め込みモデルの評価
Retrieval 性能評価用データセット 12 • 文ベクトルの性能を測るためにJaGovFaqs-22k*を利用 ◦ Questionに対するAnswerの候補を10件予測してNDCGで評価 * JaGovFaqs-22kは日本の官公庁のWebサイトのQAデータセット
参照)https://huggingface.co/datasets/matsuxr/JaGovFaqs-22k
検索評価指標の NDCG簡単解説 13 • アイテムの出現順序を考慮した評価尺度 ◦ 理想的な順序に近いほど値が1に近づく この場合DCGは
1 / log_2(4) = 0.5 NDCGはDCGを理想的な DCGで割った値で 0.5 / 1 = 0.5
Retrieval 性能評価結果 14 • 最近のオープンな日本語に特化した埋め込みモデルはクローズな埋め込みモデ ルに匹敵する能力がある • ruri-v3-310mの検索性能が低パラメータ数にもかかわらず最も高い SentenceTransformerのInformation
Retrieval Evaluatorを利用してcos類似度で評価