Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
NTCIR-17 Transfer タスク
Search
Hideo Joho
September 28, 2022
Research
0
290
NTCIR-17 Transfer タスク
NTCIR-17にパイロットタスクとして採択されたTransferタスクの紹介
Hideo Joho
September 28, 2022
Tweet
Share
More Decks by Hideo Joho
See All by Hideo Joho
NTCIR-17 Transfer Task
hideojoho
0
110
HCIR輪読会2021 フェアネス 第8章 // HCIR Group Reading 2021 on Fairness: Chapter 8
hideojoho
0
130
HCIR輪読会2021 フェアネス 書籍紹介 // HCIR Group Reading 2021 on Fairness: Book Introduction
hideojoho
1
160
HCIR輪読会2021 フェアネス 第1章 // HCIR Group Reading 2021 on Fairness: Chapter 1
hideojoho
0
71
Other Decks in Research
See All in Research
文書画像のデータ化における VLM活用 / Use of VLM in document image data conversion
sansan_randd
2
320
Composed image retrieval for remote sensing
satai
2
130
RSJ2024「基盤モデルの実ロボット応用」チュートリアルA(河原塚)
haraduka
3
700
Weekly AI Agents News! 8月号 プロダクト/ニュースのアーカイブ
masatoto
1
210
日本語医療LLM評価ベンチマークの構築と性能分析
fta98
3
780
Weekly AI Agents News!
masatoto
26
34k
Tietovuoto Social Design Agency (SDA) -trollitehtaasta
hponka
0
3k
秘伝:脆弱性診断をうまく活用してセキュリティを確保するには
okdt
PRO
4
770
The Relevance of UX for Conversion and Monetisation
itasohaakhib1
0
110
129 2 th
0325
0
250
Introducing Research Units of Matsuo-Iwasawa Laboratory
matsuolab
0
1.3k
ニュースメディアにおける事前学習済みモデルの可能性と課題 / IBIS2024
upura
3
680
Featured
See All Featured
Six Lessons from altMBA
skipperchong
27
3.5k
How to Think Like a Performance Engineer
csswizardry
22
1.2k
Fantastic passwords and where to find them - at NoRuKo
philnash
50
2.9k
Building Your Own Lightsaber
phodgson
103
6.1k
Making the Leap to Tech Lead
cromwellryan
133
9k
Optimising Largest Contentful Paint
csswizardry
33
3k
Designing Dashboards & Data Visualisations in Web Apps
destraynor
229
52k
Imperfection Machines: The Place of Print at Facebook
scottboms
266
13k
Design and Strategy: How to Deal with People Who Don’t "Get" Design
morganepeng
127
18k
Save Time (by Creating Custom Rails Generators)
garrettdimon
PRO
28
900
RailsConf 2023
tenderlove
29
940
Evolution of real-time – Irina Nazarova, EuRuKo, 2024
irinanazarova
5
440
Transcript
NTCIR-17 Transfer タスク 資源リサイクル型密検索技術 上保 秀夫 筑波大学 欅 惇志 一橋大学
大場 勇貴 筑波大学 English Version with audio 日本語版(音声付き)
概要 2
資源転移の例 • タスク横断 ◦ 案内型クエリ (Navigational queries) から情報型クエリ (Informational queries)
への再学習 ◦ 言語モデルからランキングモデルへの再学習 • ドメイン横断 ◦ Web 文書から学術記事へのドメイン適合 • 言語横断 ◦ 英語モデルから日本語モデル • などなど… 3
利用可能データ • 既存データ ◦ 英語版 MS MARCO (ver 1) (eMARCO)
◦ NTCIR-1 Ad-Hoc test collection (日本語) ◦ NTCIR-2 Ad-Hoc test collection (日本語) ◦ BERT モデル (英語/日本語) • オーナイザーから提供予定のデータ ◦ 日本語翻訳版 MS MARCO (ver 1) (jMARCO) ▪ 文書コレクションと Dev トピック (暫定版の翻訳済み) ▪ JParaCrawl version 2 + DeepL API ◦ jMARCO による学習済みの ColBERT モデル ◦ Dev / jMARCO による学習済みの BERT リランカー 4
サブタスク1: Dense First Stage Retrieval • 入力/出力 ◦ 入力: Ad-Hoc
task の トピック記述 ◦ 出力: 順位付けされた検索結果の上位 10,00件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価尺度 ◦ nDCG 5
サブタスク2: Dense Reranking Subtask • 入力/出力 ◦ 入力: 第1段階検索結果の上位 1,000
件 (文書ID、ベクトルデータ、等 ) ▪ オーガナイザーらによって提供 ◦ 出力: 再順位付けされた検索結果の上位 100 件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価指標 ◦ nDCG / MRR 6
暫定版スケジュール • 9/28, 2022: Kick-off event • 1/30, 2023: 最終タスクガイドライン公開,全資源データの公開
• 2/1, 2023: Formal Run: Dev/Test topics 公開 • 5/1, 2023: Formal Run: タスク参加登録期限 • 6/1, 2023: Formal Run: ラン提出期限 • 8/1, 2023: Formal Run: 評価結果返却 • 8/1, 2023: Task overview paper 公開 (ドラフト版) • 9/1, 2023: 参加者の論文投稿期限 (ドラフト版) • 11/1, 2023: Camera-ready 版論文投稿期限 • 12月, 2023: NTCIR-17 Conference 7
タスク設計の検討事項 1. 疎検索モデル (例:BM25のみ) のランは対象外、単純な再学習済みランは OK 2. サブタスク2の入力文書(固定 vs. サブタスク1のランを活用)
3. 現時点ではターゲットタスク言語が日本語のみ 4. 現時点では利用可能なデータやモデルに制約なし 5. Dry Run 時期を設けていない 6. Formal run の提出数は1チーム3-5 を検討中 7. Test sets の正解データを参加者が閲覧しないことを前提( ←重要) 8. 追加の適合性判定作業を実施する可能性あり 9. リーダーボードの導入の可能性あり 10. 資源ガイドや成功事例の構築を予定 8
アドバイザリー・ボード • Noriko Kando (NII, Japan) • Doug Oard (University
of Maryland, US) • 随時追加 9
最新情報・問い合わせ • Webサイト https://hcir.slis.tsukuba.ac.jp/project/ntcir-transfer/ • 連絡先
[email protected]
• Twitter #ntcir_transfer
• Slack (タスク参加登録者限定) 10