Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
NTCIR-17 Transfer タスク
Search
Hideo Joho
September 28, 2022
Research
0
350
NTCIR-17 Transfer タスク
NTCIR-17にパイロットタスクとして採択されたTransferタスクの紹介
Hideo Joho
September 28, 2022
Tweet
Share
More Decks by Hideo Joho
See All by Hideo Joho
NTCIR-17 Transfer Task
hideojoho
0
160
HCIR輪読会2021 フェアネス 第8章 // HCIR Group Reading 2021 on Fairness: Chapter 8
hideojoho
0
150
HCIR輪読会2021 フェアネス 書籍紹介 // HCIR Group Reading 2021 on Fairness: Book Introduction
hideojoho
1
190
HCIR輪読会2021 フェアネス 第1章 // HCIR Group Reading 2021 on Fairness: Chapter 1
hideojoho
0
93
Other Decks in Research
See All in Research
Submeter-level land cover mapping of Japan
satai
3
280
MIRU2025 チュートリアル講演「ロボット基盤モデルの最前線」
haraduka
15
7.9k
snlp2025_prevent_llm_spikes
takase
0
160
投資戦略202508
pw
0
560
SegEarth-OV: Towards Training-Free Open-Vocabulary Segmentation for Remote Sensing Images
satai
3
160
2025年度人工知能学会全国大会チュートリアル講演「深層基盤モデルの数理」
taiji_suzuki
25
18k
IMC の細かすぎる話 2025
smly
2
610
論文紹介:Not All Tokens Are What You Need for Pretraining
kosuken
0
170
Towards a More Efficient Reasoning LLM: AIMO2 Solution Summary and Introduction to Fast-Math Models
analokmaus
2
780
AWSで実現した大規模日本語VLM学習用データセット "MOMIJI" 構築パイプライン/buiding-momiji
studio_graph
2
480
CVPR2025論文紹介:Unboxed
murakawatakuya
0
150
電通総研の生成AI・エージェントの取り組みエンジニアリング業務向けAI活用事例紹介
isidaitc
1
940
Featured
See All Featured
XXLCSS - How to scale CSS and keep your sanity
sugarenia
248
1.3M
Keith and Marios Guide to Fast Websites
keithpitt
411
22k
Understanding Cognitive Biases in Performance Measurement
bluesmoon
29
1.9k
We Have a Design System, Now What?
morganepeng
53
7.8k
Making Projects Easy
brettharned
117
6.4k
[Rails World 2023 - Day 1 Closing Keynote] - The Magic of Rails
eileencodes
36
2.5k
CoffeeScript is Beautiful & I Never Want to Write Plain JavaScript Again
sstephenson
162
15k
Building Applications with DynamoDB
mza
96
6.6k
Automating Front-end Workflow
addyosmani
1370
200k
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
229
22k
Visualization
eitanlees
148
16k
Faster Mobile Websites
deanohume
309
31k
Transcript
NTCIR-17 Transfer タスク 資源リサイクル型密検索技術 上保 秀夫 筑波大学 欅 惇志 一橋大学
大場 勇貴 筑波大学 English Version with audio 日本語版(音声付き)
概要 2
資源転移の例 • タスク横断 ◦ 案内型クエリ (Navigational queries) から情報型クエリ (Informational queries)
への再学習 ◦ 言語モデルからランキングモデルへの再学習 • ドメイン横断 ◦ Web 文書から学術記事へのドメイン適合 • 言語横断 ◦ 英語モデルから日本語モデル • などなど… 3
利用可能データ • 既存データ ◦ 英語版 MS MARCO (ver 1) (eMARCO)
◦ NTCIR-1 Ad-Hoc test collection (日本語) ◦ NTCIR-2 Ad-Hoc test collection (日本語) ◦ BERT モデル (英語/日本語) • オーナイザーから提供予定のデータ ◦ 日本語翻訳版 MS MARCO (ver 1) (jMARCO) ▪ 文書コレクションと Dev トピック (暫定版の翻訳済み) ▪ JParaCrawl version 2 + DeepL API ◦ jMARCO による学習済みの ColBERT モデル ◦ Dev / jMARCO による学習済みの BERT リランカー 4
サブタスク1: Dense First Stage Retrieval • 入力/出力 ◦ 入力: Ad-Hoc
task の トピック記述 ◦ 出力: 順位付けされた検索結果の上位 10,00件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価尺度 ◦ nDCG 5
サブタスク2: Dense Reranking Subtask • 入力/出力 ◦ 入力: 第1段階検索結果の上位 1,000
件 (文書ID、ベクトルデータ、等 ) ▪ オーガナイザーらによって提供 ◦ 出力: 再順位付けされた検索結果の上位 100 件文書 ID • Dev/Test ◦ Dev: NTCIR-1 Ad-Hoc/CLIR (日本語) 83 トピック ◦ Test: NTCIR-2 Ad-Hoc/CLIR (日本語) 49 トピック • 評価指標 ◦ nDCG / MRR 6
暫定版スケジュール • 9/28, 2022: Kick-off event • 1/30, 2023: 最終タスクガイドライン公開,全資源データの公開
• 2/1, 2023: Formal Run: Dev/Test topics 公開 • 5/1, 2023: Formal Run: タスク参加登録期限 • 6/1, 2023: Formal Run: ラン提出期限 • 8/1, 2023: Formal Run: 評価結果返却 • 8/1, 2023: Task overview paper 公開 (ドラフト版) • 9/1, 2023: 参加者の論文投稿期限 (ドラフト版) • 11/1, 2023: Camera-ready 版論文投稿期限 • 12月, 2023: NTCIR-17 Conference 7
タスク設計の検討事項 1. 疎検索モデル (例:BM25のみ) のランは対象外、単純な再学習済みランは OK 2. サブタスク2の入力文書(固定 vs. サブタスク1のランを活用)
3. 現時点ではターゲットタスク言語が日本語のみ 4. 現時点では利用可能なデータやモデルに制約なし 5. Dry Run 時期を設けていない 6. Formal run の提出数は1チーム3-5 を検討中 7. Test sets の正解データを参加者が閲覧しないことを前提( ←重要) 8. 追加の適合性判定作業を実施する可能性あり 9. リーダーボードの導入の可能性あり 10. 資源ガイドや成功事例の構築を予定 8
アドバイザリー・ボード • Noriko Kando (NII, Japan) • Doug Oard (University
of Maryland, US) • 随時追加 9
最新情報・問い合わせ • Webサイト https://hcir.slis.tsukuba.ac.jp/project/ntcir-transfer/ • 連絡先
[email protected]
• Twitter #ntcir_transfer
• Slack (タスク参加登録者限定) 10