Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[Gunosy研究会]Semantic Hashing
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
ysekky
November 19, 2014
Research
370
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[Gunosy研究会]Semantic Hashing
ysekky
November 19, 2014
More Decks by ysekky
See All by ysekky
スタートアップの開発サイクルに学ぶ 研究活動の進め方 / research practices inspired by startup business strategy
ysekky
0
2.5k
[論文紹介] A Method to Anonymize Business Metrics to Publishing Implicit Feedback Datasets (Recsys2020) / recsys20-reading-gunosy-datapub
ysekky
3
2.9k
JSAI2020 OS-12 広告とAI オープニング / JSAI2020-OS-12-ads-and-ai-opening
ysekky
0
2.3k
JSAI2020インダストリアルセッション - Gunosyにおける研究開発 / jsai2020-gunosy-rd-examples
ysekky
1
840
ウェブサービス事業者における研究開発インターン[株式会社Gunosy] - テキストアナリティクスシンポジウム2019 / research-intern-case-study-at-gunosy
ysekky
0
3k
Gunosyにおけるニュース記事推薦/ news-recommendation-in-gunosy-webdbf2019
ysekky
1
1.6k
DEIM2019技術報告セッション - Gunosyの研究開発 / deim-2019-sponsor-session-gunosy-research
ysekky
0
1.3k
Analysis of Bias in Gathering Information Between User Attributes in News Application (ABCCS 2018)
ysekky
1
2.5k
世代による政治ニュース記事の閲覧傾向の違いの分析 - JSAI2018 / Analysis of differences in viewing behavior of politics news by age
ysekky
0
4.1k
Other Decks in Research
See All in Research
高性能計算機クラスタを用いた大規模点群処理による森林の単木抽出と構造解析
kentaitakura
1
120
最先端NLP 2026 論文紹介: Wait, Wait, Wait... Why Do Reasoning Models Loop? / SNLP Paper Review: Wait, Wait, Wait... Why Do Reasoning Models Loop?
tkng
0
210
2025年度秋葉原ウォーカブルプロジェクト調査報告 「アキバらしいウォーカブル」とは何か
izumiyama_lab
1
210
[最先端NLP勉強会2026] Checklists Are Better Than Reward Models For Aligning Language Models
nzw0301
1
310
Ghost in the 7‑Zip: The Shadow of Residential Proxies Creeping into Your Life
nttcom
0
2.1k
セマンティック通信勉強会 6Gに向けたデバイス間効率的な通信の技術紹介・課題・今後展望
satai
3
320
Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance
satai
3
130
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
21
24k
重要だけど測れていないもの:高齢者ケアの見えない課題
theoriatec2024
0
510
超効率化への挑戦:1bit LLMの現状と展望
yumaichikawa
0
670
Using our influence and power for patient safety
helenbevan
0
410
OWASP AISVS - C7
shiell
1
630
Featured
See All Featured
jQuery: Nuts, Bolts and Bling
dougneiner
66
8.6k
Build The Right Thing And Hit Your Dates
maggiecrowley
39
3.4k
BBQ
matthewcrist
89
10k
Mobile First: as difficult as doing things right
swwweet
225
10k
AI: The stuff that nobody shows you
jnunemaker
PRO
9
970
Lightning talk: Run Django tests with GitHub Actions
sabderemane
0
250
A brief & incomplete history of UX Design for the World Wide Web: 1989–2019
jct
2
500
Being A Developer After 40
akosma
91
590k
Practical Tips for Bootstrapping Information Extraction Pipelines
honnibal
25
2k
Why Mistakes Are the Best Teachers: Turning Failure into a Pathway for Growth
auna
0
240
My Coaching Mixtape
mlcsv
0
300
The Limits of Empathy - UXLibs8
cassininazir
1
640
Transcript
[論文紹介] Seman)c Hashing Ruslan Salakhutdinov, Geoffrey
Hinton (University of Toronto) SIGIR 2007 Yoshifumi Seki (Gunosy Inc) 2014.11.18 @Gunosy研究会
概要 • 目的 – Deep Learningを用いて文書のトピックをLSAとかよりいい感じに判定し たい •
背景 – TF-‐IDF • 語彙空間で類似度を推定するため,語彙が増えるとその分遅くなる • 語が一致しない場合は類似性を得ることができない – LSA(SVD) • 語が一致しなくとも類似性を得ることができるようになったが,それも限定的 な領域である – pLSA, LDA • 生成モデルによってより詳細な類似性を得ることができるようになったが,ト ピックの事後分布は正確に推定することが困難であり遅い手法か、不正確な 手法を使わなくてはならない • LSAに比べて高い改善があったとは言いがたい(実験,データセットにによる)
Deep Learningについて • 多層ニューラルネットワーク – ニューラルネットワークとは一般に隠 れ層がひとつのものを指す –
隠れ層を増やしたものがニューラル ネットワーク – 逆伝搬によって隠れ層を学習する • 何が難しいか(難しかったか) – 層を増やすと下層まで情報が伝わらな い – 過学習がとても起きやすい
Pre-‐Training • 各層を切り離して,その中で教師なし学習をやっていい感じの重みにする
Restricted Boltzmann Machines 周辺化によってp(v)を求めることができるようになる
Fine-‐Tuning • Pre-‐Trainingでいい感じにしたパラメータを教 師あり学習によって微調整する – 最近はこのへんでSVM使ってたりいろいろやって る – この論文が出た当時はBack Propaga)onをやって
る
Seman)c Hashingの特徴 • 文字のカウントデータからトピックを抽出 – 文書によって文字数が違うという文章特有の構 造を正規化によって吸収 – RBMを使ったほうがトピックをよりよくモデル化で きるらしい(過去の研究から)
• 出力をbinary化することで検索クエリからの マッチングをハッシュアルゴリズムを使って高 速化 – TFIDFを使ったLSHより精度が高い
Constrained Poisson Model • (1)が文書の長さを考慮したモデルであり,通常のRBMと異な る. • それ以外は同一なのでContras)ve Divergenceで最適化する
• 2層目以降は入力層がhになるのでそのまま
20 Newsgroup 2-‐D topic space(128 bits)
• 128LSAよりバイナリ化した提案手法のほうが精度がよい • LSAをバイナリ化すると精度は下がる • TF-‐IDFのほうが若干良い •
提案手法から上位100記事を選んでTF-‐IDFのスコアをつけるとTF-‐IDF より精度は高くなる
20bitでも高い精度を得ることができる
まとめ • トピック情報をbinaryで得ることで高速な検索 を実現 • Binaryだが表現力が高く既存手法よりも高い 精度 •
TF-‐IDFには劣るが,組み合わせることでより 高い精度を出すことができる