Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
[Gunosy研究会]Semantic Hashing
Search
ysekky
November 19, 2014
Research
380
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[Gunosy研究会]Semantic Hashing
ysekky
November 19, 2014
More Decks by ysekky
See All by ysekky
スタートアップの開発サイクルに学ぶ 研究活動の進め方 / research practices inspired by startup business strategy
ysekky
0
2.5k
[論文紹介] A Method to Anonymize Business Metrics to Publishing Implicit Feedback Datasets (Recsys2020) / recsys20-reading-gunosy-datapub
ysekky
3
2.9k
JSAI2020 OS-12 広告とAI オープニング / JSAI2020-OS-12-ads-and-ai-opening
ysekky
0
2.3k
JSAI2020インダストリアルセッション - Gunosyにおける研究開発 / jsai2020-gunosy-rd-examples
ysekky
1
840
ウェブサービス事業者における研究開発インターン[株式会社Gunosy] - テキストアナリティクスシンポジウム2019 / research-intern-case-study-at-gunosy
ysekky
0
3.1k
Gunosyにおけるニュース記事推薦/ news-recommendation-in-gunosy-webdbf2019
ysekky
1
1.6k
DEIM2019技術報告セッション - Gunosyの研究開発 / deim-2019-sponsor-session-gunosy-research
ysekky
0
1.3k
Analysis of Bias in Gathering Information Between User Attributes in News Application (ABCCS 2018)
ysekky
1
2.5k
世代による政治ニュース記事の閲覧傾向の違いの分析 - JSAI2018 / Analysis of differences in viewing behavior of politics news by age
ysekky
0
4.2k
Other Decks in Research
See All in Research
Anthropic が提案する LLM の内部状態を自然言語で説明可能にした Natural Language Autoencoders / Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations
shunk031
0
330
COMETAを用いたデータ民主化運動の歴史
sazimai
0
270
LA-Bench 2025:実験指示から実行可能手順を生成するためのデータセット/LA-Bench 2025: A Dataset for Generating Executable Experimental Procedures from Experimental Instructions
stktu
0
200
超効率化への挑戦:1bit LLMの現状と展望
yumaichikawa
0
810
【中間報告】国会議員の立法・政策実務を支える環境を巡る現状と課題
polipoli
0
690
SAM3を用いたコマ・吹き出しの 領域検出と分割構造からの読み順推定
kzmssk
0
170
20260624 NLP colloquium: 単一のhubテキストがCLIPを壊す:hubnessによる埋め込みの脆弱性特定
de9uch1
2
290
Language and AI
ayaniwa
0
320
Evaluation génomique des femelles laitières croisées : comprendre la méthode pour accompagner les éleveurs à son utilisation
institutdelelevage
PRO
0
150
Physical AIでモデリングはどう変わるか/How Physical AI Will Change Modeling
stktu
0
290
Bilan travail en élevage : première restitution des enquêtes 2025-2026
institutdelelevage
PRO
0
140
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
22
24k
Featured
See All Featured
Improving Core Web Vitals using Speculation Rules API
sergeychernyshev
21
1.7k
How to audit for AI Accessibility on your Front & Back End
davetheseo
0
580
Statistics for Hackers
jakevdp
799
230k
Visualization
eitanlees
153
17k
Exploring the Power of Turbo Streams & Action Cable | RailsConf2023
kevinliebholz
37
6.6k
Six Lessons from altMBA
skipperchong
29
4.5k
How to make the Groovebox
asonas
2
2.5k
Docker and Python
trallard
47
4.2k
Done Done
chrislema
187
17k
Odyssey Design
rkendrick25
PRO
2
860
BBQ
matthewcrist
90
10k
How to Build an AI Search Optimization Roadmap - Criteria and Steps to Take #SEOIRL
aleyda
1
2.2k
Transcript
[論文紹介] Seman)c Hashing Ruslan Salakhutdinov, Geoffrey
Hinton (University of Toronto) SIGIR 2007 Yoshifumi Seki (Gunosy Inc) 2014.11.18 @Gunosy研究会
概要 • 目的 – Deep Learningを用いて文書のトピックをLSAとかよりいい感じに判定し たい •
背景 – TF-‐IDF • 語彙空間で類似度を推定するため,語彙が増えるとその分遅くなる • 語が一致しない場合は類似性を得ることができない – LSA(SVD) • 語が一致しなくとも類似性を得ることができるようになったが,それも限定的 な領域である – pLSA, LDA • 生成モデルによってより詳細な類似性を得ることができるようになったが,ト ピックの事後分布は正確に推定することが困難であり遅い手法か、不正確な 手法を使わなくてはならない • LSAに比べて高い改善があったとは言いがたい(実験,データセットにによる)
Deep Learningについて • 多層ニューラルネットワーク – ニューラルネットワークとは一般に隠 れ層がひとつのものを指す –
隠れ層を増やしたものがニューラル ネットワーク – 逆伝搬によって隠れ層を学習する • 何が難しいか(難しかったか) – 層を増やすと下層まで情報が伝わらな い – 過学習がとても起きやすい
Pre-‐Training • 各層を切り離して,その中で教師なし学習をやっていい感じの重みにする
Restricted Boltzmann Machines 周辺化によってp(v)を求めることができるようになる
Fine-‐Tuning • Pre-‐Trainingでいい感じにしたパラメータを教 師あり学習によって微調整する – 最近はこのへんでSVM使ってたりいろいろやって る – この論文が出た当時はBack Propaga)onをやって
る
Seman)c Hashingの特徴 • 文字のカウントデータからトピックを抽出 – 文書によって文字数が違うという文章特有の構 造を正規化によって吸収 – RBMを使ったほうがトピックをよりよくモデル化で きるらしい(過去の研究から)
• 出力をbinary化することで検索クエリからの マッチングをハッシュアルゴリズムを使って高 速化 – TFIDFを使ったLSHより精度が高い
Constrained Poisson Model • (1)が文書の長さを考慮したモデルであり,通常のRBMと異な る. • それ以外は同一なのでContras)ve Divergenceで最適化する
• 2層目以降は入力層がhになるのでそのまま
20 Newsgroup 2-‐D topic space(128 bits)
• 128LSAよりバイナリ化した提案手法のほうが精度がよい • LSAをバイナリ化すると精度は下がる • TF-‐IDFのほうが若干良い •
提案手法から上位100記事を選んでTF-‐IDFのスコアをつけるとTF-‐IDF より精度は高くなる
20bitでも高い精度を得ることができる
まとめ • トピック情報をbinaryで得ることで高速な検索 を実現 • Binaryだが表現力が高く既存手法よりも高い 精度 •
TF-‐IDFには劣るが,組み合わせることでより 高い精度を出すことができる