Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
[Gunosy研究会]Semantic Hashing
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
ysekky
November 19, 2014
Research
370
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
[Gunosy研究会]Semantic Hashing
ysekky
November 19, 2014
More Decks by ysekky
See All by ysekky
スタートアップの開発サイクルに学ぶ 研究活動の進め方 / research practices inspired by startup business strategy
ysekky
0
2.5k
[論文紹介] A Method to Anonymize Business Metrics to Publishing Implicit Feedback Datasets (Recsys2020) / recsys20-reading-gunosy-datapub
ysekky
3
2.9k
JSAI2020 OS-12 広告とAI オープニング / JSAI2020-OS-12-ads-and-ai-opening
ysekky
0
2.3k
JSAI2020インダストリアルセッション - Gunosyにおける研究開発 / jsai2020-gunosy-rd-examples
ysekky
1
830
ウェブサービス事業者における研究開発インターン[株式会社Gunosy] - テキストアナリティクスシンポジウム2019 / research-intern-case-study-at-gunosy
ysekky
0
3k
Gunosyにおけるニュース記事推薦/ news-recommendation-in-gunosy-webdbf2019
ysekky
1
1.6k
DEIM2019技術報告セッション - Gunosyの研究開発 / deim-2019-sponsor-session-gunosy-research
ysekky
0
1.3k
Analysis of Bias in Gathering Information Between User Attributes in News Application (ABCCS 2018)
ysekky
1
2.5k
世代による政治ニュース記事の閲覧傾向の違いの分析 - JSAI2018 / Analysis of differences in viewing behavior of politics news by age
ysekky
0
4.1k
Other Decks in Research
See All in Research
大規模言語モデルは誰を覚えているか / Who Do Large Language Models Memorize?
upura
0
110
Language and AI
ayaniwa
0
200
ふとした出会いで生まれたSkillが、 社内利用1位になるまで
mikimhk
13
13k
[Fishers] DIVER OSINT CTF 2026 特化AIエージェントハーネスで挑戦するOSINT CTF
analokmaus
0
460
全国町字単位空き家率推定データver1.0データ仕様
microbaseinc
0
180
第64回CV・PRML勉強会 論文紹介:Linguistic Priors for Visual Decoupling: Towards Symmetric Vision-Brain Alignment
sokikatayama
0
150
SoftMatcha 2: 1兆語規模コーパスの超高速かつ柔らかい検索
e869120_sub
7
3.7k
某助成金プロジェクト採択に向けて企業研究所のアウトリーチ専任者がやったこと
afroscript
0
160
【ローカルAIに向き合う展示会vol.2】液体時間定数型モジュールを用いた オリジナルの双方向エンコーダーモデルNexteraBERT 推論速度向上検討並びにダウンストリーム評価
rikkabotan7
0
150
シングルチャネルマルチトーカー音声認識の進展
ryomasumura
0
210
セマンティック通信勉強会 6Gに向けたデバイス間効率的な通信の技術紹介・課題・今後展望
satai
3
270
NLP colloquium: AI Safety Survey
kanekomasahiro
0
920
Featured
See All Featured
Helping Users Find Their Own Way: Creating Modern Search Experiences
danielanewman
31
3.3k
Bootstrapping a Software Product
garrettdimon
PRO
307
120k
GraphQLの誤解/rethinking-graphql
sonatard
75
12k
Reflections from 52 weeks, 52 projects
jeffersonlam
356
21k
How Software Deployment tools have changed in the past 20 years
geshan
1
34k
Embracing the Ebb and Flow
colly
88
5.1k
Making the Leap to Tech Lead
cromwellryan
135
10k
Context Engineering - Making Every Token Count
addyosmani
9
1k
HDC tutorial
michielstock
2
790
Noah Learner - AI + Me: how we built a GSC Bulk Export data pipeline
techseoconnect
PRO
0
350
Why Your Marketing Sucks and What You Can Do About It - Sophie Logan
marketingsoph
0
360
A Guide to Academic Writing Using Generative AI - A Workshop
ks91
PRO
1
370
Transcript
[論文紹介] Seman)c Hashing Ruslan Salakhutdinov, Geoffrey
Hinton (University of Toronto) SIGIR 2007 Yoshifumi Seki (Gunosy Inc) 2014.11.18 @Gunosy研究会
概要 • 目的 – Deep Learningを用いて文書のトピックをLSAとかよりいい感じに判定し たい •
背景 – TF-‐IDF • 語彙空間で類似度を推定するため,語彙が増えるとその分遅くなる • 語が一致しない場合は類似性を得ることができない – LSA(SVD) • 語が一致しなくとも類似性を得ることができるようになったが,それも限定的 な領域である – pLSA, LDA • 生成モデルによってより詳細な類似性を得ることができるようになったが,ト ピックの事後分布は正確に推定することが困難であり遅い手法か、不正確な 手法を使わなくてはならない • LSAに比べて高い改善があったとは言いがたい(実験,データセットにによる)
Deep Learningについて • 多層ニューラルネットワーク – ニューラルネットワークとは一般に隠 れ層がひとつのものを指す –
隠れ層を増やしたものがニューラル ネットワーク – 逆伝搬によって隠れ層を学習する • 何が難しいか(難しかったか) – 層を増やすと下層まで情報が伝わらな い – 過学習がとても起きやすい
Pre-‐Training • 各層を切り離して,その中で教師なし学習をやっていい感じの重みにする
Restricted Boltzmann Machines 周辺化によってp(v)を求めることができるようになる
Fine-‐Tuning • Pre-‐Trainingでいい感じにしたパラメータを教 師あり学習によって微調整する – 最近はこのへんでSVM使ってたりいろいろやって る – この論文が出た当時はBack Propaga)onをやって
る
Seman)c Hashingの特徴 • 文字のカウントデータからトピックを抽出 – 文書によって文字数が違うという文章特有の構 造を正規化によって吸収 – RBMを使ったほうがトピックをよりよくモデル化で きるらしい(過去の研究から)
• 出力をbinary化することで検索クエリからの マッチングをハッシュアルゴリズムを使って高 速化 – TFIDFを使ったLSHより精度が高い
Constrained Poisson Model • (1)が文書の長さを考慮したモデルであり,通常のRBMと異な る. • それ以外は同一なのでContras)ve Divergenceで最適化する
• 2層目以降は入力層がhになるのでそのまま
20 Newsgroup 2-‐D topic space(128 bits)
• 128LSAよりバイナリ化した提案手法のほうが精度がよい • LSAをバイナリ化すると精度は下がる • TF-‐IDFのほうが若干良い •
提案手法から上位100記事を選んでTF-‐IDFのスコアをつけるとTF-‐IDF より精度は高くなる
20bitでも高い精度を得ることができる
まとめ • トピック情報をbinaryで得ることで高速な検索 を実現 • Binaryだが表現力が高く既存手法よりも高い 精度 •
TF-‐IDFには劣るが,組み合わせることでより 高い精度を出すことができる