Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
【論文紹介】Sparse Embedded k-means Clustering
Search
Sponsored
·
Ship Features Fearlessly
Turn features on and off without deploys. Used by thousands of Ruby developers.
→
Shuhei Goda
January 21, 2018
Technology
370
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
【論文紹介】Sparse Embedded k-means Clustering
Shuhei Goda
January 21, 2018
More Decks by Shuhei Goda
See All by Shuhei Goda
Turing × atmaCup #18 - 1st Place Solution
hakubishin3
0
1.3k
ジョブマッチングサービスにおける相互推薦システムの応用事例と課題
hakubishin3
3
1.2k
とある事業会社にとっての Kaggler の魅力
hakubishin3
9
3.3k
課題の解像度が荒かったことで意図した改善ができなかった話
hakubishin3
3
1.1k
Wantedly におけるマッチング体験を最大化させるための推薦システム
hakubishin3
4
1.4k
Recommendation Industry Talks #1 Opening
hakubishin3
1
480
会社訪問アプリ「Wantedly Visit」での シゴトに関する興味選択機能と推薦改善
hakubishin3
0
790
論文紹介: Improving Implicit Feedback-Based Recommendation through Multi-Behavior Alignment(Xin Xin et al., 2023)
hakubishin3
0
740
Feedback Prize - English Language Learning における擬似ラベルの品質向上の取り組み
hakubishin3
1
1.2k
Other Decks in Technology
See All in Technology
Point Cloud as a Foreign Language for Multi-modal Large Language Model
takmin
0
260
MCPを待つな、パスキーを拡げよう(OAuth/OIDC Numa (Immersion) Workshop 2026)
oidfj
PRO
0
340
AWSとAzureのマルチクラウド活用における強い味方___AWS_Kiroを使った二刀流スキル作成.pdf
duelist2020jp
0
130
形式手法特論:Hyperproperty とモデル検査 #kernelvm / Kernel VM Study Tokyo 19th
ytaka23
0
880
8bit CPU 2026
koba789
7
2.9k
ハッカソンで入賞した話 @ Findy LT
asari194617
0
1.5k
Kiro5兄弟のいまどきのセキュリティ基礎知識
kentapapa
0
370
[RSJ26] Flow as Flow: Modeling Robot Velocity Fields as Probability Velocity Fields
keio_smilab
PRO
0
100
markdown-poster Introduction
kazamori
0
390
本番に近いテストをもっと手軽に - Postmanで広がるAPIテストの世界 / Expanding the World of API Testing with Postman
yokawasa
1
120
サービス内で複数のOP・ASを連鎖させる(OAuth/OIDC Numa (Immersion) Workshop 2026)
oidfj
PRO
0
340
【5分でわかる】セーフィー エンジニア向け会社紹介
safie_recruit
0
54k
Featured
See All Featured
Code Reviewing Like a Champion
maltzj
528
40k
Bioeconomy Workshop: Dr. Julius Ecuru, Opportunities for a Bioeconomy in West Africa
akademiya2063
PRO
1
300
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
1
2.5k
Designing for humans not robots
tammielis
254
26k
Information Architects: The Missing Link in Design Systems
soysaucechin
1
1.1k
Discover your Explorer Soul
emna__ayadi
2
1.3k
Optimising Largest Contentful Paint
csswizardry
37
3.9k
Fireside Chat
paigeccino
42
4k
Claude Code どこまでも/ Claude Code Everywhere
nwiizo
67
57k
How to Create Impact in a Changing Tech Landscape [PerfNow 2023]
tammyeverts
56
3.4k
Paper Plane (Part 1)
katiecoart
PRO
1
10k
The #1 spot is gone: here's how to win anyway
tamaranovitovic
3
1.1k
Transcript
Sparse Embedded k-Means Clustering 2018/01/21 マジ卍論文読み会
概要 l 背景 ü K-meansクラスタリングは、高次元データに対して計算コストが高い。 ü 先行研究では、Random ProjectionやSVDなどの線形次元削減による 手法を用いて計算コストの改善を行っているが、それでも、 程度 の計算コストが生じている。
l 本論文の手法 ü Random Projectionで用いる写像行列にスパース行列を採用して、 高速な行列演算を実行することで、計算コストを に抑える。 l 結論 ü 本論文の手法は、先行研究の手法に比べて、十分なクラスタリング精度 を達成しつつ、計算時間を大幅に短縮している。 1 ) (nd O )) ( ( X nnz O
k平均法の計算コスト削減を目的とした先行手法 l SVDやRandom Projectionを使用した、データ行列の次元削減 ü state-of-the-artなRPでも、 の計算量と (2+ε)の精度 2
) log( 2 d ndk O
本手法の概要 l Sparse Embedded k-Means Clustering ü RPの写像行列にスパース行列を採用することで、RPの計算量を にする。
ü 埋め込み次元が である場合、信頼度 で、クラスタリングの最適解への近似精度が(1+ε)となる。 3 )) 6 , ) / 1 log( (max( 2 2 k O ) ( 1 O )) ( ( X nnz O
Sparse Embedding Algorithm 4 ランダム直交行列の作成 )) ( ( X
nnz O
ε-Approximation Embedded Matrix 5 k-Means Clusteringの目的は (1)式を満たす計画行列Dを得ること
ε-Approximation Embedded Matrix 6 元データXのクラスタリング精度に対して(1±ε)の誤差を持つような、 埋め込み後のデータ行列X^ を扱う
ε-Approximation Embedded Matrix 7 γとは、埋め込み後の データ行列X^に対する 計画行列D^が、最適解D^*に どの程度近いかを表す指標 D^がX^に対する最適解(γ=1)であるならば、
D^はデータ行列Xに対して精度(1+ε)を保証する
ε-Approximation Embedded Matrix l まとめると ü ε近似解(2)式を満たすような次元削減後のデータ行列X^があり、 ü D^がX^に対する最適解である(γ=1)ならば、 ü
D^はデータ行列Xに対して精度(1+ε)を保証する。 8
Sparse Embedding Matrix ≈ ε-Approximation Embedded Matrix 9 埋め込み次元の大きさに制約をかけることで、
ランダム直交行列R=(QΦ)'を使った埋め込み行列X^=XR'は、 1-O(δ)の確率で(2)式の条件を満たす。(証明は3章)
実験結果 10 ・クラスタリング精度 ・次元削減の計算時間