Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Sign up for free
Menu
Search
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Features
All features
Private URLs
Password Protection
Custom URLS
Scheduled publishing
Remove Branding
Restrict embedding
Deck Collections
Notes
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Explore
Featured decks
Featured speakers
Programming
Technology
Storyboards
Pricing
Search
Sign in
Sign up for free
The Pulse of News in Social Media: Forecasting ...
Search
ysekky
April 19, 2014
Research
150
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
The Pulse of News in Social Media: Forecasting Popularity(ICWSM 2012)
ysekky
April 19, 2014
More Decks by ysekky
See All by ysekky
スタートアップの開発サイクルに学ぶ 研究活動の進め方 / research practices inspired by startup business strategy
ysekky
0
2.5k
[論文紹介] A Method to Anonymize Business Metrics to Publishing Implicit Feedback Datasets (Recsys2020) / recsys20-reading-gunosy-datapub
ysekky
3
2.9k
JSAI2020 OS-12 広告とAI オープニング / JSAI2020-OS-12-ads-and-ai-opening
ysekky
0
2.3k
JSAI2020インダストリアルセッション - Gunosyにおける研究開発 / jsai2020-gunosy-rd-examples
ysekky
1
840
ウェブサービス事業者における研究開発インターン[株式会社Gunosy] - テキストアナリティクスシンポジウム2019 / research-intern-case-study-at-gunosy
ysekky
0
3.1k
Gunosyにおけるニュース記事推薦/ news-recommendation-in-gunosy-webdbf2019
ysekky
1
1.6k
DEIM2019技術報告セッション - Gunosyの研究開発 / deim-2019-sponsor-session-gunosy-research
ysekky
0
1.3k
Analysis of Bias in Gathering Information Between User Attributes in News Application (ABCCS 2018)
ysekky
1
2.5k
世代による政治ニュース記事の閲覧傾向の違いの分析 - JSAI2018 / Analysis of differences in viewing behavior of politics news by age
ysekky
0
4.2k
Other Decks in Research
See All in Research
Cross-Media Information Spaces and Architectures
signer
PRO
0
380
NLP colloquium: AI Safety Survey
kanekomasahiro
2
1.1k
2026年6月_副業コンプライアンス調査_業界別リスク度分析_株式会社フクスケ.pdf
fkske
0
110
学術バーQ AI研究最前線:自己教師あり学習による画像モデルの事前学習
naok615
0
130
ros2-perf-multihost: Automated Coordination Framework for Objective Architecture Evaluation in Distributed Systems
takasehideki
0
130
[最先端NLP勉強会2026] Checklists Are Better Than Reward Models For Aligning Language Models
nzw0301
1
320
データサイエンティストの就労意識~2015 → 2026 一般(個人)会員アンケートより
datascientistsociety
PRO
0
960
完全自律LLMエージェントでDIVER OSINT CTF 2026に挑戦してみた
analokmaus
0
730
[WebDB2026]セレンディピティ指向推薦システム再考 ―セレンディピティの原義・類型・発生過程に基づく設計指針―
recsyslab
PRO
0
180
PHTalks Bengaluru - SSRF When All Else Fails
dk999
0
1.2k
クラウド・AI 時代の研究開発 DX / R&D Digital Transformation
hariby
0
180
全国町字単位空き家率推定データver1.0データ仕様
microbaseinc
0
270
Featured
See All Featured
Digital Projects Gone Horribly Wrong (And the UX Pros Who Still Save the Day) - Dean Schuster
uxyall
1
3.2k
Design of three-dimensional binary manipulators for pick-and-place task avoiding obstacles (IECON2024)
konakalab
0
610
The Anti-SEO Checklist Checklist. Pubcon Cyber Week
ryanjones
0
250
Game over? The fight for quality and originality in the time of robots
wayneb77
1
290
SEOcharity - Dark patterns in SEO and UX: How to avoid them and build a more ethical web
sarafernandez
0
290
Chrome DevTools: State of the Union 2024 - Debugging React & Beyond
addyosmani
10
1.4k
VelocityConf: Rendering Performance Case Studies
addyosmani
331
25k
Rails Girls Zürich Keynote
gr2m
96
14k
Templates, Plugins, & Blocks: Oh My! Creating the theme that thinks of everything
marktimemedia
31
2.9k
The Curious Case for Waylosing
cassininazir
1
550
The Spectacular Lies of Maps
axbom
PRO
1
1.1k
What's in a price? How to price your products and services
michaelherold
247
13k
Transcript
The Pulse of News in Social Media: Forecas7ng Popularity
Roja Bandari, Sitaram Asur, Bernardo A. Huberman (ICWSM 2012) Yoshifumi Seki@Gunosy研究会
概要 • Mashableで記事になってたやつの元論文 – Popularity of an Ar7cle Can Be
Predicted Before It's Tweeted – hRp://mashable.com/2012/02/09/news-‐ popularity-‐twiRer-‐video/ • Videoもあるよ • その記事がどれぐらいTweetされるかを記事 に関連する要素が過去どのぐらいTweetされ たかで予測する
Data • 記事 – FeedzillaのAPIを利用 • 2011/10/8 –
2011/10/16までのフィードに含まれる記事44,000件 – タイトル, 概要文, URL, 時間, カテゴリ, 配信元 – スパム・重複は取り除かれている – 半分をカテゴリスコアの特定に利用 – 残りの半分を分類・回帰タスクに利用 • 半分を教師データに、もう半分を評価データに利用 • Tweet – Topsyを利用して集めた – 記事とTweetを結びつける – 過去50日分のTweetを利用 – 記事の人気が安定するのは4日かかる • The dynamics of viral marke7ng. Leskovec et al.(2007)
集めた記事のTweet数の分布 • Tweet数はロングテール • 全くTweetされない記事は線形のトレンドからはずれ る
Features • ニュースの配信元 • ニュースのカテゴリ • 主観的な内容か?客観的な内容か?
• 記事ないに出現する名前
Category Score • 最大を1とした時の各カテゴリの記事数とT-‐density • t-‐density = # Tweets
/ # Links • テクノロジーが最もTweetされやすい • 記事数が多く、t-‐densityが高いカテゴリはニッチで熱烈なファ ンがおおいカテゴリである
Subjec7vity • 主観的か客観的かの二値変数 – 主観的な記事ほどShareされやすいのでは? • LingPipeを使う
– hRp://alias-‐i.com/lingpipe/index.html – Text mining toolkit – 感情分析 • 教師データ – 主観的なニュース • Rush Limbaugh – hRp://www.rushlimbaugh.com/ • keith olbermann – 客観的なニュース • First Monday – hRp://firstmonday.org/
Subjec7vely • 教師データの分類精度は99% • 各ソースの平均はかなり偏りがあった
Named En77es • Named En7ty: 有名な場所、人、組織等 • Stanford Named
En7ty Recognizer(Stanford-‐ NER) – hRp://nlp.stanford.edu/sohware/CRF-‐NER.shtml – 記事・概要文からNamed En7tyを抽出 • 1ヶ月のTweetから各Named En7tyに平均t-‐ densityをScoreとして付与した
Source Score • 平均t-‐densityをsource scoreをして割り当てる • 過去何日のt-‐densityを使えばSourceのスコアが安定する か?
– 54日ぐらい • 各記事のsource scoreとtweet数の相関係数は0.35 – それだけでは不十分
Timeline
日付による影響 • Tweet数、記事数は Weeklyのトレンドがある • T-‐densityは週次のトレン ドに対して強い
Google Newsとの比較 • NewsKnife – Google Newsの表示順位とかからニュースの価値を 推定するサイト
• 閉鎖したらしい… – hRps://www.facebook.com/permalink.php? story_nid=462109153840156&id=119081421476266&stream_re f=10 • Google Newsは記事を沢山出すサイトを評価す る傾向にあり、流行る記事を見つけられない
Regression • Tweet数を回帰モデルとして予測する • 最も貢献したのはSource, ついでカテゴリ, 最後にEn7ty •
Subjec7vity効いてない(´・ω:;.:…
Classifica7on • 他クラス分類として分類器を作る • なぜAccuracyだけ?これだと全部Aに分類する分類器で76%でるから、Naïve BayesよりBaggingがいいとは言えるけど、ちゃんと分類できてるかは判断で きなさそう
Zero-‐Tweet Predic7ng • Tweet数が0の記事を予測する • SVMを使って66%のAccuracyを得た – 正例・負例の数、Precision, Recallなどが明記され
ていないためいいのか悪いのかよくわからん • Sourceとカテゴリが効き、subjec7vely, named en7tyはほとんど有効ではなかった – 結局メディアの努力とジャンルによるのか? – Tweet:0ってそもそも公式アカウントすらなさそう だし
まとめ • 結局ソースとカテゴリが効くという結果になってる。 – Tweetされるように努力している媒体や、Tweetされやすいジャ ンルが存在するということの証明にはなっている – それが記事のPopularityとして定義していいのかなぁという疑問
• 例えばSourceやカテゴリの平均Tweet数からの差分とか見 たらPopularityとかQualityの推定になったりしないかな – そうするとEn7tyとかSubjec7vityとか効いてくるんじゃないかな • 84%の精度!っていってるけど、Accuracyだけじゃ正直す ごいかどうか判断しようがない・・・ • Subjec7vityいったいどこにいったんだろうか・・・