Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
データベース15: ビッグデータ時代のデータベース
Search
Y. Yamamoto
PRO
July 27, 2026
Science
530
1
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
データベース15: ビッグデータ時代のデータベース
1. ビッグデータの特徴
2. NoSQL
講義ノートURL
https://dbnote.hontolab.org/content/nosql/01.html
Y. Yamamoto
PRO
July 27, 2026
More Decks by Y. Yamamoto
See All by Y. Yamamoto
データベース14: B+木 & ハッシュ索引
trycycle
PRO
0
890
データベース12: 正規化(2/2) - データ従属性に基づく正規化
trycycle
PRO
0
1.7k
データベース11: 正規化(1/2) - 望ましくない関係スキーマ
trycycle
PRO
0
1.7k
データベース10: 拡張実体関連モデル
trycycle
PRO
0
1.6k
データベース09: 実体関連モデル上の一貫性制約
trycycle
PRO
0
1.8k
機械学習 - ニューラルネットワーク入門
trycycle
PRO
0
1.2k
データベース08: 実体関連モデルとは?
trycycle
PRO
0
1.6k
機械学習 - SVM
trycycle
PRO
2
1.2k
機械学習 - K近傍法 & 機械学習のお作法
trycycle
PRO
1
1.6k
Other Decks in Science
See All in Science
知能とはなにか -ヒトとAIのあいだ-
tagtag
PRO
0
110
20260722【JAWS-UG東京 ランチタイムLT会 #37④】AWS Well-Architectedフレームワークに沿った回答をするAIエージェントを作ってみた
nozakijcom
1
120
科学で迫る勝敗の法則-スポーツデータ分析の最前線 (刈谷市連携講座.2026年7月) / The principle of victory discovered by science. at Kariya City, 2027.07
konakalab
0
130
[第67回 CV勉強会@関東] CV × Scientific Figures / kantoCV 67th CVPR 2026
lychee1223
0
170
Kritische evaluatie van GenAI-output voor literatuuronderzoek
voginip
0
210
CVPR2026_VGGTとその仲間たち
mickey_0226
0
1k
コーヒー豆様核 (Coffee-bean nuclei) における形態学的サブタイピングと精選・焙煎特性の同定
jagupath
PRO
0
140
Utiliser Bitcoin sans Internet
rlifchitz
0
330
Sstニューロンによる睡眠不足と回復の制御:データ駆動型トランスクリプトーム解析
tagtag
PRO
0
120
医療 LLM ベンチマークの現在地:多面的評価 と日本ローカライズ
analokmaus
1
630
20260410_SystemsThinking
takusamar
1
140
AkarengaLT vol.40
hashimoto_kei
0
120
Featured
See All Featured
Marketing Yourself as an Engineer | Alaka | Gurzu
gurzu
0
280
Sharpening the Axe: The Primacy of Toolmaking
bcantrill
46
2.9k
The SEO Collaboration Effect
kristinabergwall1
1
520
VelocityConf: Rendering Performance Case Studies
addyosmani
332
25k
Optimizing for Happiness
mojombo
378
71k
Rails Girls Zürich Keynote
gr2m
96
14k
The B2B funnel & how to create a winning content strategy
katarinadahlin
PRO
1
460
Self-Hosted WebAssembly Runtime for Runtime-Neutral Checkpoint/Restore in Edge–Cloud Continuum
chikuwait
0
700
Visual Storytelling: How to be a Superhuman Communicator
reverentgeek
2
610
"I'm Feeling Lucky" - Building Great Search Experiences for Today's Users (#IAC19)
danielanewman
230
23k
Dealing with People You Can't Stand - Big Design 2015
cassininazir
367
27k
Technical Leadership for Architectural Decision Making
baasie
3
470
Transcript
NoSQL ⼭本 祐輔 名古屋市⽴⼤学 データサイエンス研究科
[email protected]
第15回 データベース 〜 ビッグデータ時代のデータベース
講義ノート https://bit.ly/3xqTSds
関係データベース ⼤規模データを 正しく適切に管理・処理 どこまで大規模なデータに耐えられる?
情報爆発 → ビッグデータ時代の到来
1秒間に⽣成されるソーシャルメディア数 出典: https://spectralplex.com/how-much-content-is-uploaded-to-the-internet-per-second/ X (旧Twitter) Instagram 5800 件/秒 1100 件/秒
Snapchat 35,000 件/秒 750,000 件/秒 WhatsApp 銀⾏取引 in ⽇本 (= 675万件/⽇) https://www.zenginkyo.or.jp/abstract/efforts/system/zengin-system 78.1件/秒
単に巨大なデータ ビッグデータ ≠
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの量 1GB x 1 = 1GB 1KB x 1,000,000 =
1GB … データ集合(集団)の特徴を捉えるには 量(数)がより重要 < データ集合に 関する情報量
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの多様性 … データが多様でないと データ集合から多様な価値を取り出せない < 価値の多様性 …
ビックデータの特徴3V Volume Velocity Variety データの量が圧倒的に多い データの発生・更新頻度が大きい データの発生源、データの種類が多様
データの発⽣速度(頻度) ある時期のこと しか分からない データの発生頻度が高いと、データ集合の 特徴を時間的な解像度を高く捉えられる < 時間 時間 時間を考慮して, 集団の特徴を捉えられる
有⽤度 (⻑期的な視点,季節要因,リアルタイム性)
ビックデータの特徴 High Volume High Velocity High Variety データの量が圧倒的に多い データの発生頻度が大きい データの発生源/種類が多様
ビッグデータを扱うサービスでは、データの厳密な⼀貫性 よりも⾼速にデータを処理し結果を返すことが優先される 関係データベースでは 対応が難しい… データの⼀貫性に拘る
関係データベースとNoSQL 関係 データベース NoSQL ◦ データの正しさを厳密に管理 × 超⼤規模データを扱うのは困難 × 正しさの管理をある程度諦める
◦ ⼤規模・多様なデータを ⾼速・柔軟に処理 ▲ 性能向上は スケールアップで対応 ◦ 性能向上は スケールアウトで対応
システムを物理的に性能向上させる⽅法 スケールアップ スケールアウト 計算機のスペックを強化 計算機の台数を増やす CPUなど 強化 計算機を 増やす ◦
⼿間が少ない × 性能向上に限度あり × ダウンタイムがある ◦ 性能アップの上限がない × ダウンタイムがない × 分散処理が前提になる
関係データベースとNoSQL 関係 データベース NoSQL ◦ データの正しさを厳密に管理 × 超⼤規模データを扱うのは困難 × 正しさの管理をある程度諦める
◦ ⼤規模・多様なデータを ⾼速・柔軟に処理 相互補完的 RDBとNoSQLはケースに応じて使い分けるべき ▲ 性能向上は スケールアップで対応 ◦ 性能向上は スケールアウトで対応 ビッグデータ対応はNoSQLの⽅が向いている
様々なNoSQLデータベース key 1 2 key 1 2 key 1 2
{ “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, } } { “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, } } キー・ バリュー型 列指向 ドキュメント 指向 グラフ 複雑なデータを表現 ⾼速なデータ処理
キー・バリュー型データベース Key Value user_xxxx {address: 瑞穂区, age: 22} user_yyyy {address:
昭和区, age: 18} user_zzz {age: 29} product_xxx {price: 250} … § 重複のない「キー」と値「バリュー」のペアを格納 § データに厳密な制約を設けない § キー値に対応するバリューを受け取ることに特化 § データ構造の単純化によりデータ処理を超⾼速化
列指向データベース Key Value cxxx0001 cxxx0002 cxxx0003 … 書籍名 データベース入門 出版日
2009/05 価格 2200 タイトル はじめての機械学習 出版日 2015/05 著者 北 千種 価格 2500 著者 山畑 滝子 川澄 桜 タイトル データベース講義 出版日 2024/04 価格 xxx 著者 姓 名 山本 祐輔 カラムファミリー カラムファミリー内には カラムを⾃由に設定できる § キー・バリュー型DBの拡張 § バリューの中にキー・バリュー構造のデータを保持 § データ構造を柔軟化しつつ、データ処理を超⾼速化
ドキュメント指向データベース § XMLやJSONなどの⽊構造のデータを管理 § データ追加時にデータ構造を柔軟に変更可能 (多様なデータに対応できる) <students> <student> <name>⼭畑 滝⼦</name>
<birthdate>2003/12/01</birthdate> <gender>⼥</gender> <department>経済学部</department> </student> <student> <name> <family_name>川澄</family_name> <first_name>桜</first_name> </name> <birthdate>2001/07/07</birthdate> <gender>⼥</gender> <department>医学部</department> <scholarships> <scholarship> <name>YASSO</name> <registered_at> 2023/05/01</resgistered_at> </scholarship> </scholarships> </student> </students> { “students”: [ “student”: { “name”: “⼭畑 滝⼦”, “birthdate”: 2003/12/01”, “gender”: “⼥”, “department”: “経済学部” }, “student”: { “name”: { “family_name”: “川澄”, “first_name”: “桜” }, “birthdate”: 2001/07/07”, “gender”: “⼥”, “department”: “医学部”, “scholarship”: [ “scholarship”: { “name”: “YASSO”, “registered_at”: “2023/05/01” } ] ] } XMLドキュメント JSONドキュメント
グラフデータベース § あらゆるデータをグラフ構造で管理 § エンティティ間にある多様な関係の表現に最適 § グラフ探索アルゴリズムで複雑な問合せも⾼速に処理 愛知県 名古屋 南京
トリノ シドニー 県庁所在地 姉妹都市 姉妹都市 姉妹都市 ⽇本 県 ラグランジュ アボガドロ 出⾝ 出⾝ 物理 専⾨ 専⾨ 数学 名古屋 ⼤学 国⽴⼤学 ⼩林誠 出⾝校 専⾨