Upgrade to Pro — share decks privately, control downloads, hide ads and more …

コーヒー豆の可視化で 迷走しまくった(ている)話

Sponsored · Your Podcast. Everywhere. Effortlessly. Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
Avatar for min min
August 06, 2026
27

コーヒー豆の可視化で 迷走しまくった(ている)話

新卒N年目の勉強会&交流会!「Tech Talk !!!!」( https://fresh-engineers.connpass.com/event/399536/ )登壇資料

Avatar for min

min

August 06, 2026

Transcript

  1. 目次 01. 0 1. 02. 0 2. 03. 03. 04.

    04. 05. 05. 背景 大体の方針 データを加工してみた 実装したものの紹介 出てきた問題点たち
  2. 02. 02. 大体の方針 1. データを探す(なかったら作る) 2. 仮説を立てる 3. データを加工する 4.

    サイトを実装する 5. ユーザ評価 6. 演習レポート 7. 卒業!!!
  3. 02. 02. 1.データを探す→ありました Coffee Quality database from CQI アメリカの非営利団体CQI(Coffee Quality

    Institute)が蓄積しているコーヒーの 品質評価データをまとめたデータベース 1,338件のデータを収録 味の特徴量データには評価点数10点満点が入っている(値が高い=より質が良い) 品種情報 品種名 精製方法 産地情報 生産国 地域(Region) 味の特徴量(10段階) Aroma:香り Flavor:風味 Aftertaste:後味 Acidity:酸味 Body:コク Balance:バランス https://www.kaggle.com/datasets/volpatto/coffee-quality-database-from-cqi
  4. 03. 03. データの加工 (ちょっとテクいはなし1) 用いたクラスタリング:HDBSCAN データの集まり(密度)を利用してグループを自動で見つける教師な し学習のクラスタリング手法 クラスター数の事前指定が不要 任意の形状に対応 ノイズを自動で除外

    クラスターへの所属の確かさを表す値を得られる 今回の要望 味のグループ数や分布の形が事前に分からない 外れ値も含まれる可能性があるかも その地域に複数の味の傾向がどのくらい含まれるかを割合で見たい この辺りを満たしていたので採用!!
  5. 06. 06. まとめ1 データをみてさまざまな視点から仮説を立てることが大事 仮説通りにデータがまとまらないこともあるし データの加工手法を変えたらうまくいくこともある 検証もしっかりする 重なり除去(d3-force) 次元削減(UMAP・t-SNE) クラスタリング

    どの段階で詰まっているのかがわかりにくい いまんとこ仮説だと思ってるけどどうなんだろうね どうがんばってもおもしろくならないデータもあるらしい(by指導教員) AIによってアウトプットを出す速度は格段に上がったのでとりあえず検証しまくるのは大事