Upgrade to Pro
— share decks privately, control downloads, hide ads and more …
Speaker Deck
Features
Speaker Deck
PRO
Sign in
Sign up for free
Search
Search
川原瑞樹
Search
Sponsored
·
Your Podcast. Everywhere. Effortlessly.
Share. Educate. Inspire. Entertain. You do you. We'll handle the rest.
→
Kitahara Lab.
February 12, 2024
Research
100
0
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
川原瑞樹
2023年度卒業研究発表 川原瑞樹
Kitahara Lab.
February 12, 2024
More Decks by Kitahara Lab.
See All by Kitahara Lab.
カラーバーの段階的非表示による読譜誘導型ピアノ演奏支援システムの試作
kthrlab
0
41
初学者による演奏音の自動評価を目的としたフルート音の音響分析
kthrlab
1
52
サッカーにおける選手位置とパスコースの可聴化システム
kthrlab
0
35
ハウスミュージックの楽曲構成を決める要因とその法則性の分析
kthrlab
0
220
即興演奏システム JamSketch の社会応用の可能性
kthrlab
0
42
Generating Melodies from Melodic Outlines Towards an Improvisation Support Systems for Non-musicians
kthrlab
0
52
即興演奏支援に向けた旋律生成の一試行
kthrlab
0
18
JamSketch Deep α: A CNN-based Improvisation System in Accordance with User's Melodic Outline Drawing
kthrlab
0
36
即興演奏システムJamSketchにおける 旋律生成手法の改善
kthrlab
0
39
Other Decks in Research
See All in Research
CVPR2026論文紹介_VLMにとって良いvision encoderとは何か?Rethinking Model Selection in VLM Through the Lens of Gromov-Wasserstein Distance
kobayashi31
1
170
英語教育 “研究” のあり方:学術知とアウトリーチの緊張関係
terasawat
1
1k
Research Engineerという仕事 / Research Engineering: Bridging Research and Business
chck
1
230
【Zozo Research 技術共有会】三次元領域の現在と展望
mickey_0226
3
470
SAKURAONE:An Open Ethernet-based AI HPC System And Its Observed Workload Dynamicsin a Single-Tenant LLM Development Environment
yuukit
1
450
敵対生成プロンプト同時探索による内省型プロンプト最適化
kinoue_smarthr
0
310
AIエージェント時代のLLM-jpモデルのあるべき姿
k141303
0
510
ScoreMatchingRiesz for Automatic Debiased Machine Learning and Policy Path Estimation with an Application to Japanese Monetary Policy Evaluation
masakat0
0
300
Sleuthcon Keynote - How Cybercriminals (ab)use AI
fr0gger
0
250
2026 東京科学大 情報通信系 研究室紹介 (すずかけ台)
icttitech
0
4.1k
Anthropic が提案する LLM の内部状態を自然言語で説明可能にした Natural Language Autoencoders / Natural Language Autoencoders Produce Unsupervised Explanations of LLM Activations
shunk031
0
150
PGDM: Physically Guided Diffusion Model for L Downscaling
satai
3
350
Featured
See All Featured
[RailsConf 2023] Rails as a piece of cake
palkan
59
6.7k
The MySQL Ecosystem @ GitHub 2015
samlambert
251
13k
Public Speaking Without Barfing On Your Shoes - THAT 2023
reverentgeek
1
460
The SEO identity crisis: Don't let AI make you average
varn
0
510
I Don’t Have Time: Getting Over the Fear to Launch Your Podcast
jcasabona
34
2.8k
Measuring Dark Social's Impact On Conversion and Attribution
stephenakadiri
2
240
Lightning Talk: Beautiful Slides for Beginners
inesmontani
PRO
2
610
The untapped power of vector embeddings
frankvandijk
2
1.8k
Introduction to Domain-Driven Design and Collaborative software design
baasie
1
900
ラッコキーワード サービス紹介資料
rakko
1
3.9M
Paper Plane (Part 1)
katiecoart
PRO
1
9.7k
10 Git Anti Patterns You Should be Aware of
lemiorhan
PRO
659
62k
Transcript
モーフィングを用いたドラムループ素材の生成 川原瑞樹 日本大学
背景 ループシーケンサ : 数小節程度の音素材をつなげて作曲ソフトウェア ドラムループのようなリズミカルな素材は ポピュラー楽器であり、曲の特徴を形作る 音色、効果音の多様性が楽曲のバリエーションに影響を与える
背景 音素材に限りがある 自分の求める音素材が常に見つかるとは限らない 多様な音素材を生成を可能にしよう! 課題
目的 モーフィング音源を生成することで、 限られた音素材から多様な音素材を作る 2つの音源の中間的な音源
関連研究との違い ・ Li-Chia Yang, Szu-Yu Chou, Yi-Hsuan Yang, MidiNet: A
Convolutional Generative Adversarial Network for Symbolic-domain Music Generation(2017) → 畳み込みニューラルネットワーク(CNN)を使用した音楽生成 ・ 小林瑞季, 浜中雅俊, 新しいGTTMメロディモーフィング手法の提示 (2019) → GTTMに基づくメロディモーフィング手法の自動化 ・ 河原英紀, 生駒太一, 森勢将雅, 高橋徹, 豊田健一, 片寄晴弘, 歌唱音声モーフィングに基づく声質と歌 い回し転写の知覚的検討, (2017) → 高品質音声分析変換合成システムSTRAIGHTに基づくモーフィングによって、歌手の歌いまわしを転 写する ドラム音をモーフィングによって多様な音素材を生成すること に特化するものは見つからなかった
提案手法 VAE(変分オートエンコーダ)と CNN(畳み込みニューラルネットワーク) を組み合わせたモデルでモーフィングを実現する
VAE 提案手法 データの特徴を抽出し、新しいデータを生成するための深層学習モデル CNN VAEの圧縮・復元の際にフィルタを通すことで画像の特徴を学習
提案手法 モーフィングの実現 音源A 音源B モーフィング音源 スペクトログラム CNN(圧縮) CNN(復元)
モーフィング音源 CNN-VAEによって得られたモーフィング音源 音源A 音源B モーフィング音源
データセット SoundPool というWAVE形式の3 秒間の音楽ループ素材 データ数 224個 ジャンル テクノ&トランス 楽器パート ドラム
実験 1.曲作りに使えるかどうか 2.機械学習モデルによって生成されたと思われるのはどちらか 3.元音源との類似度評価 4.新しい音源が生成されたか 1~3についてWeb 上のクラウドソーシングサービスを用いて評価した
実験 1.曲作りに使えるかどうか 2.機械学習によって生成されたと思われるのはどちらか 機械学習による音源、市販音源をランダムを対に提示 聴いて以下の項目を選択する 1.曲作りに使える A or B 2.機械学習モデルによって生成された
A or B 実験参加者:145名×10回評価 音源 A 音源 B
実験 1.曲作りに使えるかどうか 機械学習による音源を選んだ割合の平均 : 0.5 曲作りの使える品質、市販の音源同等の品質である 理想の結果
結果と考察 1.曲作りに使えるかどうか 平均 標準偏差 0.419 0.223
実験 2.機械学習モデルによって生成されたと思われるのはどちらか 機械学習による音源を選んだ割合の平均 : 0.5 曲作りの使える品質、市販の音源同等の品質である 機械学習による音源を選んだ割合の平均 : 0.5以下 機械学習による音源が市販の音源よりも市販の音源らしい
理想の結果
結果と考察 2.機械学習モデルによって生成されたと思われるのはどちらか 平均 標準偏差 0.374 0.180
実験 3.元音源との類似度評価 機械学習によるモーフィング音源、モーフィング前の元音源A、Bを提示 音源 A、音源 B 、どちらに近いかを選択する 音源 X 音源
B 音源 A
実験 3.元音源との類似度評価 実験参加者:201名×10回評価 全ての評価数値の平均を出す 選択肢 評価数値 Aに近い 1 どちらかといえばAに近い 2
どちらかといえばBに近い 3 Bに近い 4
実験 3.元音源との類似度評価 2以上3未満の割合が大きい 機械学習によるモーフィング音源は元音源 A、B の中間的な音源といえる 理想の結果 平均評価数値 割合 1
以上2 未満 0 % 2以上3 未満 100 % 3 以上4 未満 0 %
結果と考察 3.元音源との類似度評価 平均評価数値 割合 1 以上2 未満 28% 2以上3 未満
48% 3 以上4 未満 24%
実験 4.新しい音源が生成されたか 機械学習で生成されたモーフィング音源 X (100個)とデータセットの音源との類 似度を調べる 音源Xのそれぞれに対して、最も似ているものの類似度を計算する 音源 X 音源
B 音源 A データセット
実験 4.新しい音源が生成されたか データセットからランダムに選ばれた音源とデータセットの音源との類似度を調 べる ランダムに選ばれた100個の音源のそれぞれに対して、最も似ているものの類 似度を計算する それらの平均値を求める データセットからランダムに選ばれた音源 データセット
実験 4.新しい音源が生成されたか 「生成音源とデータセット内の類似度」 が低いほど、生成された音源はデータ セット内のどの音源とも類似していない 理想の結果
結果と考察 4.新しい音源が生成されたか 平均最大類似度 データセット内 0.870 生成音源とデータセット内 0.935
まとめ ・市販の音素材に対して曲作り、品質に対して劣らない ・モーフィングの元となる2 つの音源のどちらかに類似するケースは少ないこと ・データセットに存在しない新しい音源が生成されている可能性は少ない
今後の課題 より多様なジャンルや楽器、スタイルに対応できるように、モデルの改良や新し い学習手法を検討する必要