Slide 1

Slide 1 text

メタバースプロジェクトにおける Observability構築とユーザー視点 での信頼性可視化の現在地 2025年7⽉11⽇SRE NEXT LT 1

Slide 2

Slide 2 text

⾃⼰紹介 sugar cat CTO室インフラチーム所属 ホロアースのSRE(2024/10~) 2

Slide 3

Slide 3 text

01 ホロアースについて 3

Slide 4

Slide 4 text

ホロアースについて 2025年4⽉に正式リリースを迎えた ホロアース ● Windowsでプレイ可能なメタ バースプラットフォーム ● タレントとともに楽しめるオー プンワールドゲーム 4

Slide 5

Slide 5 text

ホロアースについて 5

Slide 6

Slide 6 text

02 SREのロードマップと課題 6

Slide 7

Slide 7 text

ホロアースSREロードマップ 2024年10⽉から最終⽬標のSLI/SLOアラートの運⽤を⾒据えて、監視基盤およびインフラ構成の⾒直しやプ ラットフォームエンジニアリングを進めている 2024/10 2025/4 2025/10 2026/4 インフラ構成の⾒直しと プラットフォームエンジニアリング 監視基盤構築/インフラ構築⽀援 SLI/SLO 導⼊推進 サーバーサイドのテレメトリデータを Datadogへ集約 クライアントサイドへの Sentry導⼊ SLO導⼊計画策定 アラート運⽤改善 エラートラッキング実装 UJの洗い出しと成功率の可視化 リアルタイム通信の Kubernetesの運⽤改善 UGCリリースの 負荷試験‧インフラ構築⽀援 SLI定義 SLO定義 API Gateway/Kubernetes移⾏ 新規リリースのインフラ構築⽀援 7

Slide 8

Slide 8 text

ホロアースSREロードマップ 2024年10⽉から最終⽬標のSLI/SLOアラートの運⽤を⾒据えて、監視基盤およびインフラ構成の⾒直やプラッ トフォームエンジニアリングを進めている 2024/10 2025/4 2025/10 2026/4 インフラ構成の⾒直しと プラットフォームエンジニアリング 監視基盤構築/インフラ構築⽀援 SLI/SLO 導⼊推進 サーバーサイドのテレメトリデータを Datadogへ集約 クライアントサイドへの Sentry導⼊ まずはクライアント‧サーバーともにエンジニアがシステ ムの内部状態を観測可能な状態にすることが最優先 SLO導⼊計画策定 アラート運⽤改善 エラートラッキング実装 UJの洗い出しと成功率の可視化 リアルタイム通信の Kubernetesの運⽤改善 UGCリリースの 負荷試験‧インフラ構築⽀援 SLI定義 SLO定義 API Gateway/Kubernetes移⾏ 新規リリースのインフラ構築⽀援 8

Slide 9

Slide 9 text

現在のシステム構成 9

Slide 10

Slide 10 text

現在のシステム構成 クライアント ‧ホロアース(Desktop App): Unity ‧クリエイター⽤ツール(Web): React, WebGL メインのホロアースを遊ぶためのUnityビルドとUGCコンテンツを作 成するためのWebサイトを開発‧運⽤ 10

Slide 11

Slide 11 text

現在のシステム構成 ●API サーバー ●リアルタイムサーバー 各機能ごとに別々のサーバー チームで開発‧運⽤ 11

Slide 12

Slide 12 text

現在のシステム構成 各種テレメトリデータはクライアント‧サーバーごとそれぞれ監視 Saasへ集約 クライアントサイド:Sentry サーバーサイド:Datadog 12

Slide 13

Slide 13 text

課題1: 監視基盤の整備 [課題] ‧クライアントサイド: コストの兼ね合いでチーム全体での監視が満⾜に⾏えていなった。 ‧サーバーサイド: ECS/EKS上で動くアプリ内で複数のAgentが併⽤されており、⼀部で重複してメ トリクスを収集していた。 13

Slide 14

Slide 14 text

課題1: 監視基盤の整備 [課題] ‧クライアントサイド: コストの兼ね合いでチーム全体での監視が満⾜に⾏えていなった。 ‧サーバーサイド: ECS/EKS上で動くアプリ内で複数のAgentが併⽤されており、⼀部で重複してメ トリクスを収集していた。 [クライアントサイド] Sentryを導⼊しチーム全体で利⽤を促進、 補⾜したエラーの改善がリリースに含まれ るようになった。 [サーバーサイド] Datadogに全てのサービスのテレメトリ データを集約しコスト削減、各チームが利 ⽤しやすいようにダッシュボードの整備を ⾏った。 14

Slide 15

Slide 15 text

課題2: アラート運⽤の整備 [課題] ‧システムコンポーネントのメトリクスによるSLOアラートが準備されていたが、サービスの品質 改善に活かせていない 15

Slide 16

Slide 16 text

課題2: アラート運⽤の整備 [課題] ‧システムコンポーネントのメトリクスによるSLOアラートが準備されていたが、サービスの品質 改善に活かせていない ⾃動計装を活⽤し分散トレースを改善、 APMの活⽤をしやすい基盤を整備した。 APIサーバのエンドポイント、⾮同期ジョ ブごとのアラートを再定義し、より開発者 がサービスの品質改善に⽣かしやすい環境 を構築した。 16

Slide 17

Slide 17 text

課題3:CUJの洗い出しとビジネスメンバーへの可視化 [課題] ‧システムの稼働状態の把握がエンジニアに閉じてしまい、ビジネス上の機会損失を定量的に測る ためのSLOが定義されていない 17

Slide 18

Slide 18 text

課題3:CUJの洗い出しとビジネスメンバーへの可視化 [課題] ‧システムの稼働状態の把握がエンジニアに閉じてしまい、ビジネス上の機会損失を定量的に測る ためのSLOが定義されていない 機能単位でホロアースの稼働状態を定量的に確 認できるようにするためにユーザージャーニー (UJ)を整理。 前段で整理したUJとトレースデータを元に、 API側で観測可能な範囲でユーザー数ベースの 影響範囲(成功率)をダッシュボードで可視化 し、メンバー全体へ展開‧運⽤を開始した。 18

Slide 19

Slide 19 text

03 今後の展望 19

Slide 20

Slide 20 text

ホロアースSREロードマップ 2024年10⽉から最終⽬標のSLI/SLOアラートの運⽤を⾒据えて、監視基盤およびインフラ構成の⾒直やプラッ トフォームエンジニアリングを進めている 2024/10 2025/4 2025/10 2026/4 インフラ構成の⾒直しと プラットフォームエンジニアリング 監視基盤構築/インフラ構築⽀援 SLI/SLO 導⼊推進 サーバーサイドのテレメトリデータを Datadogへ集約 クライアントサイドへの インフラ構成‧運⽤の全体的な⾒直しとオブザーバビリティのコントロールをプラットフォーム Sentry導⼊ チームで⾏えるような基盤を作る SLO導⼊計画策定 アラート運⽤改善 エラートラッキング実装 UJの洗い出しと成功率の可視化 リアルタイム通信の Kubernetesの運⽤改善 UGCリリースの 負荷試験‧インフラ構築⽀援 SLI定義 SLO定義 API Gateway/Kubernetes移⾏ 新規リリースのインフラ構築⽀援 20

Slide 21

Slide 21 text

展望: Kubenetes移⾏によるゴールデンパスとAPI Gatewayの構築 AWSアカウントの分断によるネットワークや各種リソースの管理の複雑性が増している →Kubenetes移⾏+API Gatewayを構築でプラットフォームチームによるコントロールを⽬指す 21

Slide 22

Slide 22 text

まとめ ● 監視基盤の構築やUJの可視化によってSRE⽂化の形成の⾜がかりを作った ● 将来的にはプラットフォームチームを設けてアプリケーションのプラット フォームの運営を⽬指す 22