大阪オフィスに Unitree Go2 がやってきたので Physical AI やってみた
by
dafujii
×
Copy
Open
Share
Embed
Copy iframe code
Copy JS code
Copy link
Start on current slide
Slide 1
Slide 1 text
⼤阪オフィスにUnitree Go2が やってきたので Physical AI やってみた 製造ビジネステクノロジー部 ふじい
Slide 2
Slide 2 text
自己紹介 ● 2020年9⽉ ⼊社 ○ サーバサイドエンジニアのお仕事 ふじい 部署 ● 2023年3⽉ 育児休業取得 ● 2024年5⽉ 育児休業から復帰 ● 2026年12⽉ ⼤阪オフィス忘年会幹事 製造ビジネステクノロジー部 スマートプロダクトチーム ロボティクス全くの未経験 2
Slide 3
Slide 3 text
⼤阪オフィスにUnitree Go2がやってきた 3
Slide 4
Slide 4 text
ジョインブログ https://dev.classmethod.jp/articles/unitree-go2-join-classmethod-osaka/4
Slide 5
Slide 5 text
⼤阪オフィスに来ることになった経緯 5
Slide 6
Slide 6 text
⼀⽅、クラスメソッド東京本社 今年の1⽉末に来ていた 6
Slide 7
Slide 7 text
⼀⽅、クラスメソッド東京本社 しかも2⽉末には⼈型まで来た (Unitree G1) 7
Slide 8
Slide 8 text
8
Slide 9
Slide 9 text
東京本社ばっかりうらやま 9
Slide 10
Slide 10 text
6⽉頭、社⻑来阪 犬型ロボくれ いいよ 10
Slide 11
Slide 11 text
6⽉頭、社⻑来阪 開発PCもい るよね? 11
Slide 12
Slide 12 text
6⽉末、RTX 5090 搭載 PC 着弾 - Ryzen 7 7800X3D DDR5-4800 64GB GeForce RTX 5090 32GB NVMe SSD 2TB 後から Ubuntu 24.04 導⼊ 12
Slide 13
Slide 13 text
7⽉末、DGX Spark 着弾 - GB10 - ユニファイドメモリ 128GB - メモリ帯域幅 273GB/s - NVMe SSD 4TB - Ubuntu ベースの DGX OS 13
Slide 14
Slide 14 text
余談 本社⾏けば、NVIDIA CEO ジェンスン‧ファン サイン⼊り DGX Spark が⾒れるかも 14
Slide 15
Slide 15 text
8⽉末、Unitree Go2 着弾 Unitree Go2 R&D Plus 発注から納品まで2ヶ⽉ 15
Slide 16
Slide 16 text
Unitree Go2 R&D Plus Unitree Go2 の開発⽤グレード 本体の背中に Jetson ORIN NX 16GB (100TOPS)搭載 公式 SDK や ROS 2 でプログラマブルに操作可能 プログラムや LLM をドック内に配置も可能 関節モーター12個、 4D LiDAR、 カメラ、⾜裏感圧センサー、 スピーカー、マイク搭載、RealSense 付属。
Slide 17
Slide 17 text
経緯まとめ 「⼤阪にもくれ」と⾔ったら来た -> 皆さんも参考にしてください。 今⽉頭に 3D プリンターもくれっていったら OK 出た。 17
Slide 18
Slide 18 text
Physical AI やっていき! 18
Slide 19
Slide 19 text
Physical AI とは 現実世界のデータを認識‧理解し、判断した結果を 物理的な動作として現実世界に作⽤させるAI ※ 国際的な標準化団体によって定義されている⾔葉ではない 19
Slide 20
Slide 20 text
Physical AI の活⽤例 - ⾃動運転 - AMR(⾃律⾛⾏搬送ロボット) - 配膳ロボット
Slide 21
Slide 21 text
Go2 も来たし、Physical AI やっていき! Developers IO 2026 Osaka で展⽰もするぞ! (1ヶ⽉前の話)
Slide 22
Slide 22 text
ただし、時間がない 部活動 専任ではない。あくまでも⽚⼿間で。 1⼈⽉案件にアサインされた状態でやっていき 22
Slide 23
Slide 23 text
⼤阪オフィスにUnitree Go2が やってきたので Physical AI やってみた。Vibe Coding で。 製造ビジネステクノロジー部 ふじい
Slide 24
Slide 24 text
展⽰内容について 24
Slide 25
Slide 25 text
ローカル VLM で完結して動く Unitree Go2 話しかけると、応えてくれる⽝型ロボット ⾔葉の意味を認識‧理解し、動作を選択 クラウドに繋がず推論はローカル(DGX Spark)で完結 25
Slide 26
Slide 26 text
やらなかったこと - AI エージェント, MCP, tool use の利⽤ 推論を Go2 内で⾏う完全⾃律動作 Isaac Sim/Isaac Lab を使った強化学習 歩⾏ 26
Slide 27
Slide 27 text
やりたかったけど、できなかったこと(時間的制約) - アナログ時計やアナログメーターを提⽰された時に、 値を読み取り、それに応じた⾔葉を⾃律的に発する展⽰ - 「3時」 -> 「おやつの時間ですね」 - 「35度」 -> 「熱中症に気をつけてください」 - ファインチューニング(メーター読みさせるなら) - AWS IoT - Snowflake 連携 27
Slide 28
Slide 28 text
Go2 の上に載っているもの reSpeaker XVF3800 マイクアレイ。音の方向がわかる SoundCore 2 AUX in 対応スピーカー。バッテリ搭載 RealSense D435i 深度カメラ モバイルバッテリー 機材に給電用 USB ハブ バスパワー対応 Type A ハブ USB WiFi ドングル ドックのネットワーク接続用 機材全部届いたの9月2週目 28
Slide 29
Slide 29 text
治具は 3D プリンター製 build123d という Python の ライブラリを使⽤して、バイブ コーディングで製作 全6パーツ 設計ミス出るも無理やり固定 印刷時間合計15時間ほど 29
Slide 30
Slide 30 text
アーキテクチャ 30
Slide 31
Slide 31 text
ドックと DGX Spark の役割 ドック DGX Spark マイクの⾳を送信 発話の切り出し、⾳声認識 スピーカーに声を送信 意図判定 カメラ映像と距離を送信 ⼈の検出 動作の命令を機体へ送信 返事の⽣成、⾳声合成 画⾯ 31
Slide 32
Slide 32 text
全体の構成1 32
Slide 33
Slide 33 text
全体の構成2 33
Slide 34
Slide 34 text
処理の流れ 34
Slide 35
Slide 35 text
DGX Spark で動くプロセス listen マイクの音から発話を切り出し、文字にする GPU cosmos 聞こえた文を意図判定し、返事も作る GPU perception カメラの映像から、一番近い人の距離と方向を出す CPU tts 返事の文を日本語の音声にする CPU orchestrator 対話の状態を管理し、画面と声を出す display ブラウザで画面を表示する 35
Slide 36
Slide 36 text
DGX Spark 側の構成 36
Slide 37
Slide 37 text
NVIDIA Cosmos 3 Nano(8B) NVIDIA 製世界基盤モデル: WFM(World Foundation Model) 画像や映像も⼊⼒として受け取れる - ビジョンリーズニング: 画像‧映像の内容を読み取り解説 - ワールド⽣成: ⼊⼒した動画のこの先の映像を作成する - アクション⽣成: 次に取る動作を出す 今回はビジョンリーズニングのみ使⽤ 8B で VRAM 約40GB ほど使⽤ 37
Slide 38
Slide 38 text
NVIDIA Parakeet NVIDIA 製⾃動⾳声認識(ASR)モデル ⾳声データをテキストに変換。⽇本語対応。⼩さくて速い。 2-4秒の発話を 30-80ms で⽂字にする。 DGX Spark では CPU 版よりも GPU 版の⽅が 12 倍速かった 0.6B で VRAM 2.6GB ほど使⽤ 38
Slide 39
Slide 39 text
AivisSpeech Engine ⽇本語⾳声合成エンジン。CPU のみ 1⽂を 0.5 秒ほどで⽣成可能 RAM 3GB 使⽤ ⾳声合成モデルは ACML 1.0 (商⽤利⽤可)のものを使⽤ 39
Slide 40
Slide 40 text
モデルのデプロイ⽅法がバラバラになってしまった Cosmos 3 vLLM 当初は NIM を計画するもライセンス問題から vLLM を使うことに変更 Parakeet NeMo 日本語の重みが NeMo 形式でのみ配布 YOLOX onnxruntime 公式が ONNX 形式の重みを配布 AivisSpeech Docker 公式が Docker イメージを配布 デプロイ先が DGX Spark でリソースに余裕があるので気にしてない 40
Slide 41
Slide 41 text
実測値 会話として成⽴する速さ 音声認識 29〜80ミリ秒 意図判定 中央値0.363秒。96件中92件が正解 モノを見て2文で答える 中央値1.46秒、最大1.79秒 音声合成(1文) 中央値0.5〜0.6秒。1秒ぶんの音声を0.3秒で作れる 人の検出 19〜21ミリ秒 41
Slide 42
Slide 42 text
開発周りのあれこれ 42
Slide 43
Slide 43 text
開発周りの数字(9/25時点) 開発⼈数: 1⼈ 期間: 約1ヶ⽉ 43 Pull Requests - 467 コミット - fix: 201 - docs: 128 - feat: 82
Slide 44
Slide 44 text
空⾏‧コメント⾏を除いたコード量。全部 AI 製 種類 行数 ファイル数 実装(DGX Spark・拡張ドック・共通・クラウド) 11,589 90 テスト 13,977 47 評価・計測のスクリプト 1,005 10 開発用のツール(規則の検査など) 1,070 11 治具(build123d) 1,175 10 プロンプト 78 3 ドキュメント 7,701 59 44
Slide 45
Slide 45 text
Orca がめっちゃ役に⽴った - DGX Spark 内で orca server を⽴ち上げ、⼿元の PC から接 続し、git worktree を駆使して Claude Code で並列開発 - 機材も DGX Spark に接続し、機材を使った開発もリモートでできた - 内蔵ブラウザで DGX Spark で開発中の画⾯を⼿元で⾒れる - DGX Spark 内で Claude Code を動かしているので、 PC のス リープやシャットダウンなど気にしなくてもいい - やろうと思えば Orca Mobile でスマホからも接続できる 45
Slide 46
Slide 46 text
OKF や ADR で事実や決定事項をドキュメント化 - OKF(Open Knowledge Format)形式で、Go2 や開発マシンや 周辺機器などの仕様や分かったことをドキュメント化 - 他メンバーが開発することを⾒越した対応 - ADR(Architecture Decision Records)形式でアーキテクチャの 判断と理由をドキュメント化 - これらのドキュメントの作成‧更新も全て AI 任せ - 意図せず勝⼿に決定事項とされたことが何度かあった - 複数セッションを通じて同じ認識で開発できる 46
Slide 47
Slide 47 text
Claude Code 周りの苦労話 - バイブコーディング。レビューも AI レビューのみ Team プラン(Premium Seat)の 5h 制限、週間制限がキツイ /code-review で修正後に再レビューでまだバグが出る 以下のようなプロンプトを⼊れて多少はましになったが、 「レビュー対応は局所的に直さず、全体的に⾒直して」 「実装したら批判的セルフレビューして」 - セルフレビュー忘れたり、局所的な修正だけしたりを何回も 繰り返していた…… - AI の独特な表現にうんざりする:「効く」「響く」急にロシア語 47
Slide 48
Slide 48 text
その他苦労した点 - 時間がない。9⽉は3回も 38℃の発熱 - Go2 ⾃体が3年前のモノなので正直中⾝が古い - Go2 のファン⾳がうるさすぎてマイクに声が拾われない - マイクの⾼さを上げて少しでもノイズ源から離しているが… - 半⼆重になってしまった - スピーカー再⽣中は、マイクで聞き取りができない - スピーカーの⾳をマイクが拾ってしまい無限ループ発⽣ - エコー除去(AEC)機能が悪さしている - 実機が無いとできないことが多い 48
Slide 49
Slide 49 text
反省点 作ることを最優先にしてしまった - ROS 2 や SDK 周りについて理解する段階をすっとばした - 出来上がったもの全てを理解できていない 49
Slide 50
Slide 50 text
まとめ 50
Slide 51
Slide 51 text
まとめ ローカルで完結できる Physical AI は閉域網で活躍できる - ローカルで完結できる分、推論や制御が速い - データを外部に送信しないで済む - センサーデータで常時推論させても AI 利⽤費はタダ 全てバイブコーディングでもここまでできる - 事実(OKF)、決定事項(ADR)をドキュメント化、多段 AI レ ビュー、仕組み化をバイブコーディングのハーネスとして活⽤ 51
Slide 52
Slide 52 text
展⽰⾒に来てね
Slide 53
Slide 53 text
No content