Slide 1

Slide 1 text

Screen Lens 今見ている画面を翻訳する komagata Omarchy TOKYO Meetup vol.1 2026 年 9 月 10 日

Slide 2

Slide 2 text

自己紹介 komagata https://x.com/komagata フィヨルドブートキャンプ オンラインプログラミングスクール https://bootcamp.fjord.jp/

Slide 3

Slide 3 text

DHH からの問いかけ “this is what perfect omarchy looks like for japan” DHH / Omarchy Japan での言葉 日本にとって理想の Omarchy をリストアップしてほしい そこで、日本で使うために必要なものを整理した

Slide 4

Slide 4 text

日本で使うためのベースライン 日本語キーボード配列が使える(解決済み) 日本語を入力できる 日本語で音声入力できる OS の UI が日本語になっている OS の標準ソフトウェアを日本語で使える マニュアルを日本語で読める( DHH が解決)

Slide 5

Slide 5 text

でも、理想の Omarchy って何だろう? もっとチャレンジングな機能が欲しい 理想は、画面全体が勝手に翻訳されること そこまでは無理だが、 Screen Lens というのを作りました。

Slide 6

Slide 6 text

アプリごとに翻訳するのは面倒 ブラウザ チャット Steam それぞれの英語を いちいち翻訳する 理想の翻訳 画面全体を自動で 翻訳してほしい

Slide 7

Slide 7 text

デモ 2026 年 9 月 10 日時点の試作 Super + Ctrl + J 今の画面を撮影して、日本語の静止画を表示 Space で原文と比較 / Esc かクリックで終了 静止画なので、元アプリの操作やスクロールはできない 翻訳時に、画面画像と認識した文字を OpenAI へ送信します。

Slide 8

Slide 8 text

翻訳前

Slide 9

Slide 9 text

翻訳後

Slide 10

Slide 10 text

仕組み 1. OCR :文字と位置を読み取る RapidOCR + ONNX Runtime ( PC 内の CPU ) 位置検出: PP-OCRv5 Mobile / 読み取り: PP-OCRv6 Small 2. 翻訳:画面の文脈も参考にする OpenAI GPT-5.6 Luna (クラウド API ) 文章・座標と画面画像を送り、日本語に訳す 3. 描画:元の位置に日本語を重ねる Pango / Cairo 背景色と文字サイズを調整し、静止画として表示

Slide 11

Slide 11 text

工夫したポイント:画面の文脈も渡す 認識した文章と位置 + 周辺の文字 + 画面画像 翻訳モデルが、画面の文脈も参考に意味を判断 たとえば “ Open” は、ファイルなら「開く」、店なら「営業中」 画像は意味を判断する手がかり。誤認識や誤訳は残る

Slide 12

Slide 12 text

まだ難しいところ 小さい文字や、途中で切れた文 読み落としや誤訳がある。大事な内容は原文で確認 日本語が元の枠に収まらない 文字が読みにくくなったり、英語のまま残ったりする 待ち時間とプライバシー ネット接続が必要。秘密情報を自動で隠す機能はない

Slide 13

Slide 13 text

まとめとこれから 画面を撮って、その位置で日本語を読む 次は、待ち時間の短縮と文字の読みやすさを改善 皆さんの理想の Omarchy には、何が欲しいですか? ソースコード・導入手順 https://github.com/komagata/screen-lens