Slide 1

Slide 1 text

DETRをプロダクト導入して 見えた強みと弱み Sansan株式会社 竹長 技術本部 慎太朗 研究開発部

Slide 2

Slide 2 text

竹長 慎太朗 技術本部 研究開発部 Automationグループ 博士(社会工学) 写真が入ります 2015年 4月 〜 2021年 3月:近畿大学(学士,修士) 2021年 4月 〜 2024年10月:筑波大学(博士) 2024年10月 〜 現在 :Sansan株式会社 興味がある分野:コンピュータビジョン,ブラックボックス最適化

Slide 3

Slide 3 text

アジェンダ - DETRを導入する動機 - 物体検出とは - CNN系の検出器 - Transformer系の検出器 - CNN系とTransformer系の比較 - DETRを導入するまで - DETRと向き合って見えた強みと弱み - まとめ

Slide 4

Slide 4 text

名刺画像はダミーです Detection Transformer(DETR)を導入する動機 発端は内製の名刺特化のOCRエンジン「NineOCR」の運用見直し NineOCR:検出と認識の2段階で構成されるエンジン 海達␣道信 千代田飲料株式会社 東京都千代田区万田 55-83-6 千代田ビル

Slide 5

Slide 5 text

NineOCRが抱えていた課題 NineOCRは2021年にリリースされ,数年が経過しメンテナンスが必要に 特に,検出器(VFNet [Zhang et al, 2021] )に様々な課題が存在 - Python3.10 ⇨ 2026年10月にEOL - CUDA11 ⇨ 動作可能なGPUの枯渇が目前 - PyTorch1.1x ⇨ CUDA12では動作しないバージョンも存在 - MMDetection ⇨ 長期間更新されていない 継続するために,実装の見直し or モデル自体のリプレイスも検討

Slide 6

Slide 6 text

名刺画像はダミーです 物体検出とは 物体の位置とそのクラスの両方を認識するタスク full_name company_name 現在,大きく分けるとCNN・Transformerをベースとした2系統が存在 CNN系: ✓SSD ✓RetinaNet ✓FCOS ✓VFNet [Liu et al., 2016] [Lin et al., 2017] [Tian et al., 2019] [Zhang et al., 2021] Transformer系: ✓ DETR ✓ Deformable DETR ✓ RT-DETR ✓ DEIM [Carion et al., 2020] [Zhu et al., 2021] [Zhao et al., 2024] [Huang et al., 2025]

Slide 7

Slide 7 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. CNN系の検出器 1つの対象に対して複数の検出候補を出力するため,後処理を含めた設計が必要 ⇨多くの検出候補を出力するため再現率が高い傾向 後処理

Slide 8

Slide 8 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. CNNにおける検出方法の変化 - アンカーベースの検出器(例:SSD, RetinaNet) 基準領域から検出物体への変位(オフセット)を予測 Detector モデルの出力結果 後処理を適用した結果

Slide 9

Slide 9 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. CNNにおける検出方法の変化 - アンカーフリーの検出器(例:FCOS, VFNet) FPNのマルチスケール特徴上の各点から,物体境界までのオフセットを直接予測 Detector モデルの出力結果 後処理を適用した結果 特徴点の例 FCOS [Tian et al., 2019]

Slide 10

Slide 10 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. CNNの検出器における後処理 後処理の例として, NMS:確信度順に矩形を選択し,重複する候補を除去 Soft-NMS [Bodla et al., 2017] :重複矩形の確信度を低減 Weighted Boxes Fusion [Solovyev et al., 2021]:確信度に基づく矩形の重み付き統合 NMS Soft NMS WBF

Slide 11

Slide 11 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. 後処理(NMS)の難しさ 確信度閾値とNMSのIoU閾値を変えたときの結果 IoU=0.2 Conf=0.1 Conf=0.2 Conf=0.3 IoU=0.3 IoU=0.4 IoU=0.5

Slide 12

Slide 12 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. Transformer系の検出器 正解物体と予測の1対1の対応付けにより,NMS不要のEnd-to-End検出を実現 ⇨集合予測として定式化し,物体と予測を1対1で対応付けながら学習 後処理

Slide 13

Slide 13 text

DETR [Carion et al., 2020] Encoderで得られた画像特徴量と学習可能なベクトル(オブジェクトクエリ)を Decoderに入力し,各クエリが1つの物体を予測 オブジェクトクエリ数が検出可能な物体数の上限

Slide 14

Slide 14 text

DETRの関連研究 学習収束の遅さ・計算量・小物体検出などの課題が存在 - Efficient DETR [Yao et al., 2021] :クエリ初期化を改善し,学習を高速化 - Deformable DETR [Zhu et al., 2021] :Attention対象を限定し,計算量を削減 - DINO [Zhang et al., 2023] :Denoising学習で精度と収束性を向上 - RT-DETR [Zhao et al., 2024] :効率的なHybrid Encoderで計算量を削減 - DEIM [Huang et al., 2025] :Matchingを改善し,学習を高速化 RT-DETRで,Transformer系でもCNN系に匹敵する性能・処理速度を実現

Slide 15

Slide 15 text

Deformable DETR [Zhu et al., 2021] - 画像全体へのAttentionを,参照点周辺の少数の特徴点に限定 - マルチスケール特徴を利用し,小物体の検出性能を改善 ⇨Attentionの計算量を削減し,DETRの学習収束を高速化 Attention計算のイメージ

Slide 16

Slide 16 text

RT-DETR [Zhao et al., 2024] - 画像特徴から物体らしい特徴を選択し,オブジェクトクエリを生成 - 選択した位置・矩形を参照情報としてDecoderに入力 - Decoderの各層でクラスと矩形を予測し,矩形を反復的に補正

Slide 17

Slide 17 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. RT-DETR [Zhao et al., 2024] - 画像特徴から物体らしい特徴を選択し,オブジェクトクエリを生成 - 選択した位置・矩形を参照情報としてDecoderに入力 - Decoderの各層でクラスと矩形を予測し,矩形を反復的に補正 Detector モデルの出力結果 オブジェクトクエリは300個 確信度による閾値処理後

Slide 18

Slide 18 text

Source: MS COCO 2017, image ID 210273 (original image: CC BY 2.0). Bounding boxes added. CNN系とTransformer系の比較 CNN系 メリット:高速・軽量で,低スペック環境でも動作しやすい デメリット:重複候補が多く,NMSなどの後処理が必要 Transformer系 メリット:重複候補が少なく,NMSが不要 CNN系の後処理前 デメリット:計算量・メモリ使用量が大きい Transformer系の後処理前

Slide 19

Slide 19 text

CNN系とTransformer系のどちらを選択するのか 要件:VFNet (CNN系)と同等の検出性能と処理速度 RT-DETRまで性能が向上すると,CNN系・Transformer系のどちらも選択肢に ✓ NMSを不要とする後処理の単純化とパラメータ依存の低減 ✓ Transformerを基盤としたマルチモーダル研究への発展性 ✓ 対象ドメインにおけるTransformer系の導入事例の少なさ 性能だけでなく,後処理の単純化や将来拡張性も考慮し,VFNetをRT-DETRへ 置き換える方針を選択

Slide 20

Slide 20 text

DETRを導入するまで Step1:VFNetと同等の検出性能を持つRT-DETRの構築 ✓ mAP・mIoUによる検出器単体の性能評価 Step2:検出器置き換えによる下流モデル・システムへの影響確認 ✓ NineOCR:検出から認識まで含めたE2E評価 ✓ GEES:実運用フローを模擬したシャドウテスト GEESは人と機械を組み合わせた独自名刺データ化システム モデル単体の性能だけでなく,利用箇所を含めたシステム全体での影響評価

Slide 21

Slide 21 text

名刺画像はダミーです Step1:VFNetと同等の検出性能を持つRT-DETRの構築 学習後,mAP・mIoUによる検出器単体の性能評価を実施 特に,OCRではIoUの解釈が重要 黒:正解 緑:IoU=0.813 text = “水上␣弘太郎” 赤:IoU=0.703 text = “水ト␣弘太郎” 青:IoU=0.485 text = “水上␣弘太郎” IoUが高い矩形が必ずしも最適とは限らないため,E2Eでの評価が必須

Slide 22

Slide 22 text

名刺画像はダミーです Step2:検出器置き換えによる他のモデルへの影響確認 NineOCRは検出と認識の2段階の構成なので,認識器を含めたE2Eの評価が必要 ⇨名刺画像を取得し,手元の環境でE2E評価を実施 GEESの処理でもNineOCRが使用されているため影響の確認が必要 ⇨既存のシャドウテスト環境を利用し,GEES側への影響も評価 通常の流入 GEES シャドウテスト 納品される 納品されない 検出器だけを置き換え,実際のフローで確認することで,リリース時の影響を事前に把握可能

Slide 23

Slide 23 text

DETRと向き合って見えた強みと弱み 強み: ✓ 後処理の単純さ NMSが不要で,閾値処理中心のシンプルな構成 ✓ 検出の安定性 今回の名刺項目検出では,文字の一部だけを拾うような意図しない検出が少ない ✓ 推論全体の処理速度 NMSなどの複雑な後処理が不要で,デプロイ時にはVFNet比で約2倍高速化 弱み: ✓ 再現率 CNN系と比べてエッジケースの見逃しが出やすい傾向 ✓ 実行環境への依存 GPU利用を前提とし,CPU推論では速度面が厳しい GPU利用を前提とするプロダクトでは,RT-DETRは有力な選択肢

Slide 24

Slide 24 text

まとめ DETRのプロダクト導入を通じて,実運用上の強みと課題を確認 解きたいタスクに応じた検出器の選択が必要 ✓ NMS不要による後処理の単純化と保守性の向上 ✓ エッジケースに対する再現率と学習データの課題 ✓ GPU利用を前提とする点と,CPU推論の速度制約 実運用を通じて,評価指標だけでは見えない特性を把握 ✓ OCRでは検出指標だけでなく,下流タスクまで含めた評価の必要性

Slide 25

Slide 25 text

No content