Slide 1

Slide 1 text

© LayerX Inc. 帳票構造化タスクにおける LLMファインチューニングの性能評価 バクラク事業部 AI・機械学習部 AI-OCRチーム 吉田 陽祐 YOSHIDA, Yosuke DAY06 topic Deep into AI Speaker

Slide 2

Slide 2 text

© LayerX Inc. ● 帳票構造化タスクの概要 ● LLMファインチューニングの実験設定 ● 実験結果 ● まとめ 今⽇話すこと

Slide 3

Slide 3 text

© LayerX Inc. タスク概要

Slide 4

Slide 4 text

© LayerX Inc. タスク概要 ● ⼊⼒: OCRによる帳票からの⽂字検出結果 ● 出⼒: 細分化された⽇付‧⾦額‧取引先名 27ラベル (JSON) ○ ⽇付: 5ラベル (発⾏⽇、請求⽇ など) ○ ⾦額: 10ラベル (請求⾦額、未払⾦額 など) ○ 取引先名: 12ラベル (発⾏会社名、部署、担当者名 など) ○ JSON Schemaで定義 タスク概要 帳票から ⽇付‧⾦額‧取引先名 を抽出して構造化

Slide 5

Slide 5 text

© LayerX Inc. タスク概要 ● スキーマ適合率 (Valid JSON) ○ JSON Schemaに準拠した出⼒の件数 / 帳票の総数 ○ プロパティの⽋損は許容し、null埋め 評価指標 評価指標は スキーマ適合率 と 正解率 ● 正解率 (Accuracy) ○ 正解した件数 / 帳票に正解が存在するラベルの総数 ○ 帳票に正解が存在しないケースとしては領収書に⽀払期限が無い、など ○ 推論結果がスキーマに適合していない場合はすべてのラベルで不正解

Slide 6

Slide 6 text

© LayerX Inc. 実 験

Slide 7

Slide 7 text

© LayerX Inc. 実 験 ● 軽量(~8B)、Chat対応 のモデルを選定 ○ Qwen3-4B ○ Qwen3-8B ○ Llama-3-ELYZA-JP-8B ○ Llama-3.1-Swallow-8B-Instruct-v0.5 ● ベースラインとして⼤規模な商⽤モデルである Claude Sonnet 4 による Zero-shot 評価も実施 モデル選定

Slide 8

Slide 8 text

© LayerX Inc. 実 験 学習設定 QLoRA 4bit量⼦化 でファインチューニング

Slide 9

Slide 9 text

© LayerX Inc. 実 験 ● 実験環境 ○ NVIDIA RTX 6000 Ada (48GB) ● データセット ○ 社内でアノテーションしたデータから学習⽤に 6166件、評価⽤に 1588件 選定 ■ 学習⽤データセットからランダムに 2000件 選び、ファインチューニングを3回実施 ○ OCRの⽂字検出結果は先頭から最⼤ 4096⽂字 を使⽤ ● Chat形式と損失計算 ○ Chat形式で assistant role の応答のみ損失計算 ○ Qwen3は Function Callling (Tool Use) でそれ以外は通常のChat形式で学習を実施 学習設定

Slide 10

Slide 10 text

© LayerX Inc. 実 験 学習設定 assistant roleの応答

Slide 11

Slide 11 text

© LayerX Inc. 結 果

Slide 12

Slide 12 text

© LayerX Inc. 結 果 ● Before: 最も性能が⾼いQwen3-8Bでもスキーマ適合率 17.3%、正解率 7.9% ● After: すべてのモデルでスキーマ適合率は 99.6% 以上 、正解率は平均 76.5% に改善 ファインチューニング前後の性能⽐較

Slide 13

Slide 13 text

© LayerX Inc. ● Qwen3-4B ○ ⾦額で最も⾼い正解率、総合でも2位を記録したが、精度にややばらつきがみられた ○ 4Bと⼩型モデルながら⾼性能で、軽量モデルのベースラインとして有⼒ 結 果 ラベルタイプ別の正解率 モデル 金額 日付 取引先名 総合 (※) Qwen3-4B 79.12% 80.55% 72.88% 76.96% (±1.03) Qwen3-8B 78.19% 81.97% 72.34% 76.81% (±1.15) Llama-3-ELYZA-JP-8B 72.69% 81.50% 72.35% 74.90% (±0.21) Llama-3.1-Swallow-8B-Instruct-v0.5 74.70% 83.21% 75.75% 77.40% (±0.44) (※) カッコ内の数字は標準偏差

Slide 14

Slide 14 text

© LayerX Inc. ● Qwen3-8B ○ Qwen3-4Bと⽐べて明確な精度向上は⾒られず ○ 同⼀の学習設定が8Bに最適でなかった可能性や、モデルサイズの差が影響しにくいタスク であったことなどが要因と考えられる 結 果 ラベルタイプ別の正解率 モデル 金額 日付 取引先名 総合 (※) Qwen3-4B 79.12% 80.55% 72.88% 76.96% (±1.03) Qwen3-8B 78.19% 81.97% 72.34% 76.81% (±1.15) Llama-3-ELYZA-JP-8B 72.69% 81.50% 72.35% 74.90% (±0.21) Llama-3.1-Swallow-8B-Instruct-v0.5 74.70% 83.21% 75.75% 77.40% (±0.44) (※) カッコ内の数字は標準偏差

Slide 15

Slide 15 text

© LayerX Inc. 結 果 ● Llama-3.1-Swallow-8B-Instruct-v0.5 ○ ⽇付と取引先名で最も⾼い正解率を記録し総合でもトップ ○ 異なる学習データに対しても正解率のばらつきが⼩さく安定 ラベルタイプ別の正解率 モデル 金額 日付 取引先名 総合 (※) Qwen3-4B 79.12% 80.55% 72.88% 76.96% (±1.03) Qwen3-8B 78.19% 81.97% 72.34% 76.81% (±1.15) Llama-3-ELYZA-JP-8B 72.69% 81.50% 72.35% 74.90% (±0.21) Llama-3.1-Swallow-8B-Instruct-v0.5 74.70% 83.21% 75.75% 77.40% (±0.44) (※) カッコ内の数字は標準偏差

Slide 16

Slide 16 text

© LayerX Inc. ● Claude Sonnet 4 は⾦額や⽇付において最も⾼い正解率となり、総合でもトップ ● ⼀⽅で、取引先名の正解率は最下位、 他のモデルと⽐較して10ポイント以上下回る結果 ○ ⼈名やレシートの店名などの⽇本特有の固有名詞の扱いが苦⼿ 結 果 ラベルタイプ別の正解率 / Claude Sonnet 4 との⽐較 モデル 金額 日付 取引先名 総合 Qwen3-4B 79.12% 80.55% 72.88% 76.96% (±1.03) Qwen3-8B 78.19% 81.97% 72.34% 76.81% (±1.15) Llama-3-ELYZA-JP-8B 72.69% 81.50% 72.35% 74.90% (±0.21) Llama-3.1-Swallow-8B-Instruct-v0.5 74.70% 83.21% 75.75% 77.40% (±0.44) Claude Sonnet 4 (※) 86.45% 87.60% 64.36% 77.74% (※) Claude Sonnet 4のスキーマ適合率は100% (リトライ処理有り)

Slide 17

Slide 17 text

© LayerX Inc. まとめ

Slide 18

Slide 18 text

© LayerX Inc. ● ドメイン特化タスクにおけるファインチューニングの有効性 ○ ベースモデルでは困難だった帳票構造化タスクが精度面では実用レベルに到達 ○ 少量データ(2000件)でも十分な性能向上を果たした まとめ まとめ ● 軽量モデルの可能性 ○ 8B以下のモデルでもラベルによっては Claude Sonnet 4 を上回る正解率 ○ 特に Qwen3-4B は他の8Bモデルと同等の正解率