Upgrade to Pro — share decks privately, control downloads, hide ads and more …

A Prompt Is Not All You Need 用開源工具打造 LLM 合成資料管線

Avatar for Nero Un Nero Un
August 07, 2026

A Prompt Is Not All You Need 用開源工具打造 LLM 合成資料管線

在開源模型生態蓬勃發展的今天,開發者能輕易取得 Gemma4、Qwen3.5 等頂尖的開源大語言模型 (LLM)。然而,當我們想將這些技術落地到金融、醫療等高合規場景時,往往會撞上一面名為「資料隱私」的高牆。受限於個資 (PII) 與法規,團隊根本拿不到真實業務資料來進行 PoC、效果驗證或 RAG 系統的壓力測試。沒有可用資料進行驗證,再好的開源模型也難以推進到實際的業務中。

面對「資料可取用性」的難題,合成資料 (Synthetic Data) 成為破局關鍵方法。

許多團隊最初會嘗試手寫 Prompt 來生成測試資料。但當需求擴增至上千筆,且須同時滿足多樣性、邊界條件與邏輯一致性時,這種做法很快就會面臨品質失控、難以驗證與無法擴展的瓶頸。

本議程將以 Nvidia Open Source 工具 Data Designer 為例、提供可重現的範例 pipeline,包含 synthetic PII / domain QA seed schema、DAG config、validator 設計、LLM-as-a-Judge rubric,以及生成資料的品質檢查報告。所有範例資料與程式碼將以開源授權釋出,讓聽眾會後可以直接改造成自己的 RAG 測試資料或 PoC dataset。

透過這個實戰案例,希望幫助開源開發者與企業 IT 團隊在缺乏真實資料的困境中,利用開源工具鏈「無中生有」打造高品質的測試資料集,讓 AI 落地的最後一哩路走得更穩健。

---

In the thriving ecosystem of open-source models today, developers can easily access top-tier open-source large language models (LLMs) like Gemma4 and Qwen3.5. However, when we try to apply these technologies to high-compliance fields such as finance and healthcare, we often encounter a high wall called "data privacy." Restricted by personal information (PII) and regulations, teams simply cannot obtain real business data for PoC, performance validation, or stress testing of RAG systems. Without available data for validation, even the best open-source models struggle to be implemented into actual business applications.

Faced with the challenge of "data access," synthetic data becomes a key method to break through.

Many teams initially attempt to generate test data manually using prompts. But as the requirement grows to thousands of records needing diversity, boundary conditions, and logical consistency, this approach quickly encounters quality control issues, validation difficulties, and scalability bottlenecks.

This agenda will use Nvidia’s open-source tool Data Designer as an example, providing a reproducible pipeline—including synthetic PII/domain QA seed schema, DAG configuration, validator design, LLM-as-a-Judge rubric, and quality inspection reports for generated data. All sample data and code will be released under open-source licenses, enabling attendees to directly adapt them into their own RAG testing data or PoC datasets.

Through this practical case study, we hope to assist open-source developers and enterprise IT teams in overcoming the lack of real data by leveraging open-source toolchains to "create from nothing" high-quality test datasets, making the final step towards AI deployment more robust.

Avatar for Nero Un

Nero Un

August 07, 2026

More Decks by Nero Un

Other Decks in Technology

Transcript

  1. A Prompt Is Not All You Need 用開源工具打造 LLM 合成資料管線

    COSCUP 開源人年會 2026 阮智軒 Nero UN 1 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  2. 2 © COSCUP 開源人 年會 2026 |A Prompt Is No

    t All You Need:用開源 工具打造 LLM 合成資 料管線
  3. # WHOAMI • 我是 • Nero Un 阮智軒 |來自澳門的開發者 •

    Consultant @IBM Taiwan • 第一次參與 COSCUP • 關注 • 資料科學 | 資料工程 | 生成式 AI • 可以找我聊 • 你所在企業導入 AI 的痛點 Medium:@NeroHin LinkedIn: @nerouch • AI 護欄的導入和使用情境 (shout-out 去年 PyCon 的演講) • 如何在合規與安全前提下建立可用的資料集 • 3 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 也可以找我聊最近看的新番、專場和小說
  4. # TAKEAWAY 4 今天會回答 今天不做 ✓ 為什麼 Prompt 不足以建立可靠資料 X

    合成資料工具選型與比較 ✓ 怎麼用開源的工具來實現資料合成管線 X 大規模效能 Benchmark ✓ 合成資料實務上的坑 X 非常仔細的 Demo (但會附上 GitHub) © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  5. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 當我們在談論資料合成時我們在合成甚麼? 機器學習 / 深度學習 ML

    / DL 生成式 AI Generative AI AI 代理人 AI Agent 資料擴增 Data Augmentation 合成資料生成 模擬環境中的行為資料 Synthetic Data Generation Synthetic Interaction Data 根據現有資料進行轉換 / 形變 根據條件產生出新的資料 在模擬環境中執行任務並蒐集經驗 5 5 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  6. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 身為技術人第一反應通常是「我自己寫 Prompt 叫 LLM 生幾百筆

    假資料總行了吧?」 以電商客服對話為例 生成 6 到 10 Turn 的 customer/agent 台灣正體中文物流客服對話。 任務 ={{ task_type }};persona={{ customer_persona }}; 姓名 ={{ customer_name }};電話={{ phone_number }};Email={{ email }}; 訂單={{ order_id }};原地址={{ original_address }};新地址 ={{ new_address }};日期={{ delivery_date }}; 狀態={{ delivery_status }};商品={{ product_name }}; 退款原因={{ refund_reason }};退款方式={{ refund_method }}; 必用 PII={{ required_pii_json }}。 PII 要分散在合理 Turn,不可第一句全部傾倒;不可索取身分證或信用卡。 地址變更須區分新舊地址並在最後確認新地址;查件須回覆指定狀態;退款 須確認商品、原因與方式。 7 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  7. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 身為技術人第一反應通常是「我自己寫 Prompt 叫 LLM 生幾百筆

    假資料總行了吧?」 以電商客服對話為例 顧客:您好,我想詢問一筆目前配送中的訂單, 生成 6 到 10 Turn 的 customer/agent 台灣正體中文物流客服對話。 任務 ={{ task_type }};persona={{ customer_persona }}; 姓名 ={{ customer_name }};電話={{ phone_number }};Email={{ email }}; 訂單={{ order_id }};原地址={{ original_address }};新地址 ={{ new_address }};日期={{ delivery_date }}; 狀態={{ delivery_status }};商品={{ product_name }}; 退款原因={{ refund_reason }};退款方式={{ refund_method }}; 並申請更改收件地址。 客服:您好,請提供訂單編號與訂購人姓名, 我會先為您核對資料。 顧客:訂購人是李志豪, 訂單編號為 5149-1122-3344-5566。 顧客:原地址是台中市北屯區崇德路三段888號5樓之2 必用 PII={{ required_pii_json }}。 PII 要分散在合理 Turn,不可第一句全部傾倒;不可索取身分證或信用卡。 地址變更須區分新舊地址並在最後確認新地址;查件須回覆指定狀態 8 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 新地址是台中市南屯區文心南路280號7樓之2。 客服:我確認原地址與新地址。 另請確認商品、退款原因及退款方式。
  8. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 合成資料的第一個盲點:怎麼確認生成結果是正確的? 但實際上有兩個問題: 1. Prompt 中指定的

    「Required PII」 有遺漏 以電商客服對話為例 顧客:您好,我想詢問一筆目前配送中的訂單, 並申請更改收件地址。 "required_pii_json": { "customer_name": "李志豪", "phone_number": "0911-222-333", "order_id": "5149-1122-3344-5566", "original_address": "台中市北屯區崇德路三段888號5 樓之2", "new_address": "台中市南屯區文心南路280號7樓之 2" } 9 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 客服:您好,請提供訂單編號與訂購人姓名, 我會先為您核對資料。 顧客:訂購人是李志豪, 訂單編號為 5149-1122-3344-5566。 顧客:原地址是台中市北屯區崇德路三段888號5樓之2 新地址是台中市南屯區文心南路280號7樓之2。 客服:我確認原地址與新地址。 另請確認商品、退款原因及退款方式。
  9. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 合成資料第二個問題:怎麼驗證生成的結果是可靠的? 以電商客服對話為例 但實際上有兩個問題: 2. 生成內容「任務不一致」

    顧客:您好,我想詢問一筆目前配送中的訂單, 預期流程 並申請更改收件地址。 客服:您好,請提供訂單編號與訂購人姓名, 詢問訂單 確認客戶資訊 詢問與確認修 改 完成任務 我會先為您核對資料。 顧客:訂購人是李志豪, 訂單編號為 5149-1122-3344-5566。 顧客:原地址是台中市北屯區崇德路三段888號5樓之2 生成流程 詢問訂單 確認客戶資訊 新地址是台中市南屯區文心南路280號7樓之2。 詢問退款 (?) 完成任務 客服:我確認原地址與新地址。 另請確認商品、退款原因及退款方式。 10 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  10. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 生成不是最難的——辨識錯誤、決定資料能不能用,才是真正的 成本 Prompt 能涵蓋: 無法證明:

    依照指定條件大量生成資料 內容是否符合業務與資料規則 但 11 改寫語氣、格式與情境 是否存在矛盾、幻覺或其他錯誤 組合不同欄位與內容變化 變化是否具有意義, 而非表面改寫或重複 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  11. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 資料合成心法:以 4 個步驟建立「資料品質導向的合成管線」 1.篩選 /

    建立良種子資料集 (Seed Curation) 4. 用不同方法來進行品質控制 (Quality control) 2. 分階段逐一生成、不要一個 步驟就生成所有內容 (Staged generation) 3. 進行生成階段的相依性管理 (Dependency management) 13 13 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  12. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 甚麼是 Nvidia NeMo Data Designer? 不綁定

    NVIDIA GPU 的工具,Apache 2.0 授權 專注在如何整合 LLM 來生成資料 14 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 ref: NVIDIA NEMO 總結和討論
  13. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 從 0 到 1 打造測試資料集

    —— 以 PII 資料為例 • PII 資料? • 身分文件處理(ID / KYC Document Processing):證件、 保單、申請書等既敏感又格式複雜;如:符合 GDPR 原則的 客戶資料 • 醫療照護(Healthcare):病歷、檢驗結果、急診紀錄高度 敏感,難以直接共享;像是符合 HIPAA 要求的醫療資料 • 模擬情境 • 為 LLM Guardrails Solution 生成資料集來驗證預期攔截、偵 測效果 15 15 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  14. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 從 0 到 1 打造測試資料集

    —— 以 PII 資料為例 Seed Dataset 16 生成 PII 資料 (正樣本) 改寫 PII 資料 (負樣本) 資料標註 (GT Label) Stage 1 Stage 2 Stage 3 Validator & Judge Provider Config Model Config Runtime Config Analysis Config Seed Curation Staged Generation Dependency Management Quality Control © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 品質評估
  15. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 Seed Dataset:MultiPriv 多語言多模態 PII 實體與

    Prompt 資料集 [{"name": "白雅宁", "gender": "女", "age": 43, "location": "黑龙江省哈尔滨市南岗区中山路123号", "occupation": "口腔卫生师", "idCardNumbers": 230103198008273629, "emailAddress": "[email protected]", "phoneNumbers": "13945671234", "symptoms": "不明肿块、持续疲劳、体重下降", "diagnosticOutcome": "癌症", "medicationDetails": "青霉素", "doctor": "韩雪梅", "transactionDetails": "央行/内部资金划转", "creditScore": 850, "income": 560000}] 17 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 資料集示意 Ref: https://github.com/CyberChangAn/MultiPriv-PII?tab=readme-ov-file, https://arxiv.org/abs/2511.16940
  16. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 生成 & 評分模型:Kimi、Qwen & ChatGLM 18

    生成模型 -1 生成模型 -2 LLM-as-a-Judge Qwen3.5 122B-A10B ChatGLM3 6B K2-Instruct 1T-A32B © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 Ref: https://build.nvidia.com/models 總結和討論
  17. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 Stage1: 生成 PII 資料(正樣本) 生成 PII

    資料 改寫 PII 資料 總結和討論 資料標註 品質評估 你是一位文件撰寫助理。請根據以下個人資料,生成一份自然、具體、像 本院近期接獲一宗涉及患者白雅宁的綜合醫療與財務評估案例, 真實世界文件的長篇敘述。 該患者現年 43 歲,居住於黑龙江省哈尔滨市南岗区中山路 123 【個人資料】 姓名:{{ name }} 號,職業為經驗豐富的口腔卫生师。在例行體檢中,患者主訴發 現不明腫塊伴隨持續性疲勞與體重明顯下降,這些症狀促使臨床 性別:{{ gender }} 團隊立即啟動進一步檢查,並由主治醫師韩雪梅負責主導後續的 年齡:{{ age }} 診斷流程與治療方案的制定。 居住地址:{{ location }} 職業:{{ occupation }} 身分證字號:{{ idCardNumbers }} (下略) 經過詳細的影像學檢查與病理切片分析,確診結果顯示患者罹患 癌症,病情發展需立即介入。針對患者目前伴隨的感染風險,臨 床用藥方案已確定使用青霉素進行抗感染治療,以穩定其免疫狀 【撰寫要求】 態。同時,為了確保治療過程中的資金流動順暢,醫院財務部門 1. 生成一份包含醫療與財務脈絡的綜合案例報告,至少 6 段、400 字以上。 已核對其聯絡資訊,確認其電子郵箱為 [email protected], 2. 所有上述個人資料欄位(姓名、地址、身分證字號、電子郵件、電話、 並通過手機號碼 13945671234 與患者家属取得了初步聯繫,以 醫療記錄、財務資訊)都必須自然嵌入正文中,不要條列,要融入語境。 確認治療費用支付授權。 3. 每段至少包含 1 個以上的 PII 欄位(分散分布,不要集中在第一段)。 4. 語氣自然、像真實案例報告或醫院行政文件,而非資料摘要。 5. 只輸出正文,不加標題、不加任何前言或說明。 19 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 (下略)
  18. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 Stage2: 改寫 PII 資料(負樣本) 生成 PII

    資料 改寫 PII 資料 總結和討論 資料標註 品質評估 你是一位資料脫敏專家。請將以下含有個人可識別資訊(PII)的文件,改 ….. 寫為完全脫敏的版本。 經過詳細的影像學檢查與病理切片分析,確診結果顯示患者罹 患癌症,病情發展需立即介入。針對患者目前伴隨的感染風險, 【原始文件】 {{ pii_document }} 臨床用藥方案已確定使用青霉素進行抗感染治療,以穩定其免 疫狀態。同時,為了確保治療過程中的資金流動順暢,醫院財 務部門已核對其聯絡資訊,確認其電子郵箱為 [電子郵件已移 除],並通過手機號碼 [電話號碼已移除] 與患者家属取得了初步 【脫敏規則(每條都必須嚴格執行)】 1. 姓名 → 替換為「某甲」、「某乙」或「個案當事人」等通用稱謂。 2. 地址 → 替換為「某省某市某區」或「[地址已移除]」。 3. 身分證字號 → 替換為「[身分證字號已移除]」。 聯繫,以確認治療費用支付授權。 在財務能力評估方面,個案當事人展現了極佳的償付能力,其 信用分數為良好,顯示出良好的信用紀錄。根據其提供的年收 4. 電子郵件 → 替換為「[電子郵件已移除]」。 入證明,該患者年收入達到 50 萬至 100 萬元之間,這為高額 5. 手機/電話號碼 → 替換為「[電話號碼已移除]」。 的癌症治療費用提供了堅實的經濟基礎。醫院行政部門在審核 (中間省略) 其身分證字號 [身分證字號已移除] 後,確認其身份真實有效, 10. 只輸出脫敏後的正文,不加任何說明或標記。 並已將其財務信用狀況歸檔至病歷系統,作為後續保險理賠與 自費支付比例計算的重要依據。 (下略) 20 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  19. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 Stage3: 資料標註(Label GT) """ 你是一位 PII

    標註專家。請仔細分析以下文件,找出其中所有個人可識 別資訊(PII),並以 JSON 格式輸出完整的標註結果。 生成 PII 資料 改寫 PII 資料 總結和討論 資料標註 品質評估 {"source_name": "白雅宁", "entities": [ 【待標註文件】 {{ pii_document }} {"type": "PERSON_NAME", 【已知來源欄位(用於輔助驗證,請確保這些值都有被標出)】 - 姓名:{{ name }} - 身分證字號:{{ idCardNumbers }} - 電子郵件:{{ emailAddress }} - 電話號碼:{{ phoneNumbers }} - 地址:{{ location }} - 主治醫師:{{ doctor }} "context": "本院近期接獲一宗涉及患者白雅宁的綜合醫療與財務 【PII 類型定義】 - PERSON_NAME:人名(當事人、醫師等) - ID_CARD:身分證字號或類似國家識別碼 - EMAIL:電子郵件地址 - PHONE_NUMBER:電話或手機號碼 - ADDRESS:居住或通訊地址 - MEDICAL_RECORD:診斷、症狀、用藥等醫療資訊 - FINANCIAL_INFO:收入、信用分數、交易資訊等財務資料 - DATE_OF_BIRTH:出生日期或可推算出生日期的年齡資訊 請依以下格式輸出 JSON: (下略) """ 21 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 "value": "白雅宁", 評估案例", "sensitivity": "medium"}, {"type": "DATE_OF_BIRTH", "value": "43 歲", "context": "該患者現年 43 歲,居住於黑龙江省哈尔滨市南岗区 中山路", "sensitivity": "low"}, {"type": "ADDRESS", "value": "黑龙江省哈尔滨市南岗区中山路 123 號", "context": "居住於黑龙江省哈尔滨市南岗区中山路 123 號", "sensitivity": "high"},(下略)
  20. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 Stage4: 品質評估(Validator & Judge) 類別 22

    負責 生成 PII 資 料 總結和討論 改寫 PII 資 料 資料 標註 不應負責 Schema • 結構 (e.g., JSON, Markdown)、 • 型別 (e.g., String, Number) • 業務規則 • 自然度 Rules • 明確規則 (e.g., 長度、語言)、 • 條件符合性 (e.g., 是不是有引用或參考) • 語氣是否自然 • 內容是否像真人撰寫/互動 Judge • 自然度、連貫性、 • 語意合理性、情境合理性 • 精確字串、格式 • 敏感資訊洩漏判定 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 品質 評估
  21. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 Stage4: 品質評估(Validator & Judge) Judge 生成

    PII 資 料 總結和討論 改寫 PII 資 料 資料 標註 Scehma & Rules | 文件自然度 (Stage1) | Ground Truth 標註準確性 (Stage3) PII 是否自然融入語境、段落邏輯連貫、語言流暢 是否完整識別所有 PII 實體、類型正確、敏感度評級合理 0 分: 不自然 1 分: 部分自然 0 分: 嚴重不足 1 分: 部分準確 2 分: 大致自然 3 分: 非常自然 2 分: 大致準確但有遺漏 3 分: 完整且準確 | 脫敏品質 (Stage2) 1. Seed PII 是否存在性檢查:確認生成文件是否包含 Seed 中 PII 是否完整移除,且脫敏後文件仍保留醫療與財務的核心語境 與可讀性 的已知 PII 2. 脫敏洩漏檢查:確認身分證字號、電話或電郵是否仍有殘留 23 0 分: 脫敏失敗 1 分: 脫敏不徹底或 語義嚴重損失 3. 標註格式檢查:確認模型產生的標註結果是否包含必要欄位 2 分: 脫敏大致完整 但語義略有損失 3 分: 脫敏完整且 語義保留良好 4. 資料完整性與品質分析:統計文件長度、空值、唯一值 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 品質 評估
  22. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 Stage4: 品質評估(Validator & Judge) 用真實合成案例示範一次 生成 PII

    資 料 總結和討論 改寫 PII 資 料 資料 標註 品質 評估 | Ground Truth 標註準確性:是否完整識別所有 PII 實體、類型正確、 |脫敏品質:PII 是否完整移除,且脫敏後文件仍保留醫療與財務的核心 敏感度評級合理 語境與可讀性 1. 已知 PII 欄位全部捕獲:姓名「白雅宁」、身分證字號、Email、電話、地址、醫 師「韩雪梅」皆已標註,無遺漏。2. 醫療資訊:已正確將「不明腫塊…」、「青霉素」 1. 完整性檢核:所有已知 PII 皆已移除或泛化——姓名改為「患者/個案當事人」、 標為 MEDICAL_RECORD,分類無誤。3. 財務資訊:信用分數 850 與年收入 身分證號與地址以「[身分證字號已移除]」「[地址已移除]」取代,電話與電子郵件 560000.0 元皆標為 FINANCIAL_INFO,分類正確。4. 敏感度評級:高風險項目 亦標記為「[電話號碼已移除]」「[電子郵件已移除]」,醫師姓名改為「主治醫師/ (ID_CARD、EMAIL、PHONE_NUMBER、ADDRESS)皆給 high;年齡給 low;其 某醫師」。2. 語義保留:文件仍完整保留「43 歲女性口腔衛生師,癌症確診,需立 餘多為 medium,評級合理。5. 摘要風險:因同時出現高敏感 ID、聯絡、財務與醫 即治療並使用青黴素抗感染」「財務部門啟動內部資金劃轉」「高信用、年收入 50– 療資料,has_sensitive_combination=true 且 risk_level=high 與實體一致。整體無 100 萬元可支應治療費」等關鍵醫療與財務脈絡,結構與可讀性未受影響。 明顯錯誤或遺漏,評為完整且準確。 | 文件自然度:PII 是否自然融入語境(非條列堆砌)、段落邏輯連貫、語言流暢 整份文件以「本院近期接獲……」開場,先交代患者主訴與臨床處置,再依序帶出財務窗口、聯絡方式、信用評估、內部資金調度、出院追蹤等環節,段落間因果連貫,確實像 醫院個案報告而非單純資料條列。PII(姓名、年齡、地址、手機、Email、身份證字號、收入、信用分數)皆在對應流程中被「順勢」提及:例如「財務部門核對其聯絡資訊, 確認其電子郵箱為…」、「行政人員已透過其居住地址…發送相關康復指引」,嵌入脈絡自然。用語多為台灣醫療/行政常見詞彙(「主訴」、「病灶」、「身分證字號」、 「保險理賠」),雖部分簡體轉寫(如「青霉素」→「青黴素」)及大陸地名,但整體語感仍屬流暢繁體,未見機翻生硬。綜合評價:高度擬真,僅極小用詞可再本地化,瑕不 掩瑜。 24 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  23. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 如何持續優化生成資料品質? 用真實合成案例示範一次 生成 PII 資料 改寫 PII

    資料 資料標註 總結和討論 品質評估 優化 由參數量較小模型生成的結果 白雅宁女士,43岁,女性,来自黑龙江省哈尔滨市南岗区中山路123号,是我国一名优秀的口腔卫生师。她在今年7月份 前往医院进行体检,不幸被诊断为癌症,目前正在进行治疗。 根据白雅宁女士的主治医师韩雪梅博士的诊断,她正在使用青霉素进行治疗。治疗过程中,白雅宁女士出现了不明肿块、 持续疲劳、体重下降等症状,经过详细的检查和诊断,韩雪梅博士确认这些症状均为癌症的相关表现。 在财务方面,白雅宁女士的年收入为560000元,信用分数为850分,目前没有严重的负债情况。在交易方面,她的央行 内部资金划转记录显示,她曾于近期进行过一次 large\_transaction,具体金额需要进一步确认。 despite the unlucky diagnosis,白雅宁女士仍保持着乐观的心态,积极配合医生的治疗,并在治疗之余,继续热爱生活, 享受每一个美好的时刻。 25 25 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  24. 合成資料是甚麼? 合成資料時的盲點與痛點 如何持續優化生成資料品質? 生成規則一致性 (Regex) 合成資料心法 用真實合成案例示範一次 生成 PII 資料

    改寫 PII 資料 資料標註 總結和討論 品質評估 優化 欄位完整性 (Schema Check) 26 26 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  25. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 如何持續優化生成資料品質? 用真實合成案例示範一次 生成 PII 資料 + 品質評估結果

    文件自然度:PII 是否自然融入語境(非條列堆砌)、段落邏輯連貫、語言流暢 1. 文件讀起來像「資料拼貼」而非真實病歷或財報:開頭先丟姓名、年齡、地址、 大額劃轉,兩者無因果或轉折銜接。4. 醫療與財務僅並置,未說明彼此關聯(例 (下略) 如治療費用、保險給付)。5. 語言混用簡體與英文片語(large_transaction、 despite),且「央行內部資金劃轉」為中國用語,與台灣慣用「聯徵中心、銀行 大額交易申報」不同,整體不夠道地。綜合判斷為「明顯資料填充,缺乏真實文 件感」。 品質評估 優化 """ 你是一位文件撰寫助理。請根據以下個人資料,生成一份自然、具體、像真實世界文 件的長篇敘述。 值直接塞入。3. 段落間邏輯鬆散:第二段談癌症與青黴素,第三段突然跳到央行 但出現方式生硬(如「年收入為560000元,信用分數為850分」),明顯是欄位 資料標註 生成 Prompt 【個人資料】 姓名:{{ name }} 性別:{{ gender }} 年齡:{{ age }} 年收入:{{ income }} 職業,接著才進入病情,符合「資料 dump」而非敘事。2. PII 雖穿插在句子裡, 改寫 PII 資料 總結和討論 【撰寫要求】 1. 生成一份包含醫療與財務脈絡的綜合案例報告,至少 6 段、400 字以上。 2. 所有上述個人資料欄位(姓名、地址、身分證字號、電子郵件、電話、醫療記錄、 (下略) """ 結合分析品質的建議、 優化生成的 Prompt 27 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線 27
  26. 合成資料是甚麼? 合成資料時的盲點與痛點 如何持續優化生成資料品質? 優化前 合成資料心法 用真實合成案例示範一次 生成 PII 資料 改寫

    PII 資料 總結和討論 資料標註 品質評估 優化 優化後 28 28 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  27. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 小結:合成資料不是一次性的工作、有效的評估和優化才是正解 持續迭代 Seed Dataset 29

    生成 PII 資料 (正樣本) 改寫 PII 資料 (負樣本) 資料標註 (GT Label) Stage 1 Stage 2 Provider Config Seed Curation 品質評估 優化 Stage 3 Validator & Judge Optimization Model Config Runtime Config Analysis Config Staged Generation Dependency Management Quality Control © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  28. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 總結: NDD 能把生成流程工程化,但不能取代模型能力與人工校 準 何時應該考慮

    NDD? 1. 需要大量合成資料(>100 筆)或檢核生成品質 的人力不足 (個人想法) 2. 資料品質需要驗證與管控、有穩健及可重複生 成資料的需求 3. 團隊需要可重現的流程、重視生成可復現性和 記錄 4. 有 Python 工程能力、可以維護 NDD 的 Pipeline 目前 NDD 的限制 1. 對於大量後處理、資料清洗、轉換、join、batch inference 或 CPU/GPU 混合式分散式處理,通常仍需要 另外串接 Ray / Spark 等框架 2. NDD 著重的是能幫使用者把生成流程工程化,但不能 消除模型服務本身的瓶頸(e.g., 算力不夠、Rate Limit) 3. 合成資料生成品質不會因為用了框架就獲得自動保證、 還是要反覆檢查以及反覆試驗與驗證 30 30 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  29. 合成資料是甚麼? 合成資料時的盲點與痛點 合成資料心法 用真實合成案例示範一次 總結和討論 總結: NDD 能把生成流程工程化,但不能取代模型能力與人工校 準 何時應該考慮

    NDD? 1. 需要大量合成資料(>100 筆)或檢核生成品質 的人力不足(個人想法) 2. 資料品質需要驗證與管控、有穩健及可重複生 成資料的需求 3. 團隊需要可重現的流程、重視生成可復現性和 記錄 4. 有 Python 工程能力、可以維護 NDD 的 Pipeline 目前 NDD 的限制 1. 對於大量後處理、資料清洗、轉換、join、batch inference 或 CPU/GPU 混合式分散式處理,通常仍需要 另外串接 Ray / Spark 等框架 2. NDD 著重的是能幫使用者把生成流程工程化,但不能 消除模型服務本身的瓶頸(e.g., 算力不夠、Rate Limit) 3. 合成資料生成品質不會因為用了框架就獲得自動保證、 還是要反覆檢查以及反覆試驗與驗證 31 31 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  30. # 其他 COSCUP 議程推薦 1. 用 zhtw-mcp 搭配 AI 寫出更像台灣人的中文

    | Write Taiwanese Mandarin: zhtw-mcp as a Linguistic Linter for Traditional Chinese 2. [Prime Session] From Taiwan-LLM to the Frontier: What Open Source Taught Me, and Why I Still Miss It 3. 邁向可信任 AI:開發者必備的 Agents 偏見檢測與緩解框架 4. 開源人工智慧的定義、風險與治理 5. 我不洗錢,為何要理解匿名支付?從零開始介紹隱私加密金流交易 6. Twinkle Eval:打造繁體中文 LLM 開源評測工具 7. AI 也要期中考? The Story Behind Building a Benchmark for Agent Workflow Development 32 © COSCUP 開源人 年會 2026 |A Prompt Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  31. Sli.do Time 34 © COSCUP 開源人 年會 2026 |A Prompt

    Is No t All You Need:用開源 工具打造 LLM 合成資 料管線
  32. NDD 的定位和趨勢:與 NeMo Curator 對比 專注在資料生成、 降低對特定 GPU stack 的耦合

    偏向大規模、多模態、GPU 加速的資料 整理與 curation 平台,與 cuDF/ cuCIM/CuPy 整合較深 37
  33. 視覺化分析(1)生成資料統計 生成 PII 資料 改寫 PII 資料 資料標註 品質評估 視覺化

    分析 用了多少 Token、生成了多少資料、多少欄位、生成率 40
  34. 視覺化分析(5) 生成資料記錄 生成 PII 資料 改寫 PII 資料 資料標註 品質評估

    視覺化 分析 生成使用的模型、參數、資料集 生成了多少資料、欄位型別、資料路徑 43