用真實業務範例的 Few-shot:穩定 AI 輸出品質

技術分享
Author
恩梯科技
2026-08-07 2 次閱讀 8 分鐘閱讀

為什麼規則寫再多,AI 輸出還是不穩定

同一段 Prompt 指令,早上跑出來的格式和下午的不一樣:有時多一段免責聲明、有時漏掉一個欄位、語氣時而正式時而隨便。多數決策者的直覺反應是把指令寫得更長更嚴,結果 Prompt 越寫越像法律條文,輸出品質卻依舊飄忽。這不是個別團隊的錯覺:McKinsey 2025 年全球 AI 調查顯示,88% 的企業已在至少一個業務功能導入 AI(較前一年的 78% 成長),但只有約三分之一真正將 AI 規模化;MIT NANDA 的《State of AI in Business 2025》報告更指出,約 95% 的企業 GenAI 試點拿不出可衡量的損益回報——輸出不穩定、下游不敢接手自動化,正是卡關的常見原因。學術研究也早就量化了這種不穩定:加州大學柏克萊分校等團隊在 ICML 2021 發表的《Calibrate Before Use》實測發現,光是改變 Prompt 裡範例的選擇與排列順序,GPT-3 在同一任務上的準確率就能從接近隨機猜測擺盪到接近最佳水準。問題在於:許多對「一致性」的要求,用文字規則本來就難以窮舉——報價信的分寸、拒絕客訴的語氣、產品描述的詳略,你很難用條列規則描述清楚,卻能一眼認出哪個範例寫得對。Few-shot 正是解法:在 Prompt 裡放幾個「輸入→理想輸出」的真實範例,讓模型從示範中對齊格式、語氣與邊界行為。本文談的是用真實業務範例把輸出穩定下來的實戰做法,而不是設計一套模組化指令庫,也不是為複雜商業邏輯拆解 Prompt 流程。

Few-shot 有效不是感覺,是量得出來的差距

「多給幾個範例」聽起來像土法煉鋼,但它的效果在學術上有扎實的量測基礎。OpenAI 團隊 2020 年發表於 NeurIPS 的《Language Models are Few-Shot Learners》(GPT-3 論文)系統性比較了零範例(zero-shot)與多範例(few-shot)的表現:在 TriviaQA 問答任務上,準確率從零範例的 64.3% 提升到 few-shot 的 71.2%;在 CoQA 對話問答上,F1 分數從 81.5 升到 85.0。論文同時發現,模型規模越大,從範例中「就地學習」(in-context learning)的能力越強——這意味著今天的模型比當年更能吃透你給的示範。Anthropic 的官方 Prompt 工程文件也把「使用範例(multishot prompting)」列為提升輸出準確性與一致性最有效的手段之一,並特別提醒:新一代模型會極度貼近範例中的細節,你示範什麼,它就交付什麼——包括你不想要的壞習慣。對企業來說,這是把「輸出品質」從賭手氣變成工程問題的關鍵:範例即規格。

好範例從哪來:把過去的好輸出變成黃金樣本

最有效的範例不是憑空編造,而是從企業既有資料裡撈:過去同仁實際寫過、且被主管認可放行的回覆、報告或摘要。這些「被驗收過的真實輸出」就是最貼近企業標準的黃金樣本。挑選時把握四個準則:

  • 真實且正確:出自真實案例,欄位、用語與語氣都是團隊公認的標準,而非理想化的樣板。
  • 涵蓋代表性情境:放幾個最常見的情境,再補一兩個容易出錯的邊界情境。Anthropic 官方準則同樣強調範例要「相關、多樣、結構一致」,避免模型從過度相似的範例學到你沒打算教的模式。
  • 格式高度一致:所有範例的輸出結構要一模一樣,因為模型會連標點、段落與欄位順序一起模仿。
  • 先去識別化:範例常夾帶客戶名、金額與個資,入庫前務必遮蔽 PII,否則等於把個資寫進每一次 Prompt。

舉個具體例子:一家設備商希望 AI 統一產出報價回信。與其寫十條規則規定「先問候、條列品項、附交期、以一句行動呼籲結尾」,不如直接放三封業務過去寄出、成交率高的真實信件當範例——模型會自動學會那個開頭稱謂、品項的排版、交期的措辭與收尾語氣,連「急件另計」這類慣用註記都會被一併沿用。

要放幾個、怎麼排:數量與順序都會影響結果

範例不是越多越好。太少對不齊格式,太多則吃掉 context、拉高成本與延遲。Anthropic 官方文件建議一般任務以 3–5 個多樣化範例為起點;實務上數量應依任務性質微調:

任務類型建議範例數說明
格式固定、變異低(分類、欄位抽取)2–3 個對齊輸出格式即可
語氣或風格導向(客服回覆、行銷文案)3–5 個需多個範例涵蓋語氣光譜
邊界多、易誤判(合規判斷、例外處理)5–8 個+反例用正例與反例一起界定邊界

比數量更容易被忽略的是「順序」。倫敦大學學院團隊發表於 ACL 2022 的《Fantastically Ordered Prompts》實測發現:同樣四個範例,光是排列順序不同,就足以讓模型表現在「接近最佳」與「接近亂猜」之間擺盪;他們提出的熵值探測選序方法,在 11 個文本分類任務上平均帶來 13% 的相對提升。《Calibrate Before Use》則點名兩個成因:多數標籤偏誤與近因偏誤——模型傾向預測範例中出現頻率高、以及排在 Prompt 末端的答案。落地的對策很具體:分類任務的範例要平衡各標籤的數量、不要把同一類答案全堆在結尾;標籤字面要完全一致,別一下寫「已完成」一下寫「完成」;對容易越界的任務,補一兩個「錯誤輸入→應拒絕或應澄清」的反例,讓模型學會什麼時候不要照做。

動態 Few-shot:依相似度即時挑範例

當業務情境非常多時,固定那幾個範例無法覆蓋。進階做法是建一個範例庫,用 embedding 把每筆使用者輸入與範例庫比對相似度,即時取出最相關的 k 個範例塞進 Prompt——概念上等同 RAG,只是檢索的是「示範」而非「知識」。這條路線同樣有研究背書:杜克大學與微軟團隊 2021 年的《What Makes Good In-Context Examples for GPT-3?》提出 KATE 方法,用 kNN 語意相似度檢索挑選範例,在問答與生成任務上明顯優於隨機挑選。以客服為例,退貨、報修、發票三類問題各自命中自己那組範例,回覆的結構與語氣自然對得上。落地時要注意:為每筆範例標註情境標籤、定期汰換過期案例、控制 k 值避免 context 爆量,並在業務規則變動時同步更新範例,否則模型會照著早已作廢的舊標準產出。

常見陷阱與回歸驗收:讓效果可量測、可累積

  • 過度擬合:範例彼此太相似,模型把範例裡的特定產品名或數字當成通則照抄。
  • 範例互相矛盾:兩個範例對同類輸入給了不同格式,模型無所適從,一致性不升反降。
  • 格式漂移:範例輸出結構不統一,模型也跟著飄。
  • 只測正確、不測一致:驗收時應對同一批輸入重複多次跑,觀察格式與欄位是否穩定,而不是只看單次是否正確。

務實建議:建立一個小型回歸集(固定 20–30 筆輸入),每次調整範例後重跑,比對格式合規率與關鍵欄位正確率,通過再上線。這正是研究給企業的最大啟示——既然範例的選擇與排序能讓準確率大幅擺盪,那每一次改動都值得用固定題庫驗一次,讓 Few-shot 的效果可量測、可累積,而不是每次改 Prompt 都在賭手氣。當這套「範例+回歸驗收」的循環固定下來,AI 的輸出品質就從個人的手感,變成團隊可以交接、可以稽核的資產。

恩梯科技如何協助

恩梯科技協助企業把 Few-shot 範例工程整合進既有工作流程:從盤點可用的真實業務資料、篩選與去識別化黃金樣本,到設計範例數量與排列策略、建置依相似度檢索的動態範例庫,並在上線後持續以回歸集監控輸出一致性。若你的 AI 系統常因輸出格式與語氣飄忽而難以放心導入,歡迎與恩梯科技討論,用你自己的真實範例把品質穩定下來。

參考資料

  • McKinsey & Company,《The State of AI: Global Survey 2025》,2025。來源連結
  • MIT NANDA,《The GenAI Divide: State of AI in Business 2025》,2025。來源連結
  • Zhao et al.(加州大學柏克萊分校等),《Calibrate Before Use: Improving Few-Shot Performance of Language Models》,ICML,2021。來源連結
  • OpenAI,《Language Models are Few-Shot Learners》,NeurIPS,2020。來源連結
  • Anthropic,《Use examples (multishot prompting) to guide Claude's behavior》,官方 Prompt 工程文件。來源連結
  • Lu et al.(倫敦大學學院),《Fantastically Ordered Prompts and Where to Find Them》,ACL,2022。來源連結
  • Liu et al.(杜克大學/Microsoft),《What Makes Good In-Context Examples for GPT-3?》,2021。來源連結

想把這些做法落地到你的公司?

加 LINE 免費諮詢

我們不追求大量專案。

只與少數值得深入合作的夥伴建立長期關係。

申請合作評估

需要協助嗎?

點擊這裡與我們聯繫!

立即聯繫