AI 員工試用期驗收:轉正的 go/no-go 量化關卡

AI研究
Author
恩梯科技
2026-07-29 9 次閱讀 7 分鐘閱讀

試用期到了,你卻說不出「該不該轉正」

多數企業替 AI 員工設了試用期,卻在期末只能憑印象決定去留:「感覺還行」、「好像有幫上忙」。這不是驗收,是碰運氣。而代價正被數據揭穿——MIT 2025 年的《The GenAI Divide》研究分析 300 個企業部署後發現,高達 95% 的生成式 AI 專案交不出可衡量的損益貢獻,只有 5% 真正跨過「試用到生產」的斷崖;Gartner 也預估,到 2027 年底將有超過四成的代理式 AI 專案因價值不明、成本失控或風控不足而被取消。

這些失敗多半不是 AI 不夠好,而是沒有人在期初就把「怎樣算過關」講清楚。真正的試用期驗收,應該在期初就定義一組可量化的關卡,期末逐項對照,得出明確結論:go(轉正上線)、conditional(限期改善)或 no-go(下線重做)。本文聚焦「轉正這一刻」的驗收門檻與 go/no-go 邏輯,不重談指標如何設計,也不談導入的組織過渡。

轉正驗收的四道量化關卡

把驗收拆成四道彼此獨立的關卡,任何一道未達標都不能無條件轉正。門檻要對照真實基準來訂,而非憑感覺:業界廣泛使用的 τ-bench 顯示,即使頂尖模型在較簡單的零售任務可破 80% 成功率,換到規則較嚴的航空客服任務也常只落在 54~58%,這說明「達標線」必須依任務難度與風險調整。以下為一般中低風險業務的建議起點,高風險場景(金流、法遵、對外決策)應往上收緊(皆為參考基準,非保證值):

關卡衡量方式建議轉正門檻no-go 訊號
任務完成率成功結案數 ÷ 總指派數≥ 90%低於 75% 或持續下滑
品質合格率抽樣人工複核通過比例≥ 95%重大錯誤出現一次以上
人工介入率需人力接手數 ÷ 總任務≤ 15%高於 30%
表現穩定度連續達標不回跌的週數≥ 3 週週間表現大幅震盪

這些門檻可對照公開數據:以客服類 AI 為例,Intercom 的 Fin 公布其約 1.2 萬家客戶的平均解決率約 76%,換句話說仍有約四分之一的對話需要人工接手,可作為「人工介入率」的參考量級。關鍵在於「門檻先於試用」——這些數字必須在試用期開始前就白紙黑字寫下並取得業務單位同意,否則期末很容易被人情或沉沒成本拉著走。

穩定度:最常被跳過、卻最能戳破試用假象的一關

四道關卡裡最容易被輕忽的是「穩定度」。很多團隊看到一次漂亮的展示就急著轉正,卻忽略 AI 的輸出是機率性的,單次成功不代表次次可靠,而這在評測上有殘酷的數學。一個單次成功率 75% 的 Agent,連續三次都成功的機率只剩約 42%(0.75³);τ-bench 的 pass^k 實測更顯示,單次成功率約 60% 的 Agent,連跑八次全過的比例會塌到 25% 以下。串接更放大這個問題:三段各 70% 成功率的流程,端到端只剩約 34%(0.7³)。也就是說,一個「試用期看起來八成能成」的 AI,放到每天成百上千筆的真實流量裡,失誤會被放大到讓人措手不及。因此穩定度不能只看一次驗收,而要看「連續數週不回跌」,並用 pass^k(連續 k 次全過的比例)而非單次成功率來衡量,才擋得住靠運氣過關的假象。

go / no-go 怎麼判:逐關把守,不取平均

四道關卡不是加總後取平均,而是逐關把守。任何一關落在 no-go 區間,就不能直接轉正;但也不代表立刻淘汰,而是進入三選一的決策:

  • go|轉正上線:四關全部達標且穩定度連續三週不回跌,正式編入日常流程,改為抽樣監控。
  • conditional|限期改善:僅一關落在門檻與 no-go 之間,給 2 至 4 週的改善窗口,鎖定該項指標重驗,其餘維持觀察。
  • no-go|下線重做:出現重大品質事故,或兩關以上未達標,退回調整 Prompt、資料或流程,重新起算試用。

驗收時建議把「可硬性判定」與「需要判斷」的項目分開驗:任務完成率、人工介入率這類能用規則精確計算的,用確定性指標自動比對;回覆品質、語氣是否得體這類需要判斷的,2026 年主流做法是搭配 LLM-as-judge,由更強的模型依你定義的標準評分,再輔以人工抽核。用「關卡把守」而非「平均分」,能避免一個危險錯誤:讓亮眼的完成率去掩蓋不及格的品質,而品質失誤往往才是真正讓企業付出代價的地方。

轉正前必須逐項簽核的驗收清單

數字達標只是必要條件,轉正前還要確認 AI 員工能被安全託付。以下清單建議由業務負責人與技術負責人共同簽核,缺一項就不放行:

  • 四道量化關卡的期末數據已備齊,並與期初門檻逐項對照。
  • 失敗與例外案例已建檔,確認錯誤模式可控、不會造成不可逆損害。
  • 人工接手與升級的觸發條件明確,交接動線在真實情境下驗證過。
  • 上線後同時保留離線回歸測試與線上即時評分,並設定品質下滑的告警門檻與負責人。
  • 資料存取範圍符合權限最小化,敏感資訊處理方式經確認。
  • 回滾方案已備妥:一旦轉正後表現崩壞,能在多久內下線。

三個讓驗收失真的常見陷阱

  • 用 Demo 數據當驗收數據:展示環境用的是精選資料與簡化流程,反映不了生產的複雜度,驗收必須取自實際流量。
  • 只看平均、不看尾端:平均 95% 合格,剩下 5% 若集中在高金額或高風險案件,風險其實不小,要看錯誤的分布而非只看平均。
  • 試用期太短就結案:AI 的表現會隨資料與情境波動,穩定度需要足夠時間才看得出來,別在剛上手的高峰就急著轉正。

恩梯科技:把驗收標準前置到導入第一天

多數轉正爭議的根源,不是 AI 不夠好,而是沒有人在導入前就把「怎樣算過關」講清楚。恩梯科技的 AI 導入顧問服務,會在專案啟動時就與你一起訂出四道量化關卡的門檻、簽核清單與 go/no-go 決策邏輯,並協助建立上線後的監控與回滾機制,讓試用期結束時能拿數據說話,而不是靠感覺表決。與其等 AI 上線半年才發現撐不住,不如在第一天就把驗收標準寫進合約與流程裡。

參考資料

  • MIT Project NANDA,《The GenAI Divide: State of AI in Business 2025》,2025。來源連結
  • Gartner,《Gartner Predicts Over 40% of Agentic AI Projects Will Be Canceled by End of 2027》,2025。來源連結
  • Yao et al.(Sierra),《τ-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains》,2024。來源連結
  • DataCamp,《Claude 3.7 Sonnet: How it Works, Use Cases & More》,2025。來源連結
  • Intercom(Fin),《How AI Customer Service Agents Compare in 2026》,2026。來源連結

想把這些做法落地到你的公司?

加 LINE 免費諮詢

我們不追求大量專案。

只與少數值得深入合作的夥伴建立長期關係。

申請合作評估

需要協助嗎?

點擊這裡與我們聯繫!

立即聯繫