AI研究
企業如何評估 AI 系統的穩定性:一個涵蓋品質與可用性的 SLA 框架
AI 的「正確」不是二元的,第三方評測彙整顯示模型幻覺率可達 15%~52%,光靠傳統可用性 SLA 根本管不住。本文提供一個同時涵蓋可用性與品質、附上生產級門檻與評測工具的 AI SLA 框架,讓選型與驗收有客觀依據。
多數企業替 AI 員工設了試用期,卻在期末只能憑印象決定去留:「感覺還行」、「好像有幫上忙」。這不是驗收,是碰運氣。而代價正被數據揭穿——MIT 2025 年的《The GenAI Divide》研究分析 300 個企業部署後發現,高達 95% 的生成式 AI 專案交不出可衡量的損益貢獻,只有 5% 真正跨過「試用到生產」的斷崖;Gartner 也預估,到 2027 年底將有超過四成的代理式 AI 專案因價值不明、成本失控或風控不足而被取消。
這些失敗多半不是 AI 不夠好,而是沒有人在期初就把「怎樣算過關」講清楚。真正的試用期驗收,應該在期初就定義一組可量化的關卡,期末逐項對照,得出明確結論:go(轉正上線)、conditional(限期改善)或 no-go(下線重做)。本文聚焦「轉正這一刻」的驗收門檻與 go/no-go 邏輯,不重談指標如何設計,也不談導入的組織過渡。
把驗收拆成四道彼此獨立的關卡,任何一道未達標都不能無條件轉正。門檻要對照真實基準來訂,而非憑感覺:業界廣泛使用的 τ-bench 顯示,即使頂尖模型在較簡單的零售任務可破 80% 成功率,換到規則較嚴的航空客服任務也常只落在 54~58%,這說明「達標線」必須依任務難度與風險調整。以下為一般中低風險業務的建議起點,高風險場景(金流、法遵、對外決策)應往上收緊(皆為參考基準,非保證值):
| 關卡 | 衡量方式 | 建議轉正門檻 | no-go 訊號 |
|---|---|---|---|
| 任務完成率 | 成功結案數 ÷ 總指派數 | ≥ 90% | 低於 75% 或持續下滑 |
| 品質合格率 | 抽樣人工複核通過比例 | ≥ 95% | 重大錯誤出現一次以上 |
| 人工介入率 | 需人力接手數 ÷ 總任務 | ≤ 15% | 高於 30% |
| 表現穩定度 | 連續達標不回跌的週數 | ≥ 3 週 | 週間表現大幅震盪 |
這些門檻可對照公開數據:以客服類 AI 為例,Intercom 的 Fin 公布其約 1.2 萬家客戶的平均解決率約 76%,換句話說仍有約四分之一的對話需要人工接手,可作為「人工介入率」的參考量級。關鍵在於「門檻先於試用」——這些數字必須在試用期開始前就白紙黑字寫下並取得業務單位同意,否則期末很容易被人情或沉沒成本拉著走。
四道關卡裡最容易被輕忽的是「穩定度」。很多團隊看到一次漂亮的展示就急著轉正,卻忽略 AI 的輸出是機率性的,單次成功不代表次次可靠,而這在評測上有殘酷的數學。一個單次成功率 75% 的 Agent,連續三次都成功的機率只剩約 42%(0.75³);τ-bench 的 pass^k 實測更顯示,單次成功率約 60% 的 Agent,連跑八次全過的比例會塌到 25% 以下。串接更放大這個問題:三段各 70% 成功率的流程,端到端只剩約 34%(0.7³)。也就是說,一個「試用期看起來八成能成」的 AI,放到每天成百上千筆的真實流量裡,失誤會被放大到讓人措手不及。因此穩定度不能只看一次驗收,而要看「連續數週不回跌」,並用 pass^k(連續 k 次全過的比例)而非單次成功率來衡量,才擋得住靠運氣過關的假象。
四道關卡不是加總後取平均,而是逐關把守。任何一關落在 no-go 區間,就不能直接轉正;但也不代表立刻淘汰,而是進入三選一的決策:
驗收時建議把「可硬性判定」與「需要判斷」的項目分開驗:任務完成率、人工介入率這類能用規則精確計算的,用確定性指標自動比對;回覆品質、語氣是否得體這類需要判斷的,2026 年主流做法是搭配 LLM-as-judge,由更強的模型依你定義的標準評分,再輔以人工抽核。用「關卡把守」而非「平均分」,能避免一個危險錯誤:讓亮眼的完成率去掩蓋不及格的品質,而品質失誤往往才是真正讓企業付出代價的地方。
數字達標只是必要條件,轉正前還要確認 AI 員工能被安全託付。以下清單建議由業務負責人與技術負責人共同簽核,缺一項就不放行:
多數轉正爭議的根源,不是 AI 不夠好,而是沒有人在導入前就把「怎樣算過關」講清楚。恩梯科技的 AI 導入顧問服務,會在專案啟動時就與你一起訂出四道量化關卡的門檻、簽核清單與 go/no-go 決策邏輯,並協助建立上線後的監控與回滾機制,讓試用期結束時能拿數據說話,而不是靠感覺表決。與其等 AI 上線半年才發現撐不住,不如在第一天就把驗收標準寫進合約與流程裡。
想把這些做法落地到你的公司?
加 LINE 免費諮詢需要協助嗎?
點擊這裡與我們聯繫!