企業如何評估 AI 系統的穩定性:一個涵蓋品質與可用性的 SLA 框架

AI研究
Author
恩梯科技
2026-07-28 10 次閱讀 6 分鐘閱讀

AI 的 SLA 為什麼不能照抄傳統軟體

傳統軟體的 SLA 很乾脆:可用性 99.9%、回應多少毫秒,達標與否是二元的。但 AI 系統的「正確」不是黑白,而是一條連續光譜——同一個問題,模型可能答對、答得模稜兩可,或言之鑿鑿地答錯。2026 年一項跨 37 個模型的第三方評測彙整顯示,幻覺率落在 15%~52%,而且和任務形狀高度相關:有依據可抽取的封閉式問答最低、開放式生成明顯較高、需要連續呼叫工具的 Agent 工作流最容易出錯。這代表「AI 線上、回得動」不等於「輸出可信」。而輸出可不可信,法律上是企業自己扛:2024 年加拿大 Moffatt 訴 Air Canada 案,卑詩省民事調解庭(Civil Resolution Tribunal)認定官網聊天機器人講錯喪親票價的追溯申請規則,責任在航空公司而非「AI 自己」,判賠並確立了企業必須為 AI 輸出負責的先例。所以 AI 的 SLA 必須把「品質」和「可用性」一起寫進去。

兩個維度:可用性 SLO 與品質 SLO

把 AI SLA 拆成兩條線來訂,才管得動。可用性這條沿用成熟的 SRE 慣例,但要用對指標:串流式體驗看的是首 token 延遲(TTFT)與逐 token 間隔(ITL),2026 年生產級的參考門檻是 TTFT p95 < 500ms、ITL p95 < 250ms,而且一定要看 p95 而非平均——實測 30 組模型×供應商配對,p95 對 p50 的比值平均 2.1 倍、最糟到 3.2 倍,只看平均會嚴重低估那倒楣的 5%。品質這條則要另外定義:任務完成率、事實一致性(faithfulness/groundedness),再加三個便宜好用的領先指標——使用者按讚率、重試率(一直重新生成)、拒答率。這三個數字一惡化,通常品質問題已經在路上。

一張可操作的 AI SLA 指標表

維度指標生產級參考門檻量測方式
可用性系統可用時間≥ 99.5%健康檢查/uptime 監控
可用性TTFT p95 / ITL p95< 500ms / < 250ms串流延遲監控
品質事實一致性 faithfulness≥ 0.9(被支持 claim 比例)RAGAS/DeepEval LLM-as-judge
品質幻覺率抽取式 < 8%、生成式 < 20%評測集+production 抽樣
體驗重試率/拒答率設基線後看趨勢產品埋點

門檻不是抄表,要依場景校準:內部知識問答可以嚴、創意生成得放寬。重點是每一格都有可量測的數字,而不是「感覺還不錯」。

品質怎麼量:groundedness 與評測框架

品質不能靠感覺,得有可重跑的評測。2026 年主流的三套開源框架各有定位:RAGAS 專攻 RAG,四個指標不需標準答案、Python 輕量好上手;DeepEval 指標庫最完整,還能用 Pytest 綁進 CI/CD,把「品質沒退步」變成上線前的自動關卡;TruLens 提出 RAG 三角(groundedness、answer relevance、context relevance)並整合 OpenTelemetry 好接監控。三者的核心都是 faithfulness/groundedness——把模型輸出拆成一條條 claim,算「多少比例被檢索到的內容支持」,這正是抓 RAG 幻覺的關鍵機制。但有個陷阱要記得:當底層知識庫本身過期或自相矛盾時,faithfulness 分數可以很高、答案卻仍然是錯的,所以評測必須連知識庫的新鮮度一起管。

上線後怎麼守:持續監控、降級與 drift

SLA 不是驗收時量一次就結束,AI 會漂移(drift)——模型或資料的分布慢慢變,輸出系統性地改變,往壞的方向走就是退化。2026 年的實務長這樣:用便宜的蒸餾評測器在 production 全量、持續跑,只把低信心的判斷丟給人工,並定期以人工抽樣校準評測器,再把評測直接嵌進 runtime 當 guardrail。監控層交給 LLM 可觀測性平台——LangSmith、Arize Phoenix(內建評測指標與 embedding drift 偵測)、Langfuse 這類工具,專門抓基礎設施監控看不到的幻覺漂移、檢索失敗與 prompt 迴歸。最後是降級策略:當品質指標跌破門檻,系統要能自動降級、切換備援模型或轉人工,而不是繼續吐低品質結果——研究顯示,在輸出端補上事實層級的查核與修正(如 FactSelfCheck),可讓輸出中的事實性內容較未查核時提升約 35%。

沒有 SLA 的代價

把 SLA 訂清楚不是工程潔癖,是止血。RAND 2024 年的研究指出,依部分估計逾八成的 AI 專案以失敗告終,是不含 AI 的 IT 專案失敗率的兩倍;Gartner 2026 年 4 月的調查更指出,基礎設施與維運領域的 AI 使用案例每五個就有一個徹底失敗,只有 28% 完全達到投資回報的預期。這些失敗的共同病根之一,就是「成功的定義從一開始就模糊」——沒有可量測的門檻,就沒有人能說系統到底算不算能上線、上線後算不算還健康。一份寫清楚的 AI SLA,正是把這份模糊講成數字。

恩梯科技:把 SLA 變成可持續管理的能力

從上面的數據可以看出,AI 的穩定性同時是「系統會不會當」與「輸出可不可信」兩件事,而兩者都要能被量測、被監控、被觸發降級,SLA 才有意義。恩梯科技的 AI 系統顧問服務,會依你的業務場景把可用性與品質門檻訂成一張可驗收的 SLA,導入 RAGAS、DeepEval 這類評測框架與可觀測性平台,建立上線後的持續監控與降級機制,讓你的 AI 不只是能跑,而是有客觀標準說得出它現在到底健不健康,避免上線後才發現撐不住、被迫打掉重練。

參考資料

  • SQ Magazine,《LLM Hallucination Statistics》,2026。來源連結
  • McCarthy Tétrault,《Moffatt v. Air Canada: A Misrepresentation by an AI Chatbot》,2024。來源連結
  • Spheron,《LLM Inference SLO Engineering: TTFT, ITL, and P99 Latency Budgets for Production AI》,2026。來源連結
  • Digital Applied,《AI Model Latency Benchmarks 2026: TTFT & TPS Data》,2026。來源連結
  • Ragas 官方文件,《Available Metrics》。來源連結
  • TruLens 官方文件,《RAG Triad》。來源連結
  • Particula Tech,《DeepEval vs RAGAS vs TruLens: Pick Your RAG Eval Stack》,2026。來源連結
  • Arize Phoenix 官方文件,《Quickstart: Inferences》。來源連結
  • arXiv,《FactSelfCheck: Fact-Level Black-Box Hallucination Detection for LLMs》,2025。來源連結
  • RAND,《The Root Causes of Failure for Artificial Intelligence Projects and How They Can Succeed》,2024。來源連結
  • Gartner,《Gartner Says AI Projects in I&O Stall Ahead of Meaningful ROI Returns》,2026。來源連結

想把這些做法落地到你的公司?

加 LINE 免費諮詢

我們不追求大量專案。

只與少數值得深入合作的夥伴建立長期關係。

申請合作評估

需要協助嗎?

點擊這裡與我們聯繫!

立即聯繫