上禮拜到台南一家零件廠開會,會議室的投影幕上開著他們剛導入的 AI 問答系統,主管當場示範了三題,答得又快又漂亮,現場氣氛很好。我問了一句:「它整體的答對率是多少?」空氣安靜了三秒。沒有人知道,因為從頭到尾沒有人量過,全公司的驗收標準,就是剛剛那三題。
這不是特例。我這幾年跑南部工廠,看過太多老闆花了六位數導入 AI,最後判斷好不好的依據,講白了就是四個字:感覺很強。但感覺沒辦法拿去開董事會,更沒辦法跟花出去的錢對帳。這篇就想把話講清楚:AI 導入的成效是可以量的,只是大部分人沒被教過該量什麼、量多少題才算數。
為什麼「感覺很強」連工程師都騙得過
先講清楚一件事:會被 demo 騙到的,不是只有不懂技術的人。有兩層機制在作怪,兩層都跟人的直覺對著幹。
第一層是心理的。人的記憶會牢牢記住那幾次驚豔的回答,卻很快忘掉平庸或答錯的大多數,這叫可得性偏誤。你示範二十題、錯了四題,散會後腦子裡留下的往往只有那兩三題最漂亮的印象,主觀評分天生就高估。
第二層更麻煩,是模型本身的物理特性。語言模型的訓練目標,說到底是「把下一個字接得通順」,它並沒有一個內建的旋鈕在告訴你「這題我其實沒把握」。所以它答錯的時候,語氣跟答對時一模一樣自信、一樣流暢。這在技術上叫校準不良(calibration)——模型的信心跟它的正確率並不對齊。而人腦有個要命的捷徑:把「講得順」自動當成「講得對」。於是模型一本正經地編一段不存在的規格或條款,聽起來比正確答案還篤定。這種一本正經的胡說,業界叫幻覺(hallucination),它不是偶爾的 bug,而是這類模型的機率本質決定的,光靠多叮嚀幾句提示詞消不掉,只能靠量測把它框出來。
解法只有一個:把印象換成數字,而且要在貼近真實流量的資料上量。底下按場景拆開講。
場景不同,該盯的數字就不同
最常見的誤區,是拿同一套指標套所有 AI 應用。RAG 知識庫、文件抽取、AI 客服,它們壞掉的方式不一樣,該量的東西自然不同,混著看等於拿體重計量血壓。
RAG 知識庫:命中率是天花板,接地率是安全帶
RAG(檢索增強生成)的運作是先「撈」再「寫」——先從你的文件庫撈出相關段落,再讓模型根據這些段落生成回答。這個兩段式結構,決定了它有兩個必須分開量的關卡。
- 檢索命中率(recall@k):正確的段落有沒有出現在撈回來的前幾名裡(例如前五名就是 recall@5)。這是整個系統的天花板——第一步就把段落撈錯,後面模型再會寫也是白搭,只會把錯的來源包裝得更漂亮。很多人一上來就怪模型不聰明,其實九成問題卡在檢索這一關,該調的是切塊與檢索設定。
- 答案接地率(faithfulness/groundedness):回答裡的每一句話,有多少比例真的被撈回來的文件支撐,而不是模型自己腦補的。這條直接對應幻覺風險,是你的安全帶。接地率低,代表它常在資料沒講的地方自己補完,這在報價、規格、法遵場景會出人命。
- 脈絡精確率(context precision):撈回來的段落裡,有多少是真的有用的,而不是塞了一堆雜訊把模型帶偏。段落給太多、太雜,模型反而容易抓錯重點,「撈越多越保險」通常是錯的直覺。
還有一個容易搞混的地雷:答案相關性(answer relevancy)跟答案正確性(answer correctness)是兩回事。前者只看回答有沒有對到問題的題目,答得再切題也可能內容是錯的。驗收時兩個都要看,別讓一個文不對題但語氣誠懇的回答矇混過關。這些指標跟 RAG 內部運作怎麼掛鉤,可搭配我們談 RAG 原理與落地那篇一起讀,會更懂為什麼命中率是生成端補不回來的硬上限。
文件抽取:F1 看的是平衡,而 99% 沒有你想的高
文件抽取(發票、報關單、合約這類)要看的是欄位層級的三個數字:
- 精確率(precision):抽出來的欄位裡,有多少是對的,也就是會不會亂抓、抓錯。
- 召回率(recall):該抽的欄位裡,有多少真的被抓到了,也就是會不會漏抓。
- F1 分數:前兩者的調和平均。用調和平均而不是普通平均,是刻意的——它會狠狠懲罰兩者失衡的系統。一個「只要沒把握就不抓」的系統,精確率可以做得很漂亮,但召回率爛掉,F1 立刻現形,掩蓋不住。所以看抽取成效,盯 F1 比單看某一個數字誠實。
另外兩件實務上一定要做的事:一是按文件難度分層統計,印刷體、掃描件、手寫件的成績常常差一整個級距,混在一起平均等於自欺;二是追「直通率」(straight-through,不必人工碰就能過的比例)跟反過來的「人工複核率」,這個數字才真正決定你省下多少人力,也是後面算帳的關鍵乘數。
AI 客服:先把四個長得很像的詞分清楚
客服 AI 最容易出包的地方,是四個常被混用、廠商也樂得混用的詞:
- 轉移率(deflection):沒有轉到真人的對話比例——但這裡面包含了客人不耐煩、自己關掉走人的。
- 包含率(containment):AI 全程處理完、沒有升級給真人的比例,比轉移率嚴格一階。
- 解決率(resolution)/一次解決率(FCR):客人的問題真的被解掉了。這才是你真正想買的東西。
不同模型、資料集、提示、判分方式與正式流量,結果可能差很多。公開 benchmark 只能用來理解方法,不能直接當成專案承諾;驗收應使用公司自己的題庫,分別記錄正確率、引用支持率、拒答、延遲、成本與人工覆核量。
兩個採購一定會問、工程師卻常漏的維度
測試集怎麼建,數字才有解析度
把該量的指標挑對了,還有半條命卡在「你拿幾題去量」。這是最多人栽跟頭、卻最沒被講過的地方。
題目怎麼出,比題數更講究,原則有幾條:
- 全部從真實流量抽:真實工單、客訴信、客服對話紀錄裡抽樣,讓題目的分布貼近上線後真的會被問到的東西,不要自己憑空編漂亮題。
- 留兩三成刁鑽題:邊界情況、模稜兩可、故意挖坑的陷阱題要占兩到三成,這些才是系統真正會出事、最該先摸清楚的地方。
- 標準答案要兩個人獨立標:由兩位熟業務的人各自標一遍再對答案,有分歧就攤開來討論定案。兩人標得一不一致,本身就是在告訴你這題到底清不清楚,連人都會吵的題,就別怪 AI 答不好。
- 版本鎖死:這批題目定版後就固定下來,之後每改一次系統都拿同一批回測。同一把尺量下去,數字才有前後可比性,退步才看得出來。
最常犯的兩個驗收錯誤
第一個,是直接拿廠商提供的測試集來驗收。倒不是說廠商一定造假,而是出題的人跟被考的人是同一方,題目的分布會不自覺地往系統擅長的方向偏,這叫球員兼裁判。你要的分數,得用你自己的、從你公司真實流量抽出來的題庫去考才算數。
第二個,是把驗收當天那一次量測當成永久保固。文件格式會改版、客人的問法會隨季節和活動變、模型也會更新版本,任何一個變動都可能讓昨天還漂亮的數字今天就退步。所以指標不是驗收章,是要排進例行回測的儀表板——固定週期用那把鎖死的尺重量一次,一退步就進去查:是檢索壞了、資料漂移了、還是模型換版走鐘了。
最後,把帳算出來
但帳要算得誠實,得記得兩條界線。一是有些價值本來就難塞進試算表,像同仁不用加班登打、新人敢在系統上問問題不怕被笑,這些是真的好處,只是量不出來,別因為量不到就當它不存在。二是更隱蔽的陷阱:任何一個指標,一旦被拱成唯一的 KPI,就一定會被玩弄。這在管理學上叫古德哈特定律——當量尺變成目標,它就不再是好量尺。自動解決率可以靠偷偷放寬「已解決」的定義灌水,接地率可以靠讓模型少講話、盡量抄原文來墊高。數字是拿來照路的量尺,不是拿來遮眼的布,這條線得靠你自己守。
如果你的 AI 系統上線到今天,還說不出一個有憑有據的數字,那第一步不是急著換系統,是先把量尺立起來。從測試集怎麼抽、指標怎麼配、到例行回測怎麼排,這些都是廷皓科技在高雄替南部企業實際做熟的事。打 07-363-0802,或加 LINE 把你們現在的用法描述給我們,先幫你看該量什麼、怎麼量,再談要不要動系統。