製造業導入 AI,最快回本的往往不是產線自動化,而是 SOP 問答、品保單據抽取跟老師傅經驗留存這三件事。這篇用南部工廠的現場經驗,深入拆解 RAG 版本管制、文件抽取的信心分數複核、地端量化模型的硬體門檻,還有 IT/OT 網段隔離的紅線,幫你挑出最有感、風險又最小的第一步。
SOP 問答:先解決「查不到」,再談「答得好」
作業標準書、機台手冊、料號規格、工安規範,工廠裡文件從來不缺,缺的是找得到。做法是用 RAG(檢索增強生成)把這些文件切段、轉成向量存進資料庫,現場人員用白話文問,系統先檢索出最相關的段落,再讓語言模型帶著出處回答。新人不用翻三本手冊、不用打電話問學長,上手速度跟出錯率都會有感改善。
製造業知識庫最容易出錯的不是模型大小,而是拿到作廢版文件。每份 SOP 應有版號、生效日、核准狀態與適用產線,索引只收現行版;IT 與 OT 之間則依實際風險分區、設中介交換點與最小權限,不用未附來源的事故比例製造恐慌。
會踩這個雷,多半是以為 AI 夠聰明、自己會挑新的。它不會。解法不是換更強、更貴的模型,而是在文件層加上中繼資料(metadata):版本號、生效日、狀態,索引只收現行版,檢索時再拿這些欄位過濾。講究一點的還會做混合檢索——向量比語意、關鍵字比料號跟規格編號這種一字都不能錯的東西,兩邊分數合併,比單靠語意穩得多。
說穿了,這件事就是 ISO 9001:2015 第 7.5 節「文件化資訊」一直在要求的:確保使用點只拿得到現行版、防止作廢文件被誤用、標清楚變更與版次狀態。很多廠稽核時做一套、平常又是另一套,共用資料夾裡新舊版本混在一起。建知識庫這件事,剛好逼你把這個體質補回來,順帶把 AI 要吃的乾淨資料也備妥了。資料怎麼盤點清洗是另一個獨立工程,我們有專篇談,這裡先記住一句:進去的是垃圾,出來的就是講得很有自信的垃圾。
怎麼判斷這套問答做得夠不夠好
別只看 demo 那幾題答得漂不漂亮,要盯住三個數字:檢索命中率,該找到的段落有沒有進到前幾筆;引用正確率,答案有沒有貼對出處、有沒有唬爛;還有拒答率,查不到時肯不肯實務上不知道,而不是硬掰一個。一套會實務上「這題我查無資料」的系統,遠比一套題題都給你答案的系統值得信。現場的信任是一次建立、一次崩掉的,第一次被它唬到,之後就沒人要用了。
品保單據抽取:把 key-in 的手還給人
檢驗報告、進出貨單、報關文件這類大量重複的登打工作,是文件抽取(IDP)最划算的戰場。技術上它分兩層:先用 OCR 把影像轉成文字,再用版面理解加語言模型,把「哪個數字是料號、哪個是數量、哪個是合格判定」對應到欄位。這兩層的準確度差很多,得分開看,別用一個籠統的印象去談整批單據:
- 格式固定的印刷體:字元錯誤率壓得到 1% 以下,結構化欄位的抽取正確率落在九成上下,單號、總金額這種簡單又唯一的欄位衝到九成九以上不難。
- 多欄位表格、分列稅額:就算是乾淨印刷體也只有九成五上下——難的從來不是認字,是把數字擺回對的格子。
- 手寫欄位:字元正確率掉到六到八成五,潦草連筆的更低,錯誤率是印刷體的好幾倍;再加上蓋章壓字、傳真糊掉,還得往下打折。
所以期望值要設對,設計上更要留一手:讓系統對每一格輸出信心分數,高信心的自動過,低信心的自動轉人工複核;凡是涉及合格與否、數量、金額這種錯了會出事的欄位,不管信心多高,一律保留人工過目。這樣做,你賺的是把八成的重複打字自動化,同時把兩成的風險欄位攔在人手上,而不是賭 AI 一次到位。
不同模型、資料集、提示、判分方式與正式流量,結果可能差很多。公開 benchmark 只能用來理解方法,不能直接當成專案承諾;驗收應使用公司自己的題庫,分別記錄正確率、引用支持率、拒答、延遲、成本與人工覆核量。
導入順序也講一下:先挑格式固定、量最大的單據開刀,跑順了、信心門檻調對了再往外擴,千萬別第一步就去挑戰現場那疊手寫巡檢表。用最好做的場景先讓現場嚐到甜頭,比一開始就啃最硬的骨頭聰明得多。
老師傅的經驗,趁人還在的時候收
ISO 9001:2015 其實早就把這件事寫進第 7.1.6 節「組織知識」,而且點明知識有兩種:一種是寫得下來的顯性知識,一種是只在師傅腦袋裡的隱性知識。好消息是,隱性知識裡有很大一塊,早就悄悄落成文字了——歷年的故障排除紀錄、維修工單、客訴結案報告,那些就是老師傅經驗的文字化石。把它們整理進知識庫之後,半夜機台跳一個警報碼,值班的新人可以先自己查「這個碼以前出過幾次、當時怎麼排掉的」,不用每次都打電話吵醒老師傅。做過的廠回饋,這常常是三件事裡最有感的一項,因為它直接換來的,是師傅晚上能睡整覺。
但邊界要實務上兩層。第一層:知識庫不會自己長大。你得指定一個負責人,把「新的維修結案報告要回填進知識庫」寫進流程,不然兩年後它就退化成另一個沒人信的舊資料夾。廠裡真的抽不出這個人力,這一項寧可先緩,別做半套。第二層更根本:有些東西文字化石記不下來——聽聲音判斷軸承要壞、憑手感知道扭力夠不夠、聞味道曉得哪裡在燒。這部分 AI 補不了,還是得靠師徒制、靠人帶人。AI 能做的是把顯性那半收乾淨、隨時查得到,讓師傅省下重複回答老問題的力氣,把時間留給真正只有他能教的那半。別把工具當成人的替代品,它是替人挪出空間的。
地端還是雲端?看你的文件值多少錢
這題的判斷規則其實很單純:看資料外洩的代價。製程參數、配方、關鍵圖面這些受營業秘密法保護的核心資產,一旦流出去等於直接資敵,就走地端部署,資料一步都不出廠區。反過來,總務行政、通用版 SOP 這類外洩損失有限的,用雲端服務又快又便宜,沒必要為了它自己養一台機器。
最後講什麼廠現在先別急著做。文件總量不到幾十份的、半年內產線要大改的、或者連現行版 SOP 都還沒定案的,先把文件體質整好再來——不然你只是花錢把一團亂數位化,錢會花得很不值得。反過來說,只要文件量夠、版本管得住,前面講的三件事,幾乎沒有不划算的道理。
廷皓科技就在高雄楠梓,南部製造業的現場我們熟,不是坐在辦公室畫大餅的。想知道自家的文件跟單據適不適合做、該從哪個場景切入最有感,拍幾張照片、傳幾份去識別化的樣本到我們 LINE,或直接撥 07-363-0802,我們先幫你判斷,再談要不要做。