技術文章 · MIS/IT 外包

Synology NAS 亮紅燈怎麼辦?磁碟區降級、毀損、快照與 DSM 維護

先分辨 Synology 磁碟區降級與毀損,再看 SMART、RAID 重建、Btrfs、快照和外部備份;列出亮紅燈時不該直接做的操作。

作者 Steve Chen · 發布  · 更新  · 約 9 分鐘閱讀

MIS/IT 外包 — 廷皓技術專欄插圖

「早上一開機,DSM 就跳一個橘色驚嘆號,說儲存空間『已降級』,我同事想說那乾脆把硬碟拔起來換一換好了……」電話那頭的會計小姐講到這,我背脊一涼,趕緊叫她先把手收回來、什麼都別碰。降級的 Synology NAS 其實還活著,資料一個位元都沒少,可是這一步要是踏錯——拔錯插槽、或在重建到一半時再動一顆——原本能全身而退的,就真的變成撿不回來的碎片。這一行做久了你會發現,NAS 最怕的從來不是「壞掉」,而是「在還能救的時候被亂救」。

這篇我把降級與毀損的界線、RAID 重建為什麼是整台機器最脆弱的時刻、Btrfs 快照與自我修復到底在做什麼、以及為什麼「有快照不等於有備份」,用工程的角度說清楚。看懂了機制,你在面對紅燈時才不會憑感覺亂動手,也才分得出哪些操作是在救資料、哪些其實是在補刀。

降級與毀損,差的是一整條命

這兩個詞看起來都嚇人,實際意義卻是天差地遠。降級(Degraded)是儲存池裡有硬碟掛了,但因為你用的是有容錯的 RAID,同位資料還在,整個池子照樣讀寫、資料零遺失。關鍵在「容錯度」這個數字:RAID 1 與 RAID 5 的容錯度是 1,代表最多允許壞一顆;RAID 6 容錯度是 2,能同時撐住兩顆;SHR 則依底層組成而定,SHR-1 等同容忍一顆、SHR-2 容忍兩顆。降級的意思,就是你把其中一格「命」用掉了,系統正靠剩下的冗餘在硬撐——它還能跑,但已經沒有安全邊際。

毀損(Crashed)則是防線已經被打穿。當降級沒有及時處理、又掉了第二顆超出容錯上限,或是檔案系統本身的中繼資料損壞,儲存池就會進入毀損。這時候 Storage Manager 裡的「修復」選項會直接消失或失效——官方講得很直白:毀損的儲存池沒辦法再靠系統自行修回,資料能不能救,要看 RAID 底層還剩多少完整區塊、以及你手上有沒有另一份還原得回來的備份。一句話記住:降級是亮黃燈的警告,毀損是已經撞上去的事故。搞混這兩個字,處置就會完全反過來。

為什麼「重建」是整台機器最危險的一刻

很多人以為換上新碟、按下重建就沒事了,其實重建期間才是風險的最高點。原因藏在硬碟的一個規格裡:不可復原讀取錯誤率(URE)。一般消費級與 NAS 級硬碟的規格大約是每讀取 10 的 14 次方個位元、就可能出現一次讀不回來的錯誤——換算下來大約每 12.5 TB 就有一次。平常讀寫碰到的機率低到你無感,但重建時情況完全不同。

故障率、復原成功率與工時不適合用別人的平均值推估。現場應留下資產、告警、備份、還原演練、事件處理與停機紀錄,再用自家數據決定汰換、容量與維運優先順序。

另一個常被低估的變數是「時間」。大容量硬碟的重建不是幾十分鐘的事,一顆 16 TB 的碟在有負載的生產環境下,重建往往超過 48 小時起跳——而這一兩天內,你的陣列全程掛在冗餘被吃掉、甚至完全沒有冗餘的狀態下裸奔。重建時間拉得越長,暴露在第二顆故障底下的窗口就越久。這也是為什麼我常說:容量越大,越不能省那一顆冗餘碟。

硬碟選型的兩個地雷:SMR 與缺少 ERC

重建這件事對硬碟本身也很挑。第一個地雷是 SMR(疊瓦式)硬碟:它為了塞更高密度,寫入時要連帶重寫相鄰磁軌,隨機寫入慢到誇張,重建時常常慢到被系統判定逾時、直接把碟踢出陣列,反而害整個重建失敗。NAS 陣列請認明 CMR(傳統式)硬碟,別貪便宜買到 SMR。第二個地雷是 錯誤回復控制(ERC/TLER/CCTL):一般桌機硬碟碰到壞磁區會埋頭重試好幾十秒甚至更久,這段時間 RAID 控制器會誤以為整顆碟死了、把它踢掉;NAS 專用碟把單次重試上限壓在 7 秒左右,讓陣列有機會用冗餘去補、而不是把整顆好碟判死。用對硬碟,重建的成功率天差地遠。

降級的正確修復順序

講完風險,回到操作。修復降級的池子,順序錯了就是災難,我通常帶客戶照這個順序走:

  • 先確認是哪一顆、在哪一格。進 Storage Manager 看清楚是哪一顆亮紅燈、它的實體插槽編號是幾號,對著序號核對,千萬別憑印象或「看哪顆燈比較暗」就拔——拔錯一顆健康碟,等於自己動手把降級升級成毀損。
  • 換上容量不小於原碟、且在相容清單上的健康硬碟。支援熱抽換的機型可以線上更換,不支援的就正常關機再換。新碟容量一定要大於等於原本那顆,否則陣列拼不回來;也盡量選相容清單上驗證過的型號,避免韌體相容性的暗坑。
  • 開機後在儲存池頁面點「修復」,然後就放著讓它跑完。重建期間 NAS 還能用,但效能會明顯下滑,這時候請盡量別做大量寫入、別跑備份還原、更別重開機——這是陣列最脆弱的時刻,任何額外壓力都在放大「再掉一顆」的機率。

如果當初就設好了 Auto Repair 並指派了熱備援(hot spare)碟,系統甚至會在硬碟一掛的當下自動抓備援碟去重建,連你手動換碟的空窗都省掉——對多槽、又擺在無人機房的機型,我幾乎都建議留一顆熱備援,因為「人趕到現場換碟」的那幾個小時,往往就是第二顆倒下的高風險時段。最後再提醒一次:修復只對「有容錯」的 RAID 有效;當初若為了空間做了 RAID 0 或 Basic,一顆壞就是全沒,根本沒有修復這個選項。

Btrfs 快照與自我修復:它到底在幫你擋什麼

Synology 中高階機型建議用 Btrfs 檔案系統,不是行銷噱頭,是它底層兩個機制實打實在保護資料。第一個是寫入時複製(Copy-on-Write,CoW):改資料時不是就地覆蓋原區塊,而是先寫一份新區塊、再把指標切過去,舊區塊只要還有快照引用著就留著。這帶來一個很省的特性——建立快照其實只是複製了幾 KB 的中繼資料樹,並沒有真的搬移那幾 TB 的檔案,新舊之間共用所有沒變動的區塊,之後也只記錄「差異」。所以快照可以做得又快又密集,被勒索病毒加密、或誰手滑刪錯、改錯,都能從某個時間點的快照幾秒內還原回去。

第二個機制更底層:校驗和(checksum)自我修復。Btrfs 會替每個資料與中繼資料區塊算一組 CRC32C 校驗碼,中繼資料還額外多存一份備援。每次讀取都會重算校驗碼比對,一旦發現某個區塊的內容跟校驗碼對不上(也就是資料在硬碟上悄悄爛掉了),只要底層是有鏡像或冗餘的 RAID,它會自動去另一顆碟拿正確的那一份回來、順手把壞掉的區塊改寫修好。這正是對付無聲位元腐蝕(bit rot)的關鍵——傳統檔案系統根本不知道資料爛了,會把錯的當對的原封不動交給你。

別忘了定期「資料清理」

校驗和能在讀取的當下修好被讀到的區塊,但那些長期沒被讀取的冷資料呢?這就要靠 資料清理(Data Scrubbing)。它會主動把整個儲存池從頭掃一遍、逐塊比對校驗和,把潛伏的壞區塊趁早用冗餘補回來,避免它一路爛到重建那天才一次爆出來、跟 URE 一起要你的命。Synology 官方建議至少每半年跑一次,資料重要的話拉到每季一次更穩,並排在深夜離峰時段執行以免影響效能。要注意資料清理只支援 Btrfs,或 SHR(三顆以上)、RAID 5/6/F1 這類有冗餘的組態。這個功能不用另外花錢、又是主動防禦,沒開真的很可惜。

快照不是備份——從 3-2-1 到 3-2-1-1-0

這是最多人踩的觀念坑:「我有開快照,資料很安全。」錯。快照跟儲存池住在同一台機器上,機器被偷、被火燒、進水、或儲存池整個毀損,快照會一起陪葬。快照是「快速救回誤刪誤改」的工具,不是異地備份,兩者要擋的災難根本不是同一種。

真正的第二份,經典準則叫 3-2-1:至少 3 份資料、存在 2 種不同媒介、其中 1 份放異地。你可以用 Hyper Backup 把資料備到另一台 NAS、外接硬碟或雲端,把「異地」那一份補起來。但在勒索病毒橫行的今天,3-2-1 已經被業界升級成 3-2-1-1-0,多出來的兩碼才是重點:

  • 多一份「1」不可竄改或離線的副本。現在的勒索病毒會主動去找備份下手,連你的備份任務、快照一起加密或刪掉。所以要有一份是攻擊者就算拿到管理員帳密也動不了的——不可變(immutable)鎖定、或乾脆離線/離網的冷備份。要特別提醒:同步(sync)不算備份,因為同步會把加密後的壞檔即時複製到對端,兩邊一起完蛋。
  • 那個「0」是零錯誤,也就是還原要驗證過。Hyper Backup 有一個「備份完整性檢查」,會實際去驗那份備份還原得回來、檔案有沒有壞,而且過程只做驗證、不搬移資料。沒驗證過的備份,跟沒有備份其實是同一件事——太多公司都是出事那天才發現備份檔早就壞了、或根本已經停跑好幾個月。請務必定期跑檢查,並設好失敗通知。

連 NAS 都找不到?先查網路,別急著怪硬碟

還有一種驚魂場景:NAS 突然在區網上消失,網路上的芳鄰也看不到它。這時先不要直接判定為硬碟壞了,十之八九是網路層的事。常見原因有幾個:IP 被同網段新接進來的設備搶走、產生位址衝突;電腦的網路類型被設成「公用網路」,導致網路探索被防火牆整個擋掉;或是路由器 DHCP 出包、把租約發亂了。這些都跟你的資料完全無關。

排查也不難:先用瀏覽器連 find.synology.com,或在區網內裝 Synology Assistant 直接掃出機器、看它現在被分到哪個 IP。真的掃不到,就把電腦的網路設定檔改成「私人網路」、檢查有沒有 IP 衝突,機器多半就自己回來了。另外提醒,DSM 大版本更新前,務必先確認相容性、把重要資料的備份先完整跑過一次再按更新——別在沒有退路的狀態下動系統,這是紀律問題,不是運氣問題。

說到底,NAS 出狀況時真正決定結局的,往往不是硬碟壞得多嚴重,而是接手的人懂不懂得「先判斷、後動手」。廷皓科技在高雄楠梓,服務高雄、台南、屏東的中小企業,從 RAID 組態規劃、Btrfs 快照與資料清理排程、到 3-2-1-1-0 的備份架構與定期還原演練,都能幫你一條龍顧好。真的碰上降級、毀損、或找不到機器,與其自己冒險拔碟,不如先讓廷皓遠端連上去看一眼、把狀態判斷清楚。資料是公司的命,動手之前,先打一通電話給我們。

聯絡廷皓討論 看更多文章