技術文章 · MIS/IT 外包

NAS 硬碟亮紅燈、有異音,先別急著拔:從 SMART、RAID 降級到重建的完整判斷

NAS 硬碟亮紅燈、發出咖咖異音,先停手別急著拔。這篇把機制講透:紅燈分幾種、異音為什麼是機構性死刑、SMART 的重新配置與待處理磁區怎麼判生死、RAID 降級後為什麼一次只能動一顆、重建期間 URE 的數學風險有多高,以及換碟為什麼非 CMR 不可。廷皓科技服務高雄、台南、屏東,可到府協助換碟與盯完重建。

作者 Steve Chen · 發布  · 更新  · 約 8 分鐘閱讀

MIS/IT 外包 — 廷皓技術專欄插圖

故障率、復原成功率與工時不適合用別人的平均值推估。現場應留下資產、告警、備份、還原演練、事件處理與停機紀錄,再用自家數據決定汰換、容量與維運優先順序。

紅燈是狀態燈,不是死亡證明

NAS 面板那顆紅燈,意思是這顆碟被系統標記成異常,但異常是有程度之分的。它可能只是 SMART 某個數值越過了原廠設定的預警門檻,硬碟本體其實還讀得好好的;也可能是壞軌開始擴散、讀寫愈來愈吃力;更嚴重的是整顆已經掉線、系統點名點不到。同一顆紅燈,背後可能是「再撐三個月沒問題」,也可能是「再通電十分鐘就報廢」,燈號本身分辨不出來。所以看到紅燈的正確心態是:它只負責告訴你「這裡有事」,至於有多嚴重、能不能救、該怎麼救,得往下看數據和聽聲音才知道。急著下結論、急著動手,才是把小事變大事的起點。

異音要當真:這是機構層面的死刑預告

燈號可以再觀察,聲音不行。機械硬碟正常運轉是均勻的低鳴,碟盤以每分鐘五千四百轉或七千兩百轉高速旋轉,讀寫頭靠在一層只有幾奈米厚的空氣墊上懸浮飛行,全程不該碰到碟面。一旦出現規律的「咖、咖、咖」或清脆的喀喀聲,業界俗稱「死亡點擊」,多半是讀寫頭找不到定位、控制器只好把頭拉回起始位置重試,反覆歸位卻反覆失敗,你聽到的每一聲,都是機構在物理層面出狀況的證據。

為什麼異音等於機構性死刑?因為造成這種聲音的原因,通常是讀寫頭已經偏移、磨損、甚至擦撞到碟面,也就是所謂的「磁頭碰撞」。碟盤上記錄資料的磁層一旦被刮傷,那一圈資料就是物理性消失,沒有任何軟體救得回來——市面上號稱能「修復」異音硬碟的工具全部無效,唯一的路是送進無塵室、用潔淨工作台整組換掉讀寫頭。而且情況只會愈來愈糟:每多通電一分鐘、每多一次重新開機,受損的磁頭就多一次刮花碟盤的機會,把原本還能救的區域刮成救不回來的區域。所以裡面有重要資料又沒備份的話,聽到異音的正確動作是——趁還讀得到,趕快把資料往外部裝置複製出來;複製到一半卡死、速度掉到幾乎不動,就直接關機,不要反覆重開想「再試一次」,每試一次都是在燒它剩下的那點命。

先讀 SMART:三個欄位就能判生死

燈號是結果,真正的健康狀況要看 SMART 數據。Synology 在「儲存空間管理員」點選 HDD/SSD、進到那顆碟看健康資訊;QNAP 在「儲存與快照總管」的磁碟頁面。SMART 欄位一大堆,但要判斷一顆機械碟還能不能信任,主要盯三個就夠:

  • 05 重新配置磁區數(Reallocated Sectors):硬碟出廠時保留了一小池備用磁區,當某個磁區壞掉、資料還救得回來時,系統會把它搬到備用區、把原磁區標記作廢,這個計數就加一。數字在動,代表壞軌正在發生。
  • 197 目前待處理磁區(Current Pending Sector):這是「讀到一半出錯、還沒處理掉」的不穩定磁區。它其實比 05 更該讓你緊張,因為這代表資料當下就讀不出來、還卡在那裡等著被重寫或搬移。
  • 198 無法修正的磁區(Offline Uncorrectable):連錯誤更正碼都救不回來的磁區,出現這個數字就是真的掉資料了。

理解這三個的關係很重要:一個磁區壞掉時,通常先進「待處理」(197),系統之後重寫成功就把它「重新配置」到備用區(05 加一),重寫失敗才落到「無法修正」(198)。所以你常會看到 197 先漲、05 才跟上,這是同一件事的兩個階段。判斷準則也很單純:這三個欄位只要不是零,而且隔幾天再看還在往上加,這顆碟就是在走下坡。數字停在低檔、好幾週都沒動,可以先列入觀察名單;只要持續增加,別猶豫,直接排換碟——因為備用磁區池是有限的,用完之後下一個壞軌就無處可搬,會直接變成掉資料。至於要不要跑 SMART 自我測試:健康碟做個快速測試無妨,但已經有異音的碟千萬別去跑延伸測試,那等於叫腳已經受傷的人去跑一場全馬,只會加速它斷氣。

做了 RAID:降級之後為什麼一次只能動一顆

如果你的機器有做 RAID 1、5、6 或 Synology 的 SHR,那它天生就設計成能容忍硬碟故障:RAID 1 和 RAID 5 容許壞一顆,RAID 6 容許同時壞兩顆。壞一顆時陣列會進入「降級(Degraded)」狀態——資料還在、服務照跑、使用者甚至無感,但要認清一件事:此刻你的容錯額度已經歸零,等於走鋼索的人把安全網收掉了。再壞任何一顆,資料就沒了。所以降級之後的動作原則是又穩又快,而且一次只碰一顆:

  • 先對照管理介面上的槽位編號,確認到底是哪一槽出事,別靠印象、別憑面板燈位置猜。拔錯槽——把好的那顆拔掉——是整個劇本裡最慘的一種死法。
  • 準備一顆同容量或更大的健康新碟,關機更換,或依機型支援熱插拔直接換上。
  • 回到儲存空間管理介面按「修復」,讓重建開始跑。整段重建期間不要中斷、不要拔任何一顆碟、也別挑這時候灌一大批資料進去。

重建為什麼這麼怕被打擾:URE 的數學

重建這件事的本質,是把陣列裡其他每一顆碟從頭到尾完整讀一遍,再用同位校驗資訊把內容一格一格算回新碟。這帶來兩個現實問題。第一是慢:一顆 4TB 的碟就算平均以每秒 150MB 的速度讀,純讀寫也要七個多小時,而實務上機器是邊對外服務邊重建,拖上一整天到兩天很正常,這整段時間陣列都是零容錯裸奔。第二個問題更致命:其他每一顆「看起來還健康」的碟,這時候要承受平時根本不會有的、從頭到尾的滿載讀取,哪顆碟裡藏著一直沒被踩到的潛伏壞軌,往往就在這一刻爆出來。

換碟眉角:認明 CMR,避開 SMR

換碟不是同容量隨便買一顆塞進去就好,關鍵在磁記錄方式。務必挑CMR(傳統磁記錄)的 NAS 系列碟,避開SMR(疊瓦式磁記錄)。差別在物理層:CMR 的資料軌道是一條一條並排、互不干擾,要改寫哪一軌就改哪一軌;SMR 為了衝容量,把軌道像屋瓦一樣一片壓一片交疊,好處是同樣碟面塞得下更多資料,壞處是——你想改寫其中一軌,就得連帶把壓在它上面的那幾軌一起讀出來、重算、重寫。

這個「讀—改—寫」的連鎖放大,在一般家用備份時感覺不明顯,因為 SMR 碟前面墊了一小塊 CMR 快取當緩衝;但一碰到 RAID 重建這種持續、大量、不間斷的寫入,那塊快取幾分鐘就被灌爆,之後每一筆寫入都要走完整的讀改寫循環,寫入速度會從一百五十幾 MB/s 直接崩到剩個位數。後果有兩個:一是重建時間整個翻倍甚至更誇張,別家 CMR 八到十二小時收工,SMR 可能拖上三到五天;二是更危險的「幽靈掉線」——當 SMR 碟忙著重整疊瓦軌道、久久不回應指令,RAID 控制器的錯誤逾時機制會誤判它壞掉、把一顆其實好好的碟踢出陣列,在降級狀態下這一踢就可能要你的命。所以規矩很簡單:SMR 頂多拿去當外接備份碟,絕對不要放進 NAS 陣列。

現場最常犯的那個錯:拔出來再插回去

講完該做的,也講一個最常見、殺傷力最大的錯誤操作:把亮紅燈的碟拔出來、再插回去,想讓它「重新整理一下」。這個把 NAS 當隨身碟的直覺,在 RAID 上是災難。原因是 RAID 靠的是每一顆成員碟上記錄的中繼資料在維持隊形,你把碟拔出再插回,某些系統會把它當成一顆全新的碟、觸發一次根本不必要的重建;而在已經降級的狀態下,只要你手一滑拔錯、或系統判定錯誤,RAID 5 瞬間少掉兩顆成員,整個儲存空間當場報銷。會這樣操作的人,多半以為「重插就會自己好」,但 RAID 不是這樣運作的,它經不起這種土法試錯。記住:降級狀態下,任何一次多餘的拔插都是在拿全部資料下注。

把適用邊界講清楚:RAID 不是備份

上面這整套流程有它的前提,這個前提一定要講明白:它只適用於「有容錯的 RAID、而且目前只壞一顆」的情況。如果你的儲存空間是 RAID 0,或根本是單碟的基本模式,那對不起,沒有降級這個緩衝帶——紅燈亮起的當下,資料就已經站在懸崖邊,重點要立刻從「換碟重建」切換成「搶救資料」,趁還讀得到趕快複製,能救多少是多少。

還有一個觀念要一起釘死:RAID 擋的是硬碟故障,擋不了別的。它救不了你手殘誤刪、救不了勒索病毒把檔案全加密、救不了整台機器泡水或失竊。這些情境下,RAID 裡的每一顆碟都乖乖同步著壞掉的結果。真正能兜住這些的,是異地備援,也就是老生常談但沒人做得完整的 3-2-1 備份原則:至少三份資料、放在兩種不同媒介、其中一份存在異地。RAID 讓你在硬碟壞掉時服務不中斷,備份才是你最後那道保命符,兩件事不能互相取代。

如果你現在正對著一顆亮紅燈的碟,分不清是單純降級還是更糟的狀況,最安全的做法就是:先什麼都別拔,把儲存空間管理頁面的畫面截圖,用 LINE 傳給廷皓,或直接撥 07-363-0802。高雄、台南、屏東我們都到得了,從研判嚴重程度、挑對碟、換碟,一直盯到整個重建跑完、陣列回到健康狀態,都可以幫你代勞——與其事後花五、六萬賭資料救援,不如在紅燈剛亮、還來得及的時候,讓懂的人先看一眼。

聯絡廷皓討論 看更多文章