技術文章 · 網路與網通建置

交換器某個埠不通怎麼查?換線、換埠、看燈號三招快速定位

交換器某個埠不通,先用換線、換埠一次刪一個變數,再從 Link 燈號和錯誤計數讀線索。廷皓的網管師傅解釋雙工協商不符為什麼讓網路有通卻慢到個位數 Mbps、線芯傷一對為什麼會降速到 100M 或讓千兆一直閃,以及怎麼分辨真壞埠、設定鎖埠、該不該換整台。高雄、台南、屏東到府維修。

作者 Steve Chen · 發布  · 更新  · 約 8 分鐘閱讀

網路與網通建置 — 廷皓技術專欄插圖

同一台設備、同一條線改插相鄰 Port 就正常,確實把嫌疑縮到原 Port,但還不能直接判定硬體壞掉。VLAN、Port Security、STP、err-disable、速率協商、PoE 與實體接點,都可能造成「只有這一孔不通」。

排錯的第一原則:一次只動一個變數

網路排錯最容易白忙一場的原因,就是一次動太多。某台設備連不上,正確的順序是把「線、埠、設備」這三個嫌疑人一個一個隔離出來,這在工程上就叫控制變數法:每次只改一個條件,才能確定實際是誰的問題。

第一步永遠是換一條確定是好的網路線。機房要常備一條測過、貼了標籤的短跳線,把可疑的那條換下來;一換就通,收工,就是線的問題。網路線被機櫃門夾過、被拖過地面磨破皮、水晶頭卡榫斷掉造成接觸不良,這些外觀常常看不出來。線換了還不通,再把同一條好線改插到旁邊確定正常的空埠;換埠就通,原本那個埠的嫌疑就很重了。兩步做完,三個嫌疑人至少能刪掉兩個。千萬別一口氣又換線又換埠又換電腦,全部一起動,就算通了你也不知道是誰的功勞,下次照樣踩同一個坑。

順手把距離也一起查掉

結構化佈線的國際標準把一條銅纜通道的總長訂在 100 公尺,而且這 100 公尺是有分配的:牆內固定佈線(永久鏈路)最多 90 公尺,兩端的跳線加起來留 10 公尺。倉庫、廠房這種一條線從機房拉到最角落的環境,很容易不知不覺就超標。

為什麼超長會時通時斷、症狀跟壞埠很像?關鍵在插入損耗:訊號在銅線上跑會隨距離衰減,而且速率越高、載波頻率越高,衰減得越兇。千兆的工作頻率遠高於百兆,所以一條勉強能跑百兆的超長線,換到千兆就撐不住,訊號掉到臨界點就開始飄。還要提醒一點,跳線用的是多蕊軟線,插入損耗本來就比牆內的單蕊硬線高,所以別靠拉長跳線來湊距離。手邊備一支幾百塊的測線器,八芯通斷、線序、長度一測就知道,能省掉大把瞎猜的時間。

燈號會說話:不亮、有亮不閃、顏色不對

插上線,先看埠上那顆燈,它其實一直在跟你報告實體層的狀態。

  • Link 燈完全不亮:代表最底層的實體連線根本沒建立起來。問題出在線材、對端設備沒開機、或這個埠真的陣亡了:先照上面換線換埠的順序刪變數。
  • 燈恆亮卻幾乎不閃:連線有建立,只是幾乎沒有資料在走。這時方向要轉往上層,去看 IP 設定、VLAN、對端服務有沒有起來,硬體層多半是好的。
  • 燈狂閃個不停、而且整個網路一起變慢:要高度懷疑線路接成了迴圈,造成廣播風暴。一個廣播封包在環路裡無限繁殖,交換器的 CPU 和頻寬瞬間被灌爆,全網跟著卡死。這種通常是有人把兩個埠對接、或多接了一台小交換器又接回自己造成的。

多數交換器還會用燈色、或旁邊另一顆燈表示速率,常見是綠燈代表 1000M、橘燈代表 10/100M,但各家定義不完全一樣,判讀前最好翻一下那台機器面板上的標示。燈號的細部差異,我在另一篇專門談交換器燈號的文章裡整理得更全。

最陰的兩種狀況:看起來有通,實際慢到哭

完全不通反而好查,最耗時間、也最容易被冤枉成「埠壞了」的,是「有通、但慢到不合理」。這裡面藏著兩個經典陷阱,幾乎每個機房都遇過,值得拆開講清楚機制。

陷阱一:雙工協商不符

乙太網路的自動協商是 IEEE 802.3 定義的機制,正常會讓兩端自己談好速率和雙工模式(全雙工是收發同時進行,半雙工是同一時間只能收或只能發)。麻煩出在混搭:只要一邊被人手動鎖成「固定速率+全雙工」,另一邊維持自動協商,自動這端偵測得到對面的速率,卻偵測不到雙工能力,依照標準的相容規則,它只能保守地退回半雙工。

結果就是一邊全雙工、一邊半雙工。平常收發零星小封包沒感覺,一傳大檔案就出事:半雙工這端一邊在發、一邊又收到資料,判定成碰撞就中止傳送,於是半雙工端的延遲碰撞和 FCS 錯誤計數會狂跳,全雙工端則收到一堆被中止的過短殘包。在大量封包重傳的拖累下,實測速度可以從應有的水準直接掉到剩個位數 Mbps,人卻還連得上,難怪讓人第一時間去怪埠。所以老工程師的準則很簡單:要嘛兩邊都設自動協商,要嘛兩邊都手動鎖成完全一樣,最忌一邊自動、一邊鎖死。順帶一提,千兆乙太網路的標準本身就強制要開自動協商,反而是十兆/百兆時代留下來的「手動鎖定比較穩」的老習慣,最常闖出這個禍。

陷阱二:線芯傷了一對

這個更隱蔽。千兆(1000M)傳輸要用滿網路線裡全部四對芯線,靠四對同時雙向收發、再用回音消除和適應性等化把訊號分離出來;而百兆(100/10M)只需要其中兩對就夠。所以線材裡只要有一對芯線受傷:被夾斷一芯、水晶頭某一 pin 沒壓好、或長期彎折疲勞:千兆就湊不齊四對。

接下來會發生什麼,要看設備有沒有開「自動降速」這個功能,這也是很多人搞不清楚、以為一定會降速的地方:

  • 有降速功能:晶片嘗試建立千兆連線失敗幾次後(常見是試 4 次,有些機種可設到 8 次),會自動退而求其次,改用還完好的那兩對跑 100M。結果就是燈有亮、網路有通、速度卻只剩十分之一,設備的紀錄裡常會冒出「已從 1Gbps 降速到 100Mbps,請檢查線材」這類訊息。
  • 沒有、或關掉降速功能:兩端還是照樣談成千兆,但四對湊不齊、連線根本立不起來,於是這個埠就一直「協商成功→連線失敗」來回打轉,表現成燈閃爍不定、時通時斷,甚至整個不通。所以線芯斷一對不見得是乖乖降速,也可能是讓千兆一直閃,這點很多人會誤判。

因此,看到協商速率卡在 100M 上不去,或一條千兆線一直在閃、連不穩,都先驗線再說,別急著怪交換器。線材等級和四對芯線的差別,我在談 Cat5e 和 Cat6 差在哪的那篇講得比較細。

確認是真壞埠之後,該不該換整台?

好線換過、對端設備正常、雙工和速率設定也對,就單獨這一個埠不亮不通、其他埠都活跳跳,基本就能判定這個埠壞了。個別埠陣亡在現場其實很常見,元兇多半是這幾個:靜電、雷擊突波順著戶外線灌進來、以及長年插拔造成的接觸磨損。

成因值得多講一句,因為它直接牽動你要不要換整台。埠會被打壞,很多時候是靜電放電或突波這類瞬態高壓:乾燥的廠房裡,人走幾步累積的靜電,一碰接頭放電就足以擊穿埠內脆弱的半導體;戶外線在雷雨天引進來的突波更猛,一次就能同時打死攝影機、交換器上好幾個埠。這也是為什麼講究的機房會在進線端加突波保護,把過電壓引導去接地洩掉;而接地要是沒做好,那層保護幾乎等於白裝。

我的判斷準則是這樣:

  • 只壞一個埠、空埠還夠用:把線移到好埠,在壞埠貼上標籤註記日期就好,不必急著換機。
  • 同一排相鄰好幾個埠一起掛:這通常是背後同一顆晶片一起出事,不是單點故障,這台的壽命也差不多到了。
  • 又剛好是只有 100M 的老機器:那就趁這次直接汰換成千兆機種比較實在,順便把進線的突波保護和接地一起補起來,不然換了新機,一樣被同一道雷打死。

有一種「壞埠」其實是設定,不是硬體

這套換線換埠的流程,有個邊界我得老實講:它適用於無網管型、或設定很單純的交換器。到了管理型交換器上,一個埠不通的原因可能整個換一批:被管理者手動關閉、被劃進了不同的 VLAN 出不去、或被迴圈防護機制自動封鎖。這些狀況表現得跟壞埠一模一樣:你換線換埠怎麼試都不通,硬體其實好端端的。

舉個最容易誤判的:多數管理型交換器會在某個埠上偵測到不該出現的橋接訊號(BPDU)時,判定有人私接了小交換器、可能造成迴圈,於是主動把那個埠強制關閉,進入一種保護性的停用狀態(不同廠牌名稱不一樣,常見寫作 err-disabled 或 error-disable)。這種被鎖住的埠不會自己恢復,除非事先設了自動回復,否則要進管理介面把埠關掉再開一次,或先解決私接、迴圈的根因,它才會活過來。

所以碰到公司機房的設備怎麼查都查不出來,先別急著判死那個埠:登入管理介面,看那個埠的狀態和計數器最快。錯誤計數一直在跳的埠,八九不離十是線材或前面講的協商問題,不是埠真的壞;顯示被停用或被封鎖的,那就是設定或迴圈,跟硬體一點關係都沒有。分清楚這一層,才不會把一台好好的交換器誤判成該報廢。

對照指令

聯絡廷皓討論 看更多文章