數據中心小零件釀大危機 不明故障頻生 歸咎晶片太複雜
原文刊於信報財經新聞「StartupBeat創科鬥室」
數據中心支撐全球科網運作,但任何高科技設備中的零部件都可能存在技術失誤,而且往往要在爆出嚴重事故後,隱藏漏洞才會浮現。美國《紐約時報》報道,近年雲端網絡龐大複雜,不少巨企擔心數據中心伺服器的晶片不夠可靠,隨時引發不明硬件故障,甚至釀成大規模系統癱瘓。
Google年均4%伺服器意外關機
《紐約時報》引述史丹福大學一位電機工程師Subhasish Mitra指出,大型科網平台系統故障,問題較多出於伺服器硬件運作錯誤,而根源來自底層硬件,包括晶片。
早於2015年,工程界權威刊物IEEE Spectrum引述一份研究報告提到,Google數以百萬計伺服器硬件中,每年平均有4%因一些無法偵測的錯誤而意外關機。
報告提到,在一枚擁有數十億個晶體管的微處理器或電腦記憶體中,每一個可以儲存0和1(電腦最原始基本語言)的微型開關(Tiny Switches),只要出現任何微小錯誤,都足以拖垮每秒執行數十億次運算的電腦系統。社交平台Facebook有研究員認為,微型開關愈來愈容易磨損,令電腦記憶體及處理器的壽命比以前更短。
一直以來,設計電腦的科學家都希望透過添加特殊電路,偵測及自動修正不良數據。然而,Google近年接報一些難以診斷的硬件錯誤,部分只會在某些特定條件下,例如運算速度或溫度產生變化時出現。研究人員相信,這跟處理器設計愈見複雜、晶體管愈趨細小,以及廠方測試不足等因素有關。
助測錯誤監控軟件需求飆
美國晶片商超微半導體(AMD)前年的一份報告,認為DDR4記憶體晶片的可靠程度反而比起上一代的DDR3產品差5.5倍。電腦製造商聯想(00992)曾告知客戶,美國晶片生產商英特爾(Intel)新一代處理器可能比上代產品暗藏更多難以修正的錯誤。
針對硬件錯誤漸趨頻繁,《紐約時報》指出,一些能夠監控晶片健康狀況和硬件錯誤的新型軟件,需求大大增加。此外,英特爾已啟動一個新項目,透過開源軟件協助數據中心營運商,偵測和修正晶片電路未偵測的硬件錯誤,並且改變處理器的設計。
支持EJ Tech
如欲投稿、報料,發布新聞稿或採訪通知,按這裏聯絡我們。
Related Posts
Latest News
-
區塊鏈技術為數碼經濟奠基(林國誠)
近年來,區塊鏈技術在各行各業的數碼轉型發揮了重要作用,其應用已超越加密貨幣的範疇,廣泛滲透至供應鏈管理、電子病歷管理、跨境支付及版權保護等多個領域。
- Posted January 17, 2025
- 0
-
善用科技對抗網上假消息(黃岳永)
引發情緒反應的聳動標題,才能吸引讀者關注。因此,要避免受騙或成為散播假消息的幫兇,就需要具備辨別事實與虛構的能力。
- Posted January 17, 2025
- 0
-
AI醫學|化學諾獎團隊用AI 設計抑制蛇毒蛋白質
蛇毒含有複雜的毒素混合物,大部分成份是蛋白質。獲頒2024年化學諾貝爾獎的美國華盛頓大學教授貝克(David Baker),其團隊以一款人工智能(AI)軟件工具RFdiffusion,設計了全新的蛋白質,聲稱能夠抑制眼鏡蛇的三指毒素(3FTx)。
- Posted January 17, 2025
- 0
-
Microsoft Copilot|加推Copilot Chat 逐條訊息收費
微軟(Microsoft)為企業用戶推出新產品Microsoft 365 Copilot Chat,服務以OpenAI旗下GPT-4o的人工智能(AI)模型為基礎,讓用戶提出與業務相關的問題、建立工作流程自動化或產生圖像等。
- Posted January 17, 2025
- 0
-
OpenAI|美印測試 手機號碼開戶
聊天機械人ChatGPT開發商OpenAI,正於美國及印度測試一項功能,容許新用戶毋須電子郵件,以手提電話號碼註冊新賬戶,惟未計劃推廣至其他地區。
- Posted January 17, 2025
- 0
-
中國發明|極速機械豹 每秒最快跑10米
浙江大學杭州國際科創中心人形機器人創新研究院,聯合鏡識科技有限公司、凱爾達(688255.SH)焊接機器人股份有限公司共同研發的「黑豹2.0」,號稱是全球跑得最快的「四足機械人」。
- Posted January 17, 2025
- 0
-
去中心化社媒崛興 回歸原創內容
隨着短片分享平台TikTok在美國遭封殺在即,Meta放寬旗下應用程式的內容限制,以至社交平台X(前稱Twitter)持續改動演算法等,社交媒體世界掀起轉會潮。
- Posted January 17, 2025
- 0