Amazon Web Services,全球最大的雲端服務提供商,已發出內部指示,要求其工程團隊減少 CPU 浪費並清理利用率不足的 EC2 實例。原因很直接:由於 AI 工作負載推動的運算需求已超過供應,目前申請新 CPU 容量的工程師需等待數日才能獲得。
AWS 內部實際發生了什麼
這些指示可追溯至五月舉行的內部會議,當時管理層強調,在期待新硬體到貨之前,必須先最大化利用現有基礎設施。工程師已收到截止日期,要求識別並減少閒置的 EC2 實例,據稱此類實例佔所有運行實例的約 65% 處於低利用率狀態。
AWS 內部推動的優化操作手冊包括更佳的實例尺寸調整(將實例類型與實際工作負載需求匹配)、自動關閉不活動的實例,以及在團隊配置和管理資源方面進行更廣泛的效率提升。
新 CPU 伺服器容量的多日延遲是最明顯的徵兆。AWS 過去一直保有足夠的餘裕,使內部團隊能夠相對快速地啟動資源。當配置時間從數小時延長至數天,代表基礎設施已接近紅線,這遠非任何人所願見。
AI 正在吞噬資料中心
AWS 並非唯一感受到壓力的公司。微軟 Azure 和 Google Cloud 近期在財報電話會議中均承認了容量限制,尤其是 GPU 的可用性已成為全行業的瓶頸。但 AWS 的 CPU 容量趨緊是較新的發展,這表明壓力已不僅限於最受關注的 GPU 集群。
亞馬遜一直大力投資於定制晶片,包括用於通用計算的 Graviton 處理器和用於 AI 訓練的 Trainium 晶片,部分目的是為了減少對外部供應商的依賴,部分則是為了提升每瓦性能。但晶片製造的時間線意味著這些投資需要數個季度甚至數年才能轉化為部署的容量。
這對雲端客戶和更廣泛的市場意味著什麼
對於在 AWS 上運行工作負載的公司而言,供應商層面的內部容量壓力可能以多種方式呈現。某些實例類型在特定區域可能更難預訂。基於可用剩餘容量波動的按需實例定價,可能隨著剩餘容量減少而上漲。AWS 已調整預訂容量的公布定價,包括在 2026 年初對 GPU 家族普遍上調約 15%。
最可能受到影響的企業客戶是那些運行資源密集型應用程式且未承諾預留容量的公司。通過餘幣寶或預留實例鎖定容量的公司則受到一定程度的保護。依賴按需配給的客戶可能在需求高峰期間面臨可用性波動或支付高價費用。
