亞馬遜雲端服務(Amazon Web Services)是推動互聯網大規模運作的雲端計算巨頭,如今卻做了一件對於一家萬億美元公司來說幾乎顯得過時的事:要求工程師關閉他們未使用的電腦。
該指令針對閒置的 EC2 實例,這些虛擬伺服器構成了 AWS 雲端基礎設施的主幹。隨著 AI 工作負載以加速的速度消耗 GPU 容量,即使是全球最大的雲端供應商也感到壓力倍增。
廢物問題的規模
這些數字揭示了驚人的低效狀況。在30天的測量窗口內,約65%的EC2實例的平均CPU使用率低於20%。
AWS 的 Compute Optimizer 工具已升級,可偵測這些幽靈伺服器。它現在會分析過去 14 天的 CPU 使用率和網路 I/O,標示出峰值 CPU 持續低於 5% 且網路流量可忽略的實例。
亞馬遜首席執行官安迪·賈西透露,AWS 在過去一年增加了超過 3.8 吉瓦的電力容量。作為參考,這足以供應約 280 萬戶家庭使用。公司計劃在 2027 年前將其容量翻倍。
AI 需求正在打破經濟學
容量緊張有明確的驅動因素:人工智慧。GPU 加速實例作為訓練和運行大型語言模型的主力,已成為雲端運算中最稀缺的資源。
這種需求壓力已直接反映在定價上。用於機器學習的 EC2 容量塊在 1 月價格上漲了約 15%,到 7 月又再次上漲了約 20%。同一項服務在六個月內出現兩次調價,反映了供需失衡的狀況。
據報導,持續的 GPU 短缺已促使一些 AWS 客戶考慮將業務轉移至其他競爭雲端供應商。
這對雲端市場意味著什麼
對於在 AWS 上運行工作負載的企業而言,定價趨勢值得密切關注。一年內對機器學習容量模塊的兩次重大調價表明,嚴重依賴雲端 AI 處理的公司應為持續的成本上升做好預算規劃。
65% 的資源未充分利用並非僅是 AWS 的問題,這反映了整個行業過度配置資源的習慣,因為啟動新實例總比調整現有實例的大小來得容易。
亞馬遜計劃到2027年將其數據中心容量翻倍,這將成為企業歷史上最大規模的基礎設施建設之一。但在這期間,該公司似乎採用了雙管齊下的策略:在建設更多容量的同時,也盡可能提升現有設施的利用率。
