Amazon Web Services, nhà cung cấp đám mây lớn nhất thế giới, đã ban hành các hướng dẫn nội bộ yêu cầu các đội ngũ kỹ thuật cắt giảm lãng phí CPU và dọn dẹp các phiên bản EC2 sử dụng không hiệu quả. Lý do rất đơn giản: nhu cầu về khả năng tính toán, chủ yếu do các tải công việc AI thúc đẩy, đang vượt quá nguồn cung, và các kỹ sư yêu cầu thêm dung lượng CPU hiện phải chờ vài ngày mới nhận được.
Điều gì đang thực sự xảy ra bên trong AWS
Các chỉ đạo này xuất phát từ các cuộc họp nội bộ được tổ chức vào tháng Năm, nơi ban lãnh đạo nhấn mạnh nhu cầu tối đa hóa cơ sở hạ tầng hiện có trước khi mong đợi thiết bị mới đến. Các kỹ sư đã được giao thời hạn để xác định và giảm số lượng các phiên bản EC2 không hoạt động, một danh mục được cho là chiếm khoảng 65% tổng số phiên bản đang chạy bị sử dụng không hiệu quả.
Sổ tay tối ưu hóa mà AWS đang thúc đẩy nội bộ bao gồm điều chỉnh kích thước phù hợp hơn (phù hợp loại instance với nhu cầu tải thực tế), tắt tự động các instance không hoạt động, và cải thiện hiệu quả rộng hơn trong cách các đội ngũ cấp phát và quản lý tài nguyên.
Sự chậm trễ nhiều ngày trong việc bổ sung dung lượng máy chủ CPU là triệu chứng rõ ràng nhất. AWS trước đây luôn vận hành với đủ khoảng trống để các đội nội bộ có thể khởi động tài nguyên một cách tương đối nhanh chóng. Khi thời gian cấp phát kéo dài từ vài giờ thành vài ngày, cơ sở hạ tầng đang vận hành gần mức giới hạn hơn bất kỳ ai mong muốn.
AI đang ăn mòn trung tâm dữ liệu
AWS không phải là đơn vị duy nhất cảm nhận áp lực. Microsoft Azure và Google Cloud đều đã thừa nhận hạn chế về năng lực trong các cuộc gọi báo cáo kết quả gần đây, đặc biệt là khả năng cung cấp GPU đang trở thành điểm nghẽn trên toàn ngành. Nhưng việc dung lượng CPU tại AWS trở nên khan hiếm là một phát triển mới, cho thấy áp lực đang lan rộng ra ngoài các cụm GPU vốn nhận được nhiều sự chú ý nhất.
Amazon đã đầu tư mạnh vào chip tùy chỉnh, bao gồm các bộ xử lý Graviton cho tính toán tổng quát và chip Trainium cho đào tạo AI, một phần để giảm sự phụ thuộc vào các nhà cung cấp bên ngoài và một phần để cải thiện hiệu suất trên mỗi watt. Nhưng chu kỳ sản xuất chip có nghĩa là những khoản đầu tư này mất nhiều quý hoặc nhiều năm mới chuyển hóa thành công suất được triển khai.
Điều này có nghĩa gì đối với khách hàng đám mây và thị trường rộng lớn hơn
Đối với các công ty chạy tải công việc trên AWS, áp lực về năng lực nội bộ tại cấp nhà cung cấp có thể biểu hiện theo nhiều cách. Một số loại instance có thể trở nên khó đặt chỗ hơn ở các khu vực cụ thể. Giá instance Spot, vốn biến động dựa trên năng lực dư thừa sẵn có, có thể tăng lên khi năng lực dư thừa này thu hẹp. AWS đã điều chỉnh giá công bố cho các năng lực đặt trước, bao gồm mức tăng đáng chú ý khoảng 15% trên các họ GPU vào đầu năm 2026.
Những khách hàng doanh nghiệp có khả năng chịu ảnh hưởng nhiều nhất là những người chạy các ứng dụng đòi hỏi nhiều tài nguyên mà không có cam kết về dung lượng được đặt trước. Các công ty đã khóa dung lượng thông qua các kế hoạch tiết kiệm hoặc các phiên bản được đặt trước sẽ được bảo vệ phần nào. Những người phụ thuộc vào việc cấp phát theo yêu cầu có thể phải đối mặt với các sự cố về khả năng sẵn có hoặc phải trả mức giá phí trong các giai đoạn nhu cầu cao điểm.
