- Tình trạng ngừng hoạt động Internet ở APAC lan rộng nhanh chóng do nhiều người sử dụng cùng một nền tảng đám mây.
- Một sai sót có thể làm gián đoạn hoạt động thanh toán, chăm sóc sức khỏe, giao thông và các dịch vụ công cộng.
Khi các dịch vụ trực tuyến lớn không hoạt động, sự gián đoạn không còn tồn tại ở một góc của Internet nữa. Thanh toán chậm, kế hoạch du lịch bị đình trệ, hệ thống y tế đóng băng và hoạt động kinh doanh trì trệ – đôi khi chỉ trong vài phút. Những khoảnh khắc này cho thấy phần lớn thế giới hiện đang phụ thuộc vào một tập hợp hẹp các nền tảng kỹ thuật số được chia sẻ.
Để hiểu lý do tình trạng mất điện lan rộng đến nay và các tổ chức có thể làm gì để ổn định hệ thống của mình, Tech Wire Châu Á đã nói chuyện với Reuben Koh, Giám đốc Chiến lược & Công nghệ Bảo mật tại Akamai. Ông mô tả một môi trường kỹ thuật số nơi các dịch vụ hàng ngày được gắn kết với nhau chặt chẽ hơn hầu hết mọi người nhận ra và nơi mà một lỗi duy nhất có thể lan truyền qua các lớp hệ thống phụ thuộc.
Tại sao tình trạng mất điện ảnh hưởng đến nhiều ngành cùng một lúc
Koh cho biết nhiều lần ngừng hoạt động bắt đầu từ những nguyên nhân quen thuộc: thay đổi cấu hình không đúng, lỗi phần mềm hoặc lỗi phần cứng. Điều khiến chúng trở thành sự cố đa ngành chính là cấu trúc của Internet ngày nay.
“Sự cố ngừng hoạt động Internet lớn thường xuất phát từ các nguyên nhân cốt lõi tái diễn như cấu hình sai trong quá trình cập nhật định kỳ, lỗi phần mềm và lỗi phần cứng, thường là do lỗi của con người hoặc lỗi quy trình. Nhưng những vấn đề này còn phức tạp hơn do hệ sinh thái kỹ thuật số và cơ sở hạ tầng ngày nay quá nặng, được kết nối chặt chẽ và tập trung cao độ với các dịch vụ đám mây, lớp định tuyến dùng chung và nền tảng ứng dụng.”

Trước đây, sự cố của một máy chủ sẽ chỉ ảnh hưởng đến một số ít dịch vụ. Ngày nay, lỗi tương tự đó có thể nằm trong chuỗi các vùng đám mây lồng vào nhau, các API chung, hệ thống đăng nhập chung và các quyết định định tuyến toàn cầu. Khi có sự cố xảy ra, nó sẽ lan truyền nhanh chóng.
Koh chỉ ra rằng tác động nghiêm trọng hơn vì các dịch vụ thiết yếu hiện dựa trên cùng một nền tảng trung tâm. “Với các dịch vụ quan trọng như thanh toán tài chính, chăm sóc sức khỏe quan trọng và thương mại thiết yếu phụ thuộc vào cùng một nền tảng cơ sở hạ tầng tập trung, điều này càng trở thành một vấn đề lớn hơn.”
Những mối nguy hiểm tiềm ẩn khi dựa vào một vài nền tảng chính
Một thông điệp nổi bật trong ngành: nhiều tổ chức đã trở nên phụ thuộc vào một nhóm nhỏ các nhà cung cấp phần mềm và đám mây.
Koh cho biết: “Sự cố ngừng hoạt động là lời nhắc nhở rằng nhiều doanh nghiệp đã tập trung quá nhiều cơ sở hạ tầng kỹ thuật số của họ vào một số lượng nhỏ nền tảng đám mây, SaaS và mạng”. Khi dữ liệu, điện toán và logic ứng dụng đều nằm trong một vùng, một lỗi duy nhất có thể lan sang mọi thứ ở trên đó.
Đây là lý do tại sao ông nhấn mạnh sự cần thiết của thiết kế phân tán. Theo quan điểm của ông, mục tiêu không phải là sự hoàn hảo mà là sự cách nhiệt – tạo cho các hệ thống không gian để thất bại mà không làm hỏng mọi thứ.
Ông giải thích rằng các nền tảng biên toàn cầu hiện đại sử dụng tính năng cân bằng tải rộng và định tuyến theo thời gian thực để duy trì lưu lượng truy cập ngay cả khi một khu vực đang bị quá tải. Nhưng chỉ kiến trúc thôi thì chưa đủ. Ông nói: “Khả năng phục hồi cũng phụ thuộc vào kỷ luật hoạt động mạnh mẽ. Điều đó bao gồm các thử nghiệm chuyển đổi dự phòng, số liệu sẵn sàng và tư duy chấp nhận thời gian ngừng hoạt động là một khả năng thực sự thay vì rủi ro về mặt lý thuyết.
Đồng thời, các hệ thống tập trung tạo ra mục tiêu dễ dàng hơn cho những kẻ tấn công. Ông cảnh báo: “Việc tập trung quá mức thực sự có thể làm tăng rủi ro bảo mật bằng cách tạo ra các mục tiêu đơn lẻ hấp dẫn”. Các tổ chức có thể cảm thấy an toàn hơn khi dựa vào các nền tảng đám mây lớn, nhưng sự phụ thuộc tương tự đó có thể khiến họ gặp nguy hiểm nếu sự gián đoạn xảy ra với chính nhà cung cấp.
Các cơ quan quản lý hiện đang coi sự cố ngừng hoạt động trên đám mây là rủi ro hệ thống
Những sự gián đoạn gần đây đã buộc các cơ quan quản lý ở APAC và xa hơn nữa phải suy nghĩ lại về “cơ sở hạ tầng quan trọng” nghĩa là gì trong một thế giới ưu tiên kỹ thuật số. Koh lưu ý rằng các chính phủ hiện coi việc tập trung đám mây không chỉ là vấn đề kinh doanh mà còn là điều có thể ảnh hưởng đến sự ổn định quốc gia.
Ông chỉ ra Cơ quan Phát triển Truyền thông Infocomm (IMDA) của Singapore, cơ quan đã công bố các nguyên tắc phục hồi đám mây gắn liền với Đạo luật Cơ sở hạ tầng Kỹ thuật số sắp tới. Các hướng dẫn coi hệ thống đám mây là cơ sở hạ tầng điện toán quốc gia thiết yếu. Họ kêu gọi quản trị chặt chẽ hơn, kiểm soát thay đổi mạnh mẽ hơn, tách biệt khối lượng công việc và kiểm tra chuyển đổi dự phòng thường xuyên.
Úc cũng đang cảnh báo các tổ chức tài chính về việc phụ thuộc vào một số công ty siêu quy mô ở nước ngoài, trong khi Cơ quan Dịch vụ Tài chính Nhật Bản đang chú trọng hơn đến rủi ro đám mây của bên thứ ba.
Xu hướng thậm chí còn rõ ràng hơn bên ngoài khu vực APAC. Koh lưu ý rằng Đạo luật về khả năng phục hồi hoạt động kỹ thuật số (DORA) của Châu Âu sẽ đặt các nhà cung cấp đám mây lớn dưới sự giám sát trực tiếp. Tại Hoa Kỳ, các cơ quan tài chính và an ninh mạng muốn các công ty chứng tỏ rằng họ có thể tiếp tục hoạt động ngay cả khi nền tảng đám mây chính của họ gặp sự cố.
Ông nói: “Trên tất cả các khu vực pháp lý này, định hướng rõ ràng là các tổ chức sẽ phải lập kế hoạch cho sự cố đám mây vì vấn đề ổn định kinh tế và khả năng phục hồi của quốc gia, chứ không chỉ là nghĩa vụ pháp lý”.
Những hiệu ứng gợn sóng xã hội kéo dài lâu sau khi các hệ thống phục hồi
Trong khi mất điện thường được mô tả dưới dạng lỗi kỹ thuật, những ảnh hưởng tiếp theo có thể ảnh hưởng đến hầu hết mọi lĩnh vực của cuộc sống hàng ngày.
Koh cho biết cái giá bị bỏ qua nhiều nhất là sự mất niềm tin sau đó. Mọi người phụ thuộc vào hệ thống kỹ thuật số cho công việc, dịch vụ công cộng và các nhiệm vụ thiết yếu. Khi những hệ thống đó thất bại, niềm tin vào độ tin cậy của chúng sẽ yếu đi.
Ông đưa ra một số ví dụ. Trong lĩnh vực chăm sóc sức khỏe, việc ngừng hoạt động có thể làm chậm việc truy cập hồ sơ điện tử, trì hoãn kế hoạch điều trị hoặc làm gián đoạn lịch trình phẫu thuật. Trong vận tải và hậu cần, các API không thể truy cập có thể phá vỡ hệ thống bán vé, theo dõi bưu kiện hoặc các công cụ định tuyến.
Ông nhấn mạnh một trường hợp gần đây ở Úc, nơi viễn thông toàn quốc bị ngừng hoạt động khiến hơn 10 triệu người không có dịch vụ di động và cố định. Ông nói: “Sự kiện này đã thúc đẩy sự giám sát và cải cách theo quy định xung quanh cơ sở hạ tầng quan trọng và các nghĩa vụ chuyển vùng khẩn cấp”. Nó cũng cho thấy một sự cố mạng có thể ảnh hưởng như thế nào đến giao thông công cộng, bán lẻ, truy cập khẩn cấp và các dịch vụ của chính phủ.
Ở nhiều quốc gia APAC, nơi các dịch vụ công kỹ thuật số đang mở rộng nhanh chóng, sự cố ngừng hoạt động trên đám mây có thể khiến đời sống công dân bị tạm dừng. Xã hội càng phụ thuộc vào cơ sở hạ tầng kỹ thuật số chung thì những thất bại này càng trở nên nghiêm trọng hơn.
Tại sao mạng điện toán phân tán và mạng biên lại quan trọng
Koh coi điện toán phân tán là một bước thực tế để ngăn chặn thất bại. Mục đích không phải là loại bỏ tình trạng mất điện – điều mà ông tin là không thể – mà là để hạn chế phạm vi tiếp cận của chúng.
Ông nói: “Chìa khóa ở đây là kiến trúc khả năng phục hồi sâu về cách các ứng dụng, hệ thống và mạng kết nối với nhau. Việc di chuyển các chức năng điện toán trong mạng biên phân tán sẽ chuyển các phần phụ thuộc từ một nhà cung cấp hoặc vị trí duy nhất sang một nhóm lớn các nút tự trị.
Ông mô tả biên là một mạng lưới gồm các “tế bào” cục bộ hoạt động độc lập. Nếu một nút bị lỗi, lưu lượng truy cập sẽ được đẩy đến các nút lân cận và sự gián đoạn sẽ trở thành sự kiện cục bộ thay vì toàn cầu.
Ông cho biết thiết kế này làm giảm các điểm tắc nghẽn và giúp các kỹ sư trang web có thêm thời gian để khắc phục sự cố mà người dùng không cảm nhận được toàn bộ tác động. Hiệu suất, bảo mật và độ trễ cũng có thể được cải thiện vì quá trình xử lý diễn ra gần hơn với người dùng cuối.
Suy nghĩ lại về tính liên tục trong kinh doanh cho một thế giới siêu kết nối
Koh lưu ý rằng các doanh nghiệp thường đặt mục tiêu đạt 100% thời gian hoạt động, nhưng cấu trúc của các hệ thống ngày nay khiến điều đó trở nên phi thực tế. Các hoạt động kỹ thuật số và vật lý quá gắn bó với nhau và lỗi ở khu vực này thường lan sang khu vực khác.
Ông gợi ý một sự thay đổi trong tư duy. Thay vì giả định tính sẵn sàng hoàn hảo, doanh nghiệp nên lập kế hoạch kiểm soát sự xuống cấp của các dịch vụ quan trọng. Ông nói: “Một ví dụ sẽ là các tổ chức xây dựng cơ chế giảm nhẹ hiệu suất dịch vụ cho hầu hết các doanh nghiệp quan trọng thay vì hoàn toàn không có sẵn”.
Koh cũng khuyến khích đa dạng hóa nhà cung cấp và khu vực. Điều này giúp tránh sự ràng buộc của nhà cung cấp và giảm nguy cơ ngừng hoạt động duy nhất ảnh hưởng đến mọi bộ phận của doanh nghiệp.
Ông nói thêm rằng cơ sở hạ tầng biên toàn cầu có thể cung cấp một lớp bảo vệ khác bằng cách chuyển hướng lưu lượng truy cập đến các nút có sẵn ngay cả khi vị trí chính bị lỗi. Mục tiêu là xây dựng các biện pháp kiểm soát “hấp thụ sốc” – sự kết hợp giữa kiểm tra sức chịu tải, cải tiến kiến trúc và công nghệ mới giúp giảm bán kính nổ của bất kỳ sự cố nào.
Điều gì sẽ xảy ra tiếp theo: AI, API và những lỗi khó dự đoán hơn
Khi các tổ chức áp dụng nhiều AI, thiết bị IoT và hệ thống tự động hơn, họ sẽ phải đối mặt với những loại gián đoạn mới lây lan nhanh hơn và khó ngăn chặn hơn.
Koh cho biết: “AI, IoT và các hệ thống siêu kết nối đang mở rộng bề mặt tấn công kỹ thuật số và tạo ra các loại mô hình lỗi mới khó dự đoán, phát hiện và ngăn chặn hơn”.
Anh ấy chỉ ra API là một điểm yếu lớn. Các API hiện liên kết các dịch vụ đám mây, logic nghiệp vụ và quy trình làm việc tự động với nhau. Các cuộc tấn công liên quan đến cạn kiệt tài nguyên, xác thực bị hỏng hoặc lạm dụng có thể gây ra các sự cố vận hành quy mô lớn vì API là cốt lõi của rất nhiều hệ thống.
Ông cho biết “bán kính bùng nổ” của một cuộc tấn công API đang gia tăng khi các giao diện này xuất hiện ở hầu hết mọi dịch vụ kỹ thuật số.
Lưu lượng truy cập bot do AI điều khiển cũng đang tăng lên. Koh nêu bật những phát hiện từ báo cáo Trạng thái Internet gần đây cho thấy sự gia tăng đột biến các cuộc tấn công tự động sử dụng bot hỗ trợ AI. Những kỹ thuật như vậy làm cho việc mạo danh, lừa đảo và gian lận danh tính trở nên dễ dàng hơn đối với cả những kẻ tấn công lành nghề và những kẻ ít kinh nghiệm hơn.
Để chuẩn bị, ông kêu gọi các tổ chức cải thiện khả năng phát hiện và bảo vệ API, tăng cường quản lý bot và bảo mật các mô hình AI của họ. Quan trọng nhất, ông tin rằng sự giám sát của con người sẽ quan trọng hơn bao giờ hết. Ông nói: “Các tổ chức cũng cần phải thừa nhận rằng không chỉ con người, mà cả bản thân AI, cũng có thể hành xử không thể đoán trước được”. Điều đó có nghĩa là tăng cường quản lý thay đổi, ứng phó sự cố và kiểm tra hoạt động, ngay cả khi tự động hóa phát triển.
Điểm mấu chốt
Các hệ thống kỹ thuật số sẽ ngày càng phức tạp hơn và tình trạng ngừng hoạt động sẽ tiếp tục xảy ra. Thông điệp của Koh không phải là mong đợi sự hoàn hảo mà là chấp nhận thực tế thất bại và xây dựng hệ thống có thể hấp thụ nó. Thiết kế phân tán, tầm nhìn rộng hơn, kỷ luật hoạt động mạnh mẽ hơn và cái nhìn thực tế về sự phụ thuộc hiện là điều cần thiết đối với các doanh nghiệp ở APAC và hơn thế nữa.

Bạn muốn tìm hiểu thêm về Điện toán đám mây từ các nhà lãnh đạo trong ngành? Hãy xem Cyber Security & Cloud Expo diễn ra ở Amsterdam, California và London. Sự kiện toàn diện này là một phần của TechEx và được tổ chức cùng với các sự kiện công nghệ hàng đầu khác, hãy nhấp vào đây để biết thêm thông tin.
Tin tức CloudTech được cung cấp bởi TechForge Media. Khám phá các sự kiện và hội thảo trực tuyến về công nghệ doanh nghiệp sắp tới khác tại đây.



