Bỏ qua tới nội dung chính

Viettel Cloud AI-Native tích hợp chip Nvidia H200

Đăng ngày

Với chip Nvidia H200, hạ tầng Viettel Cloud AI-Native hỗ trợ đồng thời hai chế độ huấn luyện mô hình và suy luận trên cùng một cụm GPU.

Tổng công ty Giải pháp doanh nghiệp Viettel (thuộc Viettel) và VinSmart Future (hệ sinh thái Vingroup) triển khai GPU Nvidia H200 trên nền tảng Viettel Cloud AI-Native từ tháng 7, mở ra hướng tiếp cận mới với năng lực tính toán AI hiệu năng cao ngay trên hạ tầng trong nước.

Phía Viettel cho biết hạ tầng phục vụ dự án VinSmartFuture được đặt tại trung tâm dữ liệu Hòa Lạc 2 - nơi đầu tiên ở APAC (châu Á - Thái Bình Dương) tích hợp GPU H200, được tổ chức Uptime Institute cấp chứng nhận TCCF Uptime Tier III (tiêu chuẩn quốc tế về độ tin cậy, tính liên tục), đảm bảo hệ thống vận hành ổn định ngay cả khi bảo trì hay xảy ra sự cố kỹ thuật.

Toàn bộ dữ liệu huấn luyện, triển khai AI được xử lý ngay tại Việt Nam, đáp ứng đồng thời hai yêu cầu mà lâu nay nhiều doanh nghiệp phải chọn một: hiệu năng tiêu chuẩn quốc tế và chủ quyền dữ liệu trong nước.

Viettel có trung tâm dữ liệu đầu tiên tại APAC tích hợp chip GPU H200 mới của Nvidia. Ảnh: Trần TuấnViettel có trung tâm dữ liệu đầu tiên tại APAC tích hợp chip GPU H200 mới của Nvidia. Ảnh: Trần Tuấn

Hệ sinh thái khép kín từ hạ tầng đến nền tảng AI

Đại diện doanh nghiệp nhấn mạnh Viettel Cloud AI-Native không chỉ cung cấp phần cứng GPU mà là dịch vụ AI tích hợp hoàn chỉnh, từ hạ tầng, GPU, AI đến ứng dụng AI.

Cụ thể, nền tảng này được trang bị GPU Nvidia H200 SXM5 - thế hệ chip AI với 141 GB bộ nhớ mỗi GPU, cho phép chạy các mô hình ngôn ngữ lớn 70 tỷ tham số trở lên mà không cần chia nhỏ mô hình.

Để khai thác hết sức mạnh phần cứng, hệ thống tích hợp mạng kết nối tốc độ cao InfiniBand NDR400, cho phép các GPU giao tiếp trực tiếp với nhau ở tốc độ 400 Gbps, loại bỏ điểm nghẽn khi huấn luyện mô hình AI phân tán trên nhiều máy chủ. Năng lực lưu trữ hiệu năng cao (HPS) đảm bảo GPU luôn có đủ dữ liệu để xử lý liên tục, không bị gián đoạn do tốc độ đọc/ghi.

Bên cạnh phần cứng, Viettel Cloud AI-Native tích hợp sẵn phần mềm Nvidia AI Enterprise (NVAIE) gồm: bộ công cụ huấn luyện mô hình (NeMo); tối ưu tốc độ suy luận (TensorRT); triển khai dịch vụ AI (Triton Inference Server). Toàn bộ hệ thống được giám sát tập trung trên một bảng điều khiển (dashboard), giúp khách hàng có cái nhìn tổng quan đồng thời nhận cảnh báo tự động khi phát sinh bất thường.

Qua quá trình nghiên cứu, tối ưu hóa chuyên sâu, đội ngũ kỹ thuật Viettel giải quyết những nút thắt cố hữu giữa hai trường phái vận hành GPU phổ biến: Slurm Naitve truyền thông và Slurm on Kubernetes (Slinky), vốn phải đánh đổi hiệu năng để lấy sự linh hoạt.

Đại diện Viettel chỉ ra trên thực tế, hai mô hình đạt hiệu năng tương đương nhau (chênh lệch tốc độ huấn luyện dưới 0,1%), mang đến cho đối tác giải pháp tối ưu, phù hợp chi phí.

"Hầu hết nhà cung cấp hạ tầng AI buộc doanh nghiệp phải chọn một trong hai chế độ sử dụng GPU: huấn luyện mô hình (training) hay suy luận mô hình (inference), hoặc đầu tư hai hệ thống riêng biệt", đại diện đơn vị lý giải, đồng thời bổ sung Viettel Cloud AI-Native hỗ trợ đồng thời hai chế độ trên cùng một cụm GPU, cho phép các công ty chủ động phân bổ tài nguyên theo nhu cầu thực tế từng thời điểm, không lãng phí, không đầu tư dàn trải.

Trung tâm dữ liệu Hòa Lạc 2 (Hà Nội). Ảnh: Trần TuấnTrung tâm dữ liệu Hòa Lạc 2 (Hà Nội). Ảnh: Trần Tuấn

Tự chủ về công nghệ

Theo phía Viettel, với hệ sinh thái Cloud AI-Native do người Việt làm chủ công nghệ, đối tác của họ có thể tiếp cận ngay năng lực tính toán AI chuẩn quốc tế, rút ngắn thời gian lên ý tưởng, triển khai từ hàng năm xuống vài ngày. Ngoài ra, toàn bộ dữ liệu được lưu trữ, xử lý trong nước, đáp ứng yêu cầu bảo mật, tuân thủ pháp lý, chủ quyền dữ liệu.

Nền tảng này áp dụng kiến trúc multi-tenant với ba lớp cô lập độc lập, vận hành trơn tru ngay cả khi nhiều doanh nghiệp, tổ chức dùng chung một hệ thống. Dữ liệu mỗi bên được bảo vệ tách biệt, không thể truy cập chéo dù vô tình hay cố ý.

"Do hạ tầng được đặt tại Việt Nam và vận hành bởi đội ngũ kỹ sư Viettel, dữ liệu không đi qua bất kỳ máy chủ nước ngoài nào, đảm bảo chủ quyền dữ liệu", người đại diện nói.

Ngoài ra, điểm khác biệt là khâu xây dựng toàn bộ kiến trúc hạ tầng AI không phụ thuộc vào nền tảng cloud nước ngoài. Từ thiết kế, lập hồ sơ kỹ thuật đến triển khai, đánh giá vận hành đều do đội ngũ kỹ sư Viettel thực hiện.

Theo công bố, đội ngũ kỹ thuật Viettel có thể hỗ trợ khách hàng 24/7. "Nhờ tự chủ công nghệ, chúng tôi sẽ đáp ứng linh hoạt yêu cầu riêng của đối tác, mở rộng theo nhu cầu thực tế trong vài tuần mà không cần triển khai lại từ đầu, đại diện đơn vị nói thêm.

Phú Cát