NVIDIA đạt hiệu năng AI gấp 10 lần trên máy chủ GB200 NVL72 nhờ đột phá đồng thiết kế

Published on

Quảng cáo

NVIDIA vừa công bố kỷ lục hiệu năng mới trên các mô hình AI Mixture of Experts, đạt mức tăng trưởng gấp 10 lần nhờ hệ thống máy chủ GB200 Blackwell NVL72.

Trong bối cảnh ngành công nghiệp trí tuệ nhân tạo đang chạy đua mở rộng quy mô các mô hình ngôn ngữ lớn (LLM), việc gia tăng tham số và đảm bảo hiệu suất vận hành đang gặp phải những giới hạn về tài nguyên tính toán. Để giải quyết vấn đề này, các mô hình “Hỗn hợp chuyên gia” (Mixture of Experts – MoE) đã trở thành giải pháp tối ưu nhờ cơ chế chỉ kích hoạt một phần tham số cần thiết cho mỗi truy vấn thay vì toàn bộ hệ thống. Tuy nhiên, việc mở rộng quy mô MoE thường dẫn đến nút thắt cổ chai lớn về khả năng tính toán và truyền tải dữ liệu.

MoE Image MMOSITE - Thông tin công nghệ

NVIDIA mới đây đã tuyên bố vượt qua rào cản này thông qua việc ứng dụng kiến trúc Blackwell thế hệ mới. Trong thông cáo báo chí, hãng xác nhận hệ thống máy chủ GB200 NVL72 đã đạt hiệu năng cao gấp 10 lần so với thế hệ Hopper HGX H200 tiền nhiệm. Thử nghiệm được thực hiện trên Kimi K2 Thinking, một mô hình LLM mã nguồn mở nổi bật trong phân khúc với 32 tỷ tham số được kích hoạt mỗi lần chuyển tiếp (forward pass).

Đột phá công nghệ đồng thiết kế và kiến trúc Blackwell

Để giải quyết các hạn chế khi mở rộng mô hình MoE, NVIDIA đã áp dụng phương pháp tiếp cận “đồng thiết kế” (co-design). Chiến lược này tận dụng cấu hình 72 chip của hệ thống GB200 kết hợp với bộ nhớ chia sẻ tốc độ cao lên tới 30TB. Kiến trúc này đưa khả năng song song hóa chuyên gia (expert parallelism) lên một tầm cao mới, đảm bảo các lô token (token batches) được phân chia và phân tán liên tục trên các GPU.

nvidia-dat-hieu-nang-ai-gap-10-lan-tren-may-chu-gb200-nvl72-nho-dot-pha-dong-thiet-ke

Phương pháp này giúp hệ thống xử lý hiệu quả khối lượng giao tiếp dữ liệu tăng theo tỷ lệ phi tuyến tính, vốn là điểm yếu của các kiến trúc cũ. NVIDIA khẳng định kiến trúc Blackwell đã sẵn sàng để khai thác tối đa sự bùng nổ của các mô hình MoE biên (frontier MoE models) hiện nay.

Tối ưu hóa toàn diện với khung phần mềm Dynamo

Bên cạnh phần cứng, các tối ưu hóa ngăn xếp toàn diện (full-stack optimizations) đóng vai trò then chốt trong việc mở khóa hiệu suất suy luận cao cho các mô hình MoE. Khung phần mềm NVIDIA Dynamo thực hiện việc điều phối phân tách quy trình phục vụ (disaggregated serving) bằng cách gán các tác vụ nạp tiền (prefill) và giải mã (decode) cho các GPU khác nhau. Cơ chế này cho phép quá trình giải mã vận hành với khả năng song song hóa chuyên gia quy mô lớn, trong khi quá trình nạp tiền sử dụng các kỹ thuật song song phù hợp hơn với đặc thù tải công việc của nó.

Black server racks with cables in a data center setup.

Ngoài ra, định dạng NVFP4 được sử dụng để duy trì độ chính xác của dữ liệu trong khi vẫn tăng cường hiệu suất và hiệu quả năng lượng. Thành tựu này được xem là bước tiến quan trọng đối với NVIDIA và các đối tác trong chuỗi cung ứng, đặc biệt khi các mô hình MoE ngày càng trở nên phổ biến nhờ tính hiệu quả trong tính toán và khả năng triển khai linh hoạt trên nhiều môi trường khác nhau.

Nguồn: wccftech

Tin mới

Mùa Back To School 2026 khác biệt của ASUS

Mùa tựu trường 2026, ASUS vẫn giữ những giá trị cốt lõi thực dụng...

Huawei khởi động chương trình Back To School 2026 “Ready – Set – Sync”

Nhằm đồng hành cùng học sinh, sinh viên chuẩn bị cho năm học mới,...

Galaxy Z Fold8 dùng màn hình 4:3, giá từ 46,99 triệu đồng tại Việt Nam

Samsung Galaxy Z Fold8 sở hữu thân máy thấp rộng, màn hình chính 7.6 inch tỷ lệ 4:3 mới, cấu hình Snapdragon 8 Elite Gen 5, giá khởi điểm 46,99 triệu đồng.

Philips Evnia 32M2N6901A: Màn hình QD-OLED 4K định hình không gian giải trí cao cấp

Thương hiệu Philips vừa chính thức ra mắt Evnia 32M2N6901A, mẫu màn hình chuyên...

NVIDIA RTX Spark nhận bản cập nhật Driver đầu tiên

NVIDIA vừa chính thức phát hành bản xem trước đầu tiên của driver hỗ...

Apple tăng giá iCloud+ tại Việt Nam, gói 50 GB tăng mạnh nhất 31,58%

Apple tăng giá iCloud+ tại Việt Nam từ 17/7, lần đầu kể từ tháng 6/2023, với gói 50 GB tăng mạnh nhất 31,58%, nằm trong đợt điều chỉnh giá tại 8 quốc gia.

Intel Nova Lake lộ tên gọi Core Ultra Series 400, ra mắt rải rác đến 2027

Rò rỉ mới cho thấy Intel Nova Lake sẽ mang tên Core Ultra Series 400, ra mắt theo từng đợt từ đầu đến cuối năm 2027, với flagship 52 nhân đến sau cùng.

Garmin Cirqa lại lộ diện, lần này trên chính website của Garmin

Website Romania của Garmin vừa vô tình để lộ tên Cirqa trong mục Health Status, củng cố thêm tin đồn về mẫu smart band không màn hình sắp ra mắt.

AMD dọn đường ra mắt dòng vi xử lý Ryzen AI MAX PRO 400 với bản cập nhật ROCm 7.14

"Đội Đỏ" AMD đã chính thức đặt nền móng cho màn ra mắt của...

Người dùng MacBook tự mài cạnh máy để cổ tay đỡ đau

Nhiều người dùng MacBook chọn cách tự mài giũa cạnh viền sắc của máy bằng giũa kim loại và giấy nhám để giảm khó chịu khi kê cổ tay, dù Apple vốn nổi tiếng khắt khe về thiết kế.

tin liên quan

Kimi K3: Moonshot AI ra mắt mô hình mã nguồn mở 2,8 nghìn tỷ tham số

Moonshot AI công bố Kimi K3, mô hình mở lớn nhất từ trước đến nay với 2,8 nghìn tỷ tham số, vượt Claude Fable 5 ở benchmark code frontend dù vẫn dùng phần cứng bị hạn chế xuất khẩu.

Silicon Motion đã bắt đầu phát triển controller SSD PCIe Gen7

Alex Chou, lãnh đạo mảng doanh nghiệp của Silicon Motion, tiết lộ hãng đã bắt đầu phát triển controller PCIe Gen7 và đang bám sát sáng kiến Storage Next của Nvidia cho hạ tầng AI.

Nvidia bác tin trì hoãn Vera Rubin, nhưng né tránh câu hỏi về Rubin Ultra

CEO Jensen Huang khẳng định Vera Rubin đã vào sản xuất với sản lượng khổng lồ, bác bỏ tin đồn trì hoãn, nhưng không đề cập đến báo cáo về việc hệ thống Rubin Ultra Kyber NVL144 có thể bị chậm tiến độ.