[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Published on

Quảng cáo

Ngày 18.3.2025, tại hội nghị GTC, NVIDIA đã giới thiệu Dynamo, một thư viện phần mềm suy luận (inference software) mã nguồn mở (open-source) nhằm tăng tốc và mở rộng mô hình suy luận trí tuệ nhân tạo (AI reasoning models) trong các nhà máy AI.

Được thiết kế để vận hành hiệu quả trên hàng nghìn GPU, Dynamo tối ưu hóa chi phí và nâng cao doanh thu từ token cho các nhà cung cấp dịch vụ AI. Đây là phiên bản kế thừa của NVIDIA Triton Inference Server, tập trung vào việc quản lý và đẩy nhanh giao tiếp suy luận trên quy mô lớn.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Việc xử lý hàng chục nghìn token cho mỗi lệnh (prompt) đang trở thành xu hướng chính trong suy luận AI. Dynamo cải thiện hiệu suất suy luận, giảm chi phí vận hành, giúp các nhà máy AI phục vụ mô hình ngôn ngữ lớn (LLMs) hiệu quả hơn. Phần mềm này sử dụng phương pháp phục vụ phân tách (disaggregated serving), chia giai đoạn xử lý và tạo nội dung của LLM cho các GPU khác nhau.

Điều này cho phép tối ưu riêng từng giai đoạn, tăng cường sử dụng tài nguyên GPU. Jensen Huang, CEO NVIDIA, cho biết Dynamo hỗ trợ triển khai mô hình AI tùy chỉnh trên quy mô lớn, tiết kiệm chi phí cho các nhà máy AI.

Trên nền tảng Hopper hiện tại, Dynamo tăng gấp đôi hiệu suất và doanh thu khi phục vụ mô hình Llama với cùng số GPU. Với DeepSeek-R1 trên cụm GB200 NVL72, tối ưu hóa thông minh của Dynamo tăng số token tạo ra hơn 30 lần mỗi GPU. Để đạt kết quả này, phần mềm tích hợp các tính năng như thêm hoặc bớt GPU linh hoạt theo lưu lượng yêu cầu, định tuyến truy vấn đến GPU phù hợp, giảm tính toán lặp lại, đồng thời chuyển dữ liệu suy luận sang bộ nhớ và thiết bị lưu trữ rẻ hơn khi cần, đảm bảo chi phí thấp.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Dynamo hỗ trợ PyTorch, SGLang, TensorRT-LLM và vLLM, mở cửa cho doanh nghiệp, startup và nhà nghiên cứu tối ưu phục vụ AI. Nhiều công ty như AWS, Google Cloud, Microsoft Azure, Meta và Perplexity dự kiến áp dụng. Denis Yarats từ Perplexity AI cho biết Dynamo sẽ tăng hiệu quả phục vụ hàng trăm triệu yêu cầu mỗi tháng. Cohere cũng lên kế hoạch dùng Dynamo để hỗ trợ khả năng agentic AI trong dòng Command, cải thiện phối hợp đa GPU và giao tiếp thấp độ trễ.

Together AI dự định tích hợp Dynamo với Together Inference Engine để mở rộng tải suy luận, giải quyết tắc nghẽn lưu lượng. Ce Zhang từ Together AI nhận định sự linh hoạt của Dynamo giúp tối ưu tài nguyên, tăng hiệu suất phục vụ mô hình mã nguồn mở. Phần mềm bao gồm bốn cải tiến chính: GPU Planner điều chỉnh GPU theo nhu cầu, Smart Router định tuyến thông minh, thư viện giao tiếp thấp độ trễ (Low-Latency Communication Library) và Memory Manager quản lý bộ nhớ hiệu quả.

Dynamo tận dụng bộ nhớ đệm KV (KV cache) để định tuyến yêu cầu mới tới GPU có dữ liệu phù hợp, tránh tính toán dư thừa. Với mô hình như NVIDIA Llama Nemotron, phương pháp phân tách tăng tốc độ phản hồi và thông lượng (throughput). Phần mềm sẽ có trong NVIDIA NIM microservices và được hỗ trợ bởi NVIDIA AI Enterprise trong tương lai, đảm bảo bảo mật và ổn định cấp sản xuất.

Các nhà máy AI ngày càng phụ thuộc vào suy luận quy mô lớn, và Dynamo đáp ứng nhu cầu này bằng cách giảm chi phí và tăng hiệu quả. NVIDIA khuyến khích tìm hiểu thêm qua bài phát biểu GTC, blog Dynamo và các phiên thảo luận tại sự kiện đến ngày 21/3. Tuy nhiên, việc triển khai đòi hỏi hạ tầng GPU mạnh và khả năng thích nghi từ nhà cung cấp dịch vụ.

Tin mới

Hiệu năng NVIDIA DLSS 5 nhanh hơn 5 lần bản thử nghiệm

NVIDIA vừa chính thức chia sẻ những thông số hiệu năng đầu tiên của...

LG Grambook AI 2026 lộ thiết kế nhẹ hơn Samsung Galaxy Book6

Ngay sau khi Samsung trình làng mẫu laptop Galaxy Book6 trang bị vi xử...

Alienware ra mắt màn hình 4K AW3226K công nghệ RGB Stripe Tandem OLED

Alienware vừa chính thức bổ sung hai tân binh vào dải sản phẩm màn...

X phát hiện mạng lưới 200.000 bot Trung Quốc, một phần chống trung tâm dữ liệu AI

X vừa gỡ bỏ mạng lưới khoảng 200.000 tài khoản Trung Quốc, trong đó 200 tài khoản đăng nội dung khuấy động tranh cãi về trung tâm dữ liệu AI tại Mỹ.

Razer ra mắt bộ phụ kiện xanh trong suốt mừng Xbox 25 năm

Razer hợp tác Xbox tung bộ sưu tập giới hạn mừng sinh nhật 25 năm, gồm chuột Basilisk V3 Pro 35K, bàn phím BlackWidow V4 75% và tai nghe Hammerhead V3 X phiên bản xanh trong suốt.

Viewing Part chung kết tổng VCT 2026 PACIFIC STAGE 2 tổ chức tại TP.HCM và Hà Nội

Cộng đồng hâm mộ Thể thao điện tử toàn quốc sắp có dịp trải...

Xiaomi chính thức ra mắt REDMI Note 17 Series với pin dung lượng 10.000mAh

REDMI Note 17 Series nâng cấp toàn diện các tiêu chuẩn về pin, độ...

Chip Fujitsu Monaka 3D CPU 2nm ra mắt năm 2029 cùng công nghệ NVLink Fusion

Mẫu CPU Monaka của Fujitsu dự kiến trình làng vào năm 2027 với 144...

Sự kiện ra mắt dòng sản phẩm ROG kỉ niệm 20 năm

ASUS Republic of Gamers (ROG) chính thức giới thiệu bộ sưu tập ROG Edition...

Tặng 3 tháng Google AI cho khách hàng sở hữu laptop ASUS & ROG

Từ tháng 8/2026, khách hàng sở hữu các dòng laptop ASUS và ROG đủ...

tin liên quan

OpenAI đạt 1 tỉ người dùng nhưng vẫn loay hoay với bài toán lợi nhuận

OpenAI công bố hơn 1 tỉ người dùng hoạt động và 2 triệu doanh nghiệp sử dụng dịch vụ, nhưng công ty vẫn lỗ 21 tỉ USD trong năm 2025 dù doanh thu đạt hơn 13 tỉ USD.

Mô hình AI mã nguồn mở GLM-5.2 Trung Quốc xử lý sự cố mà AI Mỹ từ chối

Sự cố bảo mật tại Hugging Face cho thấy mô hình mã nguồn mở GLM-5.2 của Trung Quốc xử lý được việc mà GPT-5.6 và Claude từ chối, làm nóng lại tranh cãi chính sách AI mở tại Mỹ.