[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Published on

Quảng cáo

Ngày 18.3.2025, tại hội nghị GTC, NVIDIA đã giới thiệu Dynamo, một thư viện phần mềm suy luận (inference software) mã nguồn mở (open-source) nhằm tăng tốc và mở rộng mô hình suy luận trí tuệ nhân tạo (AI reasoning models) trong các nhà máy AI.

Được thiết kế để vận hành hiệu quả trên hàng nghìn GPU, Dynamo tối ưu hóa chi phí và nâng cao doanh thu từ token cho các nhà cung cấp dịch vụ AI. Đây là phiên bản kế thừa của NVIDIA Triton Inference Server, tập trung vào việc quản lý và đẩy nhanh giao tiếp suy luận trên quy mô lớn.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Việc xử lý hàng chục nghìn token cho mỗi lệnh (prompt) đang trở thành xu hướng chính trong suy luận AI. Dynamo cải thiện hiệu suất suy luận, giảm chi phí vận hành, giúp các nhà máy AI phục vụ mô hình ngôn ngữ lớn (LLMs) hiệu quả hơn. Phần mềm này sử dụng phương pháp phục vụ phân tách (disaggregated serving), chia giai đoạn xử lý và tạo nội dung của LLM cho các GPU khác nhau.

Điều này cho phép tối ưu riêng từng giai đoạn, tăng cường sử dụng tài nguyên GPU. Jensen Huang, CEO NVIDIA, cho biết Dynamo hỗ trợ triển khai mô hình AI tùy chỉnh trên quy mô lớn, tiết kiệm chi phí cho các nhà máy AI.

Trên nền tảng Hopper hiện tại, Dynamo tăng gấp đôi hiệu suất và doanh thu khi phục vụ mô hình Llama với cùng số GPU. Với DeepSeek-R1 trên cụm GB200 NVL72, tối ưu hóa thông minh của Dynamo tăng số token tạo ra hơn 30 lần mỗi GPU. Để đạt kết quả này, phần mềm tích hợp các tính năng như thêm hoặc bớt GPU linh hoạt theo lưu lượng yêu cầu, định tuyến truy vấn đến GPU phù hợp, giảm tính toán lặp lại, đồng thời chuyển dữ liệu suy luận sang bộ nhớ và thiết bị lưu trữ rẻ hơn khi cần, đảm bảo chi phí thấp.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Dynamo hỗ trợ PyTorch, SGLang, TensorRT-LLM và vLLM, mở cửa cho doanh nghiệp, startup và nhà nghiên cứu tối ưu phục vụ AI. Nhiều công ty như AWS, Google Cloud, Microsoft Azure, Meta và Perplexity dự kiến áp dụng. Denis Yarats từ Perplexity AI cho biết Dynamo sẽ tăng hiệu quả phục vụ hàng trăm triệu yêu cầu mỗi tháng. Cohere cũng lên kế hoạch dùng Dynamo để hỗ trợ khả năng agentic AI trong dòng Command, cải thiện phối hợp đa GPU và giao tiếp thấp độ trễ.

Together AI dự định tích hợp Dynamo với Together Inference Engine để mở rộng tải suy luận, giải quyết tắc nghẽn lưu lượng. Ce Zhang từ Together AI nhận định sự linh hoạt của Dynamo giúp tối ưu tài nguyên, tăng hiệu suất phục vụ mô hình mã nguồn mở. Phần mềm bao gồm bốn cải tiến chính: GPU Planner điều chỉnh GPU theo nhu cầu, Smart Router định tuyến thông minh, thư viện giao tiếp thấp độ trễ (Low-Latency Communication Library) và Memory Manager quản lý bộ nhớ hiệu quả.

Dynamo tận dụng bộ nhớ đệm KV (KV cache) để định tuyến yêu cầu mới tới GPU có dữ liệu phù hợp, tránh tính toán dư thừa. Với mô hình như NVIDIA Llama Nemotron, phương pháp phân tách tăng tốc độ phản hồi và thông lượng (throughput). Phần mềm sẽ có trong NVIDIA NIM microservices và được hỗ trợ bởi NVIDIA AI Enterprise trong tương lai, đảm bảo bảo mật và ổn định cấp sản xuất.

Các nhà máy AI ngày càng phụ thuộc vào suy luận quy mô lớn, và Dynamo đáp ứng nhu cầu này bằng cách giảm chi phí và tăng hiệu quả. NVIDIA khuyến khích tìm hiểu thêm qua bài phát biểu GTC, blog Dynamo và các phiên thảo luận tại sự kiện đến ngày 21/3. Tuy nhiên, việc triển khai đòi hỏi hạ tầng GPU mạnh và khả năng thích nghi từ nhà cung cấp dịch vụ.

Tin mới

Huawei khởi động chương trình Back To School 2026 “Ready – Set – Sync”

Nhằm đồng hành cùng học sinh, sinh viên chuẩn bị cho năm học mới,...

Galaxy Z Fold8 dùng màn hình 4:3, giá từ 46,99 triệu đồng tại Việt Nam

Samsung Galaxy Z Fold8 sở hữu thân máy thấp rộng, màn hình chính 7.6 inch tỷ lệ 4:3 mới, cấu hình Snapdragon 8 Elite Gen 5, giá khởi điểm 46,99 triệu đồng.

Philips Evnia 32M2N6901A: Màn hình QD-OLED 4K định hình không gian giải trí cao cấp

Thương hiệu Philips vừa chính thức ra mắt Evnia 32M2N6901A, mẫu màn hình chuyên...

NVIDIA RTX Spark nhận bản cập nhật Driver đầu tiên

NVIDIA vừa chính thức phát hành bản xem trước đầu tiên của driver hỗ...

Apple tăng giá iCloud+ tại Việt Nam, gói 50 GB tăng mạnh nhất 31,58%

Apple tăng giá iCloud+ tại Việt Nam từ 17/7, lần đầu kể từ tháng 6/2023, với gói 50 GB tăng mạnh nhất 31,58%, nằm trong đợt điều chỉnh giá tại 8 quốc gia.

Intel Nova Lake lộ tên gọi Core Ultra Series 400, ra mắt rải rác đến 2027

Rò rỉ mới cho thấy Intel Nova Lake sẽ mang tên Core Ultra Series 400, ra mắt theo từng đợt từ đầu đến cuối năm 2027, với flagship 52 nhân đến sau cùng.

Garmin Cirqa lại lộ diện, lần này trên chính website của Garmin

Website Romania của Garmin vừa vô tình để lộ tên Cirqa trong mục Health Status, củng cố thêm tin đồn về mẫu smart band không màn hình sắp ra mắt.

AMD dọn đường ra mắt dòng vi xử lý Ryzen AI MAX PRO 400 với bản cập nhật ROCm 7.14

"Đội Đỏ" AMD đã chính thức đặt nền móng cho màn ra mắt của...

Người dùng MacBook tự mài cạnh máy để cổ tay đỡ đau

Nhiều người dùng MacBook chọn cách tự mài giũa cạnh viền sắc của máy bằng giũa kim loại và giấy nhám để giảm khó chịu khi kê cổ tay, dù Apple vốn nổi tiếng khắt khe về thiết kế.

Google AI Mode cho phép kết nối Instacart, Canva, YouTube Music

Google mở rộng AI Mode trong Search, cho phép liên kết Instacart, Canva và YouTube Music để hỗ trợ người dùng hoàn tất tác vụ nhanh hơn.

tin liên quan

Kimi K3: Moonshot AI ra mắt mô hình mã nguồn mở 2,8 nghìn tỷ tham số

Moonshot AI công bố Kimi K3, mô hình mở lớn nhất từ trước đến nay với 2,8 nghìn tỷ tham số, vượt Claude Fable 5 ở benchmark code frontend dù vẫn dùng phần cứng bị hạn chế xuất khẩu.

Silicon Motion đã bắt đầu phát triển controller SSD PCIe Gen7

Alex Chou, lãnh đạo mảng doanh nghiệp của Silicon Motion, tiết lộ hãng đã bắt đầu phát triển controller PCIe Gen7 và đang bám sát sáng kiến Storage Next của Nvidia cho hạ tầng AI.

Nvidia bác tin trì hoãn Vera Rubin, nhưng né tránh câu hỏi về Rubin Ultra

CEO Jensen Huang khẳng định Vera Rubin đã vào sản xuất với sản lượng khổng lồ, bác bỏ tin đồn trì hoãn, nhưng không đề cập đến báo cáo về việc hệ thống Rubin Ultra Kyber NVL144 có thể bị chậm tiến độ.