[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Published on

Quảng cáo

Ngày 18.3.2025, tại hội nghị GTC, NVIDIA đã giới thiệu Dynamo, một thư viện phần mềm suy luận (inference software) mã nguồn mở (open-source) nhằm tăng tốc và mở rộng mô hình suy luận trí tuệ nhân tạo (AI reasoning models) trong các nhà máy AI.

Được thiết kế để vận hành hiệu quả trên hàng nghìn GPU, Dynamo tối ưu hóa chi phí và nâng cao doanh thu từ token cho các nhà cung cấp dịch vụ AI. Đây là phiên bản kế thừa của NVIDIA Triton Inference Server, tập trung vào việc quản lý và đẩy nhanh giao tiếp suy luận trên quy mô lớn.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Việc xử lý hàng chục nghìn token cho mỗi lệnh (prompt) đang trở thành xu hướng chính trong suy luận AI. Dynamo cải thiện hiệu suất suy luận, giảm chi phí vận hành, giúp các nhà máy AI phục vụ mô hình ngôn ngữ lớn (LLMs) hiệu quả hơn. Phần mềm này sử dụng phương pháp phục vụ phân tách (disaggregated serving), chia giai đoạn xử lý và tạo nội dung của LLM cho các GPU khác nhau.

Điều này cho phép tối ưu riêng từng giai đoạn, tăng cường sử dụng tài nguyên GPU. Jensen Huang, CEO NVIDIA, cho biết Dynamo hỗ trợ triển khai mô hình AI tùy chỉnh trên quy mô lớn, tiết kiệm chi phí cho các nhà máy AI.

Trên nền tảng Hopper hiện tại, Dynamo tăng gấp đôi hiệu suất và doanh thu khi phục vụ mô hình Llama với cùng số GPU. Với DeepSeek-R1 trên cụm GB200 NVL72, tối ưu hóa thông minh của Dynamo tăng số token tạo ra hơn 30 lần mỗi GPU. Để đạt kết quả này, phần mềm tích hợp các tính năng như thêm hoặc bớt GPU linh hoạt theo lưu lượng yêu cầu, định tuyến truy vấn đến GPU phù hợp, giảm tính toán lặp lại, đồng thời chuyển dữ liệu suy luận sang bộ nhớ và thiết bị lưu trữ rẻ hơn khi cần, đảm bảo chi phí thấp.

[GTC 2025] NVIDIA ra mắt thư viện Dynamo giúp tăng tốc suy luận AI gấp 30 lần

Dynamo hỗ trợ PyTorch, SGLang, TensorRT-LLM và vLLM, mở cửa cho doanh nghiệp, startup và nhà nghiên cứu tối ưu phục vụ AI. Nhiều công ty như AWS, Google Cloud, Microsoft Azure, Meta và Perplexity dự kiến áp dụng. Denis Yarats từ Perplexity AI cho biết Dynamo sẽ tăng hiệu quả phục vụ hàng trăm triệu yêu cầu mỗi tháng. Cohere cũng lên kế hoạch dùng Dynamo để hỗ trợ khả năng agentic AI trong dòng Command, cải thiện phối hợp đa GPU và giao tiếp thấp độ trễ.

Together AI dự định tích hợp Dynamo với Together Inference Engine để mở rộng tải suy luận, giải quyết tắc nghẽn lưu lượng. Ce Zhang từ Together AI nhận định sự linh hoạt của Dynamo giúp tối ưu tài nguyên, tăng hiệu suất phục vụ mô hình mã nguồn mở. Phần mềm bao gồm bốn cải tiến chính: GPU Planner điều chỉnh GPU theo nhu cầu, Smart Router định tuyến thông minh, thư viện giao tiếp thấp độ trễ (Low-Latency Communication Library) và Memory Manager quản lý bộ nhớ hiệu quả.

Dynamo tận dụng bộ nhớ đệm KV (KV cache) để định tuyến yêu cầu mới tới GPU có dữ liệu phù hợp, tránh tính toán dư thừa. Với mô hình như NVIDIA Llama Nemotron, phương pháp phân tách tăng tốc độ phản hồi và thông lượng (throughput). Phần mềm sẽ có trong NVIDIA NIM microservices và được hỗ trợ bởi NVIDIA AI Enterprise trong tương lai, đảm bảo bảo mật và ổn định cấp sản xuất.

Các nhà máy AI ngày càng phụ thuộc vào suy luận quy mô lớn, và Dynamo đáp ứng nhu cầu này bằng cách giảm chi phí và tăng hiệu quả. NVIDIA khuyến khích tìm hiểu thêm qua bài phát biểu GTC, blog Dynamo và các phiên thảo luận tại sự kiện đến ngày 21/3. Tuy nhiên, việc triển khai đòi hỏi hạ tầng GPU mạnh và khả năng thích nghi từ nhà cung cấp dịch vụ.

Tin mới

GameSir Hợp Tác Fortnite Công Bố Bộ Sưu Tập Tay Cầm Chơi Game Mobile Chính Hãng

GameSir, thương hiệu thiết bị ngoại vi chơi game hàng đầu thế giới, vừa...

CORSAIR trình làng mẫu microphone phòng thu chơi game cao cấp

Với chất lượng âm thanh đạt chuẩn phòng thu, kết hợp ứng dụng Elgato...

Xiaomi 18 Pro và 18 Pro Max hé lộ thông số camera khủng

Bộ đôi Xiaomi 18 Pro và 18 Pro Max chuẩn bị chính thức trình...

vivo chính thức ra mắt dòng X500, X500 Pro và X500 Pro Max

Thương hiệu vivo vừa chính thức công bố dải sản phẩm smartphone cao cấp...

vivo V80 Lite 5G thiết lập KỶ LỤC GUINNESS THẾ GIỚI với 32 giờ 37 phút sử dụng liên tục

vivo V80 Lite 5G vừa xác lập cột mốc lịch sử mới đầy ấn...

Synology ra mắt ActiveProtect Manager 2.0, mở rộng hỗ trợ nền tảng với AI

Synology hôm nay công bố ActiveProtect Manager 2.0 (APM 2.0), phiên bản mới nhất...

Nothing Phone (4b) Chính Thức Mở Bán

Nothing, thương hiệu công nghệ tiêu dùng có trụ sở tại London, chính thức...

REDMI Note 17 Series tăng trưởng 160% chỉ sau 10 ngày ra mắt tại Việt Nam

Chỉ sau 10 ngày ra mắt, REDMI Note 17 Series ghi nhận mức tăng...

Kingston Technology Mang Lại Những Ngày Học Thông Minh Hơn

Từ giảng đường đến các dự án sáng tạo, những giải pháp bộ nhớ...

HKC ra mắt màn hình 4K Ultrawide 43,8 inch đầu tiên trên thế giới với tỷ lệ 24:9

Thương hiệu HKC vừa chính thức trình làng Tianqi 43H180C, mẫu màn hình 43,8...

tin liên quan

OpenAI đạt 1 tỉ người dùng nhưng vẫn loay hoay với bài toán lợi nhuận

OpenAI công bố hơn 1 tỉ người dùng hoạt động và 2 triệu doanh nghiệp sử dụng dịch vụ, nhưng công ty vẫn lỗ 21 tỉ USD trong năm 2025 dù doanh thu đạt hơn 13 tỉ USD.