[GTC 2024] Gemma của Google Được Tối Ưu Hóa để Chạy trên GPU của NVIDIA

Published on

Quảng cáo

Các mô hình ngôn ngữ mở mới từ Google được tăng tốc bởi TensorRT-LLM trên các nền tảng AI của NVIDIA — bao gồm cả máy tính AI RTX địa phương.

NVIDIA, phối hợp với Google, hôm nay đã triển khai các bản tối ưu hóa trên tất cả các nền tảng AI của NVIDIA cho Gemma — mô hình ngôn ngữ mở mới tiên tiến của Google với kích cỡ nhẹ 2 tỷ và 7 tỷ tham số, có thể chạy mọi nơi, giảm chi phí và tăng tốc độ công việc sáng tạo cho các trường hợp sử dụng cụ thể trong lĩnh vực.

llm summerization MMOSITE - Thông tin công nghệ

Các đội ngũ từ hai công ty đã làm việc chặt chẽ với nhau để tăng tốc độ hiệu suất của Gemma — được xây dựng từ cùng một nghiên cứu và công nghệ đã tạo ra các mô hình Gemini — với NVIDIA TensorRT-LLM, một thư viện mã nguồn mở để tối ưu hóa suy luận mô hình ngôn ngữ lớn, khi chạy trên GPU NVIDIA ở trung tâm dữ liệu, trong đám mây, và tại chỗ trên các trạm làm việc với GPU NVIDIA RTX hoặc máy tính cá nhân với GPU GeForce RTX.

Điều này cho phép các nhà phát triển hướng đến cơ sở đã cài đặt hơn 100 triệu GPU NVIDIA RTX có sẵn trên máy tính AI hiệu suất cao toàn cầu.

Các nhà phát triển cũng có thể chạy Gemma trên GPU NVIDIA trong đám mây, bao gồm trên các thực thể A3 của Google Cloud dựa trên GPU H100 Tensor Core và sớm, GPU H200 Tensor Core của NVIDIA — có 141GB bộ nhớ HBM3e với tốc độ 4.8 terabytes mỗi giây — mà Google sẽ triển khai trong năm nay.

Các nhà phát triển doanh nghiệp có thể tận dụng thêm hệ sinh thái phong phú của công cụ từ NVIDIA — bao gồm NVIDIA AI Enterprise với khung NeMo và TensorRT-LLM — để tinh chỉnh Gemma và triển khai mô hình được tối ưu hóa trong các ứng dụng sản xuất của họ.

Tìm hiểu thêm về cách TensorRT-LLM tăng tốc suy luận cho Gemma, cùng với thông tin bổ sung cho các nhà phát triển. Điều này bao gồm một số checkpoint mô hình của Gemma và phiên bản mô hình được lượng tử hóa FP8, tất cả đều được tối ưu hóa với TensorRT-LLM.

Trải nghiệm trực tiếp Gemma 2B và Gemma 7B từ trình duyệt của bạn trên NVIDIA AI Playground.

Gemma Sẽ Sớm Có Mặt Trên ChatRTX

Thêm hỗ trợ cho Gemma sớm là Chat with RTX (nay là ChatRTX), một bản demo công nghệ của NVIDIA sử dụng tạo sinh kết hợp tìm kiếm và phần mềm TensorRT-LLM để cung cấp khả năng AI tạo sinh cho người dùng trên máy tính Windows được trang bị RTX tại địa phương.

Screenshot 2024 03 25 at 10.43.31 MMOSITE - Thông tin công nghệ

Chat với RTX cho phép người dùng cá nhân hóa một chatbot với dữ liệu của riêng họ bằng cách kết nối dễ dàng các tệp cục bộ trên máy tính RTX với một mô hình ngôn ngữ lớn.

Vì mô hình chạy cục bộ, nó cung cấp kết quả nhanh chóng, và dữ liệu người dùng ở lại trên thiết bị. Thay vì phụ thuộc vào các dịch vụ LLM dựa trên đám mây, Chat với RTX cho phép người dùng xử lý dữ liệu nhạy cảm trên máy tính cá nhân mà không cần chia sẻ với bên thứ ba hoặc có kết nối internet.

Tin mới

Hiệu năng NVIDIA DLSS 5 nhanh hơn 5 lần bản thử nghiệm

NVIDIA vừa chính thức chia sẻ những thông số hiệu năng đầu tiên của...

LG Grambook AI 2026 lộ thiết kế nhẹ hơn Samsung Galaxy Book6

Ngay sau khi Samsung trình làng mẫu laptop Galaxy Book6 trang bị vi xử...

Alienware ra mắt màn hình 4K AW3226K công nghệ RGB Stripe Tandem OLED

Alienware vừa chính thức bổ sung hai tân binh vào dải sản phẩm màn...

X phát hiện mạng lưới 200.000 bot Trung Quốc, một phần chống trung tâm dữ liệu AI

X vừa gỡ bỏ mạng lưới khoảng 200.000 tài khoản Trung Quốc, trong đó 200 tài khoản đăng nội dung khuấy động tranh cãi về trung tâm dữ liệu AI tại Mỹ.

Razer ra mắt bộ phụ kiện xanh trong suốt mừng Xbox 25 năm

Razer hợp tác Xbox tung bộ sưu tập giới hạn mừng sinh nhật 25 năm, gồm chuột Basilisk V3 Pro 35K, bàn phím BlackWidow V4 75% và tai nghe Hammerhead V3 X phiên bản xanh trong suốt.

Viewing Part chung kết tổng VCT 2026 PACIFIC STAGE 2 tổ chức tại TP.HCM và Hà Nội

Cộng đồng hâm mộ Thể thao điện tử toàn quốc sắp có dịp trải...

Xiaomi chính thức ra mắt REDMI Note 17 Series với pin dung lượng 10.000mAh

REDMI Note 17 Series nâng cấp toàn diện các tiêu chuẩn về pin, độ...

Chip Fujitsu Monaka 3D CPU 2nm ra mắt năm 2029 cùng công nghệ NVLink Fusion

Mẫu CPU Monaka của Fujitsu dự kiến trình làng vào năm 2027 với 144...

Sự kiện ra mắt dòng sản phẩm ROG kỉ niệm 20 năm

ASUS Republic of Gamers (ROG) chính thức giới thiệu bộ sưu tập ROG Edition...

Tặng 3 tháng Google AI cho khách hàng sở hữu laptop ASUS & ROG

Từ tháng 8/2026, khách hàng sở hữu các dòng laptop ASUS và ROG đủ...

tin liên quan

OpenAI đạt 1 tỉ người dùng nhưng vẫn loay hoay với bài toán lợi nhuận

OpenAI công bố hơn 1 tỉ người dùng hoạt động và 2 triệu doanh nghiệp sử dụng dịch vụ, nhưng công ty vẫn lỗ 21 tỉ USD trong năm 2025 dù doanh thu đạt hơn 13 tỉ USD.

Mô hình AI mã nguồn mở GLM-5.2 Trung Quốc xử lý sự cố mà AI Mỹ từ chối

Sự cố bảo mật tại Hugging Face cho thấy mô hình mã nguồn mở GLM-5.2 của Trung Quốc xử lý được việc mà GPT-5.6 và Claude từ chối, làm nóng lại tranh cãi chính sách AI mở tại Mỹ.