NVIDIA thúc đẩy AI cục bộ tại IFA 2026
NVIDIA / IFA 2026

NVIDIA thúc đẩy kỷ nguyên AI cục bộ tại IFA 2026

AI

Tại IFA 2026, NVIDIA công bố loạt cải tiến nhằm đưa AI tác vụ (agentic AI) đến gần hơn với người dùng PC. Các công cụ mới giúp đơn giản hóa việc triển khai mô hình AI ngay trên máy tính, đồng thời cải thiện tốc độ suy luận và cho phép kết hợp nhiều PC trong cùng mạng nội bộ để tăng năng lực xử lý.

Local AI / RTX Spark

Một trong những điểm đáng chú ý là hệ sinh thái NVIDIA RTX Spark dành cho Windows sẽ bắt đầu xuất hiện từ tháng 10, với các mẫu máy mới đến từ Lenovo và Acer. NVIDIA kỳ vọng nền tảng này sẽ mở rộng lựa chọn cho nhà phát triển, người sáng tạo nội dung và những người muốn khai thác AI trực tiếp trên thiết bị thay vì phụ thuộc hoàn toàn vào dịch vụ đám mây.

NVIDIA thúc đẩy kỷ nguyên AI cục bộ tại IFA 2026 với loạt công cụ và phần cứng mới
NVIDIA giới thiệu loạt giải pháp mới nhằm tăng tốc AI cục bộ trên PC tại IFA 2026.
01 / Local Agents

Đưa AI agent lên PC dễ dàng hơn

Việc chạy một AI agent bằng mô hình cục bộ trước đây thường đòi hỏi người dùng phải tự lựa chọn mô hình, thiết lập máy chủ suy luận, điều chỉnh lượng tử hóa và xử lý nhiều cấu hình tương thích. NVIDIA đang phối hợp với Microsoft cùng các đối tác để giảm đáng kể những bước kỹ thuật này trên máy tính sử dụng GPU RTX.

Ba nền tảng gồm Hermes Agent, OpenClaw và Perplexity Portable Computer sẽ được tích hợp các phương thức thiết lập mô hình cục bộ đơn giản hơn trên Windows. Các giải pháp này sử dụng llama.cpp cùng những tối ưu hóa suy luận mới từ NVIDIA nhằm giúp quá trình cài đặt và vận hành AI agent trở nên thuận tiện hơn.

NVIDIA Local AI / Agentic AI

Perplexity trước đó đã giới thiệu Portable Computer, một tác nhân AI có khả năng vận hành trực tiếp trên các hệ thống Linux như NVIDIA DGX Spark. Ứng dụng đóng gói mô hình, công cụ và cơ chế điều phối trong cùng một trải nghiệm, cho phép người dùng thực hiện các quy trình AI cục bộ mà không cần tiêu tốn hạn mức sử dụng dịch vụ.

Phiên bản hỗ trợ GPU NVIDIA RTX với tối thiểu 24GB VRAM trên Linux đã có mặt, trong khi phiên bản Windows đang được phát triển. Người dùng có thể xử lý dữ liệu ngay trên thiết bị và chỉ chuyển một phần tác vụ lên hơn 15 mô hình AI trên đám mây khi cần khả năng nghiên cứu hoặc suy luận chuyên sâu hơn.

Một điểm đáng chú ý là Portable Computer yêu cầu sự cho phép trước khi gửi dữ liệu lên cloud, qua đó tăng khả năng kiểm soát đối với những nội dung nhạy cảm.

02 / Agent Software

Hermes Agent và OpenClaw giảm bớt cấu hình thủ công

Hermes Agent, do Nous Research phát triển, là một AI agent đa dụng được thiết kế để hoạt động lâu dài trên hệ thống cục bộ. Với khả năng sử dụng công cụ, duy trì ngữ cảnh giữa các nhiệm vụ và hình thành các kỹ năng có thể tái sử dụng, Hermes có thể tận dụng GPU RTX, RTX PRO hoặc DGX Spark để xử lý AI ngay trên thiết bị.

Trên Windows, Hermes sẽ hỗ trợ cơ chế thiết lập mô hình chỉ với một lần nhấp. Phần mềm có thể tự nhận diện GPU NVIDIA, lựa chọn mô hình và cấu hình phù hợp, sau đó chạy thông qua llama.cpp với các tối ưu hóa suy luận được tích hợp sẵn.

NVIDIA cho biết hỗ trợ Linux sẽ được bổ sung trong thời gian tới.

Trong khi đó, OpenClaw đang nổi lên như một dự án đáng chú ý trong hệ sinh thái AI agent mã nguồn mở. Với cộng đồng phát triển lớn trên GitHub, dự án được sử dụng cho nhiều mục đích như nghiên cứu, kỹ thuật, quản lý dự án và các tác vụ năng suất cá nhân.

NVIDIA, Microsoft và OpenClaw đang phối hợp phát triển trải nghiệm thiết lập đơn giản hơn trên Windows. Ứng dụng OpenClaw Windows App sẽ hỗ trợ cấu hình mô hình AI cục bộ được tối ưu cho GPU RTX có từ 24GB VRAM.

03 / Performance

Tốc độ suy luận tăng tới 1,9 lần

Hiệu suất suy luận đóng vai trò quan trọng khi AI agent phải xử lý nhiều tác vụ liên tiếp. NVIDIA tiếp tục hợp tác với cộng đồng mã nguồn mở của llama.cpp và vLLM để tối ưu khả năng xử lý trên các nền tảng RTX và DGX.

1.9× Throughput llama.cpp trên GeForce RTX 5090
1.2× vLLM trên RTX PRO 6000 Blackwell
1.4× vLLM trên hai cụm DGX Spark

Với llama.cpp, các tối ưu hóa kernel, kỹ thuật speculative decoding được cải thiện và tốc độ prefill nhanh hơn giúp throughput trên GeForce RTX 5090 tăng tới 1,9 lần.

Trong khi đó, vLLM đạt mức tăng khoảng 1,2 lần trên RTX PRO 6000 Blackwell Workstation Edition và lên tới 1,4 lần khi sử dụng hai cụm DGX Spark. Những cải tiến này đến từ các kernel XQA mới trong FlashInfer cùng các tối ưu ở backend.

NVIDIA vLLM RTX PRO 6000 Blackwell DGX Spark
Các tối ưu mới giúp tăng tốc suy luận AI trên nền tảng RTX và DGX.

Các nâng cấp hiện có trên llama.cpp và vLLM, đồng thời được đưa vào những ứng dụng phổ biến như LM Studio và Ollama.

04 / Multi-PC AI

NVIDIA PAIR biến PC nhàn rỗi thành tài nguyên AI

NVIDIA PERSONAL AI ROUTER

Nhiều PC, một mạng AI cục bộ

Personal AI Router (PAIR) là công cụ mã nguồn mở miễn phí cho phép nhiều máy tính trong cùng mạng nội bộ phối hợp xử lý AI, tận dụng tài nguyên tính toán còn trống thay vì để chúng nhàn rỗi.

Theo NVIDIA, hơn một nửa số hộ gia đình tại Mỹ sở hữu từ hai PC trở lên, nhưng phần lớn năng lực tính toán của những thiết bị này không được sử dụng liên tục. PAIR tận dụng nguồn tài nguyên đó bằng cách tự phát hiện các PC tương thích trên mạng và phân phối những yêu cầu suy luận độc lập đến hệ thống còn năng lực xử lý.

NVIDIA PAIR / Multi-PC Local AI

Cơ chế này đặc biệt phù hợp với AI agent có khả năng chia một nhiệm vụ phức tạp thành nhiều tác vụ nhỏ chạy song song. Thay vì dồn toàn bộ yêu cầu lên một GPU duy nhất, PAIR có thể điều phối chúng sang nhiều máy tính khác nhau.

Ví dụ, khi Hermes phải xử lý một lượng lớn email để xây dựng kế hoạch công việc cuối tuần, các sub-agent có thể chia nhau thực hiện từng phần. PAIR sau đó phân bổ những tác vụ này tới các PC đang có tài nguyên trống.

Nhờ đó, máy tính chính vẫn có thể phục vụ việc chơi game hoặc sáng tạo nội dung trong khi một hệ thống khác đảm nhận các tác vụ AI.

Phiên bản beta của NVIDIA PAIR hỗ trợ Windows, macOS và Linux, với giao diện đồ họa lẫn dòng lệnh. Công cụ tương thích với GPU GeForce RTX 20 Series trở lên, GPU RTX PRO workstation sử dụng kiến trúc Turing hoặc mới hơn, DGX Spark và máy Mac sử dụng chip Apple M4 trở lên.

05 / Creative AI

AI chỉnh sửa ảnh trực tiếp trên RTX Spark

NVIDIA cũng giới thiệu khả năng xử lý AI cục bộ dành cho các ứng dụng sáng tạo nội dung. CyberLink PhotoDirector 365 sẽ được bổ sung chế độ AI PC Mode, tối ưu cho RTX Spark khi nền tảng này ra mắt.

Chế độ mới khai thác các mô hình diffusion để hỗ trợ nhiều tính năng như chỉnh sửa ảnh sinh tạo, nâng cao chất lượng hình ảnh, xóa vật thể, loại bỏ và thay thế phông nền, tinh chỉnh chân dung cũng như tạo hình ảnh mới.

Người dùng có thể lựa chọn xử lý trực tiếp trên thiết bị hoặc chuyển tác vụ lên cloud tùy nhu cầu. Trên GPU NVIDIA, PhotoDirector sử dụng TensorRT-RTX và FP8 để tăng tốc quá trình xử lý AI cục bộ.

Cách tiếp cận này không chỉ giúp giảm sự phụ thuộc vào dịch vụ trực tuyến mà còn cho phép các nhà sáng tạo thử nghiệm nhiều ý tưởng hơn mà không phải liên tục quan tâm đến giới hạn token.

06 / RTX Spark

RTX Spark Windows PC chính thức xuất hiện vào tháng 10

NVIDIA RTX SPARK / OCTOBER 2026

Một nền tảng PC mới cho AI, sáng tạo và gaming

RTX Spark được NVIDIA định vị như một thế hệ PC mới dành cho người sáng tạo, game thủ và AI agent, kết hợp sức mạnh xử lý AI lớn với thiết kế laptop mỏng và desktop nhỏ gọn.

NVIDIA RTX Spark sẽ bắt đầu được bán trong tháng 10/2026. Tại IFA, các đối tác đã trình diễn thêm những thiết kế mới, trong đó Acer giới thiệu concept desktop RTX Spark nhỏ gọn, còn Lenovo công bố Yoga Pro 9n và Yoga 9n 2-in-1.

1 PFLOP Hiệu năng GPU RTX Blackwell
128GB Bộ nhớ hợp nhất tối đa
20 Nhân Grace CPU

Nền tảng RTX Spark được NVIDIA định vị như một thế hệ PC mới dành cho người sáng tạo, game thủ và AI agent. Hệ thống sử dụng GPU RTX Blackwell đạt 1 Petaflop, bộ nhớ hợp nhất tối đa 128GB và CPU Grace 20 nhân.

Cấu hình này hướng đến cả laptop mỏng có thời lượng pin dài lẫn desktop nhỏ gọn đủ năng lực chạy AI agent liên tục trong nền.

Khi kết hợp với Windows Agent framework, RTX Spark có thể hỗ trợ các AI agent hoạt động nền dưới sự kiểm soát ở cấp hệ điều hành. Điều này mở ra hướng sử dụng PC như một nền tảng AI luôn sẵn sàng thay vì chỉ chạy mô hình khi người dùng trực tiếp mở ứng dụng.

Tại Gamescom trước đó, Electronic Arts, Embark và Ubisoft cũng đã công bố kế hoạch đưa các tựa game của mình lên RTX Spark Windows PC. Những cái tên này gia nhập nhóm đối tác từng xác nhận hỗ trợ nền tảng tại COMPUTEX, gồm KRAFTON, NetEase, Riot Games và Xbox.

07 / AI Ecosystem

Hệ sinh thái AI cục bộ tiếp tục mở rộng

NVIDIA cho biết tháng 8 vừa qua chứng kiến hàng loạt mô hình AI mới được tối ưu cho khả năng vận hành tại chỗ.

Nemotron 3.5 Lightning với 30 tỷ tham số đã được phát hành cho RTX PC, RTX PRO Workstation, DGX Spark và Jetson. Z.ai cũng đưa GLM-5.3-Flash, một mô hình multimodal mixture-of-experts, lên DGX Station.

Qwen giới thiệu Qwen3.8-Flash-Next và Qwen3.8-27B, hướng đến các tác vụ AI agent và lập trình cục bộ. Trong lĩnh vực tạo video, LTX 2.5 được tối ưu cho GPU RTX, DGX Spark và DGX Station, trong khi FastH3 của FastVideo được giới thiệu như phiên bản rút gọn từ MiniMax-H3 với mục tiêu tăng tốc đáng kể quá trình tạo video.

Meta cũng đưa Muse Glimmer, mô hình 30 tỷ tham số dành cho coding và agentic AI, lên các nền tảng gồm GeForce RTX PC, DGX Spark, DGX Station và Jetson.

Đáng chú ý, DeepSeek v4 Flash với kiến trúc mixture-of-experts gồm 284 tỷ tham số, trong đó 13 tỷ tham số được kích hoạt, có thể chạy cục bộ trên hệ thống gồm hai DGX Spark hoặc DGX Station.

Tại IFA 2026, NVIDIA đang định hình một hướng đi rõ ràng cho PC: AI agent dễ triển khai hơn, suy luận nhanh hơn và nhiều máy tính có thể phối hợp để tạo thành một hệ thống AI cục bộ linh hoạt.

Những bước tiến này cho thấy NVIDIA đang đặt cược mạnh vào xu hướng đưa AI xuống thiết bị. Khi mô hình ngày càng tối ưu, phần cứng mạnh hơn và công cụ triển khai đơn giản hơn, PC không còn chỉ là thiết bị truy cập AI trên cloud mà đang trở thành một nền tảng xử lý AI độc lập.

Với sự xuất hiện của RTX Spark từ tháng 10, NVIDIA đang mở rộng thêm một lựa chọn phần cứng dành cho những người muốn đưa AI vào các tác vụ thường nhật, sáng tạo nội dung, phát triển phần mềm và cả giải trí ngay trên máy tính cá nhân.

Nguồn: NVIDIA
Chia sẻ.