84 363 723 419

Support 24/7

0 Your Cart $0.00

Cart (0)

No products in the cart.

Chi phí AI có thể giảm mạnh khi Agent biết đổi mô hình giữa chừng

Nvidia muốn AI Agent tự chọn mô hình để giảm mạnh chi phí vận hành

AI Agent đang bước vào giai đoạn mà một câu hỏi rất thực dụng bắt đầu quan trọng hơn việc mô hình nào thông minh nhất. Doanh nghiệp phải trả bao nhiêu tiền để AI hoàn thành một công việc?

Nếu mọi yêu cầu đều được gửi tới mô hình frontier đắt tiền, chi phí sẽ tăng rất nhanh khi Agent chạy liên tục. Nhưng nếu doanh nghiệp tự xây một hệ thống để phân loại yêu cầu, chọn mô hình rẻ cho việc đơn giản và mô hình mạnh cho việc phức tạp, họ lại tạo thêm một dự án hạ tầng phải bảo trì.

Nvidia đang đặt cược vào một hướng khác. Nemotron 3.5 Lightning cung cấp một mô hình mở được tối ưu cho các tác vụ Agent khối lượng lớn, còn NeMo Switchyard quyết định ở từng bước của quy trình, mô hình nào nên được sử dụng.

Trong các thử nghiệm Nvidia công bố, cách kết hợp này có thể giữ mức hoàn thành tác vụ tương đương mô hình frontier nhưng đưa chi phí benchmark xuống khoảng một phần ba so với việc chỉ chạy Opus 4.8.

Đây không đơn thuần là câu chuyện về một model mới. Nó là câu chuyện về cách hệ thống AI bắt đầu trở nên quan trọng hơn chính một mô hình AI đơn lẻ.

Nvidia vừa đưa ra hai thành phần có mối quan hệ rất chặt chẽ.

Một là Nemotron 3.5 Lightning, mô hình 30 tỷ tham số dạng mixture-of-experts mở, được thiết kế cho những tác vụ AI Agent chuyên biệt và có khối lượng lớn.

Hai là NeMo Switchyard, thư viện mã nguồn mở dùng để định tuyến từng bước trong workflow của Agent tới mô hình phù hợp nhất.

Ý tưởng rất đơn giản.

Một Agent không phải lúc nào cũng cần cùng một mức “trí thông minh”.

Một bước có thể chỉ cần đọc dữ liệu. Một bước khác cần viết code. Bước tiếp theo có thể phải suy luận phức tạp. Nếu sử dụng cùng một model đắt tiền cho tất cả, doanh nghiệp đang trả mức giá cao nhất ngay cả khi công việc không cần đến nó.

Switchyard muốn biến lựa chọn model thành một quyết định động.

Và đó là điểm đáng chú ý nhất.

Điều gì mới?

Model routing không phải ý tưởng mới.

Các nền tảng như OpenRouter, LiteLLM và những framework định tuyến khác đã cho phép developer phân phối request tới nhiều model hoặc nhà cung cấp.

Điểm khác của Switchyard nằm ở chỗ Nvidia nhìn routing như một phần của quy trình Agent, thay vì chỉ là một lớp phân phối request.

Một Agent có trạng thái.

Nó gọi tool.

Tool trả về dữ liệu.

Có lỗi xảy ra.

Một bước hóa ra đơn giản hơn dự kiến.

Hoặc một bước bất ngờ trở nên phức tạp.

Trong quá trình đó, nhu cầu về model cũng thay đổi.

Nếu ngay từ đầu doanh nghiệp quyết định rằng toàn bộ workflow phải chạy bằng một model, quyết định đó nhanh chóng trở nên lỗi thời.

Switchyard cố giải quyết chính sự thay đổi này.

Tại sao nó quan trọng?

Hãy lấy một Agent coding làm ví dụ.

Nó có thể trải qua 10 bước.

Bước đầu tiên đọc repository.

Bước thứ hai tìm file liên quan.

Bước thứ ba phân tích lỗi.

Bước thứ tư viết code.

Bước thứ năm chạy test.

Bước thứ sáu đọc log.

Không phải tất cả sáu bước đều cần cùng một mô hình.

Nếu bước đọc file có thể xử lý bằng một model nhanh và rẻ, việc dùng model frontier ở đó là lãng phí.

Ngược lại, nếu Agent đang đứng trước một lỗi logic phức tạp, tiết kiệm vài cent nhưng khiến chất lượng suy luận giảm có thể làm tổng chi phí tăng lên vì Agent phải thử lại nhiều lần.

Do đó, bài toán thực sự không phải:

Model nào rẻ nhất?

Mà là:

Model nào rẻ nhất nhưng vẫn đủ tốt cho bước này?

Đó là một bài toán tối ưu hóa hệ thống.

Switchyard hoạt động như thế nào?

Switchyard cho phép sử dụng nhiều chiến lược routing.

Một chiến lược có thể dựa trên trạng thái của Agent.

Một chiến lược khác có thể dùng classifier.

Thậm chí có thể chọn ngẫu nhiên, dù đây rõ ràng không phải phương án tối ưu cho những workflow nghiêm túc.

Quan trọng hơn, router có thể nhìn vào những tín hiệu liên quan tới chi phí.

Một yếu tố Nvidia đề cập là độ dài đầu ra của model, hay mức độ verbose.

Hai model có thể hoàn thành cùng một nhiệm vụ nhưng tạo ra số lượng token rất khác nhau.

Nếu router có thể dự đoán model nào sẽ tạo ra ít token hơn trong một tác vụ cụ thể, chi phí có thể được đưa trực tiếp vào quyết định routing trước khi request được gửi đi.

Đây là một thay đổi nhỏ nhưng có ý nghĩa lớn.

Routing không còn chỉ là:

Model A tốt hơn Model B.

Nó trở thành:

Model A đủ tốt cho bước này, nhanh hơn và rẻ hơn Model B.

Dữ liệu đáng chú ý nằm ở đâu?

Nvidia đưa ra một số con số từ các công ty thử nghiệm Switchyard.

LangChain báo cáo giảm 74% chi phí trên 145 tác vụ Deep Agents nhiều lượt, khi chỉ định tuyến khoảng 7% request tới model frontier. Đổi lại, độ chính xác giảm khoảng 6%.

Ramp cho biết Switchyard đạt hiệu năng tương đương model frontier trên Ramp SWE-Bench, trong khi giảm 58% chi phí và 33% thời gian chạy.

Cognition tích hợp staged router vào Devin Desktop cho sử dụng nội bộ. Công ty báo cáo hiệu năng gần frontier trên FrontierCode Main và giảm 28% chi phí trung bình so với việc định tuyến mọi thứ tới một model frontier duy nhất.

Đây là những con số đáng chú ý, nhưng cần đọc đúng.

Chúng không chứng minh rằng mọi doanh nghiệp sẽ giảm chi phí theo cùng tỷ lệ.

Chúng cho thấy một điều khác quan trọng hơn.

Routing có thể biến chi phí model thành một biến có thể tối ưu trong chính workflow.

Nvidia cũng cho biết khi kết hợp Switchyard với Lightning, chi phí benchmark có thể giảm xuống khoảng một phần ba so với việc chạy Opus 4.8 đơn lẻ, trong khi vẫn duy trì mức hoàn thành tác vụ ở cấp frontier theo thử nghiệm của công ty.

Lightning không phải model mạnh nhất

Đây là điểm cần tránh hiểu sai.

Nemotron 3.5 Lightning không được Nvidia định vị là model tổng quát tốt nhất trong phân khúc.

Theo Artificial Analysis Intelligence Index được bài viết dẫn lại, Lightning đạt điểm 24, ngang gpt-oss-120b nhưng thấp hơn một số model như Nemotron 3 Super, Gemma 4 31B, Claude 4.5 Haiku và Mistral Medium 3.5.

Nói cách khác, Lightning không thắng bằng cách trở thành “model thông minh nhất”.

Nó thắng trong một bài toán khác.

Tốc độ và hiệu quả.

Theo dữ liệu PinchBench do Nvidia cung cấp, Lightning đạt độ chính xác tương đương Qwen3.6-35B nhưng hoàn thành nhanh hơn khoảng 30%.

So với Gemma 4 26B, Nvidia cho biết Lightning đạt độ chính xác cao hơn trong thời gian hoàn thành tương đương.

Đây là một cuộc chơi khác với cuộc đua benchmark tổng quát.

Trong production, latency và cost thường quan trọng không kém accuracy.

Doanh nghiệp tạo giá trị ở đâu?

Giá trị lớn nhất không nhất thiết nằm ở Lightning.

Nó nằm ở sự kết hợp giữa model và router.

Một model rẻ hơn sẽ không giúp nhiều nếu doanh nghiệp không biết khi nào nên sử dụng nó.

Một router thông minh cũng không tạo ra nhiều giá trị nếu tất cả các model trong pool đều đắt hoặc có hiệu năng tương tự nhau.

Nvidia đang cố sở hữu cả hai đầu.

Lightning là lựa chọn nhanh và tiết kiệm.

Switchyard là lớp quyết định.

Khi hai thứ hoạt động cùng nhau, doanh nghiệp có thể xây một hệ thống trong đó:

  • tác vụ đơn giản dùng model nhỏ;
  • tác vụ tốc độ cao dùng model nhanh;
  • tác vụ khó dùng model frontier;
  • request có rủi ro cao về chất lượng được ưu tiên model mạnh;
  • chi phí token trở thành một biến trong quyết định.

Đây là cách AI chuyển từ một model làm tất cả sang một hệ thống nhiều model.

Platform hay product?

Nếu chỉ nhìn Lightning, Nvidia đang phát hành thêm một model mở.

Nếu nhìn cả Lightning và Switchyard, câu chuyện hoàn toàn khác.

Nvidia đang xây một stack.

Model cung cấp năng lực.

Router quyết định model nào được dùng.

Gateway kết nối với hệ thống doanh nghiệp.

Agent framework tạo workflow.

Và doanh nghiệp cung cấp dữ liệu, chính sách cùng mục tiêu.

Đây là lý do Nvidia nhấn mạnh khả năng tích hợp.

Cogniton, LangChain và Nous Research có thể gọi Switchyard trực tiếp từ framework Agent.

Trong khi Kong, LiteLLM và OpenRouter tích hợp Switchyard vào lớp gateway.

Kong thậm chí đưa Switchyard trực tiếp vào Kong AI Gateway.

Chiến lược này cho phép Nvidia không buộc doanh nghiệp phải thay thế toàn bộ stack hiện tại.

Đó là một điểm rất quan trọng khi bán hạ tầng cho doanh nghiệp.

Đối thủ và lợi thế cạnh tranh

Đối thủ trực tiếp của Switchyard không nhất thiết là một model khác.

Những cái tên gần hơn là Not Diamond và RouteLLM.

Not Diamond được sử dụng trong Auto mode của OpenRouter.

RouteLLM là framework mã nguồn mở từ UC Berkeley và LMSYS.

Điểm khác biệt trong chiến lược của Nvidia là họ kiểm soát cả model lẫn router.

Điều này tạo ra một vòng lặp tối ưu hóa thú vị.

Router biết đặc điểm của model.

Model được thiết kế để phù hợp với những tác vụ mà router có thể chuyển tới nó.

Sau đó dữ liệu production lại giúp cải thiện cách routing.

Nếu hệ sinh thái phát triển đủ lớn, lợi thế không còn chỉ nằm ở model benchmark.

Nó nằm ở khả năng quyết định model nào nên được dùng ở thời điểm nào.

Rủi ro lớn nhất

Có một nghịch lý.

Routing càng thông minh, hệ thống càng phức tạp.

Doanh nghiệp phải theo dõi accuracy, latency, token usage, chi phí, retry rate và hành vi của từng model.

Một router chọn sai model có thể khiến Agent thất bại.

Một router quá tiết kiệm có thể làm giảm chất lượng.

Một router quá thận trọng sẽ lại gửi quá nhiều request tới model đắt tiền.

Vì vậy, routing không phải phép màu giúp AI tự nhiên rẻ đi.

Nó là một bài toán tối ưu hóa liên tục.

Ngoài ra, các benchmark của Nvidia cần được xem trong bối cảnh chúng là kết quả do công ty cung cấp hoặc được đối tác báo cáo. Doanh nghiệp triển khai thực tế vẫn cần benchmark trên chính workflow, dữ liệu và yêu cầu chất lượng của mình.

Việt Nam sẽ bị tác động thế nào?

Đây có thể là một cơ hội đáng kể đối với doanh nghiệp Việt Nam.

Doanh nghiệp trong nước thường không có ngân sách AI lớn như các tập đoàn công nghệ Mỹ.

Điều đó khiến bài toán cost-per-task đặc biệt quan trọng.

Một chatbot có vài nghìn request mỗi ngày có thể chưa tạo ra áp lực lớn.

Nhưng một Agent chăm sóc khách hàng hoạt động 24/7, một Agent xử lý catalog thương mại điện tử, một Agent phân tích đơn hàng hoặc một Agent lập trình chạy liên tục sẽ tạo ra lượng request rất lớn.

Nếu mọi request đều dùng model đắt nhất, chi phí nhanh chóng trở thành vấn đề.

Routing cho phép doanh nghiệp suy nghĩ khác.

Không cần hỏi:

“Chúng ta nên mua model tốt nhất nào?”

Mà hỏi:

“Workflow của chúng ta có bao nhiêu loại tác vụ và mỗi loại thực sự cần năng lực đến đâu?”

Đây là câu hỏi kinh tế quan trọng hơn.

Doanh nghiệp Việt Nam nên làm gì?

Đầu tiên, đừng xây Agent với giả định rằng một model sẽ phục vụ mọi nhiệm vụ.

Hãy đo workflow.

Xác định những bước đơn giản, những bước cần suy luận và những bước thực sự đòi hỏi frontier model.

Thứ hai, đo chi phí theo tác vụ hoàn thành, không chỉ theo token.

Một model rẻ hơn nhưng phải retry ba lần chưa chắc rẻ hơn.

Một model đắt hơn nhưng hoàn thành ngay từ lần đầu có thể có tổng chi phí thấp hơn.

Thứ ba, lưu lại dữ liệu routing.

Doanh nghiệp cần biết model nào được gọi, cho bước nào, mất bao lâu, tiêu tốn bao nhiêu token và có thành công hay không.

Không có dữ liệu này, routing sẽ biến thành phỏng đoán.

Thứ tư, bắt đầu với một pool model nhỏ.

Không cần tích hợp 20 model ngay từ ngày đầu.

Một model nhanh và rẻ.

Một model cân bằng.

Một model mạnh.

Ba lựa chọn đã đủ để bắt đầu thử nghiệm một router có ý nghĩa.

Cuối cùng, hãy xem routing như một thành phần hạ tầng.

Nếu doanh nghiệp dự định xây hàng chục Agent, việc lựa chọn model không nên nằm rải rác trong từng ứng dụng.

Nó nên được đưa lên một lớp chung.

Khi đó, thay đổi model có thể không cần sửa toàn bộ business logic.

Đây mới là giá trị kiến trúc dài hạn.

Cuộc đua AI đang thay đổi.

Giai đoạn đầu tập trung vào câu hỏi model nào thông minh nhất.

Sau đó đến câu hỏi model nào rẻ nhất.

Nhưng khi AI Agent bắt đầu chạy hàng triệu tác vụ trong production, câu hỏi quan trọng hơn sẽ là:

Làm thế nào để sử dụng đúng model cho đúng bước với chi phí thấp nhất mà không làm giảm chất lượng?

NeMo Switchyard là một câu trả lời cho bài toán đó.

Nemotron 3.5 Lightning là một phần còn lại của câu trả lời.

Một model tốt không đủ.

Một router tốt cũng chưa đủ.

Giá trị nằm ở hệ thống kết hợp cả hai.

Điều này cũng làm thay đổi cách nhìn về cạnh tranh AI. Khi open-weight model ngày càng phổ biến, lợi thế sẽ khó nằm mãi ở việc sở hữu một model độc quyền.

Lợi thế có thể chuyển lên tầng cao hơn.

Ai hiểu workflow tốt hơn. Ai định tuyến tốt hơn. Ai tối ưu chi phí tốt hơn. Và ai xây được hệ thống AI vận hành ổn định trong production.

Đó là lý do câu chuyện Nvidia lần này đáng chú ý.

Nvidia không chỉ đang đưa thêm một model ra thị trường.

Họ đang đặt cược rằng tương lai của AI Agent sẽ không phải là một model làm mọi thứ.

Nó sẽ là một hệ thống gồm nhiều model, được điều phối theo từng công việc.

Và trong một thế giới nơi AI làm việc liên tục, 24 giờ mỗi ngày, khả năng chọn đúng model có thể quan trọng không kém khả năng xây dựng model tốt nhất.

Your experience on this site will be improved by allowing cookies Cookie Policy