Năm 2026, một developer Việt Nam xây ứng dụng AI gần như chắc chắn sẽ đối mặt với cùng một câu hỏi: nên gọi model qua OpenRouter hay mở tài khoản và gọi API trực tiếp từng provider như DeepSeek, Anthropic hay OpenAI? Mỗi hướng đi đều có người ủng hộ nhiệt tình, và cả hai đều có lý do chính đáng. Bài viết này sẽ so sánh bằng số liệu giá thật công bố tháng 8/2026, phân tích chi phí thực tế, rate limit, độ phức tạp tích hợp, rồi đưa ra khung quyết định cụ thể cho từng hoàn cảnh.
OpenRouter là gì và hoạt động ra sao
OpenRouter là một aggregator, tức lớp trung gian tập hợp hàng trăm model từ nhiều provider khác nhau sau một API duy nhất. Tại thời điểm viết bài, danh sách model công khai tại openrouter.ai/api/v1/models liệt kê 413 model, từ DeepSeek V4 Flash giá rẻ đến Claude Opus 5 và GPT-5.6. Bạn tạo một tài khoản, nạp credit, lấy một API key, rồi gọi mọi model bằng cùng một endpoint tương thích định dạng OpenAI.
Điểm mấu chốt về kiến trúc: OpenRouter không tự chạy model. Nó nhận request của bạn, chọn provider phù hợp (theo giá, tốc độ hoặc chất lượng tùy cấu hình), chuyển tiếp request, rồi trả kết quả về. Nếu provider gặp lỗi, nó tự động fallback sang provider khác mà ứng dụng của bạn không hề hay biết. Đây chính là lý do OpenRouter quảng bá khả năng "gộp uptime" của nhiều nhà cung cấp vào một con số ổn định hơn bất kỳ provider đơn lẻ nào.
Chi phí thật: pass-through giá và phí nạp credit 5,5%
Điều đầu tiên cần làm rõ: OpenRouter không cộng thêm phần trăm lên giá inference. Theo FAQ chính thức, họ "pass through" nguyên giá của provider, không markup, và kiếm tiền bằng phí khi bạn nạp credit: 5,5% cho mỗi lần nạp (tối thiểu 0,80 USD), riêng thanh toán crypto là 5%. Nghĩa là nạp 100 USD, bạn có khoảng 94,6 USD thực dùng cho inference.
Với nhà phát triển dùng key riêng của provider (BYOK, bring your own key), OpenRouter còn miễn phí hẳn một hạn mức: 25.000 USD chi phí inference mỗi tháng cho gói pay-as-you-go, 200.000 USD cho enterprise; chỉ phần vượt hạn mức mới bị tính phí 5%.
Vì giá model được pass-through, mức giá niêm yết trên OpenRouter gần như trùng với giá provider. Tuy nhiên có một ngoại lệ quan trọng: với những model được nhiều provider cùng phục vụ, OpenRouter hiển thị giá "hợp nhất" (blended) lấy bình quân giữa các provider, và provider rẻ hơn có thể kéo giá này xuống dưới giá chính hãng.
Giá thực tế theo model tháng 8/2026
Nhìn vào giá output 1 triệu token (biểu đồ trên, thang log), chênh lệch giữa các nhóm model là rất lớn. DeepSeek V4 Flash qua OpenRouter chỉ khoảng 0,13 USD, trong khi GPT-5.5 là 30 USD, tức gấp hơn 200 lần. Đây là lý do quyết định chọn model ảnh hưởng ngân sách nhiều hơn quyết định chọn kênh gọi.
Cụ thể hơn, các mức giá niêm yết tháng 8/2026:
DeepSeek V4 Flash qua OpenRouter: 0,064 USD input và 0,129 USD output mỗi 1 triệu token. Gọi trực tiếp DeepSeek: 0,14 USD input (cache miss) và 0,28 USD output. Ngạc nhiên thú vị: giá blended trên OpenRouter thấp hơn giá chính hãng, vì các provider thứ ba phục vụ model này với giá cạnh tranh hơn. Ngược lại, DeepSeek V4 Pro trực tiếp giá 0,435 USD input, 0,87 USD output, còn qua OpenRouter blended là 1,168 USD và 2,336 USD, đắt hơn đáng kể.
Với Anthropic, giá OpenRouter trùng khớp hoàn toàn với bảng giá chính thức tại platform.claude.com: Claude Sonnet 5 là 2 USD input, 10 USD output; Claude Opus 5 là 5 USD và 25 USD. OpenAI tương tự: GPT-5.4 là 2,5 USD và 15 USD, GPT-5.5 là 5 USD và 30 USD, GPT-5.4 mini chỉ 0,75 USD và 4,5 USD, còn GPT-5.6 luna chỉ 0,2 USD và 1,2 USD theo developers.openai.com.
DeepSeek trực tiếp: giá peak và off-peak từ 16/8/2026
DeepSeek vừa chuyển sang biểu giá theo giờ, hiệu lực từ 16:00 UTC ngày 16/8/2026. Khung giờ peak là 01:00-04:00 và 06:00-10:00 UTC, mọi giờ còn lại là off-peak với giá bằng một nửa giá peak. Với V4 Flash, input off-peak 0,22 USD, output off-peak 0,66 USD; giờ peak tương ứng 0,44 USD và 1,32 USD. V4 Pro off-peak 0,66 USD input, 1,98 USD output; peak 1,32 USD và 3,96 USD. Bên cạnh đó, cache hit vẫn rẻ hơn rất nhiều: chỉ 0,007 USD input cho Flash ngoài giờ peak, và concurrency limit của API trực tiếp lên tới 2.500 cho Flash, 500 cho Pro.

Ý nghĩa thực tế: nếu workload của bạn là batch chạy đêm, gọi trực tiếp DeepSeek và lên lịch ngoài giờ peak giúp tiết kiệm 50% chi phí. Nếu qua OpenRouter, giá bạn trả phụ thuộc provider được route tới, và khó tận dụng triệt để biểu giá theo giờ này của DeepSeek.
DeepSeek trực tiếp so với OpenRouter: câu chuyện hai chiều
Biểu đồ dưới đây tóm tắt sự khác biệt giá input giữa hai kênh với ba biến thể DeepSeek. V4 Flash rẻ hơn qua OpenRouter, V4 Pro đắt hơn hẳn, còn biến thể ổn định 0731 thì hai bên bằng nhau ở mức 0,14 USD. Bài học rút ra: đừng tin vào công thức "OpenRouter luôn rẻ hơn" hay "luôn đắt hơn", hãy tra cứu giá từng model tại thời điểm bạn quyết định, vì giá blended thay đổi theo danh sách provider.

Rate limit và độ tin cậy
Rate limit là điểm khác biệt lớn giữa hai cách tiếp cận. Với OpenRouter, model miễn phí (biến thể :free) giới hạn 50 request mỗi ngày, và nếu bạn đã mua từ 10 USD credit thì được nâng lên 1.000 request mỗi ngày; với tài khoản trả phí, giới hạn tỷ lệ theo số credit bạn đã mua và model cụ thể. Gọi trực tiếp, DeepSeek công bố concurrency 2.500 cho V4 Flash và 500 cho V4 Pro, còn Anthropic và OpenAI vận hành hệ thống tier (tier 1 đến tier 5) tăng dần theo tổng chi tiêu, muốn quota cao phải chủ động xin nâng hạn mức.
Về độ tin cậy, OpenRouter thắng ở khả năng fallback tự động: một provider ngừng hoạt động không làm request của bạn thất bại, vì nó tự chuyển sang provider khác. Gọi trực tiếp thì bạn phụ thuộc hoàn toàn vào hạ tầng của một bên, nhưng đổi lại bạn kiểm soát được chính xác provider nào xử lý dữ liệu của mình, điều quan trọng với yêu cầu tuân thủ.
Độ phức tạp tích hợp
Gọi trực tiếp từng provider nghĩa là mỗi bên một tài khoản, một API key, một SDK và đôi khi một định dạng riêng: OpenAI dùng định dạng riêng, Anthropic dùng định dạng Messages riêng, DeepSeek thì tương thích OpenAI nhưng vẫn có điểm khác. Code của bạn phải phân nhánh theo từng provider, và mỗi lần thêm model mới lại phải viết thêm tích hợp. Với OpenRouter, mọi thứ gọn về một API key, endpoint tương thích OpenAI nên các SDK phổ biến như openai-python, LangChain hay Vercel AI SDK chạy được ngay chỉ bằng cách đổi base URL. Muốn thử model mới chỉ cần đổi chuỗi tên model trong code.
Khi nào nên dùng gì
Dựa trên chi phí thật, rate limit và độ phức tạp ở trên, khung quyết định gợi ý như sau:
Chọn OpenRouter khi: bạn đang prototype hoặc so sánh nhiều model trong một dự án; muốn một hóa đơn duy nhất cho mọi provider; cần fallback tự động để tăng độ tin cậy; tận dụng giá blended rẻ của model như DeepSeek V4 Flash; hoặc muốn dùng model miễn phí để thử nghiệm nhanh.
Chọn gọi API trực tiếp khi: ứng dụng đã ở production với lưu lượng lớn và một provider chủ lực; bạn cần kiểm soát tier, quota và SLA của chính provider; dữ liệu nhạy cảm không muốn đi qua lớp trung gian thứ ba; workload batch lớn muốn hưởng giảm 50% giá batch của Anthropic hoặc OpenAI; hoặc muốn tối ưu prompt caching với chính sách giá cache write và cache hit của riêng provider.
Cách thứ ba là kết hợp: giữ key trực tiếp cho provider chính, dùng OpenRouter cho phần model phụ, hoặc bật BYOK để vừa có giao diện thống nhất vừa quản lý chi phí và hạn mức trực tiếp với provider.
Tổng kết
Không có câu trả lời tuyệt đối. OpenRouter đáng giá khi bạn cần linh hoạt, tốc độ thử nghiệm và độ tin cậy từ fallback, với cái giá phải trả là phí nạp credit 5,5% và ít quyền kiểm soát provider. Gọi trực tiếp đáng giá khi bạn đã xác định rõ provider chủ lực, chạy scale lớn và cần tối ưu từng đồng chi phí bằng cache, batch và biểu giá theo giờ của chính provider. Cách tốt nhất là tính toán bằng số liệu hiện tại trước khi quyết định, vì giá model thay đổi liên tục, như chính biểu giá peak và off-peak mới của DeepSeek vừa cho thấy.
Câu hỏi thường gặp
OpenRouter có đắt hơn gọi API trực tiếp không?
Không hẳn. OpenRouter pass-through giá provider và chỉ thu phí 5,5% khi nạp credit, nên với cùng một model và provider, chi phí xấp xỉ nhau. Có model qua OpenRouter còn rẻ hơn nhờ giá blended từ nhiều provider, ví dụ DeepSeek V4 Flash niêm yết 0,064 USD input so với 0,14 USD khi gọi trực tiếp DeepSeek.
Dùng OpenRouter có an toàn cho dữ liệu nhạy cảm không?
Request của bạn đi qua hạ tầng OpenRouter trước khi tới provider, nên với dữ liệu thuộc diện bảo mật hoặc tuân thủ nghiêm ngặt, gọi trực tiếp provider là lựa chọn an toàn hơn. OpenRouter cung cấp tùy chọn provider routing để giới hạn nơi xử lý dữ liệu, nhưng vẫn là một lớp trung gian.
Giá off-peak của DeepSeek áp dụng vào giờ nào?
Peak là 01:00-04:00 và 06:00-10:00 UTC, các giờ còn lại là off-peak với giá bằng một nửa. Biểu giá này hiệu lực từ 16:00 UTC ngày 16/8/2026. Nếu chạy batch qua API trực tiếp DeepSeek, nên lên lịch ngoài khung giờ peak để tiết kiệm 50%.
Có nên dùng OpenRouter cho production không?
Được, nhiều ứng dụng production dùng OpenRouter nhờ fallback tự động và một API cho nhiều model. Nhưng nếu bạn đã ổn định một provider chủ lực với lưu lượng lớn, gọi trực tiếp thường rẻ hơn về dài hạn nhờ không mất phí nạp credit, tận dụng được batch giảm 50% và cache của chính provider.


No comments yet