Kimi K3 vs DeepSeek V4 vs GLM-5.2 — Cuộc chiến AI mã nguồn mở Trung Quốc 2026
Hè 2026 là mùa bùng nổ của AI mã nguồn mở Trung Quốc. Trong vòng chưa đầy 7 tuần, ba "ông lớn" cùng trình làng: Moonshot AI ra mắt Kimi K3 — mô hình open-weight lớn nhất thế giới với 2,88 nghìn tỷ tham số; DeepSeek phát hành V4-Flash với giá API rẻ chưa từng thấy (chỉ $0,28/1M token đầu ra) nhắm thẳng vào cuộc chiến AI agent; còn Z.ai (Zhipu AI) mở toàn bộ trọng số GLM-5.2 theo giấy phép MIT, vươn lên top đầu các bảng xếp hạng lập trình. Cả ba đều có context window 1 triệu token và đều có thể tải trọng số về tự chạy — nhưng khác biệt rất lớn về giá API, hiệu năng và hạ tầng triển khai. Bài viết dưới đây so sánh chi tiết ba mô hình giúp bạn chọn được lựa chọn phù hợp nhất.
Cập nhật: 2026-08-02 — Nguồn: TechRepublic, Geeky Gadgets, TechBooky, Yahoo Finance, TechNode, TechTimes, Times of India, Reuters, SCMP, VentureBeat
| Tiêu chí | Kimi K3 (Moonshot AI) |
DeepSeek V4 (DeepSeek) |
GLM-5.2 (Z.ai / Zhipu AI) |
|---|---|---|---|
| 📅 Ngày ra mắt | 16/7/2026 mở trọng số ngay trong tháng 7/2026 |
V4 Preview: giữa tháng 7 V4-Flash API public beta: 31/7/2026 |
13/6/2026 mở trọng số MIT: 17/6/2026 |
| 🏢 Nhà phát triển | Moonshot AI (Bắc Kinh) | DeepSeek (Hàng Châu) | Z.ai — Zhipu AI (Bắc Kinh) |
| 🧠 Tổng số tham số | 2,88 nghìn tỷ (2.88T) lớn nhất thế giới, gần chạm mốc 3T |
1,6 nghìn tỷ (1.6T) | 753 tỷ (753B) — MoE chỉ ~40B kích hoạt mỗi lần suy luận |
| ⚙️ Kiến trúc nổi bật | MoE + Kimi Delta Attention (tăng tốc decode 6,3x) + Attention Residuals | MoE + tinh chỉnh agent chuyên sâu (V4-Flash-0731), tương thích Responses API kiểu Codex | MoE + IndexShare (giảm 2,9x FLOPs ở 1M context) + LayerSplit + HiSparse |
| 📐 Context window | 1.000.000 token | 1.000.000 token (toàn bộ dòng V4) | 1.000.000 token |
| 🖼️ Multimodal | ✅ Có — text, mã nguồn, suy luận hình ảnh | Chủ yếu text & mã nguồn (chi tiết multimodal: Đang cập nhật) |
Chủ yếu text & mã nguồn tối ưu cho coding |
| 🚀 Hiệu quả scaling | 2,5x so với Kimi K2 | Cải thiện lớn nhờ post-training, không đổi kiến trúc | Tốc độ tăng 3–192% so GLM-5.1 (context 32K → 1M) |
| 💰 Giá API (input / 1M token) | $3,00 | $0,14 — rẻ nhất nhóm | Giữ nguyên như GLM-5.1 ~1/6 chi phí GPT-5.5 (VentureBeat) |
| 💰 Giá API (output / 1M token) | $15,00 | $0,28 — mức sàn agentic mới của ngành | Giữ nguyên như GLM-5.1 (giá cụ thể: Đang cập nhật) |
| ⏰ Giá theo khung giờ (peak/off-peak) | ✗ Không công bố | ✓ Có — giờ cao điểm (9–12h, 14–18h) gấp đôi giờ thấp điểm | ✗ Không công bố |
| 🔧 Terminal-Bench 2.1 | Đang cập nhật | 82,7 (V4-Flash) | 81,0 (Claude Opus 4.8: 85,0) |
| 🔧 Lập trình long-horizon | Vượt Opus 4.8, GPT-5.6 Sol & GPT-5.5 trong tối ưu GPU kernel (Reuters) | DeepSWE: 54,4 DSBench-Hard: 59,6 |
SWE-bench Pro: 62,1 (GPT-5.5: 58,6 — Opus 4.8: 69,2) |
| 🥇 Bảng xếp hạng độc lập | #1 Arena.ai xây dựng giao diện web; Vals AI #2 toàn cầu (sau Claude Fable 5) | Đang cập nhật | Code Arena #2 toàn cầu (Elo 1.595), #1 trong nhóm khả dụng; #1 Design Arena |
| 🤖 Khả năng agent | ✅ Rất mạnh — long-horizon coding, tự động hoá quy trình | ✅ Mạnh nhất nhóm — vượt V4-Pro-Preview ở 9/9 benchmark agent | ✅ Mạnh — tối ưu long-horizon agentic coding |
| 📜 Giấy phép / Trọng số mở | ✅ Open weights (tháng 7/2026) qua Fireworks, Microsoft Foundry |
✅ Open weights (V4 Preview + V4-Flash) | ✅ MIT License Hugging Face + ModelScope |
| 🖥️ Yêu cầu hạ tầng tự host | Cực lớn — hàng trăm nghìn USD (Reuters) | Lớn — 1,6T tham số cần cụm GPU mạnh | ~1,5 TB GPU memory (full precision) chạy được trên chip Huawei Ascend, Cambricon |
| ⚠️ Rủi ro dữ liệu khi dùng API | ⚠️ Dữ liệu đi qua hạ tầng Trung Quốc — cần cân nhắc | ⚠️ Dữ liệu đi qua hạ tầng Trung Quốc — cần cân nhắc | ⚠️ Cao — Luật An ninh Quốc gia TQ (Điều 7); tự host để tránh |
| 🎯 Đối tượng phù hợp | Doanh nghiệp cần hiệu năng đỉnh, dùng qua cloud (Fireworks, Foundry) | Team AI agent & ứng dụng khối lượng lớn, nhạy cảm chi phí | Developer muốn tự host, dự án mã nguồn mở, tác vụ long-context |
| ⭐ Đánh giá tổng thể | 4.6/5 — Mạnh nhất nhưng đắt & nặng | 4.6/5 — Giá rẻ nhất, agent xuất sắc | 4.4/5 — Mở nhất, cân bằng tốt |
Bối cảnh: Vì sao ba mô hình này "nóng" nhất hè 2026?
Chưa bao giờ cuộc đua AI Trung Quốc — Mỹ lại căng thẳng như giữa năm 2026. Ngày 12/6, Bộ Thương mại Mỹ ban hành lệnh cấm xuất khẩu khiến các mô hình Claude Fable 5 và Mythos 5 của Anthropic bị rút khỏi thị trường ngoài nước Mỹ, tạo khoảng trống lớn cho các mô hình mở. Ngay sau đó, Z.ai mở trọng số GLM-5.2 (17/6), DeepSeek công bố V4 chính thức giữa tháng 7 và phát hành V4-Flash public beta (31/7), còn Moonshot AI gây chấn động với Kimi K3 (16/7) — mô hình open-weight đầu tiên tiến sát mốc 3 nghìn tỷ tham số theo Reuters.
Làn sóng này khiến thị trường tài chính rung chuyển: cổ phiếu Z.ai và MiniMax lao dốc trên sàn Hong Kong sau khi Kimi K3 ra mắt, OpenAI phải cắt 80% giá mô hình GPT-5.6 Luna chỉ 2 ngày trước khi DeepSeek công bố giá $0,28/1M token đầu ra, và các nhà phân tích Bank of America nhận định các phòng lab Trung Quốc "vẫn tạo ra bước nhảy vọt dù bị giới hạn phần cứng" nhờ tối ưu kiến trúc và pre-training scaling. Dưới đây là phân tích chi tiết từng mô hình.
Kimi K3 — Gã khổng lồ 2,88 nghìn tỷ tham số (Moonshot AI)
Kimi K3 là mô hình open-weight lớn nhất từng được phát hành, với 2,88 nghìn tỷ tham số và context window 1 triệu token. Điểm mạnh kỹ thuật nằm ở cơ chế Kimi Delta Attention — tăng tốc quá trình giải mã (decoding) lên 6,3 lần — cùng Attention Residuals giúp cải thiện độ chính xác theo ngữ cảnh, qua đó nâng hiệu quả scaling lên gấp 2,5 lần so với Kimi K2. Đây là mô hình multimodal thực thụ (văn bản, mã nguồn, suy luận hình ảnh), được đánh giá xuất sắc trong tối ưu GPU kernel (vượt Opus 4.8, GPT-5.6 Sol và GPT-5.5 theo Reuters), dẫn đầu Arena.ai ở hạng mục xây dựng giao diện web và đứng #2 toàn cầu trên Vals AI (chỉ sau Claude Fable 5). Moonshot thừa nhận mô hình vẫn thua các mô hình đóng hàng đầu ở đánh giá tổng thể, và chi phí triển khai là rào cản lớn: tự chạy toàn bộ trọng số có thể tốn hàng trăm nghìn USD. Doanh nghiệp thường tiếp cận qua cloud — Moonshot đã đưa Kimi K3 lên Fireworks và Microsoft Foundry từ cuối tháng 7.
DeepSeek V4 — Vua giá rẻ của cuộc chiến AI agent (DeepSeek)
DeepSeek V4 (1,6 nghìn tỷ tham số) chính thức ra mắt giữa tháng 7/2026, nhưng tâm điểm là V4-Flash-0731 phát hành 31/7 — cùng kiến trúc và kích thước với bản preview nhưng được tái huấn luyện (re-post-training) chuyên sâu cho tác vụ agent. Kết quả: mô hình vượt V4-Pro-Preview ở 9/9 benchmark agent, đạt 82,7 trên Terminal-Bench 2.1, 76,7 trên Cybergym, 70,3 trên Toolathlon và 54,4 trên DeepSWE. Điểm gây sốc nhất là giá: $0,14 đầu vào / $0,28 đầu ra mỗi 1M token — thấp hơn tới 76,7% so với GPT-5.6 Luna ở mức giá tương đương hiệu năng (Intelligence Index 50 so với 51). DeepSeek còn tiên phong chính sách giá theo khung giờ (giờ cao điểm 9–12h và 14–18h gấp đôi giờ thấp điểm) và hỗ trợ chuẩn Responses API tương thích agent kiểu Codex, giúp doanh nghiệp chuyển đổi với chi phí thấp.
GLM-5.2 — Ngôi sao mã nguồn mở MIT (Z.ai / Zhipu AI)
GLM-5.2 của Z.ai (tiền thân là Zhipu AI) là mô hình MoE 753 tỷ tham số nhưng chỉ kích hoạt ~40 tỷ mỗi lần suy luận, với context 1 triệu token. Được phát hành hoàn toàn theo giấy phép MIT trên Hugging Face và ModelScope từ 17/6, GLM-5.2 trở thành mô hình coding mở mạnh nhất hiện có: SWE-bench Pro 62,1 (vượt GPT-5.5 ở mức 58,6), Terminal-Bench 2.1 đạt 81,0, Code Arena #2 toàn cầu (Elo 1.595) và #1 trong số các mô hình đang khả dụng sau khi Fable 5 bị rút khỏi Arena; đồng thời đứng đầu Design Arena. Các kỹ thuật IndexShare (giảm 2,9x phép tính ở context tối đa), LayerSplit và HiSparse giúp mô hình chạy hiệu quả trên cả chip nội địa Trung Quốc như Huawei Ascend. Hai chế độ suy luận GLM-5.2 (max) và (high) cho phép cân bằng hiệu năng và chi phí. Lưu ý quan trọng: dùng API cloud của Z.ai đồng nghĩa dữ liệu chịu sự điều chỉnh của Luật An ninh Quốc gia Trung Quốc — giải pháp an toàn là tự host trọng số (tốn ~1,5 TB GPU memory ở full precision).
So sánh nhanh với các mô hình Mỹ
Cả ba mô hình đều nhắm tới Claude Opus 4.8 / Fable 5 (Anthropic) và GPT-5.6 (OpenAI) — nhóm mô hình đóng đắt tiền nhất. GLM-5.2 được VentureBeat ghi nhận "đánh bại GPT-5.5 trên nhiều benchmark coding long-horizon với chi phí chỉ bằng 1/6"; DeepSeek V4 mang lại trí tuệ gần ngang state-of-the-art với chi phí 1/6 so với Opus 4.7 và GPT-5.5; còn Kimi K3 cạnh tranh trực tiếp ở hiệu năng đỉnh nhưng với mức giá ngang tầm Claude Sonnet 5 ($3/$15). Lợi thế chung của nhóm Trung Quốc: trọng số mở, context 1M token, giá rẻ — điểm yếu chung: rủi ro dữ liệu khi dùng API xuyên biên giới và hạ tầng tự host nặng nề.
Tổng kết — Nên chọn mô hình AI nào?
Kimi K3 — Sức mạnh tối đa
Mô hình open-weight lớn nhất thế giới, mạnh nhất nhóm về suy luận đa phương thức và tối ưu GPU kernel. Phù hợp: doanh nghiệp lớn cần hiệu năng đỉnh, dùng qua cloud.
- ✅ 2,88T tham số — lớn nhất thế giới
- ✅ Multimodal text/code/hình ảnh
- ✅ #1 Arena.ai xây dựng web, #2 Vals AI
- ✅ Kimi Delta Attention — decode nhanh 6,3x
- ⚠️ Giá API cao ($3/$15)
- ⚠️ Hạ tầng tự host cực kỳ tốn kém
DeepSeek V4 — Agent giá rẻ
Mức giá $0,14/$0,28 phá vỡ mọi chuẩn mực, kết hợp hiệu năng agent xuất sắc (Terminal-Bench 82,7). Phù hợp: team AI agent, ứng dụng khối lượng lớn nhạy cảm chi phí.
- ✅ Rẻ nhất nhóm — tiết kiệm tới 76,7% so Luna
- ✅ Terminal-Bench 2.1: 82,7
- ✅ Tương thích Responses API / agent kiểu Codex
- ✅ Giá theo khung giờ peak/off-peak
- ⚠️ Chủ yếu text & mã nguồn
- ⚠️ Benchmark nội bộ cần thẩm định độc lập
GLM-5.2 — Mã nguồn mở MIT
Mô hình mở hoàn toàn (MIT), coding mạnh nhất trong nhóm mở, chạy được trên chip Trung Quốc. Phù hợp: developer tự host, dự án mã nguồn mở, tác vụ long-context.
- ✅ MIT License — tự do thương mại hoá
- ✅ SWE-bench Pro 62,1 — vượt GPT-5.5
- ✅ #1 Code Arena trong nhóm khả dụng
- ✅ Chạy trên Huawei Ascend, Cambricon
- ⚠️ Cần ~1,5 TB GPU memory khi tự host
- ⚠️ Rủi ro dữ liệu khi dùng API cloud
Lời khuyên
- Cần hiệu năng đỉnh và có ngân sách lớn: Chọn Kimi K3 qua cloud (Fireworks, Microsoft Foundry) — mạnh nhất về đa phương thức và tối ưu GPU kernel, nhưng đừng kỳ vọng tự host.
- Làm AI agent, ứng dụng sản xuất khối lượng lớn: Chọn DeepSeek V4-Flash — hiệu năng agent dẫn đầu nhóm với chi phí không tưởng; tận dụng khung giờ thấp điểm để tiết kiệm thêm 50%.
- Muốn tự host, kiểm soát dữ liệu, tùy biến sâu: Chọn GLM-5.2 (MIT) hoặc DeepSeek — trọng số mở giúp tránh hoàn toàn rủi ro dữ liệu xuyên biên giới, chỉ cần đầu tư hạ tầng GPU tương ứng.
- Tuân thủ dữ liệu: Nếu doanh nghiệp xử lý dữ liệu nhạy cảm, hãy tự host trọng số mở thay vì gọi API cloud Trung Quốc, và tham khảo tư vấn pháp lý về Luật An ninh Quốc gia TQ (Điều 7).
- Theo dõi giá: Cuộc chiến giá đang diễn ra rất nhanh — OpenAI vừa giảm 80% giá Luna, DeepSeek vừa công bố giá sàn $0,28. Kiểm tra bảng giá chính thức trước khi ký hợp đồng dài hạn.