Quay lại danh sách

Kimi K3 Của Moonshot Vừa Vượt Claude Và GPT-5.6 Trong Bài Test Ưu Tiên Coding — Nhưng Bạn Chưa Thể Tải Trọng Số Cho Đến 27/7

Đăng ngày 18 thg 7, 20267 phút đọc
AI AgentsDeveloper ToolsGenAI

Một Model Mới Vừa Làm Lại Cuộc Tranh Luận Trung Quốc Với Mỹ Về AI

Ngày 16/7/2026, phòng lab AI Trung Quốc Moonshot AI ra mắt Kimi K3, và chỉ trong 24 giờ, Axios, Fortune, VentureBeat và Yahoo Finance đã đưa tin đây là lần ra mắt model open-weight-track quan trọng nhất kể từ khi DeepSeek xuất hiện. Tuyên bố nổi bật: một model được xây dựng bên ngoài các phòng lab frontier của Mỹ nhưng chỉ thua Claude và GPT-5.6 với khoảng cách một chữ số trên nhiều benchmark nghiêm túc, đồng thời phá vỡ giả định 'model mở không thể cạnh tranh' vốn tồn tại suốt phần lớn năm 2026. Việc tuyên bố này có đứng vững trước sự soi xét hay không ít quan trọng hơn thực tế rằng, lần thứ hai trong khoảng mười tám tháng, một phòng lab Trung Quốc đã buộc Anthropic, OpenAI và Google phải công khai trả lời câu hỏi về giá cả và năng lực.

Bên Trong Kimi K3: 2,8 Nghìn Tỷ Tham Số, Kiến Trúc Sparse, Và Một Chiếc Két Còn Khóa

Moonshot mô tả K3 là model sparse mixture-of-experts với khoảng 2,8 nghìn tỷ tham số tổng, trong đó chỉ một phần nhỏ được kích hoạt cho mỗi request — chính kỹ thuật kiến trúc giúp giữ chi phí inference ở mức chấp nhận được cho model quy mô này. Model đi kèm cửa sổ ngữ cảnh 1 triệu token, đầu vào hình ảnh gốc (native vision), và cái mà Moonshot gọi là reasoning luôn bật (always-on reasoning). Điểm mấu chốt: Moonshot hứa sẽ công bố trọng số thật vào ngày 27/7/2026, không phải ngay ngày ra mắt. Cho đến lúc đó, 'open-weight' vẫn chỉ là một lời hứa chứ chưa phải sự thật — model chỉ có thể truy cập qua API hosted của Moonshot, giống hệt một model frontier đóng của Anthropic hay OpenAI.

K3 Thực Sự Vượt Claude Và GPT-5.6 Ở Đâu — Và Không Vượt Được Ở Đâu

Trên GDPval-AA v2, benchmark đo các tác vụ thực tế trải rộng 44 ngành nghề và 9 ngành công nghiệp lớn, K3 đạt 1.687 điểm — đứng thứ ba toàn bảng, sau Claude Fable 5 Max (1.815) và GPT-5.6 Sol Max (1.747,8), nhưng trên Claude Opus 4.8 (1.600). Artificial Analysis chấm Intelligence Index của K3 là 57, xếp hạng 4 trong số 189 model được theo dõi. K3 dẫn đầu ở Automation Bench (30,8), SpreadsheetBench 2 (34,8) và BrowseComp (91,2), và đứng thứ hai ở AA-Briefcase và JobBench, sau Fable 5. Tuy nhiên, kết quả mà developer thực sự bàn tán nhiều nhất lại hẹp và cụ thể hơn: trong bài test mù do đơn vị đánh giá AI Arena thực hiện, các developer chọn kết quả của Kimi K3 nhiều hơn cả Claude Fable 5 lẫn GPT-5.6 Sol, riêng cho các tác vụ coding front-end.

Cuộc Tranh Cãi Về Giá: Hiệu Năng Frontier, Mức Giá Frontier

Moonshot định giá K3 ở mức 0,30 đô la/triệu token input cached, 3,00 đô la/triệu token input mới, và 15,00 đô la/triệu token output — ngang tầm với dòng Claude Sonnet của Anthropic. Điều này gây bất ngờ cho cộng đồng vốn kỳ vọng một model open-weight-track của Trung Quốc sẽ phá giá thị trường Mỹ theo cách DeepSeek từng làm. So với chính DeepSeek V4 Flash, mức giá 0,14 đô la input / 0,28 đô la output, giá output của K3 cao hơn khoảng 50 lần. Phản ứng của developer bị chia rẽ giữa sự nể phục kỹ thuật thực sự — bao gồm các báo cáo cho thấy K3 viết thành công code compiler GPU — và một phản ứng thẳng thắn hơn được tóm gọn trong một câu lặp lại nhiều lần trong cộng đồng: 'cho chúng tôi xem hóa đơn token đi.' Lập trường của Moonshot không hề xin lỗi: nếu K3 benchmark như một model frontier, nó sẽ định giá như một model frontier.

Phản Xạ 'Khoảnh Khắc DeepSeek' Của Phố Wall Lại Trỗi Dậy

Đến ngày 17/7, cả Fortune lẫn Yahoo Finance đều mô tả K3 đang gây ra những cơn chấn động kiểu DeepSeek trên thị trường vốn dựa vào giả định rằng các phòng lab Mỹ đang giữ lợi thế compute và năng lực bền vững. Axios đi thẳng vào khung diễn giải mạnh mẽ hơn, gắn việc ra mắt này với nỗi lo rằng khoảng cách dẫn đầu của Trung Quốc trong các công nghệ cận-frontier đang thu hẹp. Nên thận trọng với cách diễn giải 'thị trường hoảng loạn' này — một bảng benchmark đơn lẻ không quyết định được cuộc đua năng lực, và K3 vẫn còn kém hai model hàng đầu của Mỹ ở các điểm số tổng hợp quan trọng nhất. Nhưng bản thân phản ứng đó, có thật và tức thời, là một dữ kiện đáng chú ý: nhà đầu tư giờ đây đang định giá khả năng lặp lại kịch bản này, chứ không còn coi nó là sự kiện đơn lẻ.

Vì Sao Điều Này Quan Trọng Hơn Bảng Xếp Hạng Benchmark

Đối với các đội đang đánh giá nên định tuyến khối lượng công việc coding-agent qua model nào, chiến thắng của K3 trong ưu tiên coding front-end mới là con số thực sự làm thay đổi quyết định — bảng xếp hạng GDPval hữu ích, nhưng một bài test ưu tiên mù đúng vào loại tác vụ mà sản phẩm bạn đang triển khai thì thực tế hơn nhiều. Đồng thời, đừng nhầm 'open-weight-track' với 'dùng được ngay hôm nay': cho đến khi trọng số được công bố ngày 27/7, và cho đến khi điều khoản giấy phép được công khai, K3 vẫn chỉ dùng qua API và phụ thuộc hoàn toàn vào hạ tầng cùng uptime của Moonshot, không khác gì một model đóng trên thực tế. Khoảng cách giữa 'hứa mở' và 'thực sự mở' chính là kiểu rủi ro phụ thuộc nhà cung cấp mà blog này từng cảnh báo khi một lệnh quản lý buộc Anthropic đình chỉ hai model chỉ với 48 giờ báo trước hồi tháng 6, và lặp lại trong bài viết hôm qua về hai chiến lược quản lý bang trái ngược của Anthropic và OpenAI — một model bạn không thể tự host là một model mà mức độ sẵn có của nó nằm trong tay người khác.

Cần Làm Gì Trước Ngày 27/7

Ba bước cụ thể cho các đội kỹ thuật ngay bây giờ. Thứ nhất, nếu sản phẩm của bạn liên quan đến coding-agent hoặc sinh code, hãy thêm K3 vào bộ benchmark cấp API của bạn ngay trong tuần này bằng endpoint hosted của Moonshot — kết quả ưu tiên coding front-end đủ cụ thể để đáng kiểm chứng lại trên chính tác vụ của bạn thay vì tin tưởng bảng xếp hạng tổng hợp. Thứ hai, hãy mô hình hóa chi phí thực tế trên mỗi tác vụ được giải quyết, chứ không phải đô la thô trên mỗi triệu token; mức giá 0,30 đô la cho input cached nghĩa là các khối lượng công việc dùng prompt-caching nhiều có thể rẻ hơn đáng kể so với con số nổi bật 3 đô la/15 đô la. Thứ ba, hãy tạm hoãn mọi kế hoạch tự host hay fine-tune cho đến ngày 27/7, khi trọng số thật và điều khoản giấy phép của Moonshot được công khai — trước đó, 'open-weight' vẫn chỉ là lời của Moonshot, chưa phải một thứ có thể tải về.

Kết Luận

Kimi K3 chưa soán ngôi Claude Fable 5 hay GPT-5.6 Sol trên các benchmark tổng hợp quan trọng nhất, nhưng nó thu hẹp khoảng cách đủ nhiều — và thắng tuyệt đối ở ưu tiên coding front-end — để xứng đáng có mặt trong bất kỳ đợt đánh giá model nghiêm túc nào tuần này. Câu chuyện thực sự không nằm ở vị trí trên bảng xếp hạng; mà nằm ở việc một phòng lab ngoài nước Mỹ định giá một model cận-frontier ngang mức giá frontier của Mỹ và vẫn thu hút được sự chú ý của developer, trong khi mới chỉ hứa hẹn — chứ chưa thực sự giao — bộ trọng số mở có thể biến nó thành một lựa chọn thay thế thực sự cho việc bị khóa chặt vào một API. Hãy theo dõi ngày 27/7 — đó là ngày quyết định câu chuyện này sẽ trở thành một lựa chọn tự host thực sự, hay chỉ là một model đóng khác với marketing tốt hơn.