Trọng Số Mở Của Kimi K3 Cuối Cùng Cũng Ra Mắt — Nhưng Tự Host Mô Hình AI Lớn Nhất Từ Trước Đến Nay Tốn 3-4 Triệu Đô La Phần Cứng
Ngày 27/7/2026, Moonshot AI công bố toàn bộ trọng số mở (open weights) của Kimi K3 trên Hugging Face — 2,8 nghìn tỷ tham số, mô hình mã nguồn mở lớn nhất từng được phát hành, theo giấy phép Modified MIT. Chín ngày trước đó, blog này đã đưa tin K3 dẫn đầu các bài test ưu tiên coding trước Claude Fable 5 và GPT-5.6 Sol, nhưng có một điểm mắc: không ai tải được mô hình cho đến hôm nay. Ngày đó đã đến, và đợt phát hành này cho thấy cả việc các mô hình mã nguồn mở đã thu hẹp khoảng cách với các phòng lab đóng đến mức nào trên năng lực coding, lẫn lý do vì sao 'mở' không còn đồng nghĩa với 'dễ chạy' — để tự host K3, bạn cần khoảng 1,4 terabyte trọng số và một dàn GPU có giá 3-4 triệu đô la để mua.
Một Mô Hình 2,8 Nghìn Tỷ Tham Số, Chỉ Kích Hoạt 1,8%
Kimi K3 sử dụng kiến trúc Stable LatentMoE với 896 chuyên gia (expert), mỗi token chỉ đi qua đúng 16 trong số đó — khoảng 50 tỷ tham số hoạt động mỗi bước, tức chỉ khoảng 1,8% tổng trọng số mô hình. Hai cải tiến về attention, Kimi Delta Attention (KDA) và Attention Residuals (AttnRes), được thiết kế để giữ ổn định cho các chuỗi dài và các tầng sâu, hỗ trợ cửa sổ ngữ cảnh 1.048.576 token (khoảng 1 triệu). Moonshot huấn luyện mô hình bằng quantization-aware training ngay từ giai đoạn fine-tune có giám sát, dùng trọng số MXFP4 gốc kèm activation MXFP8 — đây là lý do toàn bộ mô hình chỉ chiếm khoảng 1,4TB thay vì nhiều petabyte nếu phát hành ở FP16 thông thường với quy mô này. Trọng số được công bố tại huggingface.co/moonshotai/Kimi-K3 — gần gấp ba lần kích thước 1 nghìn tỷ tham số của K2, và là đợt phát hành mã nguồn mở lớn nhất từ trước đến nay.
So Với Claude Và GPT, Kimi K3 Đứng Ở Đâu
Trên Terminal-Bench 2.1, Moonshot công bố K3 đạt 88,3 điểm, chỉ kém GPT-5.6 Sol (88,8) và vượt qua cả Claude Fable 5 lẫn Opus 4.8 (84,6). SWE-bench Verified đạt 76,8%, và K3 đứng #1 trên bộ benchmark riêng của Moonshot gồm Program Bench (77,8) và SWE Marathon (42,0). Trên Artificial Analysis Intelligence Index độc lập, K3 đạt 57,11 điểm — xếp #4 toàn cầu, sau Fable 5 (59,86) và GPT-5.6 Sol max (58,89), nhưng vượt Opus 4.8 (55,69). Trên Frontend Code Arena do cộng đồng vận hành, K3 chiếm vị trí số 1 tuyệt đối với 1.679 Elo, vượt qua Fable 5 (1.631) và GPT-5.6 Sol (1.618). Những con số này không biến K3 thành mô hình mạnh nhất hiện có — nó vẫn kém hơn về trí tuệ tổng quát — nhưng giờ đây nó là mô hình mã nguồn mở mạnh nhất với khoảng cách lớn, và cạnh tranh ngang ngửa với các mô hình đóng đỉnh cao trên chính các tác vụ coding mà phần lớn nhà phát triển quan tâm nhất.
Điểm Mắc: Mở Không Đồng Nghĩa Với Rẻ
Công bố trọng số không đồng nghĩa với việc mô hình dễ chạy. Để tự host K3, bạn cần một dàn khoảng 72 GPU NVIDIA GB200 NVL72, có giá 3-4 triệu đô la để mua và lắp đặt, tiêu thụ liên tục khoảng 120kW, và ngốn hơn một triệu kWh điện mỗi năm — chưa tính chi phí mạng, lưu trữ, làm mát hay nhân sự; nếu thuê năng lực tương đương trên thị trường mở, chi phí lên tới gần 7 triệu đô la mỗi năm. Về mặt kinh tế, đây gần như ngược lại với những gì bạn nghĩ: vì chỉ khoảng 50 tỷ trong tổng số 2,8 nghìn tỷ tham số hoạt động ở mỗi token, K3 tương đối rẻ để chạy một khi đã được nạp vào bộ nhớ, nhưng lại đắt để host vì toàn bộ 2,8 nghìn tỷ tham số vẫn phải nằm sẵn trong bộ nhớ tốc độ cao cùng lúc. Đó chính là toàn bộ điểm mắc của đợt phát hành này: giấy phép thì mở, nhưng hóa đơn phần cứng thì không.
Vì Sao Doanh Nghiệp Vẫn Sẽ Tự Host
Với phần lớn nhà phát triển cá nhân và đội nhóm nhỏ, cách thực tế nhất để dùng K3 vẫn là API do Moonshot host — giá 0,30 đô la mỗi triệu token input cache-hit, 3 đô la mỗi triệu token input cache-miss, và 15 đô la mỗi triệu token output, với tỷ lệ cache-hit trên 90% mà Moonshot báo cáo cho các tải coding thông thường. Nhưng trọng số mở lại quan trọng nhất với một nhóm đối tượng khác: các doanh nghiệp và đội nhóm liên quan đến khu vực công e ngại việc định tuyến mã nguồn độc quyền qua một API có trụ sở tại Trung Quốc, giờ đây có thể tự host K3 trên hạ tầng riêng để giữ dữ liệu nằm trong lãnh thổ và có thể kiểm toán — cùng logic về chủ quyền dữ liệu vốn đã định hình cách các ngành bị quản lý chặt tiếp cận các đợt phát hành của DeepSeek. Giấy phép Modified MIT cho phép sử dụng thương mại và fine-tune, nhưng Moonshot chưa công bố văn bản giấy phép cuối cùng của K3 tại thời điểm phát hành ngày 27/7; mọi phiên bản trước trong dòng K2 đều có điều khoản về số người dùng hoạt động hàng tháng (MAU) đối với các triển khai thương mại quy mô lớn, nên các đội kỹ thuật nên đọc kỹ file giấy phép thực tế của K3 thay vì mặc định các điều khoản của K2 vẫn được giữ nguyên.
Ý Nghĩa Với Các Nhà Phát Triển Và Đội AI
Với phần lớn các đội, hôm nay không có gì thay đổi về mặt vận hành — bạn đã có thể tiếp cận K3 qua API của Moonshot hoặc Kimi Code, hoặc một mô hình trước đó trong dòng K2 qua model picker của GitHub Copilot, mà không cần đụng đến GPU nào. Điều thay đổi là đòn bẩy đàm phán: một mô hình coding gần đỉnh cao giờ đây đã chính thức có thể fine-tune, kiểm toán và chạy hoàn toàn ngoài máy chủ của bất kỳ nhà cung cấp nào, cho các đội mua sắm và bảo mật một lựa chọn thay thế đáng tin cậy để đưa ra khi đàm phán với các nhà cung cấp mô hình đóng, dù phần lớn trong số họ sẽ không thực sự dựng hạ tầng để tự chạy trực tiếp. Các nhà cung cấp cloud và các sáng kiến AI chủ quyền quốc gia đã sẵn có dàn GPU lớn mới là những bên nhiều khả năng nhất sẽ tự host mô hình này; còn lại, mọi người có được giá trị của lựa chọn mà không phải bỏ ra chi phí đầu tư.
Kết Luận
Đợt phát hành Kimi K3 xác nhận rằng các mô hình mã nguồn mở đã thu hẹp phần lớn khoảng cách năng lực coding với các phòng lab đóng đỉnh cao — trên một số benchmark quan trọng với nhà phát triển, K3 giờ đây vượt hẳn Claude Fable 5 và GPT-5.6 Sol. Điều nó cũng xác nhận là rào cản thực sự để tự chạy một mô hình đỉnh cao từ lâu đã không còn là giấy phép nữa; giờ đây đó là hóa đơn phần cứng 3-4 triệu đô la. Điều này định hình lại cuộc cạnh tranh giữa các phòng lab đỉnh cao: không còn chỉ là cuộc đua công bố bộ trọng số tốt nhất, mà là cuộc đua khiến việc chạy những trọng số đó trở nên khả thi về chi phí — và trên thước đo đó, chính các API được host sẵn, chứ không phải giấy phép mở, vẫn đang quyết định ai thực sự được dùng AI đỉnh cao.