Quay lại danh sách

Claude Opus 5 Hứa Hẹn Giá Chỉ Bằng Một Nửa Fable 5 — Nhưng Thử Nghiệm Thực Tế Chỉ Tiết Kiệm Được 20%

Đăng ngày 26 thg 7, 20266 phút đọc
GenAIAI AgentsDeveloper Tools

Ngày 23/7/2026, Anthropic phát hành Claude Opus 5, định vị đây là mô hình mang lại trí tuệ gần ngang Claude Fable 5 nhưng với giá chỉ bằng đúng một nửa Fable 5 — 5 đô la cho mỗi triệu token input và 25 đô la cho mỗi triệu token output, ngang với mức giá của Opus 4.8 sắp bị thay thế. Mô hình đã có mặt trên Claude.ai, Claude API, Claude Code, AWS Bedrock và Google Vertex AI, và trở thành mặc định mới trên Claude Max ngay trong ngày ra mắt. Các benchmark độc lập củng cố tuyên bố về trí tuệ. Điều chúng không giải quyết được là tuyên bố về chi phí: chỉ trong vòng 24 giờ, một nhà phát triển được theo dõi rộng rãi đã thử nghiệm mô hình này trong môi trường thực tế và phát hiện mức tiết kiệm thực tế gần 20%, chứ không phải 50% — bởi Opus 5 có xu hướng dùng nhiều token hơn để hoàn thành cùng một tác vụ.

Một Mô Hình Đỉnh Cao Với Giá Niêm Yết Bằng Một Nửa

Opus 5 đi kèm cửa sổ ngữ cảnh 1 triệu token, output tối đa 128K token, và mốc kiến thức tháng 5/2026 — mới nhất trong toàn bộ dòng sản phẩm của Anthropic. Mức giá tiêu chuẩn giữ nguyên ở 5/25 đô la mỗi triệu token input/output, không đổi so với Opus 4.8; chế độ nhanh hơn, chạy nhanh gấp khoảng 2,5 lần, có giá gấp đôi ở mức 10/50 đô la. Để so sánh, Fable 5 — mô hình mạnh nhất và đắt nhất của Anthropic — có giá mỗi token cao hơn đáng kể, và đó chính là cơ sở cho cách Anthropic quảng bá Opus 5 là 'bằng một nửa giá'.

Nơi Opus 5 Thực Sự Thắng Trên Các Benchmark

Các benchmark độc lập cho kết quả nhất quán giữa các bên đã thử nghiệm: trên Frontier-Bench v0.1, một bài đánh giá coding dạng agentic, Opus 5 đạt 43,3% so với 33,7% của Fable 5 — hơn gấp đôi điểm số trước đó của Opus 4.8. Trên CursorBench 3.2, Opus 5 chỉ kém đỉnh điểm của Fable 5 đúng 0,5% trong khi chi phí mỗi tác vụ chỉ bằng một nửa. Trên ARC-AGI 3, một benchmark về suy luận, nó đạt điểm cao gấp khoảng ba lần mô hình đứng thứ hai, còn trên OSWorld 2.0, một benchmark về sử dụng máy tính, nó vượt qua kết quả tốt nhất của Fable 5 trong khi chỉ tốn hơn một phần ba chi phí. Trên Artificial Analysis Intelligence Index độc lập, Opus 5 dẫn đầu với 61 điểm, và dẫn đầu Agentic Index với 55,3 điểm — cả hai đều vượt qua Fable 5 và GPT-5.6 Sol.

Điểm Mắc: Thử Nghiệm Thực Tế Của Theo Chỉ Cho Thấy Tiết Kiệm 20%

Những con số đó là lý do Anthropic có thể tự tin gọi Opus 5 là một mô hình đỉnh cao với giá bằng một nửa. Nhưng nhà phát triển Theo, người sáng lập t3.gg và là một trong những tiếng nói được theo dõi sát sao nhất trong cộng đồng coding agent, đã dành trọn một ngày chạy các tác vụ production thực tế qua mô hình này và báo cáo một kết quả hẹp hơn nhiều: mức tiết kiệm thực tế gần 20%, chứ không phải 50% như giá niêm yết gợi ý. Lời giải thích của anh khá đơn giản — Opus 5 rẻ hơn trên mỗi token, nhưng có xu hướng dùng nhiều token hơn cho mỗi tác vụ so với Fable 5 để đạt cùng kết quả, dù là qua các chuỗi suy luận dài hơn, nhiều lượt gọi công cụ (tool call) hơn, hay các bước trung gian dài dòng hơn. Giá mỗi token giảm một nửa nhân với số token mỗi tác vụ tăng lên cho ra một mức giảm hóa đơn nhỏ hơn nhiều so với con số nổi bật trên trang giá.

Vì Sao Rẻ Hơn Trên Mỗi Token Không Đồng Nghĩa Rẻ Hơn Trên Mỗi Tác Vụ

Đây là một sự khác biệt mà các bảng giá theo token luôn che khuất: chỉ số quyết định hóa đơn thực tế của bạn là chi phí trên mỗi tác vụ hoàn thành, chứ không phải chi phí trên mỗi triệu token. Một mô hình rẻ hơn 50% trên mỗi token nhưng tiêu tốn nhiều hơn 60% token trung bình cho cùng một loại tác vụ vẫn có thể khiến bạn phải trả nhiều hơn theo cách nhỏ nhưng có thật, chứ không phải mức giảm giá mà trang giá gợi ý. Đây cũng chính là động lực từng khiến sức 'ngốn' token của GPT-5.6 Sol bị chỉ trích vì đẩy chi phí lên cao trên các tải agentic dù mức giá mỗi token vẫn cạnh tranh — token rẻ và tác vụ rẻ là hai tuyên bố khác nhau, và các nhà cung cấp luôn có động lực quảng bá cái đầu tiên trong khi các đội kỹ thuật cần lập ngân sách cho cái thứ hai.

Ý Nghĩa Với Các Nhà Phát Triển Và Đội AI

Với các đội đang cân nhắc nên định tuyến tải coding agentic vào mô hình nào, cách làm thực tế nhất chính là cách Theo đã dùng: đừng so sánh bảng giá, hãy chạy chính các tác vụ đại diện của mình qua cả hai mô hình rồi so sánh hóa đơn thực tế. Điểm benchmark cao hơn cùng giá mỗi token thấp hơn khiến Opus 5 trở thành một lựa chọn mặc định hợp lý để thử nghiệm, đặc biệt với các đội đang dùng Fable 5 mà cảm thấy chi tiêu token của mình tăng nhanh hơn sản lượng công việc — nhưng 'giá bằng một nửa' nên được xem là mức trần của khoản tiết kiệm có thể đạt được, chứ không phải một sự đảm bảo. Vì Opus 5 hiện đã có mặt trên Claude Code, Bedrock và Vertex AI cũng như API trực tiếp, phần lớn các đội có thể chạy phép so sánh đó mà không tốn chi phí di chuyển nào ngoài việc đổi một dòng cấu hình.

Kết Luận

Tuyên bố về giá của Anthropic cho Opus 5 là chính xác về mặt kỹ thuật và đã được kiểm chứng độc lập trên cơ sở mỗi token, mỗi benchmark — đây đúng là một mô hình đỉnh cao với giá bằng một nửa Fable 5. Điều mà làn sóng thử nghiệm thực tế đầu tiên bổ sung thêm là lời nhắc rằng giá mỗi token và chi phí mỗi tác vụ là hai con số khác nhau, và khoảng cách giữa chúng chính là nơi ngân sách hạ tầng AI thường đi sai hướng. Các đội đo lường chi phí tác vụ thực tế trước khi chuyển đổi sẽ nhận được mức giảm giá thật, dù khiêm tốn hơn; các đội chuyển đổi chỉ dựa vào con số nổi bật có thể thấy hóa đơn của mình giảm 20%, chứ không phải 50% — và dù thế nào, trên các tải agentic production, khoảng cách đó đáng để đo lường chứ không nên mặc định.