AI/4 tháng 9, 2026/9 phút đọc

GPT-6 Astra So Với Claude Fable 5.1: Benchmark, Giá Cả, Và Nên Dùng Mô Hình Nào

OpenAI's GPT-6 Astra và Anthropic's Claude Fable 5.1 ra mắt cách nhau chỉ hai ngày trong tháng 9 năm 2026. So sánh benchmark, giá cả, cách mỗi hãng xử lý an toàn, và mô hình nào phù hợp với công việc nào.

Bella Ng
Bella NgĐồng sáng lập, Growthtrait
GPT-6 Astra So Với Claude Fable 5.1: Benchmark, Giá Cả, Và Nên Dùng Mô Hình Nào

Anthropic ra mắt Claude Fable 5.1 vào ngày 1 tháng 9 năm 2026. Hai ngày sau, OpenAI đáp trả bằng GPT-6 Astra. Trong một khoảng thời gian ngắn, hai mô hình đa dụng mạnh nhất mà hai công ty từng phát hành đối đầu nhau chỉ trong vòng 48 giờ, và cả ngành đã dành những ngày sau đó để tranh cãi xem mô hình nào thực sự dẫn đầu.

Câu trả lời trung thực là không mô hình nào thắng tuyệt đối ở mọi mặt. Trên Intelligence Index của Artificial Analysis, một điểm số tổng hợp mà trang này chạy độc lập trên cả hai mô hình, Fable 5.1 đạt 66 điểm so với 61 điểm của Astra, và Fable 5.1 cũng là mô hình rẻ hơn một chút khi tính theo giá thực tế pha trộn. Nhưng trên nhiều benchmark riêng lẻ mà OpenAI công bố trong bài so sánh của chính họ, Astra dẫn trước, có lúc với khoảng cách khá xa.

Bài viết này so sánh mỗi mô hình thực sự là gì, hiệu suất trên những con số đáng tin so với những con số nên nhíu mày, giá cả và cửa sổ ngữ cảnh, cách mỗi công ty xử lý rủi ro an toàn của một mô hình mạnh hơn và agentic hơn, và mô hình nào phù hợp với loại công việc nào.

GPT-6 Astra và Claude Fable 5.1 là gì?

GPT-6 Astra là mô hình ngôn ngữ lớn mới nhất của OpenAI, ra mắt ngày 3 tháng 9 năm 2026 như một mô hình computer use, được xây để thao tác trình duyệt, bảng tính và ứng dụng theo cách con người làm, với cửa sổ ngữ cảnh khoảng 1,05 triệu token. Chúng tôi đã trình bày đầy đủ năng lực, các tuyên bố benchmark và câu hỏi về an toàn của nó trong bài viết trước.

Claude Fable 5.1 là mô hình frontier mới nhất của Anthropic, ra mắt ngày 1 tháng 9 năm 2026, được xây cho các tác vụ suy luận đòi hỏi cao và công việc agentic dài hơi, tập trung vào lập trình, nghiên cứu nhiều bước, làm việc với tài liệu và bảng tính, cùng computer use. Nó có chế độ suy nghĩ thích ứng luôn bật, nhận đầu vào văn bản và hình ảnh, trả về văn bản, hỗ trợ cửa sổ ngữ cảnh 1 triệu token với tối đa 128.000 token đầu ra.

Anthropic ra mắt mô hình này cùng lúc với Claude Mythos 5.1, mà theo Anthropic là cùng một mô hình nền nhưng với mức độ an toàn khác nhau. Fable 5.1 được cung cấp rộng rãi cho tất cả mọi người. Mythos 5.1 chỉ khả dụng qua các chương trình truy cập tin cậy của Anthropic, với các biện pháp bảo vệ được xây riêng để hỗ trợ công việc trong lĩnh vực an ninh mạng và khoa học sự sống, và Anthropic đang bổ sung một Chương trình Xác minh Khoa học Sự sống cho nghiên cứu sinh học. Fable 5.1 và Mythos 5.1 cũng là các mô hình Claude đầu tiên mang watermark văn bản của Anthropic.

Hai mô hình này thực sự so sánh với nhau ra sao trên benchmark?

Bắt đầu từ con số gần với tính độc lập nhất: Artificial Analysis, một bên thứ ba chạy một bộ đánh giá chuẩn hóa trên các mô hình thay vì chỉ dựa vào những gì mỗi hãng tự báo cáo, đặt Fable 5.1 dẫn trước trên Intelligence Index của họ, 66 so với 61 của Astra. Chỉ số đó gộp chín bài đánh giá trải rộng từ lập trình, khoa học đến kiến thức tổng quát, nên đây là một con số hợp lý nếu bạn muốn một con số duy nhất.

Bài so sánh do chính OpenAI công bố khi ra mắt lại kể một câu chuyện phức tạp hơn ở cấp benchmark riêng lẻ. Những con số này đến từ tài liệu của OpenAI, không phải từ Anthropic hay một phòng thí nghiệm độc lập, và các trang đưa tin về chúng đã lưu ý rằng so sánh giữa các agent harness khác nhau không hoàn toàn ngang hàng nhau, nên hãy coi đây là cách nhìn của một bên chứ chưa phải sự thật đã được kiểm chứng:

  • FrontierMath Tier 4 (v2), một benchmark toán học khó: Astra 97,6% so với Fable 5.1 87,8%.
  • GPQA Diamond, câu hỏi khoa học trình độ sau đại học: Astra 96,0% so với Fable 5.1 93,7%.
  • AutomationBench, mô phỏng các tác vụ văn phòng nhiều bước: Astra 41,4% so với Fable 5.1 31,4%.
  • Terminal-Bench Science, quy trình khoa học phức tạp trong môi trường terminal: Astra 64,6% so với Fable 5.1 52,6%.
  • DeepSWE v1.1, benchmark lập trình agentic: Astra 74,1% so với Fable 5.1 67,4%.

Trên các benchmark mà chính Anthropic chọn công bố, so sánh Fable 5.1 với Opus 5 và GPT-5.6 Sol của OpenAI trước đó thay vì so trực tiếp với Astra, Anthropic báo cáo Fable 5.1 đạt 65,0% trên Humanity's Last Exam có dùng công cụ, cao hơn các mô hình Claude trước đó, và dẫn trước Opus 5 trên mọi benchmark mà họ công bố. OpenAI chưa đưa ra một con số Astra tương ứng trực tiếp cho cùng bài kiểm tra đó trong tài liệu của chính họ, dù các bên theo dõi thứ ba xếp Astra ở phía sau Fable 5.1 tại đây. Vì Fable 5.1 ra mắt trước Astra hai ngày, bài so sánh của Anthropic tự nhiên chưa thể bao gồm Astra, và Anthropic cũng chưa công bố phản hồi so sánh trực tiếp.

Mô hình chung xuất hiện nhất quán qua các nguồn: Astra có xu hướng dẫn trước ở các benchmark nặng về toán, khoa học và agentic dựa trên terminal theo báo cáo của chính OpenAI, trong khi Fable 5.1 thắng ở chỉ số tổng hợp độc lập và benchmark suy luận kiểu bài thi mà Anthropic nhấn mạnh. Không nên đọc số liệu tự báo cáo của bên nào là trung lập, và chưa có phòng thí nghiệm độc lập nào chạy đầy đủ một cuộc so sánh trực tiếp giữa hai mô hình trên mọi benchmark.

Giá cả và cửa sổ ngữ cảnh

Trên giấy tờ, giá API tiêu chuẩn khá gần nhau: cả hai mô hình đều niêm yết khoảng 10 đô la trên một triệu token đầu vào và 50 đô la trên một triệu token đầu ra. Khác biệt thực sự nằm ở token cache, nơi chiếm phần lớn chi phí trong các phiên làm việc agentic dài. Token cache đọc của Fable 5.1 chỉ khoảng 0,25 đô la trên một triệu token so với khoảng 1,00 đô la trên một triệu của Astra, và Anthropic nói mức giảm đó khiến khối lượng công việc Fable 5.1 điển hình rẻ hơn khoảng 25% so với Fable 5, và rẻ hơn tới 45% cho công việc agentic nặng. Phản ánh điều đó, Artificial Analysis đưa ra giá thực tế pha trộn là 7,17 đô la trên một triệu token cho Fable 5.1 so với 7,70 đô la cho Astra ở cùng tỷ lệ sử dụng.

Cửa sổ ngữ cảnh gần như ngang nhau: Astra hỗ trợ khoảng 1,05 triệu token so với 1 triệu của Fable 5.1, và cả hai đều giới hạn đầu ra khoảng 128.000 token.

OpenAI và Anthropic xử lý rủi ro an toàn ra sao?

Cả hai công ty đều ra mắt mô hình mạnh nhất của mình kèm theo một phiên bản bị hạn chế hơn, điều này nói lên điều gì đó về vị trí hiện tại của cả ngành. Như chúng tôi đã trình bày chi tiết, Astra là mô hình đầu tiên của OpenAI vượt ngưỡng Critical trong Preparedness Framework về an ninh mạng, nên các năng lực an ninh mạng nâng cao của nó chỉ giới hạn cho người kiểm thử đã qua sàng lọc thay vì phát hành cho tất cả mọi người.

Cách chia của Anthropic vận hành khác nhưng có nét tương đồng. Fable 5.1 là mô hình được cung cấp rộng rãi. Mythos 5.1, cùng một mô hình nhưng ít hạn chế hơn, bị giới hạn sau các chương trình truy cập tin cậy của Anthropic dành riêng cho công việc an ninh mạng và khoa học sự sống. Riêng biệt, Anthropic cho biết người dùng Claude Code sẽ thấy khoảng 60% ít cảnh báo an ninh mạng sai hơn với Fable 5.1, một tuyên bố về việc mô hình phân tích bảo mật chính xác hơn chứ không phải về năng lực tấn công.

Đó là hai trục khác nhau đáng để tách bạch. OpenAI đang quản lý rủi ro một mô hình trở nên nguy hiểm đủ năng lực trong tấn công an ninh mạng. Anthropic đang nhấn mạnh mô hình của họ trở nên chính xác hơn trong rà soát code phòng thủ. Đọc cùng nhau, cả hai nói lên cùng một điều: cả hai phòng thí nghiệm giờ đều coi năng lực an ninh mạng của mô hình frontier là điều nghiêm trọng đủ để giới hạn, chứ không chỉ là một con số để công bố.

Vậy nên dùng mô hình nào?

Nếu công việc của bạn thiên về lập trình agentic nặng, tác vụ dựa trên terminal, hoặc suy luận toán và khoa học, các con số của chính OpenAI đặt Astra dẫn trước, có lúc với khoảng cách khá xa, dù đó là số liệu của chính công ty này. Nếu bạn muốn thứ gần nhất với một điểm tổng hợp được đo độc lập cộng với chi phí pha trộn thấp hơn cho các phiên agentic dài, Fable 5.1 hiện đang nhỉnh hơn.

Với phần lớn công việc nội dung và marketing, khoảng cách quan trọng hơn con số benchmark nổi bật là việc một mô hình tuân thủ cấu trúc tốt ra sao, bám sát tài liệu nguồn thế nào, và xử lý tác vụ nhiều bước mà không bị trôi ý, điều này gần với những gì AutomationBench và các đánh giá computer use thực sự kiểm tra hơn là những gì một benchmark kiểu thi toán quốc tế như FrontierMath cho bạn biết. Cả hai mô hình đều đủ mạnh ở khía cạnh này để yếu tố quyết định thường là chi phí, công cụ sẵn có, và hệ sinh thái mà đội của bạn đã dùng, hơn là khoảng cách hai hay ba điểm trên bất kỳ biểu đồ nào.

Kết lại

Hai mô hình frontier vượt mặt nhau chỉ trong 48 giờ, mỗi bên đều công bố những con số khiến mình trông như đang dẫn đầu, là dấu hiệu rõ ràng nhất cho thấy chu kỳ ra mắt AI đã bị nén lại đến mức nào. Bất kể ai dẫn đầu tuần này nhiều khả năng sẽ bị đáp trả trong vòng một tháng, bởi một trong hai phòng thí nghiệm này hoặc một bên khác. Câu hỏi bền vững hơn không phải mô hình nào thắng bảng xếp hạng hôm nay, mà là mô hình nào phù hợp với khối lượng công việc, ngân sách và mức chấp nhận rủi ro thực tế của bạn, và câu trả lời đó đáng để xem lại mỗi khi một trong hai công ty ra mắt sản phẩm mới.

Nếu bạn cần hỗ trợ xác định mô hình nào, hoặc kết hợp mô hình nào, thực sự phù hợp với quy trình nội dung và marketing của mình, dịch vụ đào tạo AI của chúng tôi được xây để cắt qua đúng loại nhiễu thông tin này. Liên hệ với chúng tôi và chúng tôi sẽ giúp bạn xác định thứ gì đáng để áp dụng ngay bây giờ.

Câu hỏi thường gặp

Khác biệt giữa GPT-6 Astra và Claude Fable 5.1 là gì?

GPT-6 Astra là mô hình mới nhất của OpenAI, ra mắt ngày 3 tháng 9 năm 2026, được xây chủ yếu như một mô hình computer use để thao tác phần mềm. Claude Fable 5.1 là mô hình frontier mới nhất của Anthropic, ra mắt sớm hơn hai ngày vào 1 tháng 9 năm 2026, tập trung vào lập trình, nghiên cứu và công việc agentic. Cả hai đều hỗ trợ cửa sổ ngữ cảnh khoảng 1 triệu token và ra mắt cách nhau chỉ vài ngày.

Mô hình nào đạt điểm benchmark cao hơn, GPT-6 Astra hay Claude Fable 5.1?

Tùy vào benchmark. Fable 5.1 dẫn trước trên Intelligence Index độc lập của Artificial Analysis, 66 so với 61, và trên Humanity's Last Exam theo tài liệu của chính Anthropic. Astra dẫn trước trên nhiều benchmark riêng lẻ mà OpenAI công bố trong bài so sánh của họ, bao gồm FrontierMath, GPQA Diamond và AutomationBench, dù những con số đó do OpenAI tự báo cáo chứ chưa được kiểm chứng độc lập.

Mô hình nào rẻ hơn, GPT-6 Astra hay Claude Fable 5.1?

Giá API tiêu chuẩn của cả hai khá gần nhau, khoảng 10 đô la trên một triệu token đầu vào và 50 đô la trên một triệu token đầu ra. Fable 5.1 có token cache rẻ hơn, khiến chi phí thực tế pha trộn của nó khoảng 7,17 đô la trên một triệu token so với 7,70 đô la của Astra, theo Artificial Analysis.

Claude Mythos 5.1 là gì?

Claude Mythos 5.1 là cùng một mô hình nền với Claude Fable 5.1, theo Anthropic, nhưng với mức độ an toàn khác nhau. Nó chỉ khả dụng qua các chương trình truy cập tin cậy của Anthropic, được xây để hỗ trợ công việc nhạy cảm trong an ninh mạng và khoa học sự sống thay vì sử dụng công khai rộng rãi.

GPT-6 Astra hay Claude Fable 5.1 an toàn hơn?

Cả hai công ty đều giới hạn mô hình mạnh nhất của mình sau một phiên bản hạn chế hơn. Astra là mô hình đầu tiên của OpenAI vượt ngưỡng Critical về an ninh mạng trong Preparedness Framework, giới hạn các tính năng an ninh mạng nâng cao cho người kiểm thử đã qua sàng lọc. Anthropic giới hạn Mythos 5.1, phiên bản ít an toàn hơn, cho các chương trình truy cập tin cậy trong khi cung cấp Fable 5.1 rộng rãi, và riêng biệt báo cáo Fable 5.1 tạo ra ít cảnh báo bảo mật sai hơn trong rà soát code.

Cần hỗ trợ triển khai?

Growthtrait có thể giúp bạn áp dụng điều này vào thực tế. Cùng trao đổi về mục tiêu của bạn.

Liên hệ ngay