Anthropic vừa chính thức giới thiệu Claude Opus 5, đồng thời đưa ra tuyên bố khá táo bạo rằng mô hình này có thể đạt hiệu năng gần tương đương Claude Fable 5 nhưng với chi phí chỉ bằng một nửa. Đây là một thông điệp đáng chú ý bởi trước đó Fable 5 vẫn được xem là mô hình AI mạnh nhất mà Anthropic cung cấp cho người dùng phổ thông.
Tuy nhiên, nếu đọc kỹ tài liệu công bố, chính Anthropic cũng thừa nhận một điều thú vị: Opus 5 không phải là mô hình mạnh nhất của hãng về tổng thể, mà Fable 5 vẫn giữ lợi thế ở một số tác vụ yêu cầu khả năng suy luận rất sâu.
Điều đó đặt ra câu hỏi quan trọng: Opus 5 vs Fable 5, đâu mới là lựa chọn phù hợp cho lập trình, phân tích dữ liệu và các tác vụ AI chuyên nghiệp? Bài viết dưới đây sẽ tổng hợp benchmark chính thức, đồng thời phân tích ba bài kiểm tra thực tế để làm rõ sự khác biệt giữa hai mô hình.
|
Hạng mục |
Opus 5 |
Fable 5 |
|
Trạng thái |
Phát hành chính thức |
Mô hình cao cấp của Anthropic |
|
Khả năng lập trình Agent |
Rất mạnh |
Nhỉnh hơn ở một số benchmark |
|
Coding Benchmark |
Thắng phần lớn bài test |
Thắng sát nút một vài bài |
|
Suy luận đa lĩnh vực |
Rất tốt |
Nhỉnh hơn |
|
Phân tích dữ liệu |
Chính xác cao |
Phân tích sâu hơn |
|
Khả năng đọc ngữ cảnh |
Tốt |
Xuất sắc |
|
Chi phí sử dụng |
Thấp hơn |
Cao hơn khoảng gấp đôi |
Có thể thấy ngay từ bảng tổng quan, Anthropic không định vị Opus 5 là phiên bản thay thế hoàn toàn Fable 5 mà hướng đến việc mang lại hiệu năng gần tương đương với mức chi phí thấp hơn đáng kể.
Anthropic công bố nhiều bài đánh giá khác nhau để so sánh hai mô hình.
|
Benchmark |
Opus 5 |
Fable 5 |
|
Frontier Bench |
43.3% |
33.7% |
|
GDPval AA v2 |
1861 |
1747 |
|
BrowseComp |
90.8% |
87.4% |
|
Humanity's Last Exam (No Tools) |
56.3% |
56.5% |
|
Humanity's Last Exam (With Tools) |
64.7% |
63.9% |
|
OSWorld 2.0 |
70.6% |
66.1% |
|
DeepSWE v1.1 |
68.8% |
69.7% |
|
FrontierCode |
53.4% |
53.5% |
|
AutomationBench |
26.0% |
17.4% |
|
Legal Agent Benchmark |
11.7% |
13.3% |
|
HealthBench Professional |
59.8% |
66.0% |
|
BioMysteryBench |
49.4% |
46.5% |
Quan sát toàn bộ bảng benchmark có thể thấy Opus 5 giành lợi thế ở phần lớn các bài đánh giá liên quan đến coding, workflow tự động hóa và khả năng làm việc theo chuỗi tác vụ. Trong khi đó, Fable 5 vẫn thể hiện tốt hơn ở một số benchmark thiên về suy luận chuyên sâu như Legal Agent hay HealthBench.
Điều này cũng phù hợp với tuyên bố của Anthropic rằng Opus 5 không vượt qua Fable 5 ở mọi khía cạnh, mà tập trung tối ưu hiệu suất trên các tác vụ phổ biến hơn.
Benchmark chỉ phản ánh một phần năng lực của mô hình. Để đánh giá sát hơn với công việc thực tế, cả hai được đưa vào ba bài kiểm tra độc lập với cùng một bộ prompt và môi trường thực thi.
Bài test đầu tiên yêu cầu hai mô hình xác định nguyên nhân gây ra một lỗi thực tế trong thư viện mã nguồn mở Hypothesis mà không được phép sửa mã.
Đây là một lỗi khá khó vì ngay cả đội phát triển dự án cũng từng mất nhiều thời gian để tái hiện.
Kết quả khá thú vị khi cả Opus 5 và Fable 5 đều xác định đúng nguyên nhân gây lỗi, đồng thời đều đề xuất hướng xử lý tương tự bản vá chính thức của dự án. Tuy nhiên cách tiếp cận lại khác nhau.
Fable 5 tập trung giải thích vì sao lỗi chỉ xuất hiện ngẫu nhiên và khiến các lập trình viên khó tái hiện trong môi trường phát triển. Trong khi đó, Opus 5 chủ động tạo một bản vá tạm thời trong bộ nhớ rồi tự chạy lại toàn bộ bộ kiểm thử để xác minh giả thuyết, dù đề bài không yêu cầu chỉnh sửa mã nguồn.
Điều này cho thấy Opus 5 có xu hướng hành động nhiều hơn, còn Fable 5 lại ưu tiên lý giải bản chất của vấn đề.
Bài kiểm tra thứ hai mô phỏng một báo cáo tài chính của doanh nghiệp SaaS với 27 lỗi được cài sẵn ở nhiều mức độ khác nhau. Các lỗi trải dài từ những sai sót rất dễ phát hiện cho tới những bất thường chỉ có thể tìm ra khi đối chiếu dữ liệu giữa nhiều bảng tính.
Kết quả:
Điều đáng chú ý là Opus gần như không bỏ sót các sai lệch số liệu nhỏ. Trong khi đó, Fable lại đưa ra một góc nhìn tổng thể hơn. Sau khi tính toán lại toàn bộ doanh thu theo từng tháng, mô hình nhận ra rằng mọi sai lệch đều vô tình khiến báo cáo tài chính trở nên đẹp hơn so với thực tế.
Đây là kiểu kết luận không được yêu cầu trong đề bài nhưng lại phản ánh khả năng suy luận và tổng hợp thông tin rất tốt của Fable. Ngược lại, cả hai đều bỏ lỡ một trường hợp Simpson's Paradox, cho thấy AI hiện nay vẫn chưa thể thay thế hoàn toàn chuyên gia phân tích tài chính.
Bài kiểm tra cuối cùng yêu cầu hai mô hình phân tích hàng loạt tài liệu marketing của các hãng AI, sau đó xác định những tuyên bố mâu thuẫn và đưa ra khuyến nghị mô hình phù hợp cho lập trình viên.
Kết quả:
Một lần nữa, Opus thể hiện khả năng rà soát dữ kiện rất mạnh. Mô hình còn tự tính xác suất thống kê cho tuyên bố "thắng 8 trên 13 benchmark" của Anthropic và chỉ ra rằng khoảng cách này chưa đủ lớn để khẳng định ưu thế tuyệt đối.
Trong khi đó, Fable lại gây ấn tượng theo cách khác.
Thay vì tập trung vào các con số, mô hình nhận ra rằng gần như toàn bộ dữ liệu độc lập trong bài đều đến từ Artificial Analysis và kết luận rằng nếu nguồn dữ liệu này thay đổi thì toàn bộ đánh giá cũng cần được xem xét lại. Đây là một lập luận mang tính phản biện mà Opus không đưa ra.
Sau ba bài kiểm tra, có thể thấy sự khác biệt giữa hai mô hình không nằm ở việc mô hình nào "thông minh hơn", mà ở cách chúng xử lý thông tin. Opus 5 có xu hướng chú ý tới từng chi tiết nhỏ, ít bỏ sót dữ liệu và phù hợp với các công việc cần độ chính xác cao như kiểm tra mã nguồn, rà soát tài liệu hay đối chiếu số liệu.
Trong khi đó, Fable 5 nổi bật ở khả năng kết nối các dữ kiện rời rạc để đưa ra nhận định tổng thể. Những kết luận của mô hình thường có chiều sâu hơn, đặc biệt trong các tác vụ yêu cầu phân tích chiến lược hoặc đánh giá nhiều góc nhìn khác nhau.
Nói cách khác, Opus giống một kỹ sư kiểm định rất cẩn thận, còn Fable lại giống một chuyên gia tư vấn có khả năng nhìn ra bức tranh lớn.
Nếu công việc của bạn thiên về lập trình, rà soát dữ liệu, kiểm tra tài liệu hoặc các workflow tự động, Opus 5 là lựa chọn rất đáng cân nhắc. Mô hình này phát hiện nhiều lỗi hơn trong hầu hết các bài kiểm tra thực tế, đồng thời vẫn đạt điểm số rất cao trên phần lớn benchmark do Anthropic công bố.
Trong khi đó, Fable 5 phù hợp hơn với các nhiệm vụ cần khả năng suy luận sâu, tổng hợp thông tin hoặc đưa ra các nhận định mang tính chiến lược. Dù đôi lúc bỏ sót những chi tiết nhỏ, mô hình lại thường tạo ra các kết luận có chiều sâu và giàu tính phản biện hơn.
Thực tế, hai mô hình không hoàn toàn thay thế lẫn nhau. Opus 5 hướng tới hiệu quả và độ chính xác trong quá trình xử lý dữ liệu, còn Fable 5 vẫn giữ vai trò là mô hình có năng lực suy luận tổng thể mạnh nhất trong hệ sinh thái Anthropic ở thời điểm hiện tại.
Tin liên quan
Sản phẩm đã xem
Showroom: 172 Lê Thanh Nghị, Phường Bạch Mai, Hà Nội
Tel: 086 830 2123
Trung tâm bảo hành: 172 Lê Thanh Nghị, Phường Bạch Mai, Hà Nội
Tel: 086 830 2123
Trụ sở (Không bán hàng): 11 Vũ Thạnh, Phường Ô Chợ Dừa, Hà Nội
Tel: 086 830 2123