Anthropic đã cập nhật Claude vào ngày 1 tháng 9 với phiên bản Fable 5.1, cắt giảm chi phí token đầu vào được lưu trong cache từ 1,00 đô-la xuống còn 0,25 đô-la cho mỗi triệu token — mức giảm 75% diễn ra đúng thời điểm mà hầu hết các nhà phát triển AI sản xuất nhận ra rằng tích lũy ngữ cảnh, chứ không phải sức mạnh tính toán thô, mới là nơi ngân sách hạ tầng của họ thực sự tập trung. Trong một phiên tác nhân trực tiếp, một cuộc hội thoại duy nhất của Claude có thể chứa hàng trăm nghìn token trong cache khi ngữ cảnh được xây dựng qua các lượt tương tác. Với mức 0,25 đô-la mỗi triệu token, việc tích lũy đó trở thành một lựa chọn thiết kế có chủ đích thay vì một giới hạn chi phí mà nhà phát triển phải tìm cách vượt qua.
Kết quả benchmark đi kèm với thay đổi giá cho thấy những cải thiện về hiệu suất càng củng cố thêm luận điểm kinh tế. Trên Terminal-Bench-Science 0.1, đo lường khả năng suy luận khoa học đa bước đòi hỏi thiết kế thí nghiệm và phân tích lặp, Fable 5.1 đạt 52,6% so với 24,7% của Fable 5 — tức là hơn gấp đôi kết quả trước đó. AutomationBench cải thiện từ 17,1% lên 31,4%, và Terminal-Bench 4.0, một bài đánh giá năng lực tác nhân rộng hơn, tăng từ 42,0% lên 55,8%. CursorBench 3.2.0 đạt 73,4%. Xu hướng trên cả bốn bài đánh giá là nhất quán: Fable 5.1 không chỉ tốt hơn một chút ở biên, mà còn đáng tin cậy hơn đáng kể ở những hạng mục tác vụ định hình giá trị tác nhân.
Tác động tổng hợp viết lại bài toán chi phí khi xây dựng ứng dụng với Claude. Một ứng dụng tác nhân hoàn thành tác vụ trong ít lượt hơn — vì mô hình đáng tin cậy hơn — tiêu thụ ít chu kỳ token hơn trên đường đến kết quả thành công. Áp dụng mức giảm 75% cache cho các token mà nó sử dụng, và mức giảm chi phí hiệu quả trên mỗi tác vụ trong các quy trình tác nhân có tái sử dụng cao lên tới 45% hoặc hơn. Anthropic chưa công bố một con số tiêu đề duy nhất cho khoản tiết kiệm tổng hợp, nhưng các nhà phát triển tự mô hình hóa kinh tế token của họ sẽ đạt được những con số trong khoảng đó cho các khối lượng công việc nặng về ngữ cảnh.
Fable 5.1 có sẵn ngay lập tức thông qua API trực tiếp của Anthropic với mã định danh mô hình claude-fable-5-1, và thông qua Amazon Web Services Bedrock, Google Cloud Platform, và Microsoft Azure. Anthropic công bố Enterprise Frontier Safeguards như một khả năng đồng thời: kiểm soát lưu trữ dữ liệu do khách hàng chủ động, mã hóa với khóa do khách hàng quản lý, và triển khai trong cùng tenant hạ tầng đám mây hiện có của mỗi khách hàng, không tính thêm phí ngoài chi phí đám mây cơ bản.
Song song với bản phát hành chính thức, Anthropic giới thiệu Mythos 5.1, một biến thể của cùng mô hình nền tảng hoạt động với các biện pháp bảo vệ dễ dãi hơn theo mô tả của công ty dành cho các tổ chức đã được thẩm định. Quyền truy cập được giới hạn cho các viện nghiên cứu an ninh mạng đã được xác minh và các công ty khoa học sự sống. Công ty trích dẫn các ứng dụng đã được chứng minh bao gồm thiết kế liên kết protein và tối ưu hóa mô hình sinh học với thông lượng suy luận cao hơn tới 2,5 lần so với bản phát hành tiêu chuẩn. Việc truy cập Mythos 5.1 không phải tự phục vụ: Anthropic xem xét từng đơn đăng ký riêng lẻ và chưa công bố quy mô của nhóm người tham gia.
Các con số tác nhân của Fable 5.1, đặc biệt trên Terminal-Bench-Science, đưa kết quả công bố của Anthropic vượt lên trước các số liệu được OpenAI tiết lộ gần đây nhất trên các đánh giá tương đương. Việc so sánh benchmark giữa các công ty mang đến những lưu ý về phương pháp luận — các nhà cung cấp chọn các bài đánh giá có lợi cho mô hình của họ, và các bài kiểm tra cụ thể mà Anthropic nhấn mạnh có lẽ được chọn vì kết quả thuận lợi của chúng. Điều khó giải thích hơn là mô hình tăng gấp đôi nội bộ: Fable 5.1 không phải là cùng một mô hình với giá giảm kèm theo. Sự thay đổi hiệu suất đủ lớn đến mức câu chuyện về giá và câu chuyện về hiệu suất không thể tách rời nhau.
Đối với các nhà phát triển hiện chưa sử dụng Claude, động thái về giá cache là con số đáng để chuyển đổi vào bài toán kinh tế token của riêng họ. Bất kỳ nhà cung cấp AI nào không tiến đến mức 0,25 đô-la mỗi triệu token được cache sẽ ngay lập tức phải đối mặt với các câu hỏi so sánh chi phí trực tiếp trong các cuộc bán hàng doanh nghiệp. Giá cache của Anthropic đã thấp hơn một số đối thủ cạnh tranh trước khi giảm này; khoảng cách đã được nới rộng. Cải thiện hiệu suất khó khái quát hóa hơn trên các trường hợp sử dụng, nhưng trong phân khúc tác nhân và suy luận khoa học, Fable 5.1 đặt ra một mức chuẩn mà bản phát hành lớn tiếp theo từ bất kỳ nhà cung cấp nào sẽ được đo lường dựa trên đó.
(0)Comments