Claude Opus 4.7 ra mắt: Khả năng viết mã vượt trội gấp 3 lần

Anthropic đã phát hành Claude Opus 4.7 vào ngày 16 tháng 4, phiên bản này mang đến những cải tiến về khả năng lập trình vượt xa dự đoán của nhiều người — hiệu suất sửa lỗi mã nguồn sản xuất cao gấp 3 lần thế hệ trước, và điểm SWE-bench Pro tăng từ 53,4% lên 64,3%.

Ba điểm chuẩn đáng chú ý nhất

Trước tiên, hãy xem các số liệu cốt lõi:

Bài kiểm tra chuẩn Opus 4.6 Opus 4.7 Thay đổi
SWE-bench Pro 53,4% 64,3% +10,9%
CursorBench 58% 70% +12%
Rakuten-SWE-Bench (tác vụ sản xuất) Đường cơ sở Gấp 3 lần Cải thiện đáng kể

SWE-bench Pro hiện được công nhận là một chuẩn mực lập trình khó đạt được. Mức 64,3% đã vượt qua GPT-5.4 phát hành vào tháng 3 và Gemini 3.1 Pro của Google phát hành vào tháng 2. Trong 93 bài kiểm tra tác vụ lập trình nội bộ của Anthropic, Opus 4.7 đã cải thiện 13% so với Opus 4.6 và giải quyết thêm 4 bài toán mà Opus 4.6 hoàn toàn không thể xử lý.

Con số từ Rakuten là thú vị nhất — "hiệu suất sửa lỗi mã nguồn sản xuất cao gấp 3 lần" đề cập đến việc sửa lỗi trong các kho mã doanh nghiệp thực tế, không phải tập dữ liệu tổng hợp. Các con số được chạy trên mã nguồn thực tế có giá trị tham khảo cao hơn so với các bài toán tổng hợp trong phòng thí nghiệm.

Anthropic cũng đã thực hiện đánh giá tác nhân tài chính (Finance Agent Evaluation) và chuẩn mực giá trị kinh tế tri thức (GDPval-AA), cả hai đều đạt kết quả tốt nhất hiện tại.

Khả năng thị giác tăng hơn gấp ba lần, nhưng ít người nhắc đến

Ngoài lập trình, Opus 4.7 đã có những nâng cấp đáng kể về xử lý hình ảnh:

  • Hỗ trợ cạnh dài tối đa 2576 pixel (khoảng 3,75 megapixel)
  • Cao gấp 3 lần giới hạn độ phân giải hình ảnh trước đây của dòng Claude
  • Nhận diện chính xác hơn đáng kể các sơ đồ cấu trúc phân tử hóa học và bản vẽ kỹ thuật phức tạp

Điều này sẽ có tác động lớn đến các tình huống nghiên cứu khoa học, phân tích tài liệu kỹ thuật hoặc đọc bản vẽ kỹ thuật. Đối với việc viết mã, tác động có thể không trực tiếp, nhưng những người làm việc trong lĩnh vực đa phương thức nên thử nghiệm.

Còn một thay đổi dễ bị bỏ qua: tokenizer đã được cập nhật, cùng một văn bản đầu vào hiện tạo ra số lượng token gấp 1,0 đến 1,35 lần. Nghe có vẻ là điều xấu (nhiều token hơn đồng nghĩa với chi phí cao hơn), nhưng thực tế điều này cho thấy mô hình xử lý thông tin với độ chi tiết cao hơn, giúp hiểu các tài liệu dài và mã phức tạp tốt hơn.

Tại sao Anthropic cố tình vô hiệu hóa khả năng an ninh mạng

Đây là quyết định phản trực giác nhất trong bản phát hành 4.7: Opus 4.7 chủ động thêm các rào cản an toàn, tự động phát hiện và chặn các yêu cầu an ninh mạng có rủi ro cao.

Khoan đã — Anthropic vừa phát hành Claude Mythos Preview vào tuần trước, tập trung vào an ninh mạng, và đã hợp tác với Amazon, Apple, Microsoft để triển khai dự án đặc biệt Project Glasswing. Làm sao cả hai điều này có thể cùng tồn tại?

Câu trả lời là phân tầng sản phẩm:

  • Mythos là mô hình có kiểm soát được thiết kế dành riêng cho các chuyên gia bảo mật, chỉ có thể truy cập thông qua xác minh danh tính của Chương trình xác minh an ninh mạng (Cyber Verification Program)
  • Opus 4.7 là mô hình hàng đầu phổ thông dành cho công chúng, Anthropic không muốn nó trở thành công cụ tấn công mà bất kỳ ai cũng có thể gọi

Logic này hợp lý. Tập trung các khả năng rủi ro cao vào các kênh chuyên nghiệp có thể xác minh danh tính, thay vì mở chúng cho tất cả mọi người qua API — đây là một sự phân tầng an toàn thực tế.

Tổng quan tính năng mới

Một số tính năng phụ trợ đã được ra mắt cùng lúc:

  • Task budgets (bản công khai thử nghiệm): Cho phép Claude tự quản lý mức tiêu thụ token trong các tác vụ chạy dài, tránh hết ngân sách đột ngột ở giai đoạn cuối
  • Lệnh /ultrareview: Phiên đánh giá mã chuyên sâu, gắn cờ lỗi và vấn đề thiết kế, sâu hơn so với đánh giá thông thường
  • Mức nỗ lực xhigh: Trước đây chỉ có high, nay thêm xhigh, cung cấp khả năng điều chỉnh chi tiết hơn giữa độ sâu suy luận và tốc độ phản hồi
  • Mở rộng chế độ Auto: Người dùng Max Claude Code có thể sử dụng

Giá không đổi: API gọi $5/triệu token đầu vào, $25/triệu token đầu ra, hoàn toàn giống với Opus 4.6. Về hỗ trợ nền tảng: claude.ai, API, Amazon Bedrock, Google Cloud Vertex AI, Microsoft Foundry đều đã có sẵn, model ID là claude-opus-4-7.

Khoảng cách với đối thủ thực sự lớn đến đâu

Theo Anthropic, Opus 4.7 vượt trội so với GPT-5.4 (phát hành tháng 3) và Gemini 3.1 Pro (phát hành tháng 2) trong các lĩnh vực lập trình tác nhân, gọi công cụ quy mô lớn, sử dụng máy tính tác nhân và phân tích tài chính.

Tất nhiên, điểm chuẩn chỉ là điểm chuẩn. Khoảng cách trong trải nghiệm thực tế sẽ chỉ rõ ràng hơn khi cộng đồng bắt đầu sử dụng. Nhưng riêng con số "gấp 3 lần" từ Rakuten-SWE-Bench đã đủ thuyết phục trong bối cảnh sửa lỗi mã nguồn sản xuất.

Từ Opus 4.6 lên 4.7 không phải là một bước cải tiến nhỏ — ít nhất là trong các tác vụ lập trình, mức cải thiện lần này đáng để xem xét nghiêm túc.

Nguồn tham khảo: CocoLoop, Introducing Claude Opus 4.7 (Anthropic Blog); Anthropic's Claude Opus 4.7 makes a big leap in coding, while deliberately scaling back cyber capabilities (The Decoder); Anthropic releases Claude Opus 4.7, narrowly retaking lead for most powerful generally available LLM (VentureBeat)