Theo theo dõi từ OneMillionBeating, công ty phân tích bán dẫn và trí tuệ nhân tạo SemiAnalysis đã phát hành bài đánh giá đồng bộ của các công cụ lập trình, bao gồm GPT-5.5, Opus 4.7 và DeepSeek V4. Kết luận chính: GPT-5.5 là mô hình lập trình tiên tiến lần đầu tiên của OpenAI sau nửa năm, kỹ sư của SemiAnalysis bắt đầu chuyển đổi giữa Codex và Claude Code, trước đó hầu hết chỉ sử dụng Claude. GPT-5.5 dựa trên việc huấn luyện trước mới mang mã hiệu "Spud", là lần mở rộng quy mô huấn luyện trước đầu tiên của OpenAI kể từ GPT-4.5.
Trong quá trình thử nghiệm, xuất hiện phân công công việc: Claude đảm nhiệm kế hoạch và xây dựng dự án mới cũng như việc sửa lỗi bug tập trung vào suy luận. Codex mạnh mẽ hơn trong việc hiểu cấu trúc dữ liệu và suy luận logic, nhưng không giỏi trong việc suy luận ý định mơ hồ của người dùng. Với cùng một nhiệm vụ trên bảng điều khiển, Claude tự động sao chép bố cục trang tham khảo nhưng dữ liệu được tạo ra một cách lớn lẻ, trong khi Codex bỏ qua bố cục nhưng dữ liệu chính xác hơn nhiều.
Bài viết tiết lộ một chi tiết hoạt động của bài kiểm tra cơ bản: OpenAI vào tháng 2 năm nay đã viết blog kêu gọi ngành công nghiệp chuyển sang SWE-bench Pro như một tiêu chuẩn mới cho các bài kiểm tra lập trình, nhưng công bố của GPT-5.5 đã chuyển sang một bài kiểm tra mới có tên "Expert-SWE". Lý do ẩn chứa trong dòng nhỏ ở cuối thông báo: GPT-5.5 bị Opus 4.7 vượt mặt trên SWE-bench Pro, với mức thấp hơn rất nhiều so với Mythos (77,8%) của Anthropic chưa công bố.
Đối với Opus 4.7, sau một tuần phát hành, Anthropic đã đưa ra bản phân tích sau vụ việc ("postmortem"), thừa nhận rằng Claude Code đã có ba lỗi trong giai đoạn từ tháng 3 đến tháng 4, kéo dài vài tuần, ảnh hưởng đến gần như tất cả người dùng, trước đó nhiều kỹ sư đã phản ánh về việc hiệu suất của phiên bản 4.6 giảm nhưng bị coi là cảm nhận chủ quan. Ngoài ra, tokenizer mới của bản 4.7 sẽ dẫn đến sự tăng lên tới 35% về lượng token sử dụng, Anthropic tự thừa nhận điều này, tương đương với việc tăng giá ẩn.
DeepSeek V4 được đánh giá là "tiếp tục với xu hướng nhưng không dẫn đầu", sẽ là lựa chọn thay thế chi phí thấp nhất cho mô hình không công khai. Bài viết cũng khẳng định "Claude vẫn vượt trội so với DeepSeek V4 Pro trong nhiệm vụ khó khăn về viết tiếng Trung", và bình luận "Claude đã sử dụng ngôn ngữ của đối phương để vượt qua mô hình Trung Quốc".
Bài viết đưa ra một khái niệm then chốt: việc đánh giá mức giá của mô hình nên xem xét "chi phí mỗi nhiệm vụ" thay vì "chi phí mỗi token". Giá của GPT-5.5 là gấp đôi so với GPT-5.4 (5 đô la cho mỗi đầu vào, 30 đô la cho mỗi triệu token đầu ra), nhưng với số lượng token ít hơn hoàn thành cùng một nhiệm vụ, chi phí thực sự có thể không cao hơn. Dữ liệu sơ bộ của SemiAnalysis cho thấy tỷ lệ đầu vào/đầu ra của Codex là 80:1, thấp hơn so với Claude Code 100:1.
