动察 Beating AI tin nhanh, Anthropic đã thêm một bộ quy trình tinh chỉnh tự động vào Skill claude-api chính thức của Claude Code. build-eval trước tiên tạo bộ kiểm thử và phương pháp chấm điểm từ các cuộc hội thoại thực tế, lỗi hoặc các trường hợp thủ công, sau đó hillclimb để Claude Code liên tục sửa đổi System Prompt, mô tả công cụ, mô hình và cường độ suy luận. Mỗi lần sửa xong đều chạy lại kiểm thử, nếu hiệu quả tốt hơn thì giữ lại, nếu kém đi thì khôi phục.
Để tránh việc Claude chỉ tối ưu cho các câu hỏi kiểm thử, nó sẽ không dùng tất cả mẫu để tinh chỉnh cùng lúc. Một phần trường hợp được dùng để tìm vấn đề và sửa cấu hình, một nhóm trường hợp khác được giữ lại để kiểm tra xem thay đổi có thể áp dụng cho những vấn đề chưa từng gặp hay không. Nếu điểm số phía trước tăng lên nhưng kết quả kiểm thử giữ lại không cải thiện, thay đổi này có thể bị đánh giá là quá khớp và bị rút lại.
Anthropic đã dùng 44 phiếu yêu cầu hỗ trợ khách hàng để minh họa quy trình này. Claude Code lần lượt dọn dẹp Prompt, bổ sung quy tắc nghiệp vụ, thử các mô hình khác nhau và giảm cường độ suy luận. Cuối cùng tìm được một cấu hình Sonnet 5 effort thấp. Trên 14 phiếu không tham gia tinh chỉnh, độ chính xác tăng từ 78,6% của cấu hình ban đầu lên 90,5%, chi phí giảm xuống còn khoảng một phần năm so với ban đầu.
