动察 Beating AI tin nhanh, OpenRouter ra mắt Jev Router, tích hợp Jev của TypeSafe vào định tuyến mô hình. Trước mỗi lượt yêu cầu, Jev sẽ đánh giá độ khó của tác vụ, yêu cầu về độ chính xác, cũng như mô hình hiện tại và mức suy luận có đủ dùng không, rồi quyết định tiếp tục giữ nguyên, tăng cường độ suy luận, hay đổi sang mô hình khác.
Auto Router trước đây của OpenRouter thiên về chọn mô hình theo loại tác vụ. Nó sẽ đánh giá đây là tác vụ gì trước, rồi tham khảo tình hình sử dụng các mô hình trong các yêu cầu cùng loại 7 ngày qua để chọn tuyến. Jev Router sẽ tiếp tục xem lượt này thực sự khó đến mức nào. Tác vụ đơn giản có thể hạ mức, bài khó có thể tăng reasoning effort; nếu cùng một mô hình vẫn giải quyết được thì không vội đổi mô hình.
Ở đây còn một vấn đề rất thực tế, đó là bộ nhớ đệm ngữ cảnh. Trong hội thoại dài, một khi đổi mô hình, ngữ cảnh đã được đệm thường không thể tái sử dụng trực tiếp, mô hình mới có thể phải xử lý lại toàn bộ đoạn lịch sử trò chuyện. Jev Router sẽ tính cả phần tổn thất này. OpenRouter cho biết, chỉ khi lợi ích kỳ vọng từ việc đổi mô hình cao hơn chi phí chuyển đổi thì mới thực sự đổi mô hình, và cùng một mô hình cũng sẽ cố gắng tiếp tục sử dụng.
OpenRouter tự kiểm tra cho biết, trong 4 bài benchmark Agent với tổng cộng 423 tác vụ, Jev Router hoàn thành 237 tác vụ, Auto Router hoàn thành 130 tác vụ, giải quyết thêm khoảng 82% tác vụ. Trong 5 bài benchmark Agent khác, độ trễ trung vị của token đầu tiên cũng thấp hơn các router khác tham gia kiểm tra.
Cách làm tương tự trước đây đã xuất hiện trong cộng đồng Jev. Ví dụ `gholtzap/jev-codex-model-and-effort-router` sẽ để Jev chọn mô hình và mức suy luận cho Codex trước, rồi cố định toàn bộ luồng để tái sử dụng bộ nhớ đệm; `Jev-Auto-Router` thì thử chọn lại mô hình theo từng lần gọi. Lần này OpenRouter đã đưa những cách làm như vậy trực tiếp vào dịch vụ định tuyến chính thức.
