Theo 动察 Beating theo dõi, công ty đánh giá mô hình AI Vals AI đã hoàn thành vòng gọi vốn Series A trị giá 40 triệu USD, định giá đạt 400 triệu USD, do a16z dẫn đầu. Các cổ đông cũ như 8VC, Pear VC, Bloomberg Beta tiếp tục tham gia đầu tư.
Vals chuyên đánh giá bên thứ ba cho các mô hình lớn. Hiện nay, khi nhiều mô hình được ra mắt, kết quả vẫn do chính nhà sản xuất tự kiểm tra và tự công bố. Vals sử dụng các nhiệm vụ thực tế như lập trình, tài chính, luật pháp, y tế để kiểm tra thống nhất các mô hình khác nhau. Theo công bố chính thức, kết quả của họ đã được trích dẫn trong các thẻ mô hình của OpenAI, Anthropic, Google, Meta và xAI, và doanh thu năm nay đã đạt gấp 8 lần so với cả năm 2025.
Điều a16z quan tâm chính là giá trị "trọng tài bên thứ ba" này. Các Benchmark công khai ngày càng dễ bị gian lận điểm số, trộn vào dữ liệu huấn luyện, thậm chí bị nhà sản xuất tối ưu hóa có chủ đích, điểm cao trên bảng xếp hạng chưa chắc đã đồng nghĩa với chất lượng thực tế tốt.
Lần này Vals còn mở hoàn toàn Vals Smith, cho phép biến bất kỳ kho lưu trữ GitHub nào thành Coding Benchmark. Hệ thống sẽ trích xuất các nhiệm vụ phát triển thực tế từ các PR lịch sử, sau đó dùng bài kiểm tra ẩn để xác minh xem mô hình có hoàn thành được hay không. Nhờ đó, doanh nghiệp có thể trực tiếp kiểm tra mô hình nào phù hợp nhất với kho mã nguồn của mình, thay vì chỉ nhìn vào bảng xếp hạng công khai.
