BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

Bạn đã giúp Google huấn luyện trí tuệ nhân tạo miễn phí suốt 15 năm, nhưng chỉ là không hề hay biết.

Đọc bài viết này mất 15 phút
Bạn đã chứng minh mình là con người, nhưng kết quả lại khiến bản thân trở nên có thể bị thay thế.
Tiêu đề gốc: Bạn đã huấn luyện AI của Google suốt 15 năm. Bạn không hề hay biết.
Tác giả gốc: Sharbel, đồng sáng lập Unfungible
Biên dịch gốc: Lila, BlockBeats


Lời biên tập: CAPTCHA, những dãy số hoặc hình ảnh bạn cần nhấp vào mỗi khi đăng nhập trang web, là thứ quen thuộc với mọi người dùng Internet. Nhưng khi bạn liên tục nhấp vào "Tôi không phải robot", bạn nghĩ mình chỉ đang xác thực danh tính, nhưng thực ra bạn đang tham gia vào quá trình sản xuất dữ liệu lớn nhất và bí mật nhất toàn cầu. reCAPTCHA do Luis von Ahn phát triển đã biến những hành vi rời rạc của con người thành nền tảng dữ liệu hỗ trợ các hoạt động cốt lõi của Google và công ty xe tự lái Waymo trực thuộc.


Dưới vỏ bọc "miễn phí" và "an toàn", Internet đã âm thầm định hình một mối quan hệ lao động mới: bạn dành thời gian để chứng minh mình là con người, nhưng lại đóng góp cho việc huấn luyện AI, và một khi AI đã học được, công sức này sẽ bị thay thế hoàn toàn. Bài viết này, chưa đầy 20 giờ sau khi đăng, đã thu về hơn 9,5 triệu lượt xem trên Twitter. Dưới đây là nội dung gốc:


Mỗi ngày, khoảng 500.000 giờ lao động của con người bị Google khai thác miễn phí. Và những người đóng góp chỉ đơn giản muốn đăng nhập vào tài khoản ngân hàng trực tuyến của mình.


reCAPTCHA là chiến dịch vận hành dữ liệu ngầm thành công nhất trong lịch sử Internet. Ở thời kỳ đỉnh cao, 200 triệu người hoàn thành xác thực mỗi ngày. Nhưng hầu như không ai nhận ra ý nghĩa thực sự đằng sau mỗi cú nhấp chuột.


Công ty xe tự lái Waymo của Google, hiện có giá trị thị trường 45 tỷ USD. Phần lớn dữ liệu huấn luyện cốt lõi của nó đều do bạn cung cấp miễn phí khi truy cập các trang web.


Dưới đây là câu chuyện đầy đủ:


Khởi nguồn: Một ý tưởng thông minh


Năm 2000, bot spam đang phá hủy Internet. Diễn đàn bị tràn ngập, hộp thư đến bị nhồi nhét, các trang web cần gấp một cách để phân biệt con người với máy móc.


Giáo sư Luis von Ahn tại Đại học Carnegie Mellon đã giải quyết vấn đề này. Ông phát minh ra CAPTCHA: một dạng văn bản méo mó chỉ con người mới đọc được, robot không thể vượt qua.


Nhưng von Ahn còn thấy xa hơn thế. Hàng triệu người đang tiêu tốn sức lực vào những thử thách này. Nếu như sức lực đó có thể làm được hai việc cùng lúc thì sao?


Năm 2007, ông lại cho ra mắt reCAPTCHA. Điểm tinh tế ở chỗ: nó không còn hiển thị những ký tự lộn xộn ngẫu nhiên nữa, mà thay vào đó là hai từ. Một từ đã được hệ thống biết trước, từ còn lại là một cuốn sách thật được quét mà máy tính chưa thể nhận dạng. Và câu trả lời của bạn đã giúp số hóa những cuốn sách này.


Những cuốn sách này đến từ kho lưu trữ của tờ New York Times và Google Books, lên tới 130 triệu cuốn.


Bạn tưởng mình chỉ đang đăng nhập vào một trang web bình thường, nhưng thực ra bạn đang thực hiện OCR (Nhận dạng ký tự quang học) cho thư viện số lớn nhất thế giới.


Năm 2009, Google chính thức mua lại reCAPTCHA.



Sau đó, Google đã thay đổi cách chơi


Kỷ nguyên "chữ méo mó" kết thúc vào khoảng năm 2012.


Google lại đối mặt với thử thách mới: Xe chụp ảnh Street View đã ghi lại mọi con đường trên toàn cầu, nhưng những bức ảnh chỉ là dữ liệu thô. Để AI hoạt động hiệu quả, nó cần hiểu những gì nhìn thấy: biển báo, vạch kẻ đường, đèn giao thông, mặt tiền cửa hàng.


Vì vậy, Google đã thiết kế lại reCAPTCHA v2. Trong giao diện không còn chữ méo mó nữa, mà là một lưới ảnh. "Nhấp vào tất cả ô có đèn giao thông." "Chọn mọi vạch kẻ đường." "Nhận diện mặt tiền cửa hàng."


Những bức ảnh này trực tiếp đến từ Google Street View. Cú nhấp chuột của bạn chính là nhãn dữ liệu.


Mỗi lần lựa chọn đều đang nói cho mô hình thị giác máy tính của Google biết: cụm pixel này là đèn giao thông, hình dạng kia là vạch kẻ đường. Bạn không phải đang vượt qua bài kiểm tra, bạn đang xây dựng bộ dữ liệu.



Quy mô không thể tưởng tượng


Vào thời kỳ đỉnh cao, mỗi ngày có 200 triệu reCAPTCHA được giải. Mỗi thử thách mất 10 giây, nghĩa là mỗi ngày tạo ra 2 tỷ giây lao động của con người. Tức là: 500.000 giờ mỗi ngày.


Chi phí gắn nhãn dữ liệu có trả công dao động từ 10 đến 50 đô la mỗi giờ. Tính theo mức thấp nhất: giá trị lao động được khai thác miễn phí mỗi ngày lên tới 5 triệu đô la.


Và reCAPTCHA không chỉ tồn tại trong một ứng dụng nào đó. Nó xuất hiện ở khắp mọi ngân hàng, mọi cổng thông tin chính phủ, mọi trang thương mại điện tử. Bạn không có lựa chọn nào khác: muốn đăng nhập tài khoản? Trước tiên hãy gắn nhãn tập dữ liệu. Google chưa bao giờ hỏi ý kiến bạn, chưa trả một xu lương nào, thậm chí chưa từng nói với bạn về điều này.



Điều này đã tạo ra những gì?


Những dữ liệu này được đưa trực tiếp vào hai sản phẩm:


-Google Maps: Công cụ dẫn đường được sử dụng nhiều nhất toàn cầu. Khả năng nhận diện biển báo đường phố, cửa hàng và địa lý đô thị của nó, một phần nhờ vào hàng tỷ lần con người gắn nhãn khi đăng nhập vào các trang web.


-Waymo: Dự án xe tự lái của Google. Để dẫn đường an toàn, xe tự lái cần nhận diện gần như hoàn hảo hàng nghìn mẫu hình thị giác.


Dữ liệu huấn luyện chân thực cho những công việc nhận diện đó được tạo ra bởi hàng triệu người, mà không hề hay biết, thông qua reCAPTCHA. Waymo đã hoàn thành hơn 4 triệu chuyến đi trả phí vào năm 2024, với định giá 45 tỷ đô la. Nền tảng của nó được xây dựng bởi những "cư dân mạng không công" chỉ muốn kiểm tra email.


Tại sao không ai có thể sao chép mô hình này?


Gắn nhãn dữ liệu cực kỳ đắt đỏ. Các công ty như Scale AI, Appen và Labelbox tồn tại để giải quyết vấn đề này, thuê hàng trăm nghìn công nhân, đôi khi với mức lương dưới 1 đô la một giờ.


Cách giải quyết của Google lại khác: họ biến việc gắn nhãn thành bắt buộc. Không cần trả tiền, không cần xin phép, mà là "tấm vé" để vào mọi ngóc ngách của internet. Kết quả là: hàng tỷ hình ảnh được gắn nhãn, phủ sóng toàn cầu, mọi thời tiết, mọi thành phố trên thế giới. Không một công ty gắn nhãn nào có thể làm được điều này. Bản thân internet là nhà máy, và mỗi cư dân mạng là một nhân viên không hợp đồng.



Bạn vẫn đang tham gia cho đến nay


reCAPTCHA v3 ra mắt năm 2018 thậm chí không còn hiển thị thử thách. Nó quan sát cách bạn di chuyển chuột, tốc độ cuộn trang, thời gian dừng lại. Dấu vân tay hành vi của bạn cho nó biết liệu bạn có phải là con người hay không. Những dữ liệu hành vi này cũng được đưa trở lại vào hệ thống AI của Google.


Bạn chưa bao giờ chủ động tham gia, chưa bao giờ có một ô đánh dấu để bạn chọn. Nhưng ngay lúc này, trên hầu hết các trang web bạn truy cập, bạn vẫn đang làm điều đó.


Sự mỉa mai đáng lo ngại


Ý định ban đầu của Luis von Ahn thật thiên tài: Biến năng lượng mà con người đang lãng phí thành sản phẩm hữu ích. Nhưng cách Google tận dụng tầm nhìn này lại là chuyện khác. Họ khai thác cơ chế bảo mật mà người dùng buộc phải sử dụng, triển khai nó trên toàn mạng, thu hoạch kết quả để xây dựng các sản phẩm thương mại trị giá hàng chục tỷ đô la. Người dùng chẳng nhận được gì, thậm chí còn không hề hay biết.


Sự mỉa mai sâu sắc nhất nằm ở chỗ: Bạn dành nhiều năm để chứng minh mình là con người, bằng cách hoàn thành các công việc nhận diện thị giác mà AI lúc đó chưa thể làm được. Và một khi AI đã học được điều đó, việc gắn nhãn thị giác của con người không còn cần thiết nữa.


Bạn chứng minh mình là con người, nhưng kết quả lại khiến bản thân trở nên có thể bị thay thế.


Liên kết gốc


Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:

Nhóm Telegram đăng ký: https://t.me/theblockbeats

Nhóm Telegram thảo luận: https://t.me/BlockBeats_App

Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia

Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Báo lỗi/Báo cáo
Gửi