BTC
$96,000
5.73%
ETH
$3,521.91
3.97%
HTX
$0.{5}2273
5.23%
SOL
$198.17
3.05%
BNB
$710
3.05%
lang
简体中文
繁體中文
English
Tiếng Việt
한국어
日本語
ภาษาไทย
Türkçe
Trang chủ
AI AI
Tin nhanh
Bài viết
Sự kiện
BlockBeats Pro
Thêm
Thông tin tài chính
Chuyên đề
Hệ sinh thái chuỗi khối
Mục nhập
Podcast
Data
OPRR

IOSG: Tại sao Phố Wall đang nói "không" với ChatGPT và Claude?

Đọc bài viết này mất 46 phút
Nhiều năm bị cáo buộc về quyền riêng tư và sở hữu trí tuệ, nhưng cả hai công ty vẫn không mất đi chút đà tăng trưởng nào. Tuy nhiên, một số doanh nghiệp đã có những hành động cụ thể.
Tiêu đề gốc: 《IOSG Weekly Brief|Ngã tư đường của AI: Tại sao Phố Wall đang nói "Không" với ChatGPT và Claude? #336》
Nguồn gốc: IOSG Ventures


Tại sao cần AI riêng tư


Ngày 1 tháng 7, CEO của Palantir, Alex Karp, đã có một cuộc phỏng vấn kéo dài 20 phút trên CNBC mà một số phương tiện truyền thông gọi là "suy sụp tinh thần". Theo lời Karp, các doanh nghiệp đang trả phí token cho các phòng thí nghiệm tiên tiến, đồng thời nhìn thấy IP của chính họ chảy vào các nhà cung cấp mô hình. Ông gọi sự rò rỉ này là sự chuyển giao alpha, và sự chuyển giao đang diễn ra ở lớp kiến trúc: mọi yêu cầu gửi đến mô hình mã nguồn đóng đều đến máy chủ của nhà cung cấp dưới dạng văn bản rõ. Chỉ vài ngày trước khi chương trình phát sóng, Palantir vừa công bố hợp tác với NVIDIA để chạy mô hình Nemotron mở trong môi trường do khách hàng tự kiểm soát, kèm theo một tuyên ngôn chủ quyền AI gồm chín điều. Sau chương trình CNBC, PLTR đã tăng vọt 8%.


Trong hai thập kỷ qua, các doanh nghiệp dựa vào sự tin cậy ở lớp giao thức để sử dụng phần mềm đám mây, và điều đó đã hiệu quả. Mỗi nhà cung cấp SaaS chỉ thấy một phần dữ liệu của doanh nghiệp, và hầu hết không có động lực để sử dụng dữ liệu khách hàng nuôi dưỡng sản phẩm cốt lõi. Salesforce thấy kênh bán hàng, Workday thấy nhân sự, Jira thấy vòng lặp phát triển, AWS cung cấp nền tảng lưu trữ và tính toán. Tuy nhiên, quy trình làm việc AI ngày nay chủ trương tải lên toàn bộ tài sản cùng một lúc, bao gồm cả ngữ cảnh có cấu trúc kết nối các phòng ban, để tối đa hóa năng suất. Bỏ qua ý định tốt, các nhà cung cấp thượng nguồn giờ đây có thể sử dụng dữ liệu này để phát triển các tính năng mới, thay vì để chúng nằm im trên máy chủ.


Không ai giảm tốc độ, doanh thu hàng năm của Anthropic đạt 47 tỷ USD vào tháng 5, tăng mạnh so với 9 tỷ USD vào cuối năm 2025, trong khi OpenAI vượt 900 triệu người dùng hoạt động hàng tuần vào tháng 2. Cả hai công ty đều hoàn thành các vòng gọi vốn mới vào mùa xuân năm nay, với định giá gần 1 nghìn tỷ USD và dự kiến sẽ IPO với vốn hóa cao hơn. Nhiều năm cáo buộc về quyền riêng tư và IP đều không làm mất đi chút đà tăng trưởng nào của hai công ty.


Một phần doanh nghiệp đã hành động từ sớm. Vào tháng 2 năm 2023, chưa đầy ba tháng sau khi ChatGPT ra mắt, các ngân hàng lớn ở Phố Wall đã hạn chế sử dụng nó. Vào tháng 5 năm 2023, sau khi kỹ sư Samsung rò rỉ mã nguồn chip vào ChatGPT, công ty đã cấm toàn bộ mạng lưới sử dụng AI tạo sinh. Để đáp lại, OpenAI đã ra mắt ChatGPT Enterprise vào tháng 8 năm đó, cam kết không sử dụng dữ liệu thương mại để huấn luyện, kèm theo thỏa thuận zero-data-retention (ZDR), sau này trở thành yêu cầu tiêu chuẩn trong mua sắm doanh nghiệp.


Tuy nhiên, hợp đồng chỉ khóa tài khoản công ty. IBM phát hiện rằng đến năm 2025, AI ngầm (nhân viên đưa dữ liệu công ty vào các công cụ AI chưa được phê duyệt qua tài khoản cá nhân) đã liên quan đến 1/5 sự cố rò rỉ dữ liệu, và việc sử dụng AI ngầm ở mức độ cao khiến chi phí rò rỉ trung bình tăng thêm 670.000 USD. Trong một cuộc khảo sát năm 2025 của công ty đào tạo an ninh Anagram, 40% nhân viên cho biết họ sẵn sàng vi phạm chính sách sử dụng AI để hoàn thành nhiệm vụ nhanh hơn.


Doanh nghiệp ít nhất có thể mua lối thoát bằng tiền: hợp đồng ZDR, gói dịch vụ không huấn luyện, hoặc triển khai chủ quyền nếu bạn là chính phủ hoặc khách hàng của Palantir. Còn với người dùng phổ thông như bạn và tôi, việc AI có bảo mật quyền riêng tư hay không vẫn còn gây tranh cãi, cho đến khi lệnh triệu tập của tòa án xuất hiện.


Một lệnh tòa vào tháng 5 năm 2025 buộc OpenAI phải lưu giữ cả những cuộc trò chuyện tiêu dùng đã bị người dùng xóa. Đến tháng 11, thẩm phán lại ra lệnh chuyển 20 triệu cuộc trò chuyện trong số đó cho luật sư của The New York Times làm tài liệu khám phá bằng chứng. Tiếp theo là các vụ án hình sự: hồ sơ ChatGPT của bị cáo trong vụ đốt rừng Palisades được đưa vào bằng chứng; bản tuyên thệ trong vụ án hai mạng người ở Florida trích dẫn câu hỏi của nghi phạm về cách xử lý xác chết. Sam Altman cũng thừa nhận trong một cuộc phỏng vấn vào tháng 7 năm 2025 rằng các cuộc trò chuyện ChatGPT không được bảo vệ bởi đặc quyền pháp lý, và trong các vụ kiện, OpenAI "có thể bị yêu cầu" giao nộp lịch sử trò chuyện của người dùng.


Vấn đề không phải chỉ tội phạm mới cần trò chuyện riêng tư. Các cuộc trò chuyện của con người với AI bị lưu trữ và có thể bị triệu tập, tạo ra một mặt giám sát mà hầu hết người dùng không biết tồn tại. Một cuộc khảo sát của Kolmogorov Law vào tháng 10 năm 2025 với 1.000 người dùng AI tại Mỹ cho thấy 50% không biết các cuộc trò chuyện này có thể bị triệu tập, trong khi 2/3 cho rằng các cuộc trò chuyện này nên được bảo vệ tương tự như khi tư vấn luật sư hoặc bác sĩ.


Các mô hình nguồn mở tự lưu trữ hoặc chạy trong môi trường có thể xác minh đang nhanh chóng bắt kịp, nhưng những mô hình mạnh nhất vẫn tụt hậu so với các mô hình nguồn đóng tiên tiến khoảng 4 tháng về khả năng tổng quát. Điều này đặt các doanh nghiệp và cá nhân theo đuổi tokenmaxxing trước ngã ba đường: hoặc hy sinh vài tháng chất lượng mô hình để đổi lấy quyền riêng tư, hoặc tiếp tục gửi tài liệu nhạy cảm lên máy chủ của Anthropic, vì đối thủ cạnh tranh đang giành lợi thế năng suất theo cách đó.


Hiện tại, không có giải pháp hoàn hảo nào trên thị trường. Báo cáo này tổng hợp các nỗ lực thu hẹp khoảng cách từ nhiều bên, quan sát xem trí tuệ tiên tiến dưới quyền riêng tư có thể chứng minh còn cách bao xa để đến tay doanh nghiệp và người dùng phổ thông.


Quyền riêng tư hiện được thực hiện như thế nào


Quyền riêng tư trong AI không phải là một kỹ thuật đơn lẻ, nhưng mọi cơ chế hiện có trên thị trường đều xử lý cùng một sự kiện: một prompt rời khỏi thiết bị của bạn, băng qua mạng, đến máy chạy mô hình, rồi trả về một phản hồi. Sự khác biệt giữa các cơ chế nằm ở chỗ dữ liệu rõ ràng (plaintext) tồn tại ở đâu trên đường đi này, ai có thể đọc được nó, và dựa vào đâu để xác minh tính riêng tư của phản hồi.


Quyền riêng tư cấp giao thức


Ở lớp này, ngoài bạn ra còn có người khác đọc được prompt dạng rõ ràng của bạn, và điều gì xảy ra tiếp theo hoàn toàn dựa vào một lời cam kết.


· Không lưu trữ theo hợp đồng là giải pháp dành cho doanh nghiệp. Nhà cung cấp dịch vụ biết bạn là ai, xử lý prompt của bạn, và cam kết không lưu trữ, việc thực thi dựa vào hợp đồng và uy tín.


· Proxy ẩn danh xóa đi danh tính của bạn, nhưng không mã hóa nội dung bạn nói. Nhà cung cấp dịch vụ hạ nguồn vẫn xử lý dữ liệu rõ ràng theo chính sách riêng của họ. Các điều khoản khác nhau tùy theo bên, ví dụ Duck.ai (sản phẩm chatbot của DuckDuckGo) loại proxy này sẽ thương lượng thỏa thuận xóa dữ liệu với các công ty mô hình, trong khi Venice để người dùng tự giả định rằng nhà cung cấp dịch vụ sẽ lưu trữ mọi thứ, nhưng cả hai bên đều không thể xác minh.


Mỗi chặng đường giữa các máy đều chạy trên TLS, nó chỉ mã hóa đường ống, bên nhận có thể đọc được tất cả thông tin. Các relay thường sử dụng Oblivious HTTP (RFC 9458) để tách quyền biết thông tin này, nguyên lý giống như nhờ bạn bè chuyền giấy. Bạn bè biết ai đưa nhưng không đọc được nội dung, người nhận đọc được nội dung nhưng không biết ai viết. OHTTP đã trở thành tiêu chuẩn IETF từ tháng 1 năm 2024, hiện nhiều công ty đã chạy lưu lượng sản xuất trên các relay OHTTP thuê từ Cloudflare và Fastly.


Đây cũng là giới hạn quyền riêng tư tối đa có thể đạt được khi truy cập các mô hình đóng (closed-source), lý do là một bài toán số học. Chi phí cho một lần huấn luyện mô hình hàng đầu hiện nay ở mức hàng tỷ đô la, và định giá gần nghìn tỷ đô la của các phòng thí nghiệm này dựa trên sự độc quyền của các trọng số mô hình. Khoảng cách về năng lực mô hình tồn tại bao lâu, thì mức phí bảo hiểm (premium) tồn tại bấy lâu, vì vậy các phòng thí nghiệm coi các tệp trọng số như bí mật quốc gia.


Meta đã từng bị động thực hiện thí nghiệm này. LLaMA phát hành vào tháng 2 năm 2023 ban đầu chỉ dành cho các nhà nghiên cứu, nhưng chưa đầy một tuần, các trọng số đã bị rò rỉ dưới dạng torrent lên 4chan. Một tuần sau, llama.cpp đã cho phép mô hình 7B nhỏ nhất trong số đó chạy cục bộ trên một chiếc MacBook. Ba ngày sau, Stanford đã tinh chỉnh chatbot trợ lý Alpaca từ cùng một mô hình với chi phí chưa đến 600 đô la. Vụ rò rỉ này đã hạ chi phí vận hành Llama xuống chỉ còn tiền điện, bất kỳ ai có tệp tin đều có thể chạy nó tại nhà. Tháng 7 năm 2023, Meta chính thức mã nguồn mở Llama 2 với giấy phép thương mại kèm điều khoản loại trừ 700 triệu người dùng hoạt động hàng tháng. Trọng số đã chạy, và phí bảo hiểm cũng chạy theo.


Về mặt lý thuyết, các phòng thí nghiệm tiên tiến có thể thực hiện chứng thực từ xa (attestation) cho suy luận của mô hình đóng, nhưng chứng thực chỉ có thể chứng minh đoạn mã nào đã đọc prompt, chứ không thể chứng minh đoạn mã đó đã làm gì với nó. Để xác định máy chủ có lưu giữ dữ liệu hay không, chúng ta cần kiểm toán mã phục vụ (serving code) và tái cấu trúc nó thành hàm băm mà phần cứng báo cáo. Nhưng một khi giao nộp mã phục vụ, phòng thí nghiệm cũng giao nộp các kỹ thuật xử lý hàng loạt và lưu trữ đệm hỗ trợ tỷ suất lợi nhuận, và những kỹ thuật này sẽ được chuyển giao cho mọi thế hệ mô hình trong tương lai. Lý do Apple và Meta có thể thực hiện chứng thực từ xa cho ngăn xếp dịch vụ đằng sau iPhone và WhatsApp là vì lợi nhuận của họ nằm ở thiết bị và quảng cáo, việc công khai mã phục vụ hầu như không tốn kém gì.


Đây là lý do tại sao trọng số và mã phục vụ của các mô hình hàng đầu không thể đến tay các bên vận hành bên ngoài. Và không có bên vận hành bên ngoài, thì không có chứng thực của bên thứ ba; không có chứng thực, quyền riêng tư có thể xác minh chỉ tồn tại trên các mô hình nguồn mở.


Quyền riêng tư cấp độ cấu trúc


Mỗi cơ chế trong loại này đều thay thế cam kết tin cậy bằng chứng thực dựa trên phần cứng, mật mã hoặc vật lý, nhưng mỗi cơ chế đều phải trả một cái giá khác nhau cho việc nâng cấp quyền riêng tư, và điều đầu tiên là chúng chỉ có thể chạy các mô hình nguồn mở.


· TEE (Môi trường thực thi tin cậy) Tính toán bảo mật đưa suy luận vào chạy trong một enclave phần cứng (một khoang kín trên chip mà ngay cả bên vận hành máy cũng không thể mở), chip sẽ ký một chứng thực, ghi rõ mô hình nào và đoạn mã nào đã được chạy.


· Prompt chỉ bị phong tỏa ở điểm cuối. Trên đường đi qua trung gian nền tảng, vẫn tồn tại một thực thể có thể đọc văn bản rõ, và chỉ có giao thức mới ngăn được trung gian ghi lại hoặc rò rỉ nội dung trung chuyển.


· E2EE (Mã hóa đầu cuối) chặn các điểm chuyển tiếp có thể đọc được. Thiết bị người dùng mã hóa prompt bằng khóa của enclave, mỗi bước nhảy ở giữa mang theo một phong bì kín chỉ có enclave mới mở được.


· Niềm tin đặt ở phía máy khách. Mã chịu trách nhiệm mã hóa prompt và xác minh chứng thực cũng có khả năng thu hồi sự đảm bảo này. Do đó, E2EE có thể xác minh không chỉ yêu cầu enclave đã được chứng thực, mà còn yêu cầu mã máy khách mở và có thể tái tạo.


· So với sự đơn giản của TEE, cái giá của E2EE là gánh nặng kỹ thuật, điều này cũng làm chậm quá trình tích hợp tính năng. E2EE biến proxy thành một người đưa tin mù, vì vậy tất cả các chức năng phụ thuộc vào việc đọc văn bản rõ phải được xây dựng lại xung quanh khóa máy khách, hoặc chỉ được xây dựng lại bên trong enclave.


· FHE (Mã hóa đồng cấu hoàn toàn, và biến thể MPC) loại bỏ hoàn toàn bên tin cậy. Máy chủ thực hiện tính toán trên bản mã trong một chiếc hộp khóa mà nó không bao giờ mở được, chìa khóa chỉ nằm trong tay bạn. MPC (Tính toán đa bên) chia prompt thành các phần bí mật và phân phối cho nhiều bên, trừ khi tất cả các bên thông đồng, hiệu quả là tương đương.


· Cái giá phải trả là tốc độ. FHE nguyên bản chỉ thực hiện được phép cộng và phép nhân, do đó các bước phi tuyến tính cần thiết cho hoạt động của transformer phải được xây dựng lại với chi phí rất cao. Chi phí suy luận trên bản mã cao gấp 10.000 đến 100.000 lần so với bản rõ, mỗi token trên mô hình nhỏ cũng mất vài giây đến vài phút, trong khi không mã hóa chỉ mất mili giây.


· Các chip tùy chỉnh cho tính toán mã hóa hứa hẹn thu hẹp khoảng cách, nhưng nguyên mẫu đầu tiên chỉ hoàn thành demo vào đầu năm 2026, phiên bản thương mại còn phải chờ thêm vài năm nữa.


· Suy luận cục bộ trực tiếp loại bỏ con đường này. Mô hình chạy trên phần cứng của chính bạn, không có trung gian, không có máy chủ, không có nhà cung cấp dịch vụ, cũng không có nhu cầu xác thực.


· Cái giá hiển nhiên là chi phí và năng lực mô hình. gpt-oss-120b đạt điểm khoảng một nửa so với GLM-5.2 trên chỉ số Artificial Analysis, nhưng dung lượng 65GB, vượt quá tổng bộ nhớ của hai card đồ họa chơi game cao cấp nhất hiện nay. Trong khi đó, GLM-5.2 độ chính xác đầy đủ chỉ có thể chạy trên nút trung tâm dữ liệu 8 card, riêng GPU đã tốn hơn 300.000 USD.


Tuy nhiên, ngoài những hạn chế về cấu trúc này, chi phí đưa suy luận vào enclave đang giảm dần. Trên suy luận đơn card, điểm chuẩn của nhà cung cấp dịch vụ đám mây enclave Phala cho thấy, tổn thất thông lượng H100 ở chế độ enclave trung bình dưới 7%, và gần như bằng 0 trên các mô hình lớn, vì chi phí chính nằm ở việc đưa dữ liệu vào chip, chứ không phải tính toán bên trong. Trên suy luận đa card, GPU thế hệ mới Blackwell của NVIDIA đã hỗ trợ mã hóa trực tiếp lưu lượng giữa các chip, trong khi H100 cũ để đạt hiệu quả tương tự phải vòng qua CPU host với băng thông chỉ bằng 1/7. Điểm chuẩn của NVIDIA trên Blackwell cho thấy, tổn thất thông lượng của mô hình 397B ở chế độ enclave dưới 8%. Với những tiến bộ này, tổn hao hiệu suất của bản thân suy luận riêng tư không còn là ràng buộc quyết định.


Trên thực tế, bản thân enclave hầu như không làm tăng thêm chi phí vận hành cho bên vận hành. Mỗi H100 sau năm 2023 đều có chế độ enclave tích hợp sẵn, chi phí bổ sung là tổn thất thông lượng do mã hóa, chứ không phải chip thêm. Hiện tại, giá thuê SKU H100 bảo mật trên Azure vẫn là 8,90 USD/giờ, không bật enclave là 6,98 USD, tương đương tăng 27% so với cơ sở hạ tầng đám mây truyền thống. Trong khi đó, trên các nhà cung cấp chuyên về enclave như Phala, H100 chế độ bảo mật đang được cho thuê với giá khởi điểm 3,80 USD/giờ, thấp hơn mức giá 3,99 đến 4,29 USD của card SXM thông thường của Lambda. Về giải pháp API托管, endpoint có attestation của NEAR AI cung cấp gpt-oss-120b với giá 0,15 USD đầu vào và 0,55 USD đầu ra trên mỗi triệu token, ngang bằng với Amazon Bedrock, Together và Groq trên tuyến bản rõ. Ngay cả với các mô hình yêu cầu đa chip song song, NEAR AI định giá trên GLM 5.2 không chênh lệch một xu so với Fireworks, và trên mô hình Kimi K2.6 lớn hơn, đầu vào rẻ hơn 15%, đầu ra rẻ hơn 4%.


Mặc dù các nhà cung cấp dịch vụ suy luận quyền riêng tư mới này có thể đang đốt lợi nhuận để giành thị phần (điều này đúng với bất kỳ công ty nào muốn tăng trưởng trên thị trường), nhưng xu hướng cấu trúc cho thấy chi phí bảo vệ quyền riêng tư đang giảm dần đối với cả người tiêu dùng và nhà vận hành.


Mô hình nguồn mở sẽ thắng như thế nào?


Mặc dù chi phí hiệu suất đang được nén lại, vẫn tồn tại một khoảng cách rõ ràng giữa các mô hình tiên tiến và các mô hình nguồn mở SOTA. Một chủ thể muốn tối đa hóa năng suất và duy trì vị trí dẫn đầu vẫn phải tin tưởng rằng các phòng thí nghiệm tiên tiến sẽ không đánh cắp IP của mình.


Khoảng cách vẫn còn, nhưng AIA Labs của Bridgewater và Thinking Machines đã đưa ra một ví dụ vào ngày 30 tháng 6: một mô hình mở được tinh chỉnh bằng chú thích chuyên gia đã đánh bại các mô hình tiên tiến cả về độ chính xác và chi phí.


Trong nghiên cứu, nhóm đã tinh chỉnh Qwen3-235B trên Tinker (dịch vụ API tinh chỉnh được quản lý của Thinking Machines). Họ mua chú thích từ nhà cung cấp, huấn luyện vòng đầu tiên với dữ liệu này, sau đó chuyển các mẫu có sự khác biệt cho nhân viên đầu tư của công ty để chú thích lại. Quá trình huấn luyện sử dụng học tăng cường (GRPO), với ba sửa đổi: round-robin batching (mỗi nhiệm vụ luân phiên xuất một batch), CISPO loss (giới hạn mức độ một câu trả lời có thể kéo mô hình đi xa), và on-policy distillation (neo vào checkpoint tốt nhất hiện tại, đảm bảo mô hình không học từ các bản sao yếu hơn).


Tất cả các nhiệm vụ đều lấy từ quy trình làm việc hàng ngày của nhân viên đầu tư: một tin tức có quan trọng đối với chuyên gia đầu tư cấp C-suite không, một tài liệu ngân hàng trung ương có gợi ý hướng thay đổi lãi suất trong tương lai không, và phần mẫu câu trong một tài liệu hoặc email bắt đầu từ đâu. Điểm số đến từ bộ kiểm tra độc lập. Các mô hình tiên tiến đạt trung bình khoảng 50% với prompt đơn giản, và chỉ lên 78,2% với prompt chuyên gia, thấp hơn ngưỡng 80% do nhân viên đầu tư đặt ra. Trong khi đó, Qwen được tinh chỉnh đạt 84,7%, theo cách tính của bài báo, tương đương với việc mắc ít lỗi hơn 29,8% so với mô hình tiên tiến nhất, và chi phí suy luận thấp hơn 13,8 lần.


https://thinkingmachines.ai/news/learning-to-replicate-expert-judgment-in-financial-tasks/


Trường hợp này chứng minh rằng mô hình nguồn mở có thể chiến thắng về độ chính xác và chi phí, nhưng quá trình huấn luyện vẫn không mang tính riêng tư. Dữ liệu chuyên gia được sử dụng trong quá trình này là dữ liệu độc quyền của Bridgewater, đi qua dịch vụ bên thứ ba của Tinker, nằm cùng một tầng tin cậy với giao thức ZDR. Quỹ cũng thuê sức mạnh tính toán, toàn bộ quá trình huấn luyện chạy trên những cỗ máy mà nó chưa bao giờ kiểm soát. Những người mua muốn công thức này nhưng không muốn chấp nhận các giả định về tin cậy hiện có rất ít lựa chọn. Thuê cụm GPU trần, quá trình huấn luyện có thể đọc được đối với nhà vận hành đám mây. Mua cụm máy giải quyết vấn đề lưu trữ dữ liệu, nhưng chi phí tăng vọt.


Hướng đi có chứng thực (attestation) vừa mới xuất hiện. Vào tháng 3, Workshop Labs và Tinfoil đã phát hành Silo, một stack hậu huấn luyện chạy trong enclave của Tinfoil, trên một node 8 card, với chìa khóa chỉ do khách hàng nắm giữ. Chi phí enclave được bài báo đưa ra là, hai giờ huấn luyện chỉ mất thêm 11 phút, và stack này có thể chứa một mô hình nghìn tỷ tham số (Kimi K2 Thinking) bằng cách đóng băng trọng số cơ sở và chỉ huấn luyện các adapter nhỏ trên đó. Khó khăn nằm ở chỗ, học tăng cường (RL) cần di chuyển dữ liệu qua lại giữa các thành phần, và việc di chuyển dữ liệu chính là chi phí của enclave.


Chưa đầy một tháng sau khi Silo được phát hành, Workshop Labs đã được Thinking Machines mua lại. Các thành phần cần thiết để chạy một vòng lặp RL kiểu Bridgewater trong enclave hiện đều thuộc về cùng một công ty.


Quyền riêng tư ở lớp Harness


Còn một vấn đề nữa nằm ngoài tất cả các cơ chế suy luận riêng tư. Các cơ chế này mỗi cái quản lý đường đi từ prompt đến mô hình, trong khi mỗi lần gọi công cụ bên ngoài do agent khởi tạo đều mở ra một con đường mà lớp suy luận không thể chạm tới. Trào lưu kỹ thuật harness gần đây đã phóng đại vấn đề lên gấp bội. Mỗi công cụ, kho nhớ và nguồn dữ liệu được kết nối xung quanh mô hình đều là một điểm đến đọc rõ ràng phần lát cắt quy trình làm việc của chính nó. Máy chủ lịch đọc được lịch trình, máy chủ cơ sở dữ liệu đọc được truy vấn. Một agent hoàn toàn cục bộ nếu muốn bất cứ thứ gì ngoài tập huấn luyện, vẫn cần gửi từ khóa tìm kiếm dưới dạng văn bản rõ cho công cụ tìm kiếm; nếu phía máy chủ không đọc được văn bản rõ, nó không thể trả lời câu hỏi.


Giải pháp chính thống hiện vẫn mặc định nằm ở lớp giao thức. Các công ty như Runlayer và MintMCP sử dụng một cổng trung tâm để kiểm soát toàn bộ lưu lượng công cụ, che giấu thông tin nhận dạng cá nhân (PII) trước khi yêu cầu ra ngoài. Cổng cũng quyết định máy chủ nào có thể nhận lưu lượng, chặn những máy chủ chưa được kiểm duyệt, và ghi lại điểm đến cũng như nội dung của mỗi lần gọi để phục vụ kiểm tra. Ngay cả khi các biện pháp kiểm soát này được gắn với kiểm toán độc lập (SOC 2), máy chủ công cụ vẫn phải đọc truy vấn dưới dạng văn bản rõ để trả lời; việc nó có giữ lại bản sao hay không phụ thuộc vào chính sách lưu trữ của nó, và điều này nhân lên với mỗi công cụ trong harness. Ngoài ra, bản thân cổng cũng là một bên đọc phụ thuộc vào lòng tin trên đường đi, chứ không phải là xác thực.


Các giải pháp cấp độ kiến trúc đã chạm đến tầng trung gian. Ví dụ, Phala trực tiếp lưu trữ máy chủ MCP vào TEE, phạm vi bao phủ ví, thực thi mã và nguồn dữ liệu. Người dùng có thể xác minh tuyên bố bảo mật chỉ bằng một chứng thực (attestation), thay vì tin tưởng vào bên vận hành. Tuy nhiên, các công cụ được lưu trữ trong TEE cuối cùng vẫn phải gửi truy vấn dưới dạng văn bản rõ cho nhà cung cấp dịch vụ; enclave chỉ niêm phong người đưa tin, chứ không phải điểm đến.


Chỉ có một số ít điểm đến học được cách trả lời mà không cần đọc, nhưng chỉ giới hạn trong các truy vấn có cấu trúc. Apple cung cấp tính năng Truy xuất Thông tin Riêng tư (Private Information Retrieval) cho iPhone, cho phép so sánh số điện thoại với cơ sở dữ liệu thư rác mà không tiết lộ số. Microsoft sử dụng cùng một giải pháp cho mật khẩu trong trình duyệt Edge. MongoDB có Queryable Encryption, cho phép máy khách mã hóa các trường trước khi chúng rời khỏi thiết bị, và máy chủ chỉ dựa vào bản mã để thực hiện các so khớp giá trị bằng nhau và phạm vi.


Nhưng đối với tìm kiếm mở, giải pháp tốt nhất hiện nay chỉ dừng lại ở niềm tin; tìm kiếm mã hóa có thể xác minh vẫn chưa rời khỏi phòng thí nghiệm. Brave cam kết không lưu trữ dữ liệu trên chỉ mục 40 tỷ trang của riêng mình (thay vì của Google), nhưng nó vẫn nằm ở tầng giao thức. Exa xây dựng một chỉ mục thần kinh, nhúng từ khóa của người dùng thành ngữ nghĩa và sắp xếp kết quả theo khớp ngữ nghĩa, nhưng bước nhúng này vẫn được tính toán từ văn bản rõ trên máy chủ của Exa. Bài báo Tiptoe năm 2023 của MIT đã hoàn thành việc sắp xếp trên 360 triệu trang web mà không tiết lộ truy vấn, nhưng mỗi lần tìm kiếm đều tiêu tốn một lượng lớn sức mạnh tính toán của máy chủ, và chất lượng sắp xếp có khoảng cách so với tìm kiếm không mã hóa. Bài báo Wally năm 2024 của Apple giấu truy vấn thực vào trong một loạt mồi nhử, giúp giảm chi phí giao tiếp xuống tối đa 31 lần, nhưng bộ toán học này chỉ trở nên rẻ khi có hàng triệu truy vấn đồng thời, và quy mô này hiện không có bất kỳ hệ thống tìm kiếm riêng tư nào sở hữu.


Tìm kiếm mã hóa là khả thi, nhưng hiệu suất và chi phí vẫn chưa đạt đến mức khả thi về mặt thương mại.


Triển vọng


Nhu cầu về AI riêng tư đang tăng lên. Venice AI gần đây đã vượt qua 3,5 triệu người dùng đã đăng ký và thông lượng 1,3 nghìn tỷ token mỗi tháng, sau đó hoàn thành vòng gọi vốn Series A với định giá 1 tỷ USD. Proton là đối thủ cạnh tranh trực tiếp của nó, với sản phẩm trò chuyện Lumo đã đạt 10 triệu người dùng trong vòng một năm ra mắt. Về cơ sở hạ tầng, Phala hiện đang chạy trung bình 2 đến 3 tỷ token mỗi ngày trên OpenRouter. Duck.ai định tuyến gpt-oss-120b và Gemma vào enclave của Tinfoil, cung cấp quyền riêng tư có thể xác minh ngoài proxy người dùng. Điều này chưa tính đến tự lưu trữ, rất có thể là kênh lớn nhất cho suy luận riêng tư, vì mô hình chạy trên phần cứng của chính người dùng, không để lại dấu vết sử dụng nào.


Tuy nhiên, trong làn sóng lớn của AI chính thống, AI bảo mật chỉ chiếm một phần rất nhỏ, và khoảng cách này chỉ được thu hẹp khi các phòng thí nghiệm tiên tiến có ý định đáp ứng nhu cầu đó. Vào tháng 5, các sản phẩm của Google đã xử lý 3200 nghìn tỷ token, tính theo đó, lưu lượng truy cập một tháng của Venice chỉ tương đương 18 phút của Google. Tháng 11 năm ngoái, Google ra mắt Private AI Compute (PAC), đưa một số tính năng do Gemini hỗ trợ chạy trong môi trường TPU enclave cách ly với chính công ty, và được thiết kế để kiểm toán độc lập bởi NCC Group. Nhưng vấn đề là, PAC chỉ bao phủ một số tính năng Pixel như đề xuất cá nhân hóa và tóm tắt ghi âm, chứ không bao phủ ứng dụng Gemini mà hàng trăm triệu người đang sử dụng. Google dám giao thiết kế cho bên kiểm toán, vì các tính năng này kiếm tiền từ thiết bị và quảng cáo, chứ không phải bán token.


Các giải pháp lưu trữ hiện tại cũng không hoàn hảo. Người dùng muốn có quyền riêng tư tối đa thông qua E2EE phải chờ các tính năng mới được xây dựng lại ở nơi nhà cung cấp dịch vụ không thể đọc được. Harness riêng tư vẫn phụ thuộc vào giao thức ở lớp dịch vụ. Để có kết quả tinh chỉnh tốt nhất với chi phí hợp lý, vẫn phải tin tưởng vào nhà cung cấp bên thứ ba. Tự lưu trữ có thể loại bỏ tất cả nhà cung cấp dịch vụ, nhưng chạy mô hình nguồn mở mạnh nhất tại chỗ có thể tốn kém hơn cả căn nhà nơi nó được cắm.


Dù có khiếm khuyết, AI riêng tư đã là một lựa chọn thực tế và phải chăng, và những khoảng trống còn lại đang dần thu hẹp. Đối với người tiêu dùng thông thường, trên Lumo và Venice, trò chuyện riêng tư với mô hình mở mà không ghi nhật ký là miễn phí, trong khi gói đăng ký 18 đến 20 đô la của Venice hoặc Tinfoil đưa cuộc trò chuyện tương tự vào enclave, không đắt hơn gói đăng ký ChatGPT. Đối với quy trình làm việc của doanh nghiệp, các điểm cuối có attestation hiện nay thậm chí còn rẻ hơn so với các tuyến đường văn bản rõ. Các điểm cuối như API E2EE của NEAR đã có thể đưa ngữ cảnh được mã hóa vào enclave, bộ nhớ, tải tệp lên và hướng dẫn tùy chỉnh đều có thể hoạt động trên E2EE ngay hôm nay. Về việc tinh chỉnh sau huấn luyện có attestation, Vera Rubin NVL72 sắp ra mắt của NVIDIA sẽ mở rộng tính toán bảo mật từ nút 8 card của Blackwell lên khung 72 card, giúp các vòng lặp RL tiên tiến khả thi hơn mà không làm lộ IP.


Tuy nhiên, việc nắm bắt giá trị quan trọng lại nằm ngoài các lớp nén giá này. Quyền riêng tư gần như miễn phí ở những nơi nó đã tồn tại, nhưng chưa bao phủ các quy trình làm việc agentic chính thống. Các nhà vận hành tập trung vào cho thuê enclave chỉ nắm giữ một công tắc trên chip tiêu chuẩn, không phải là hào phòng thủ, trong khi các cổng giao thức ở lớp giao thức cạnh tranh trực tiếp với phần mềm trung gian truyền thống. Vị trí có thể phòng thủ là nửa chưa được giải quyết trong báo cáo này: vòng lặp huấn luyện bị nhốt trong enclave, lệnh gọi công cụ bị khóa đầu cuối, chỉ mục tìm kiếm không nhìn thấy từ khóa. Ai làm được một trong những điều này trước, sẽ bán thứ mà không cuộc chiến giá nào có thể hàng hóa hóa được. Vốn theo đuổi AI bảo mật nên mua khoảng trống, không phải công tắc.


Vậy, tin tưởng hay xác minh? Đối với các tác vụ yêu cầu thực thi lại và tác nhân, hãy chọn tin tưởng, bởi vì mỗi lần gọi công cụ vốn dĩ đã gửi văn bản rõ đến đích mà enclave không thể bảo vệ, và các mô hình tiên tiến trong vòng lặp này xứng đáng với mức giá của chúng. Còn đối với những suy nghĩ cấp cao giúp phân biệt một công ty với đối thủ, hãy chọn xác minh. Chiến lược, hoạch định và những phán đoán được chắt lọc từ nhiều năm kinh nghiệm chuyên môn, chính là alpha đang gây tranh cãi. Con đường phía trước là tinh chỉnh các mô hình nguồn mở bằng những hiểu biết độc quyền này trong ranh giới tự kiểm soát của công ty. Trong lĩnh vực mà alpha của một công ty tồn tại, các mô hình mở do chuyên gia điều chỉnh đã đánh bại các mô hình tiên tiến cả về độ chính xác lẫn chi phí, và cơ sở hạ tầng để xây dựng chúng trong môi trường bảo mật đang dần xuất hiện từng nút một.


Liên kết gốc


Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:

Nhóm Telegram đăng ký: https://t.me/theblockbeats

Nhóm Telegram thảo luận: https://t.me/BlockBeats_App

Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia

Chọn thư viện
Thêm mới thư viện
Hủy
Hoàn thành
Thêm mới thư viện
Chỉ mình tôi có thể nhìn thấy
Công khai
Lưu
Báo lỗi/Báo cáo
Gửi