Theo theo dõi của Beating Heart, gần đây trên các mạng xã hội lan truyền một tin đồn, cho rằng nhập các thẻ đặc biệt như
Tình hình thực tế không liên quan đến cách ly đa người dùng. Sau khi nhập think hoặc <|begin_of_sentence|> vài thẻ đặc biệt như vậy, mô hình sẽ bị lừa vào mẫu kiểu định dạng trong quá trình huấn luyện, sau đó dựa trên bộ nhớ của mình và từ gợi ý hệ thống hiện tại (bao gồm ngày hôm đó) tạo ra một đoạn nội dung trông giống như cuộc trò chuyện thật. Những nội dung này là mô hình tự tạo ra, không phải được trích xuất từ cuộc trò chuyện của người dùng khác một cách thời gian thực.
Hiện tượng này được gọi là Trích xuất Dữ liệu Huấn luyện (Training Data Extraction) trong giới học thuật, là một vấn đề phổ biến của tất cả các mô hình lớn, không phải chỉ riêng của DeepSeek. Google DeepMind đã công bố nghiên cứu chuyên sâu từ năm 2023, chứng minh rằng bằng cách nhập đầu vào đặc biệt có thể trích xuất dữ liệu huấn luyện từ các mô hình hàng đầu như GPT, PaLM. Bài báo Magpie được ICLR 2025 chấp nhận đã sử dụng trực tiếp cơ chế này như một công cụ, chỉ cần cho mô hình đã được căn chỉnh thức ăn các mã thông báo mẫu thì có thể xào ra dữ liệu huấn luyện hàng loạt.
Có người sử dụng "nội dung rò rỉ bao gồm ngày hôm nay" để bác bỏ, cho rằng dữ liệu huấn luyện không thể là ngày hôm nay. Nhưng từ gợi ý hệ thống của mỗi cuộc trò chuyện của DeepSeek đều ghi lại ngày hôm đó, nội dung được tạo ra bởi mô hình tự nhiên sẽ chứa ngày đó, điều này không chứng minh nội dung đó xuất phát từ một người dùng khác hàng thực. Để chứng minh rằng đó là vấn đề cách ly đa người dùng, cần xác nhận thông tin rò rỉ thực sự thuộc về một người dùng khác tồn tại thực sự, hiện chưa có bằng chứng nào hỗ trợ điều này.
