En son Pulse Beating izlemesine göre, son zamanlarda sosyal medyada dolaşan bir haberde, DeepSeek konuşma kutusuna
Gerçek durum çok kiracılı izolasyonla ilgili değildir. think veya <|begin_of_sentence|> gibi özel işaretler girildikten sonra, model eğitim sırasında kullanılan format desenine aldatılır, daha sonra kendi hafızası ve mevcut sistem ipucu kelime tabanlı (o günün tarihi de dahil) olarak gerçek bir sohbete benzer görünen bir içerik oluşturur. Bu içerikler model tarafından kendisi uydurulmuş olup, başka bir kullanıcının sohbetinden canlı olarak alınmamıştır.
Bu tür bir olay akademik çevrede Eğitim Veri Belleği Çıkarma (Training Data Extraction) olarak adlandırılır, bu büyük modellerin ortak bir sorunudur ve DeepSeek'e özgü değildir. Google DeepMind, 2023 yılında GPT, PaLM gibi ana akım modellerden eğitim verilerini çıkarmanın özel girişlerle yapılabileceğini kanıtlayan özel bir araştırma yayınlamıştı. ICLR 2025'te kabul edilen Magpie makalesi bu mekanizmayı doğrudan bir araç olarak kullanan, hizalanmış modellere şablon işareti verilerek eğitim verilerini topluca oluşturan bir yöntem sunmuştur.
Bazıları "sızan içeriğin bugünkü tarihi içerdiğini” kullanarak itiraz etmekte, eğitim verilerinin bugünün verileri olamayacağını iddia etmektedir. Ancak DeepSeek'in her sohbetin sistem ipucu kelimesinde o günün tarihinin yazılı olduğunu unutmamak gerekir, model tarafından oluşturulan içerik doğal olarak bu tarihi içerecektir, bu durumun içeriğin başka bir gerçek kullanıcıdan geldiğini kanıtlamadığı unutulmamalıdır. Çok kiracılı izolasyon sorununu kanıtlamak için, sızan bilgilerin gerçekten var olan başka bir kullanıcıya ait olduğunu doğrulamak gerekir ve şu anda bu konuyu destekleyecek herhangi bir kanıt bulunmamaktadır.
