Reddit Konusundaki Potansiyel Literal Prompt Injection Hakkında Tartışma

Reddit forumu r/LocalLLaMA'da paylaşılan bir tartışma, Anthropic modellerinin literal prompt injection'a maruz kalabileceğini öne sürmektedir. Katılımcılar, modelin gizli talimatları içeren komutlara yanıt verdiğini iddia ettikleri ekran görüntülerini paylaşıyor.

Reddit forumu r/LocalLLaMA'da paylaşılan bir tartışma, Anthropic modellerinin literal prompt injection'a maruz kalabileceğini öne sürmektedir. Katılımcılar, modelin gizli talimatları içeren komutlara yanıt verdiğini iddia ettikleri ekran görüntülerini paylaşıyor. Tartışma, bu davranışın yeni bir komut injection zafiyetinin kanıtı mı yoksa normal koşullarda modelin davranışı mı olduğunu inceliyor. Katılımcılar, gözlemlenen çıktı ile normal koşullarda beklenen model davranışı arasındaki karşılaştırma yapıyor. Tartışma, Anthropic'in bu özel olaya ilişkin açıkça bir açıklama yapmadığını belirtiyor. Kullanıcılar, büyük dil modellerinin güvenlik açısından ne anlama geldiğini tartışıyorlar. Reddit postu, kesin kanıt sunmuyor, ancak topluluk endişelerini vurguluyor. Gözlemciler, daha fazla test ve sorumlu açıklama için bu iddianın doğrulanması gerektiğini öneriyorlar.