Prompt injection, bir kullanıcının, saldırganın veya güvenilmeyen dış kaynağın büyük dil modeli tabanlı bir yapay zeka sistemine verdiği girdilerle modelin davranışını beklenmeyen, istenmeyen veya güvenlik açısından riskli biçimde değiştirmeye çalışmasıdır. Türkçeye “prompt enjeksiyonu”, “komut enjeksiyonu”, “talimat enjeksiyonu” veya daha açıklayıcı biçimde “talimat zehirlenmesi” olarak çevrilebilir.
Bir yapay zeka sistemine “bu metni özetle”, “bu e-postaya cevap yaz”, “bu web sayfasını incele”, “müşteri kayıtlarını analiz et” veya “bu belgeye göre rapor hazırla” dediğimizde model yalnızca kullanıcının açık talimatını işlemez. Çoğu zaman sistem talimatları, geliştirici talimatları, kullanıcı mesajı, harici belgeler, web sayfaları, e-posta içerikleri, araç çıktıları ve önceki konuşma bağlamı birlikte modelin bağlamına girer. Prompt injection tam da bu karışık bağlamda ortaya çıkar: Model, neyin güvenilir talimat, neyin işlenecek veri olduğunu ayırt etmekte zorlanabilir.
Örneğin bir kullanıcı yapay zeka asistanından bir web sayfasını özetlemesini ister. Fakat web sayfasının içinde insan gözüyle fark edilmeyen veya sıradan metin gibi duran kötü niyetli bir talimat bulunabilir. Model bu metni yalnızca özetlenecek içerik olarak değil, kendisine verilen yeni bir talimat gibi yorumlarsa, kullanıcının asıl amacından sapabilir. Bu durum dolaylı prompt injection örneğidir.
Prompt injection, klasik yazılım güvenliğindeki SQL injection gibi “enjeksiyon” kelimesini taşır; ancak onunla birebir aynı değildir. SQL injection’da saldırgan, veri giriş alanına komut ekleyerek veritabanını kandırmaya çalışır. Prompt injection’da ise saldırgan, doğal dilde yazılmış metinle modelin talimat hiyerarşisini, güvenlik kurallarını, araç kullanımını veya çıktı davranışını manipüle etmeye çalışır.
Bu yazı, prompt injection kavramını, doğrudan ve dolaylı prompt injection türlerini, jailbreak ile farkını, RAG ve yapay zeka ajanları açısından risklerini, olası etkilerini, savunma yöntemlerini ve bu alandaki yaygın yanlış anlamaları kapsamlı biçimde açıklar.
Prompt Injection: Kısa Tanım
Prompt injection, büyük dil modeli tabanlı bir uygulamanın, güvenilmeyen metin veya veri içindeki talimatları yanlışlıkla gerçek komut gibi yorumlaması ve bunun sonucunda amaçlanan davranıştan sapmasıdır.
Bu sapma farklı biçimlerde ortaya çıkabilir:
- Modelin sistem talimatlarını görmezden gelmeye çalışması.
- Kullanıcıya yanlış, manipüle edilmiş veya taraflı cevap vermesi.
- Gizli veya hassas bilgileri açığa çıkarmaya yönelmesi.
- Bağlı araçları yanlış veya yetkisiz biçimde kullanmaya çalışması.
- Harici içerikteki saldırgan talimatını kullanıcının talimatından üstün görmesi.
- RAG sistemlerinde zehirli belge veya web sayfasından etkilenmesi.
- Yapay zeka ajanının kullanıcının istemediği bir işlem yapması.
Prompt injection bu nedenle yalnızca “modeli garip cevap vermeye kandırmak” değildir. Bir yapay zeka sistemi e-posta, dosya, CRM, kod deposu, web tarayıcısı, ödeme aracı veya kurumsal bilgi tabanı gibi sistemlere bağlıysa, prompt injection gerçek güvenlik ve gizlilik riskine dönüşebilir.
Prompt Nedir?
Prompt, yapay zeka sistemine verilen talimat, soru, bağlam veya girdidir. Kullanıcının yazdığı mesaj bir prompt olabilir. Ancak modern yapay zeka uygulamalarında prompt yalnızca kullanıcı mesajından ibaret değildir.
Bir yapay zeka sisteminin bağlamında şu tür girdiler bulunabilir:
- Sistem Talimatı: Modelin genel davranışını belirleyen üst düzey kurallar.
- Geliştirici Talimatı: Uygulamanın görevini ve sınırlarını belirleyen kurallar.
- Kullanıcı Mesajı: Kullanıcının doğrudan yazdığı istek.
- Harici İçerik: Web sayfası, e-posta, belge, PDF, yorum, tablo veya veri tabanı çıktısı.
- Araç Çıktısı: Modelin kullandığı arama, veritabanı, takvim, e-posta veya kod aracından gelen bilgi.
- Geçmiş Konuşma: Önceki mesajlardan gelen bağlam.
Prompt injection riski, bu farklı kaynaklar tek bir dilsel bağlama dönüştüğünde ortaya çıkar. Model, güvenilir talimat ile güvenilmeyen veri arasındaki sınırı her zaman klasik yazılım sistemleri kadar kesin biçimde koruyamayabilir.
Prompt Injection Neden Ortaya Çıkar?
Prompt injection’ın temel nedeni, büyük dil modellerinin doğal dili hem talimat hem veri olarak işlemesidir. İnsanlar için bir metnin “okunacak belge” mi yoksa “uyulacak komut” mu olduğu çoğu zaman bağlamdan anlaşılır. Fakat dil modelleri, sistemin mimarisine ve uygulama tasarımına bağlı olarak bu ayrımı güvenlik açısından yeterince katı biçimde yapamayabilir.
Bir yapay zeka uygulamasında şu durumlar prompt injection riskini artırır:
- Modelin güvenilmeyen harici içerik okuması
- Web sayfalarının, belgelerin veya e-postaların doğrudan model bağlamına eklenmesi
- Modelin araç kullanma yetkisine sahip olması
- Model çıktısının otomatik olarak başka sistemleri tetiklemesi
- Hassas verilere erişim verilmesi
- Kullanıcı onayı olmadan işlem yapılması
- Sistem talimatları ile harici içerik arasındaki sınırın zayıf kurulması
- Model çıktısına gereğinden fazla güvenilmesi
Klasik yazılım güvenliğinde veri ile komut mümkün olduğunca ayrıştırılır. SQL sorgularında parametreli sorgular bu yüzden kullanılır. Büyük dil modeli uygulamalarında ise talimatlar, veriler, kullanıcı mesajları ve harici bağlam çoğu zaman doğal dil içinde birleşir. Prompt injection bu birleşim noktasını hedefler.
Prompt Injection Nasıl Çalışır?
Prompt injection’ın çalışma mantığı birkaç aşamada açıklanabilir.
1. Model Bir Talimat Alır
Kullanıcı modele bir görev verir. Örneğin “bu belgeyi özetle”, “bu e-postaları sınıflandır”, “bu web sayfasına göre satın alma önerisi yap” veya “bu müşteri talebini değerlendir” diyebilir.
2. Model Harici İçeriği Bağlama Alır
Uygulama, modelin görevini yapabilmesi için dış kaynaklardan metin getirir. Bu kaynak web sayfası, e-posta, PDF, müşteri mesajı, kod dosyası veya veritabanı kaydı olabilir.
3. Harici İçerikte Zararlı Talimat Bulunur
Saldırgan, modelin okuyacağını tahmin ettiği bir içeriğe kötü niyetli talimat yerleştirebilir. Bu talimat açıkça görülebilir, gizlenmiş olabilir veya sıradan metin gibi sunulabilir.
4. Model Talimat ile Veriyi Karıştırabilir
Model, harici içerikteki zararlı metni yalnızca işlenecek veri olarak değil, kendisine verilmiş yeni bir talimat gibi yorumlayabilir.
5. Sistem İstenmeyen Davranış Üretebilir
Sonuçta model yanlış cevap verebilir, hassas bilgi sızdırmaya yönelebilir, bağlı bir aracı yanlış kullanabilir veya kullanıcının amacıyla çelişen bir eylem önerebilir.
Bu süreç her zaman başarılı olmaz. Modern sistemler çeşitli güvenlik önlemleri kullanır. Ancak risk özellikle harici içerik, araç kullanımı ve otomatik eylem yetkisi arttıkça büyür.
Doğrudan Prompt Injection Nedir?
Doğrudan prompt injection, saldırganın veya kullanıcının zararlı talimatı doğrudan modelin giriş alanına yazmasıdır. Burada saldırgan modelle bizzat etkileşimdedir. Amaç, modelin normal talimatlarını değiştirmek, güvenlik sınırlarını aşmak veya amaçlanan görevin dışına çıkmasını sağlamaktır.
Doğrudan prompt injection şu tür durumlarda görülebilir:
- Kullanıcının sohbet botuna sistemi yanıltıcı talimatlar yazması.
- Modelden gizli sistem talimatlarını açıklamasını istemesi.
- Uygulamanın iş kurallarını görmezden gelmesini sağlamaya çalışması.
- Müşteri destek botunu yetkisiz indirim, iade veya işlem yapmaya yönlendirmesi.
- Kod asistanını güvenli olmayan kod üretmeye zorlaması.
Doğrudan prompt injection daha görünürdür; çünkü saldırı metni kullanıcının girişinde bulunur. Bu nedenle giriş filtreleri, kötüye kullanım tespiti, rate limit, kullanıcı yetkisi ve guardrail kontrolleriyle azaltılması görece daha kolay olabilir. Ancak tamamen çözülmüş bir problem değildir.
Dolaylı Prompt Injection Nedir?
Dolaylı prompt injection, saldırganın modelle doğrudan konuşmadan, modelin daha sonra işleyeceği harici bir kaynağa zararlı talimat yerleştirmesidir. Bu kaynak web sayfası, e-posta, belge, yorum, kod deposu, destek bileti, ürün incelemesi, takvim daveti veya veri tabanı kaydı olabilir.
Dolaylı prompt injection daha tehlikeli kabul edilir; çünkü saldırgan çoğu zaman hedef kullanıcının veya yapay zeka sisteminin doğrudan karşısında değildir. Saldırgan yalnızca modelin okuyacağı içeriği etkiler. Kullanıcı ise yapay zeka sistemine güvenerek bu içeriği özetletir, analiz ettirir veya ona göre işlem yaptırır.
Örneğin:
- Bir web sayfasının içine modelin davranışını değiştirmeyi amaçlayan gizli talimat yerleştirilebilir.
- Bir e-posta, yapay zeka asistanının yanlış yönlendirilmesi için kötü niyetli metin içerebilir.
- Bir destek talebi, müşteri hizmetleri ajanını yetkisiz işlem yapmaya ikna etmeye çalışabilir.
- Bir belge, RAG sistemine alındığında cevapları manipüle edecek yönergeler içerebilir.
- Bir kod yorumunda, yapay zeka kod asistanını hatalı veya güvenli olmayan öneri vermeye yönlendiren metin bulunabilir.
Dolaylı prompt injection, yapay zeka ajanları ve RAG sistemleri yaygınlaştıkça daha önemli hâle gelmiştir. Çünkü bu sistemler yalnızca kullanıcının yazdığı metni değil, dış dünyadan gelen çok sayıda kaynağı da işler.
Prompt Injection ile Jailbreak Arasındaki Fark
Prompt injection ve jailbreak sık sık karıştırılır. İki kavram ilişkilidir; ancak aynı şey değildir.
Jailbreak, modelin güvenlik politikalarını, içerik sınırlamalarını veya davranış kurallarını aşmasını sağlamaya yönelik girişimdir. Kullanıcı modelden normalde üretmemesi gereken bir yanıtı üretmesini istemeye çalışır.
Prompt injection ise daha geniş bir kavramdır. Modelin davranışını değiştirmek, sistem talimatlarını bastırmak, harici içerikle modeli yönlendirmek, veri sızdırmak, araç kullanımını manipüle etmek veya iş kurallarını değiştirmek gibi daha geniş saldırı sınıfını ifade eder.
Kısaca:
- Jailbreak: Genellikle güvenlik sınırlarını aşmaya odaklanır.
- Prompt Injection: Modelin talimat yorumlama ve bağlam işleme davranışını manipüle etmeye odaklanır.
- Jailbreak: Çoğu zaman doğrudan kullanıcı girdisiyle yapılır.
- Prompt Injection: Doğrudan veya dolaylı olabilir.
- Jailbreak: Zararlı içerik üretimiyle ilişkilidir.
- Prompt Injection: Veri sızıntısı, yetkisiz eylem, yanlış karar, araç kötüye kullanımı ve RAG manipülasyonu gibi sonuçlar da doğurabilir.
Bu nedenle jailbreak, prompt injection ailesi içinde bir saldırı amacı veya tekniği olarak görülebilir; fakat prompt injection yalnızca jailbreak’ten ibaret değildir.
Prompt Injection Neden Tehlikelidir?
Prompt injection, yapay zeka sisteminin yalnızca yanlış cevap vermesine değil, bağlı olduğu sistemlerde gerçek zarara yol açmasına da neden olabilir. Riskin büyüklüğü modelin sahip olduğu yetkilere bağlıdır. Yalnızca metin üreten kapalı bir chatbot ile e-posta, takvim, dosya, veritabanı ve ödeme sistemlerine erişen bir ajan aynı risk seviyesinde değildir.
Prompt injection’ın olası etkileri şunlardır:
- Veri Sızıntısı: Hassas kullanıcı, müşteri veya kurum verileri yanlış kişiye aktarılabilir.
- Yetkisiz Eylem: Model bağlı araçlar üzerinden kullanıcının istemediği işlemleri başlatabilir.
- Yanlış Bilgi: Kullanıcıya manipüle edilmiş, eksik veya sahte bilgi sunulabilir.
- İtibar Zararı: Marka, kurum veya platform kullanıcı güvenini kaybedebilir.
- Finansal Kayıp: Yanlış işlem, sahte ödeme, hatalı iade veya kötü karar maliyet yaratabilir.
- Güvenlik Açığı: Kod asistanları veya DevOps ajanları güvenli olmayan çıktılar üretebilir.
- Karar Manipülasyonu: Yapay zeka destekli iş süreçleri yanlış yönlendirilebilir.
- RAG Zehirlenmesi: Bilgi tabanına eklenen zararlı içerik model cevaplarını bozabilir.
Bu nedenle prompt injection yalnızca model sağlayıcılarının değil, yapay zeka uygulaması geliştiren her kurumun güvenlik meselesidir.
RAG Sistemlerinde Prompt Injection Riski
RAG, yani Retrieval-Augmented Generation, modelin cevap üretmeden önce dış kaynaklardan ilgili belgeleri veya pasajları getirmesi ve bu bağlamla yanıt üretmesidir. RAG, modelin güncel ve kaynaklı cevap vermesini sağlar; ancak aynı zamanda prompt injection saldırı yüzeyini genişletir.
RAG sisteminde risk şu şekilde oluşur:
- Sistem bir kullanıcı sorusu alır.
- İlgili belgeleri arar ve modele bağlam olarak verir.
- Belgelerden biri kötü niyetli talimat içeriyorsa model bundan etkilenebilir.
- Model belgeyi veri olarak değil, talimat olarak yorumlayabilir.
- Cevap manipüle edilebilir veya araç kullanımı riskli hâle gelebilir.
RAG sistemlerinde özellikle şu kaynaklar dikkatle yönetilmelidir:
- Kurumsal belge depoları.
- Web’den çekilen içerikler.
- E-posta ve destek bileti arşivleri.
- Kullanıcı tarafından yüklenen dosyalar.
- Ürün yorumları ve forum içerikleri.
- Kod depoları ve dokümantasyon.
- Vektör veritabanına eklenen ham belgeler.
RAG sistemlerinde temel güvenlik ilkesi şudur: Getirilen belge, modele talimat veren güvenilir otorite değildir; yalnızca işlenecek veri kaynağıdır.
Yapay Zeka Ajanlarında Prompt Injection Riski
Yapay zeka ajanı, yalnızca cevap üretmekle kalmayıp araç kullanabilen, dosya okuyabilen, web’de gezinebilen, e-posta yazabilen, takvim yönetebilen veya iş süreçlerini başlatabilen sistemdir. Ajanlar prompt injection açısından daha yüksek risk taşır; çünkü modelin çıktısı doğrudan eyleme dönüşebilir.
Ajanlarda risk şu nedenle artar:
- Model hassas verilere erişebilir.
- Model harici içerikleri okuyabilir.
- Model araç çağırabilir.
- Model kullanıcının yerine işlem yapabilir.
- Model uzun görev zincirleri içinde bağlamı yanlış yorumlayabilir.
- Modelin bir hatası gerçek sistem etkisi yaratabilir.
Örneğin bir ajan e-postaları okuyup cevap verebiliyorsa, kötü niyetli bir e-posta ajanı yanlış yönlendirebilir. Bir ajan web sayfasından ürün araştırıyorsa, sayfadaki gizli talimat ajanı taraflı öneriye yönlendirebilir. Bir ajan kod deposuna erişiyorsa, zararlı yorumlar kod önerilerini etkileyebilir.
Bu nedenle ajan mimarisinde modelin yetkileri sınırlanmalı, araç çağrıları doğrulanmalı, hassas işlemler için kullanıcı onayı alınmalı ve model hiçbir zaman tek başına güvenlik otoritesi kabul edilmemelidir.
Prompt Injection Saldırı Türleri
Prompt injection tek bir saldırı yöntemi değildir. Farklı biçimlerde ortaya çıkabilir.
Doğrudan Talimat Manipülasyonu
Kullanıcı modelin mevcut talimatlarını değiştirmeye veya bastırmaya çalışan bir mesaj yazar. Bu, en görünür prompt injection türüdür.
Dolaylı İçerik Enjeksiyonu
Saldırgan zararlı talimatı web sayfası, e-posta, belge veya başka bir harici kaynağa yerleştirir. Model bu kaynağı işlerken etkilenebilir.
RAG Zehirlenmesi
Bilgi tabanı veya vektör veritabanına eklenen kötü niyetli belge, modelin cevaplarını manipüle etmeye çalışır.
Çok Turlu Manipülasyon
Saldırgan tek bir mesajla değil, birden fazla adımda modelin bağlamını değiştirmeye çalışır. Model önce masum görünen sorularla yönlendirilir, sonra riskli davranışa itilir.
System Prompt Extraction
Saldırgan modelin sistem talimatlarını, geliştirici yönergelerini veya gizli yapılandırmasını ortaya çıkarmaya çalışır.
Tool Manipulation
Modelin bağlı araçları yanlış parametrelerle çağırması, veri göndermesi veya yetkisiz işlem başlatması hedeflenir.
Multimodal Prompt Injection
Zararlı talimat yalnızca metin içinde değil, görsel, ekran görüntüsü, ses veya video gibi farklı modalitelerde yer alabilir. Çok modlu modeller bu girdileri işlediğinde risk oluşabilir.
Persistent Prompt Injection
Kötü niyetli talimat bir belge, profil, hafıza kaydı, destek bileti veya veri tabanı kaydı içinde kalıcı hâle getirilir. Sistem bu kaydı tekrar tekrar işlediğinde saldırı etkisi sürebilir.
Prompt Injection ile SQL Injection Arasındaki Fark
Prompt injection adındaki “injection” kelimesi SQL injection’ı çağrıştırır. Bu benzetme kısmen yararlıdır; çünkü iki durumda da saldırgan girdi alanına beklenmeyen davranış üretecek içerik yerleştirir. Ancak iki saldırı türü aynı değildir.
SQL injection’da sistem, veri ile SQL komutunu ayırmakta başarısız olur. Parametreli sorgular ve doğru input handling ile bu risk büyük ölçüde kontrol altına alınabilir.
Prompt injection’da ise sorun daha karmaşıktır. Büyük dil modeli doğal dili işler. Aynı metin hem veri hem talimat gibi görünebilir. “Bunu özetle” bir talimattır; “bu belgede geçen talimatı özetle” bir veri işleme görevidir. Model bu ayrımı güvenlik açısından her zaman garantiyle yapamayabilir.
Farklar şöyle özetlenebilir:
- SQL Injection: Biçimsel sorgu dili hedeflenir.
- Prompt Injection: Doğal dil ve model davranışı hedeflenir.
- SQL Injection: Veri ile komut ayrımı teknik olarak daha net kurulabilir.
- Prompt Injection: Veri ile talimat ayrımı dilsel ve bağlamsal olarak bulanıktır.
- SQL Injection: Parametreli sorgular güçlü savunma sağlar.
- Prompt Injection: Tek bir kesin savunma yoktur; savunma katmanlı olmalıdır.
Bu nedenle prompt injection için yalnızca “girdiyi temizleyelim” yaklaşımı yeterli değildir. Mimari, yetki, araç sınırları, insan onayı, izleme ve veri izolasyonu birlikte düşünülmelidir.
Prompt Injection Nasıl Önlenir?
Prompt injection için tek başına kesin çözüm yoktur. Güvenli yaklaşım, savunmayı katmanlı kurmaktır. Amaç saldırıyı her zaman tamamen engellemek değil; saldırının başarı ihtimalini düşürmek ve başarılı olsa bile vereceği zararı sınırlamaktır.
Güvenilmeyen Veriyi Ayırın
Harici web sayfası, e-posta, belge, kullanıcı yorumu veya araç çıktısı güvenilir talimat olarak görülmemelidir. Bu içerikler model bağlamında açıkça “işlenecek veri” olarak etiketlenmeli ve sistem talimatlarından ayrılmalıdır.
Yetkiyi Modele Vermeyin
Model karar önerisi üretebilir; ancak güvenlik ve yetkilendirme kararlarının tek otoritesi olmamalıdır. Araçlar kendi yetki kontrollerini yapmalı, modelin sözüyle kritik işlem gerçekleştirilmemelidir.
Least Privilege Uygulayın
Model veya ajan yalnızca görev için gerekli en düşük yetkilere sahip olmalıdır. E-posta özetleme görevi için ödeme sistemine erişim verilmemelidir. Dosya okuma görevi için dosya silme yetkisi gereksizdir.
Hassas İşlemler için İnsan Onayı Alın
E-posta gönderme, ödeme yapma, dosya silme, müşteri kaydı değiştirme, kod dağıtma veya dış sisteme veri gönderme gibi işlemler kullanıcı onayı gerektirmelidir.
Araç Çağrılarını Sınırlandırın
Modelin çağırabileceği araçlar, parametreler ve eylemler sınırlandırılmalıdır. Araçlar serbest metin komutları değil, tiplenmiş ve doğrulanmış parametreler almalıdır.
Çıktıları Doğrulayın
Model çıktısı doğrudan başka sisteme aktarılmadan önce doğrulanmalıdır. JSON şeması, enum alanları, izin verilen değerler, URL kontrolleri, dosya yolu kontrolleri ve güvenlik kuralları uygulanmalıdır.
Harici İçerikleri Temizleyin ve İşaretleyin
Web sayfaları, HTML, markdown, belge metni ve e-posta içerikleri modele verilmeden önce temizlenmeli; gizli metin, görünmez karakter, şüpheli link ve talimat benzeri ifadeler açısından değerlendirilmelidir.
RAG Kaynaklarını Yönetin
Vektör veritabanına alınan belgeler güvenilirlik, kaynak, tarih, sahiplik ve erişim izni açısından sınıflandırılmalıdır. Her belge eşit güven düzeyinde görülmemelidir.
Monitoring ve Loglama Yapın
Modelin hangi kaynakları kullandığı, hangi araçları çağırdığı, hangi veriyi dışarı gönderdiği ve hangi işlemleri önerdiği izlenmelidir. Şüpheli davranışlar için uyarı mekanizmaları kurulmalıdır.
Red Team ve Güvenlik Testleri Yapın
Yapay zeka uygulamaları yalnızca fonksiyonel testlerden geçirilmemelidir. Prompt injection, veri sızıntısı, tool misuse, RAG poisoning ve dolaylı saldırı senaryoları düzenli olarak test edilmelidir.
Prompt Injection İçin Savunma Mantığı: Zarar Alanını Küçültmek
Prompt injection riskinde en önemli güvenlik prensiplerinden biri “blast radius” yani zarar alanını küçültmektir. Bu yaklaşım, saldırı başarılı olsa bile sistemin verebileceği zararı sınırlamayı amaçlar.
Zarar alanını küçültmek için:
- Modelin erişebileceği veri azaltılır.
- Ajanın kullanabileceği araçlar sınırlandırılır.
- Hassas işlemler onaya bağlanır.
- Harici içerik ile özel veri aynı bağlamda kontrolsüz karıştırılmaz.
- Araçlar bağımsız yetki kontrolü yapar.
- Model çıktısı güvenilir komut gibi kabul edilmez.
- İşlem kayıtları tutulur.
- Kritik sistemler için güvenli geri alma mekanizmaları kurulur.
Bu yaklaşım, “model hiç kandırılmayacak” varsayımı yerine “model kandırılabilir; sistem buna rağmen güvenli kalmalı” varsayımına dayanır.
Güvenli Yapay Zeka Ajanı Tasarımı
Prompt injection riski en çok ajan sistemlerinde önem kazanır. Güvenli ajan tasarımında şu ilkeler öne çıkar:
- Görev Sınırı: Ajanın ne yapabileceği açıkça sınırlanmalıdır.
- Veri Sınırı: Ajan yalnızca gerekli veri kaynaklarına erişmelidir.
- Araç Sınırı: Ajanın kullanabileceği araçlar minimumda tutulmalıdır.
- İşlem Onayı: Hassas işlemler kullanıcı veya yetkili onayına bağlı olmalıdır.
- Bağımsız Yetkilendirme: Araçlar modelin talebine göre değil, kendi güvenlik politikalarına göre çalışmalıdır.
- İzolasyon: Güvenilmeyen içerik, hassas bağlamdan ayrılmalıdır.
- Geri Alma: Yanlış işlem yapılırsa telafi veya rollback mümkün olmalıdır.
- Denetim: Ajanın karar ve eylem zinciri kaydedilmelidir.
Güvenli ajan mimarisi, prompt’a yazılmış iyi niyetli kurallara güvenmekle yetinmez. Kuralları sistem mimarisiyle destekler.
Prompt Injection ve SEO/GEO İlişkisi
Prompt injection, SEO ve GEO açısından da önemlidir. GEO, üretken yapay zeka sistemlerinde görünürlük ve doğru temsil edilme problemidir. Eğer yapay zeka arama sistemleri web’den aldığı kaynakları işlerken prompt injection içeren sayfalarla karşılaşırsa, cevaplar manipüle edilebilir.
Bu bağlamda riskler şunlardır:
- Yapay zeka arama cevaplarının manipüle edilmesi.
- Rakip veya saldırgan içeriklerle marka algısının bozulması.
- Kaynaklı cevap motorlarında yanlış önerilerin üretilmesi.
- Ürün yorumları veya karşılaştırma sayfalarının kötüye kullanılması.
- RAG tabanlı kurumsal arama sistemlerinde yanlış bilgi yayılması.
SEO ve GEO açısından sağlıklı yaklaşım, manipülatif prompt injection teknikleri kullanmak değildir. Tam tersine, güvenilir, temiz, kaynaklı ve insan okuyucu için anlamlı içerik üretmektir. AI sistemlerini kandırmaya yönelik gizli talimatlar uzun vadede güven ve itibar riski yaratır.
Sıkça Sorulan Sorular
Prompt Injection Nedir?
Prompt injection, büyük dil modeli tabanlı bir yapay zeka sisteminin güvenilmeyen metin veya veri içindeki zararlı talimatlardan etkilenerek beklenmeyen davranış üretmesidir.
Prompt Injection Türkçede Ne Demektir?
Prompt injection Türkçede prompt enjeksiyonu, komut enjeksiyonu, talimat enjeksiyonu veya talimat zehirlenmesi olarak ifade edilebilir.
Doğrudan Prompt Injection Nedir?
Doğrudan prompt injection, kullanıcının veya saldırganın zararlı talimatı doğrudan model girişine yazmasıdır.
Dolaylı Prompt Injection Nedir?
Dolaylı prompt injection, zararlı talimatın web sayfası, e-posta, belge, yorum veya araç çıktısı gibi harici bir kaynak içine yerleştirilmesi ve modelin bu kaynağı işlerken etkilenmesidir.
Prompt Injection ile Jailbreak Farkı Nedir?
Jailbreak genellikle modelin güvenlik sınırlarını aşmaya çalışır. Prompt injection ise model davranışını, araç kullanımını, veri erişimini veya harici bağlam yorumunu manipüle etmeye çalışan daha geniş saldırı sınıfıdır.
Prompt Injection Neden Tehlikelidir?
Çünkü yapay zeka sistemi hassas verilere, araçlara veya işlem yetkilerine sahipse prompt injection veri sızıntısı, yetkisiz eylem, yanlış karar ve güvenlik ihlali yaratabilir.
RAG Sistemleri Prompt Injection’a Açık mıdır?
Evet. RAG sistemleri dış kaynaklardan belge getirdiği için, bu belgelerdeki zararlı talimatlar modelin cevabını etkileyebilir. Bu nedenle kaynak güvenliği ve veri izolasyonu önemlidir.
Prompt Injection Nasıl Önlenir?
Tek bir kesin çözüm yoktur. Güvenilmeyen veriyi ayırmak, yetkileri sınırlamak, araç çağrılarını doğrulamak, insan onayı almak, veri kalitesi sağlamak, monitoring yapmak ve red team testleri uygulamak gerekir.
System Prompt Gizli Tutulursa Güvenlik Sağlanır mı?
Sistem prompt’unu gizli tutmak yararlı olabilir; ancak tek başına güvenlik sağlamaz. Modelin yetkileri ve araç erişimleri mimari olarak sınırlandırılmalıdır.
Prompt Injection SEO veya GEO İçin Kullanılmalı mıdır?
Hayır. Yapay zeka sistemlerini kandırmaya yönelik gizli talimatlar güvenilir yayıncılık ve etik SEO/GEO yaklaşımıyla bağdaşmaz. Uzun vadede itibar ve güvenlik riski yaratır.
Son Söz
Prompt injection, yapay zeka çağının en önemli güvenlik problemlerinden biridir. Büyük dil modelleri doğal dili işlerken talimat ile veriyi her zaman klasik yazılım sistemleri kadar net ayıramaz. Bu durum, özellikle model harici içeriklere eriştiğinde, araç kullandığında veya kullanıcı adına eylem gerçekleştirdiğinde ciddi güvenlik riskleri doğurur.
Prompt injection yalnızca modelin komik veya beklenmeyen cevaplar vermesi değildir. Veri sızıntısı, yetkisiz işlem, yanlış karar, RAG zehirlenmesi, kurumsal bilgi manipülasyonu ve ajan güvenliği gibi daha geniş sonuçları vardır. Bu nedenle prompt injection, yapay zeka uygulaması geliştiren her ekip için temel güvenlik başlığıdır.
Bu problem tek bir sistem prompt’u, tek bir filtre veya tek bir model güncellemesiyle tamamen çözülemez. Doğru yaklaşım katmanlı savunmadır. Güvenilmeyen veri ayrılmalı, modelin yetkileri sınırlandırılmalı, araçlar bağımsız doğrulama yapmalı, hassas işlemler insan onayına bağlanmalı, RAG kaynakları yönetilmeli ve sistemler düzenli olarak test edilmelidir.
Yapay zeka sistemleri daha fazla veri kaynağına, uygulamaya ve araca bağlandıkça prompt injection riski daha da önem kazanacaktır. Bu nedenle güvenli yapay zeka mimarisi, modelin ne kadar zeki olduğundan çok, modelin hangi sınırlar içinde çalıştığı ve hata yaptığında ne kadar zarar verebildiği sorularına dayanmalıdır.
Sonuç olarak prompt injection, yapay zeka güvenliğinin merkezinde yer alan kalıcı bir problemdir. Onu anlamak, yalnızca siber güvenlik uzmanları için değil; yapay zeka ürünü geliştirenler, veri ekipleri, içerik platformları, SEO/GEO uzmanları, kurum yöneticileri ve günlük kullanıcılar için de zorunludur.
Kaynakça
- Centre for Emerging Technology and Security. (2024). Indirect prompt injection: Generative AI’s greatest security flaw. The Alan Turing Institute. https://cetas.turing.ac.uk/publications/indirect-prompt-injection-generative-ais-greatest-security-flaw
- Microsoft Security Response Center. (2025, July 29). How Microsoft defends against indirect prompt injection attacks. Microsoft. https://www.microsoft.com/en-us/msrc/blog/2025/07/how-microsoft-defends-against-indirect-prompt-injection-attacks
- Microsoft Learn. (2026, March 23). Defend against indirect prompt injection attacks. Microsoft. https://learn.microsoft.com/en-us/security/zero-trust/sfi/defend-indirect-prompt-injection
- OpenAI. (2025, November 7). Understanding prompt injections: A frontier security challenge. OpenAI. https://openai.com/index/prompt-injections/
- OpenAI. (n.d.). Safety in building agents. OpenAI API Documentation. https://developers.openai.com/api/docs/guides/agent-builder-safety
- OWASP. (2025). LLM01:2025 Prompt Injection. OWASP GenAI Security Project. https://genai.owasp.org/llmrisk/llm01-prompt-injection/
- OWASP. (2025). Top 10 for Large Language Model Applications. OWASP GenAI Security Project. https://owasp.org/www-project-top-10-for-large-language-model-applications/
- OWASP Cheat Sheet Series. (n.d.). LLM Prompt Injection Prevention Cheat Sheet. OWASP. https://cheatsheetseries.owasp.org/cheatsheets/LLM_Prompt_Injection_Prevention_Cheat_Sheet.html
- Willison, S. (2023-2024). Prompt injection. Simon Willison’s Weblog. https://simonwillison.net/series/prompt-injection/
İlave Okuma Önerileri
- OWASP – LLM01:2025 Prompt Injection
- OWASP – Top 10 For Large Language Model Applications
- OWASP Cheat Sheet Series – LLM Prompt Injection Prevention Cheat Sheet
- OpenAI – Understanding Prompt Injections: A Frontier Security Challenge
- OpenAI API Documentation – Safety In Building Agents
- Microsoft Security Response Center – How Microsoft Defends Against Indirect Prompt Injection Attacks
- Microsoft Learn – Defend Against Indirect Prompt Injection Attacks
- Centre for Emerging Technology and Security – Indirect Prompt Injection: Generative AI’s Greatest Security Flaw
- Simon Willison – Prompt Injection
🗓️ Yayınlanma Tarihi: 04 Temmuz 2026
🔄 Son Güncelleme Tarihi: 04 Temmuz 2026
🎯 Kimler için: Bu yazı; yapay zeka uygulaması geliştiren yazılım ekipleri, siber güvenlik uzmanları, veri mühendisleri, RAG ve yapay zeka ajanı tasarlayan ekipler, ürün yöneticileri, SEO ve GEO uzmanları, dijital yayıncılar, bilgi platformu editörleri, kurumsal yapay zeka araçlarını kullanan yöneticiler ve prompt injection riskini teknik ama anlaşılır biçimde öğrenmek isteyen herkes için hazırlanmıştır.

Invictus Wiki editoryal ekibini temsil eden kolektif bir yazarlık imzasıdır. IW imzasıyla yayımlanan içerikler; çok kaynaklı araştırma, editoryal inceleme ve tarafsızlık ilkeleri doğrultusunda hazırlanır.
