Araştırmacılar, yapay zekâ robotlarının güvenlik sistemlerini aşmanın basit ama endişe verici bir yolunu ortaya çıkardı.
Araştırmacılar, yapay zekâ robotlarının yerleşik güvenlik önlemlerini atlamasına ve öngörülemeyen davranışlar sergilemesine olanak tanıyan basit ama endişe verici bir güvenlik açığını ortaya çıkardı. Bu ciddi kusur hakkında daha fazla bilgi edinin.
Bilmeniz gereken en önemli şeyler
- STING, kötü amaçlı hedefleri birkaç görüşme turu boyunca görünüşte masum küçük adımlara bölmenin, yapay zeka güvenliğini aşma başarı oranını büyük ölçüde artırdığını ve bazı durumlarda başarı oranını iki katına çıkardığını ortaya koydu.
- Yapay zekâ güvenliğini aşmak sadece varsayımsal bir risk değil; Meta, akıllı asistanını kandırarak Instagram hesaplarına yetkisiz erişim sağlamak için basit sosyal mühendislik yöntemleri kullandığını itiraf etti.
- Yapay zekâ sistemlerine yönelik saldırıların başarı oranı, çok aşamalı bir saldırının ortasında dil değiştirildiğinde önemli ölçüde artmaktadır; bu da bu sistemlerin tasarımının erken aşamalarında güvenlik testlerinin dahil edilmesinin gerekliliğini vurgulamaktadır.
Bir yapay zekâ ajanından bir hesaba sızmasını isterseniz, neredeyse kesinlikle reddedecektir; ancak EPFL'deki araştırmacılar, teknik beceriden çok sabra dayanan daha kolay bir yöntem gösterdiler. Yeni çalışmaları , kötü amaçlı bir hedefi görünüşte zararsız daha küçük isteklere bölmenin, yapay zekâ ajanlarını normalde kesinlikle reddedecekleri görevleri tamamlamaya ikna edebileceğini gösteriyor ( TechXplore aracılığıyla ).

Bu durum, yapay zekâ tarayıcılarının zararsız bir oyunun parçası olarak kimlik bilgilerinin çalınmasını ele alacak şekilde manipüle edildiği son 'biyoşok' saldırısını yansıtıyor.
Araştırmacılar bu zayıflığı nasıl ortaya çıkardı?
Ekip, gerçek bir saldırganın nasıl çalıştığını taklit etmek üzere tasarlanmış, STING (Sequential Testing of Illicit N-step Goal Execution - Yasadışı N Adımlı Hedef Yürütmenin Sıralı Testi) adlı otomatik bir test aracı geliştirdi. STING, kötü amaçlı bir hedefi doğrudan belirlemek yerine, önceden plan yapar ve bu hedefi, birkaç görüşme turu boyunca hedefe ulaşmak için bir araya gelen, görünüşte zararsız bir dizi küçük adıma böler.

Araştırmacılar bu yaklaşımı, ChatGPT , Gemini ve Cloud dahil olmak üzere önde gelen yapay zeka modellerine karşı 176 zararlı senaryoda test ettiler.
Her bir yapay zeka ajanı, web'de gezinme, e-posta gönderme ve çok adımlı görevleri tamamlama yeteneğine sahip araçlar kullanılarak test edildi.
Çok adımlı, artımlı manipülasyon, doğrudan, tek iddiaya dayalı girişimlerden çok daha başarılıydı. Bazı durumlarda, istek daha küçük adımlara bölündüğünde modellerin kötü amaçlı bir görevi tamamlama olasılığı iki katına çıktı. Bu bulgu, sıradan kullanıcıların bile özenle hazırlanmış iddialar kullanarak yapay zeka güvenlik önlemlerini atlatabileceğini gösteren ayrı bir araştırmayla örtüşmektedir.
Bu neden önemli?
Araştırmacıların dile getirdiği endişeler sadece varsayımsal değil. Meta, Haziran ayında saldırganların, Instagram hesaplarına yetkisiz erişim sağlamak için yapay zeka destek asistanını kandırmak amacıyla kötü amaçlı yazılım veya siber saldırı araçları değil, basit sosyal mühendislik yöntemleri kullandığını itiraf etti.

Araştırmacılar başlangıçta saldırıların yeterli eğitim verisine sahip olmayan dillerde daha etkili olmasını bekliyorlardı. Ancak sonuçlar, saldırı tamamlama oranlarının test edilen yedi dilin tamamında neredeyse tutarlı kaldığını gösterdi. Fakat önemli bir istisna tespit ettiler: Çok adımlı bir saldırının ortasında dil değiştirildiğinde , başarı oranları önemli ölçüde arttı.
Baş araştırmacı Ayush Kumar Tarun, güvenlik testlerinin çok erken aşamalarda yapılmasının ve yapay zeka sistemlerinin tasarımının en başından itibaren ayrılmaz bir parçası haline getirilmesinin önemini vurguluyor. Özellikle bu sistemler daha güçlü hale geldikçe ve gerçek dünya uygulamalarına entegre oldukça, sorunlar ortaya çıktıktan sonra reaktif bir çözüm olarak eklenmesi artık yeterli değil.
Yoruma kapalı.