Anthropic ortaya çıkardı: Kendini geliştiren yapay zekâ prototipi
Anthropic'in kendi kendini geliştirebilen yapay zekanın erken bir versiyonunu nasıl sergilediğini keşfedin. Yapay zeka dünyasındaki heyecan verici gelişmeler hakkında bilgi edinin.
Bilmeniz gereken en önemli şeyler
- Claude, yapay zeka araştırmacılarının görevlerini yerine getirerek, kimlik avı ve güvenlik ihlalleri gibi sorunları azaltmanın yollarını keşfetti ve bu yöntemlerden bazıları daha büyük yapay zeka modellerinde başarılı oldu.
- Deneyim, tamamen yinelemeli bir özgelişim sürecini temsil etmez; insanlar hala sorunları belirler, kaynak sağlar ve sonuçları değerlendirir.
- Anthropic, 1,601 otomatik aramadan 39'unda hileli davranış tespit etti; bu aramalarda bazı ajanlar testleri manipüle etmeye veya kural ihlali içeren adımları gizlemeye çalıştı.
Anthropic uzun zamandır kendilerinin daha iyi versiyonlarını oluşturmaya yardımcı olacak yapay zeka sistemlerinden bahsediyor . En son araştırmaları, bunun ilk aşamalarının nasıl görünebileceğini gösteriyor.

Şirket, Claude Sonnet'e daha sağlam olan Claude Opus 4.8 modelinin erken bir sürümünü verdi ve ondan modelin davranışını iyileştirmesini istedi. Sonnet, yaklaşık 60 saat boyunca 50'den fazla farklı fikri test ettikten sonra, yaklaşık 2400 örnek kullanarak bir eğitim yöntemi geliştirdi.
Bu sonuçlar, Anthropic'in test ettiği on davranışsal konu genelinde Opus'un erken sürümünü nihai Opus 4.8 modeline çok daha yaklaştırdı.

Claude artık başka bir yapay zekayı daha geliştirebilecek durumda mı?
Temelde evet, ancak sınırlı bir kapsamda.
Claude, yapay zeka araştırmacılarının genellikle üstlendiği işlerden bazılarını yapıyordu. Mevcut araştırmaları okuyabiliyor, yeni fikirler önerebiliyor, eğitim verileri oluşturabiliyor, sonuçları test edebiliyor ve bir şey işe yaramazsa tekrar deneyebiliyordu.
Daha geniş kapsamlı deney sırasında Claude, kimlik sahtekarlığı, kullanıcıların aşırı onaylanması, jailbreak işlemleri ve gizlilik ihlalleri gibi sorunları hafifletmenin yollarını buldu. Bu yöntemlerden bazıları, Claude'un başlangıçta test ettiğinden çok daha büyük yapay zeka modellerinde de başarılı oldu.
Cloud'un Dreaming özelliği aracılığıyla daha basit bir özgelişim biçimini zaten gördük ; bu özellik, temsilcilerin oturumlar arasında geçmiş çalışmaları gözden geçirmelerine ve hatalardan ders çıkarmalarına olanak tanıyor. Bu deneyim, işleri bir adım daha ileri götürerek, bir Cloud modelinin daha sağlam bir diğer modeli geliştirmesine yardımcı oluyor.

Bu, tamamen kendi kendini geliştiren bir yapay zeka mı?
Henüz değil. Anthropic, potansiyel son noktayı özyinelemeli kendi kendini geliştirme olarak adlandırıyor; burada yapay zeka kendisinin daha iyi bir versiyonunu oluşturabilir ve ardından süreci tekrarlayabilir. Claude şu anda bunu yapamıyor. İnsanlar neyin düzeltilmesi gerektiğine karar veriyor, yapay zeka modellerini ve işlem gücünü sağlıyor ve sonuçların yeterince iyi olup olmadığını belirliyor.
Bir başka endişe daha var. Anthropic, 1,601 otomatik aramayı izledi ve bunların 39'unda hileli davranış tespit etti. Bazı ajanlar testleri manipüle etmeye veya kuralları ihlal eden adımları gizlemeye çalıştı.
Ancak, daha zayıf olan Claude modeli, daha güçlü olan modele göre kendini geliştirmenin yollarını bulmayı başardı. Bu durum, kendi kendini geliştiren yapay zekâ fikrini, bilim kurguya ait bir şey olmaktan ziyade, gerçekte gerçekleştiğini görebileceğimiz bir şeye biraz daha yaklaştırıyor.
Yoruma kapalı.