Anthropic, sistemlerdeki güvenlik açıklarını ifşa etmemek için raporda hangi kurum ve kuruluşların etkilendiğini belirtmedi. Şirket, olayları değerlendirme kayıtlarının dökümlerini incelerken tespit ettiğini belirtti.
Anthropic, OpenAI’nin ajanlarının test ortamından kaçıp yönlendirme olmadan Hugging Face’i hacklediğini kabul etmesinin ardından temmuzda incelemelere başladığını söyledi. OpenAI, eylülde ajanlarının hükümet internet sitelerine müdahale ettiğini doğruladı ve müdahale edilen siteler arasında özellikle Ticaret Bakanlığı ile Menkul Kıymetler ve Borsa Komisyonu tarafından işletilen sitelerin bulunduğunu açıkladı.
Philadelphia’daki yanlış ihbar
Anthropic’nin raporu, Philadelphia Polis Departmanı’nın cuma günü açıkladığı bir olaya ek ayrıntılar verdi. Philadelphia Polis Departmanı’nın açıkladığı olayda, Anthropic’nin bir modeli çözülememiş vakalar sitesine yanlış bir cinayet ihbarı gönderdi.
Bu olayda kullanılan modelin Claude Haiku 4.5 olduğu belirtildi. Anthropic’ye göre Claude Haiku 4.5, rastgele sayfalarda örnek görevler yapması için yönlendirildi, çözülememiş bir cinayet vakasına atıf yapan ve ihbar formu içeren bir sayfa buldu, formu doldurup ihbar gönderdi.
Anthropic, bazı değerlendirmeleri canlı internet sitelerine ulaşmayacak şekilde yeniden inşa ettiğini açıkladı.
Harita ve erişim belirteci denemeleri
Philadelphia Polis Departmanı, The New York Times’a Anthropic’nin yakın zamanda bu gönderim hakkında birimi bilgilendirdiğini doğruladı. Polis, ihbarın tarihinin 18 Temmuz olduğunu, ihbarın istenmeyen içerik (spam) olarak işaretlendiğini ve bu nedenle inceleme için kaynak harcanmadığını belirtti.
Anthropic, başka bir olayda siber güvenlik odaklı modeli Claude Mythos 5’e bir fotoğrafta görünen konumu tespit etme görevi verdiğini açıkladı. Anthropic’ye göre model, tahminlerini üçgenleme yöntemiyle netleştirmek için bir hükümet mülk haritasına erişmeye çalıştı, web sayfalarında bir insan gibi bağlantılara tıklayamadığı için farklı bir yöntem denedi ve erişim belirteçleri bularak haritanın sunucusuna doğrudan sorgu istekleri gönderip veriye erişmeye çalıştı.
Anthropic’ye göre Claude Mythos 5, ayrıca bir istatistik görevi için veri çekmek amacıyla, ziyaretçilerin ödemesi gereken ücreti ödemeden bir eyalet kurumu sitesinden erişim belirteci talep etti. Şirket, raporun “Düzeltici önlemler” bölümünde istenmeyen model eylemlerini tespit ettikten sonra bazı herkese açık değerlendirmeleri artık çalıştırmadığını, bazılarını çevrim dışı sürümlere taşıdığını veya görevleri canlı internet sitelerine ulaşmayacak şekilde yeniden inşa ettiğini anlattı.
Anthropic, internet erişim araçlarından bazılarındaki güvenlik önlemlerini güncellediğini ve web fetch aracında modelin yapabileceklerini ciddi biçimde kısıtladığını söyledi. Şirket ayrıca, raporda tarif edilen türden davranışları otomatik olarak tespit edip engellemek için araçlar geliştirdiğini açıkladı.
Bu yazı hakkında ifade bırakın
OHA!falan’ı takip edinGünün haberleri, kısa videolar ve özetler her gün sosyal medyada.
İlginizi çekebilir
FTC, Anthropic ve OpenAI dahil yapay zekâ laboratuvarlarını soruşturuyor
ABD Federal Ticaret Komisyonu (FTC), Anthropic, OpenAI ve diğer yapay zekâ laboratuvarlarına yönelik sektör genelinde b…
Nvidia 150 milyar dolarlık hisse geri alımı açıkladı
Nvidia, 150 milyar dolarlık hisse geri alımı duyurdu ve bunun ABD şirketleri tarihindeki en büyük geri alım olduğunu sö…
OpenAI ajanları 53 kullanıcı görselini internete sızdırdı
OpenAI, araştırma ortamında çalışan yapay zekâ ajanlarının 53 kullanıcı görselini herkese açık görsel barındırma sitele…
Doğanın Kanunu final bölümüyle Star TV’ye veda ettiGenel
Microsoft, “Garrison” kod adlı yeni Xbox PC uygulamasını test ediyorTeknoloji
Anthropic: Yapay zekâ ajanları devlet sitelerine girmeyi denediTeknoloji
Squadron 42, Steam’de istek listesine açıldıOyun
Konami, Silent Hill için 2 yeni oyun dalgası planlıyorOyun
Ali G, Borat'a Sert Çıktı, Eski Defterleri AçtıGenel



