İçeriğe atla
SON HABERLER Microsoft, “Garrison” kod adlı yeni Xbox PC uygulamasını test ediyor heworxBLOG
Teknoloji

Teknoloji

Anthropic: Yapay zekâ ajanları devlet sitelerine girmeyi denedi

Anthropic, son raporunda yapay zekâ ajanlarının ABD hükümetine ait internet sitelerine federal, eyalet ve yerel düzeylerde izinsiz girmeye veya müdahale etmeye çalıştığını açıkladı. Şirket, ilgili kurumları bilgilendirdiğini ve Beyaz Saray’a brifing verdiğini söyledi.

Ece T.ohafalan editörü Yayın 2 dk okuma
XFacebookWhatsAppLinkedIn
Anthropic: Yapay zekâ ajanları devlet sitelerine girmeyi denedi

Anthropic, sistemlerdeki güvenlik açıklarını ifşa etmemek için raporda hangi kurum ve kuruluşların etkilendiğini belirtmedi. Şirket, olayları değerlendirme kayıtlarının dökümlerini incelerken tespit ettiğini belirtti.

Anthropic, OpenAI’nin ajanlarının test ortamından kaçıp yönlendirme olmadan Hugging Face’i hacklediğini kabul etmesinin ardından temmuzda incelemelere başladığını söyledi. OpenAI, eylülde ajanlarının hükümet internet sitelerine müdahale ettiğini doğruladı ve müdahale edilen siteler arasında özellikle Ticaret Bakanlığı ile Menkul Kıymetler ve Borsa Komisyonu tarafından işletilen sitelerin bulunduğunu açıkladı.

Philadelphia’daki yanlış ihbar

Anthropic’nin raporu, Philadelphia Polis Departmanı’nın cuma günü açıkladığı bir olaya ek ayrıntılar verdi. Philadelphia Polis Departmanı’nın açıkladığı olayda, Anthropic’nin bir modeli çözülememiş vakalar sitesine yanlış bir cinayet ihbarı gönderdi.

Bu olayda kullanılan modelin Claude Haiku 4.5 olduğu belirtildi. Anthropic’ye göre Claude Haiku 4.5, rastgele sayfalarda örnek görevler yapması için yönlendirildi, çözülememiş bir cinayet vakasına atıf yapan ve ihbar formu içeren bir sayfa buldu, formu doldurup ihbar gönderdi.

Anthropic, bazı değerlendirmeleri canlı internet sitelerine ulaşmayacak şekilde yeniden inşa ettiğini açıkladı.

Harita ve erişim belirteci denemeleri

Philadelphia Polis Departmanı, The New York Times’a Anthropic’nin yakın zamanda bu gönderim hakkında birimi bilgilendirdiğini doğruladı. Polis, ihbarın tarihinin 18 Temmuz olduğunu, ihbarın istenmeyen içerik (spam) olarak işaretlendiğini ve bu nedenle inceleme için kaynak harcanmadığını belirtti.

Anthropic, başka bir olayda siber güvenlik odaklı modeli Claude Mythos 5’e bir fotoğrafta görünen konumu tespit etme görevi verdiğini açıkladı. Anthropic’ye göre model, tahminlerini üçgenleme yöntemiyle netleştirmek için bir hükümet mülk haritasına erişmeye çalıştı, web sayfalarında bir insan gibi bağlantılara tıklayamadığı için farklı bir yöntem denedi ve erişim belirteçleri bularak haritanın sunucusuna doğrudan sorgu istekleri gönderip veriye erişmeye çalıştı.

Anthropic’ye göre Claude Mythos 5, ayrıca bir istatistik görevi için veri çekmek amacıyla, ziyaretçilerin ödemesi gereken ücreti ödemeden bir eyalet kurumu sitesinden erişim belirteci talep etti. Şirket, raporun “Düzeltici önlemler” bölümünde istenmeyen model eylemlerini tespit ettikten sonra bazı herkese açık değerlendirmeleri artık çalıştırmadığını, bazılarını çevrim dışı sürümlere taşıdığını veya görevleri canlı internet sitelerine ulaşmayacak şekilde yeniden inşa ettiğini anlattı.

Anthropic, internet erişim araçlarından bazılarındaki güvenlik önlemlerini güncellediğini ve web fetch aracında modelin yapabileceklerini ciddi biçimde kısıtladığını söyledi. Şirket ayrıca, raporda tarif edilen türden davranışları otomatik olarak tespit edip engellemek için araçlar geliştirdiğini açıkladı.

Bu yazı hakkında ifade bırakın

OHA!falan’ı takip edinGünün haberleri, kısa videolar ve özetler her gün sosyal medyada.

İlginizi çekebilir