İçeriğe atla
SON HABERLER Faav, Microsoft Titan’a yönetici erişimi sağladığını anlattı heworxBLOG
Yazılım
ReviewBench, yapay zekâ kod incelemesi için yayımlandı

Yazılım

ReviewBench, yapay zekâ kod incelemesi için yayımlandı

ReviewBench adlı yeni bir çevrim dışı performans testi, yapay zekâ kod inceleme sistemlerini değerlendirmek için bugün kullanıma sunuldu. Veri seti 19 programlama dilinde 219 herkese açık çekme isteğinden oluşuyor.

Mert A.ohafalan editörüYayın · 2 dk okuma
XFacebookWhatsAppLinkedIn

GitHub’ın paylaştığı bilgilere göre ReviewBench, GitHub’daki 103,9 milyon gerçek çekme isteğinin dil, depo boyutu ve çekme isteği boyutu dağılımlarına göre modellendi. Veri setindeki 219 çekme isteği, açık kaynak lisanslı 187 herkese açık depodan seçildi.

Dil ve depo boyutu dağılımları GitHub genelindeki dağılımlarla yakından eşleşecek şekilde tasarlandı. Çekme isteği boyutu dağılımında ise çok küçük, tek dosyalı değişikliklerin aşırı temsilini azaltmak için orta ve büyük boyutlu değişikliklere daha fazla ağırlık verildi.

Altın küme üç aşamada kuruldu

ReviewBench’teki her bulgu, önem derecesine ve kategoriye göre etiketlendi. Altın küme (ground truth) bulgularını oluşturmak için üç aşamalı bir süreç izlendi ve aynı temel sorunu işaret eden bulgular anlamsal olarak tekilleştirildi.

Altın küme aday bulguları, gerçek insan inceleyicilerden, yazarın sonraki commit’lerinden çıkarılan sorunlardan, deterministik analiz araçlarından ve farklı model ailelerinden birden fazla ileri seviye büyük dil modelinden toplandı. Bir bulgunun doğru kabul edilmesi için doğru, ilgili ve önemsiz olmayan (non-trivial) olması şartı arandı.

ReviewBench’te her değerlendirmede kullanılan veri seti, hakem ve eşleştirici birlikte sürümleniyor.

6 metrik, sürümlenen hakemle raporlanıyor

ReviewBench, bilinen ve yeni keşfedilen sorunları ölçmek için iki metrik ailesinde toplam 6 metrik raporluyor. “Grounded” metrikleri altın küme etiketlerine dayalı kesinlik, geri çağırım ve F1 skoru verirken, “augmented” metrikleri altın küme ile eşleşmeyen bulguları da değerlendirerek kesinlik, geri çağırım ve F1 skoru üretiyor.

Değerlendirmede büyük dil modeli hakem olarak Claude Sonnet 5 kullanıldı ve değerlendirme rubriği ile rubriği uygulayan hakem (judge) yayımlandı. ReviewBench’te her değerlendirmede kullanılan veri seti sürümü, hakem (judge) ve eşleştirici (matcher) birlikte sürümleniyor.

Web sitesi, liderlik tablosu ve gönderim

ReviewBench’in “research preview” sürümü ReviewBench web sitesi üzerinden erişime açıldı. Sitede tam performans testi incelenebiliyor, kod inceleme ajanları karşılaştırılabiliyor ve kullanıcı kendi ajanını değerlendirip sonuç gönderebiliyor.

ReviewBench veri setinin tamamı da herkese açık olarak yayımlandı. Çekme istekleri, bulgular, etiketler, önem derecesi ve kategori anotasyonları veri setinde yer alıyor. Tam veri setiyle değerlendirilen kod inceleme ajanlarının sonuçları ortak bir liderlik tablosunda yayımlanıyor ve kullanıcı tercihleri değiştikçe liderlik tablosu buna göre yeniden sıralanıyor.

Bu yazı hakkında ifade bırakın

OHA!falan’ı takip edinGünün haberleri, kısa videolar ve özetler her gün sosyal medyada.

Mert A.ohafalan editörü

Sürümleri, araçları ve geliştirici tarafını izler. Neyin bozulduğunu ve neyin kolaylaştığını ayrı ayrı yazar.

İlginizi çekebilir