GitHub’ın paylaştığı bilgilere göre ReviewBench, GitHub’daki 103,9 milyon gerçek çekme isteğinin dil, depo boyutu ve çekme isteği boyutu dağılımlarına göre modellendi. Veri setindeki 219 çekme isteği, açık kaynak lisanslı 187 herkese açık depodan seçildi.
Dil ve depo boyutu dağılımları GitHub genelindeki dağılımlarla yakından eşleşecek şekilde tasarlandı. Çekme isteği boyutu dağılımında ise çok küçük, tek dosyalı değişikliklerin aşırı temsilini azaltmak için orta ve büyük boyutlu değişikliklere daha fazla ağırlık verildi.
Altın küme üç aşamada kuruldu
ReviewBench’teki her bulgu, önem derecesine ve kategoriye göre etiketlendi. Altın küme (ground truth) bulgularını oluşturmak için üç aşamalı bir süreç izlendi ve aynı temel sorunu işaret eden bulgular anlamsal olarak tekilleştirildi.
Altın küme aday bulguları, gerçek insan inceleyicilerden, yazarın sonraki commit’lerinden çıkarılan sorunlardan, deterministik analiz araçlarından ve farklı model ailelerinden birden fazla ileri seviye büyük dil modelinden toplandı. Bir bulgunun doğru kabul edilmesi için doğru, ilgili ve önemsiz olmayan (non-trivial) olması şartı arandı.
ReviewBench’te her değerlendirmede kullanılan veri seti, hakem ve eşleştirici birlikte sürümleniyor.
6 metrik, sürümlenen hakemle raporlanıyor
ReviewBench, bilinen ve yeni keşfedilen sorunları ölçmek için iki metrik ailesinde toplam 6 metrik raporluyor. “Grounded” metrikleri altın küme etiketlerine dayalı kesinlik, geri çağırım ve F1 skoru verirken, “augmented” metrikleri altın küme ile eşleşmeyen bulguları da değerlendirerek kesinlik, geri çağırım ve F1 skoru üretiyor.
Değerlendirmede büyük dil modeli hakem olarak Claude Sonnet 5 kullanıldı ve değerlendirme rubriği ile rubriği uygulayan hakem (judge) yayımlandı. ReviewBench’te her değerlendirmede kullanılan veri seti sürümü, hakem (judge) ve eşleştirici (matcher) birlikte sürümleniyor.
Web sitesi, liderlik tablosu ve gönderim
ReviewBench’in “research preview” sürümü ReviewBench web sitesi üzerinden erişime açıldı. Sitede tam performans testi incelenebiliyor, kod inceleme ajanları karşılaştırılabiliyor ve kullanıcı kendi ajanını değerlendirip sonuç gönderebiliyor.
ReviewBench veri setinin tamamı da herkese açık olarak yayımlandı. Çekme istekleri, bulgular, etiketler, önem derecesi ve kategori anotasyonları veri setinde yer alıyor. Tam veri setiyle değerlendirilen kod inceleme ajanlarının sonuçları ortak bir liderlik tablosunda yayımlanıyor ve kullanıcı tercihleri değiştikçe liderlik tablosu buna göre yeniden sıralanıyor.
Bu yazı hakkında ifade bırakın
OHA!falan’ı takip edinGünün haberleri, kısa videolar ve özetler her gün sosyal medyada.
Mert A.ohafalan editörü
Sürümleri, araçları ve geliştirici tarafını izler. Neyin bozulduğunu ve neyin kolaylaştığını ayrı ayrı yazar.
İlginizi çekebilir
GitHub, 2026’nın ilk yarısına ilişkin Şeffaflık Merkezi verilerini paylaştı
GitHub, geliştiricilerin çalışmalarını etkileyebilecek politika tekliflerini daha anlaşılır kılmak ve açık kaynak toplu…
Faav, Microsoft Titan’a yönetici erişimi sağladığını anlattı
16 yaşındaki güvenlik araştırmacısı Faav, Microsoft’un dahili Titan analiz hizmetine imzasız bir oturum belirteciyle yö…
Mold 3.0 yayımlandı: bağlayıcı Rust’a taşındı
Yüksek hızlı bağlayıcı Mold’un 3.0 sürümü 5 Ekim 2026’da çıktı. Sürüm, C++ yerine Rust ile yazıldı ve önceki kararlı sü…
Faav, Microsoft Titan’a yönetici erişimi sağladığını anlattıYazılım
Apple Music logosunu yenilemeye hazırlanıyorMüzik
GTA 6'da NPC’ler daha fazla ayrıntı taşıyacakOyun
Marvel Comics uygulaması 16 Kasım’da çıkacakOyun
ReviewBench, yapay zekâ kod incelemesi için yayımlandıYazılım
Akasa Euler MX2: Mini-ITX için fansız kasaTeknoloji


