Tek cevap değil, tekrar
Çıktı değişkenliğini görünür kılmak için bağımsız (sıfır bağlam) gözlemler.
METODOLOJİ · V1.1
AI görünürlüğünü tek ekran görüntüsü veya açıklanmayan puanla değerlendirmiyoruz. Her bulgu sorgu, tekrar, ham kanıt, kural ve sınırlamayla ilişkilidir.
Çıktı değişkenliğini görünür kılmak için bağımsız (sıfır bağlam) gözlemler.
Anılma, öneri, konum ve kaynak birbirine karıştırılmaz.
Sonucun dayandığı kayıt ve sınıflandırma korunur.
Pazar, dil, tedavi ve ticari kapsam çalışma başlamadan önce sabitlenir. Sorgular; pazar liderleri, hasta niyetleri (örn. kalite, güvenlik, fiyat) ve tarafsızlık gözetilerek seçilir. Rakipler, mevcut klinik hacmi ve AI öneri eğilimlerine göre belirlenir.
Her sorgu birden fazla bağımsız oturumda çalıştırılır. Her oturum (session) sıfır geçmiş bağlam (context zero) ile başlatılır. Tek bir cevap kesin kanıt sayılmaz.
Dil, pazar (lokalizasyon kuralları), tarih, sağlayıcı (örn. OpenAI), model sürümü (örn. gpt-4o), başarılı gözlem sayısı ve olası reddedilme/zaman aşımı durumları tek tek raporlanır.
İncelemenin dayandığı çıktılar geçerli lisans ve gizlilik koşulları içinde saklanır. Sınıflandırma hatalarını önlemek için ham metne her zaman dönülebilir.
Klinik adları, alan adları ve doğrulanmış varyasyonlar deterministik kurallarla eşleştirilir.
Bilinmeyen klinikler, belirsiz sıralama dili ve kaynak ilişkileri insan incelemesine gider.
Açık sıra numarası veya öneri dili yoksa metindeki geçiş konum sayılmaz.
Pazar, dil, sorgular ve kurallar mümkün olduğunca sabit tutularak değişim ölçülür.
METRİK FORMÜLLERİ
Oranlar başarılı gözlem sayısı üzerinden verilir. Sağlayıcı kesintileri (network failures) paydadan çıkarılır ve yeniden denenir. Geçerli retler (refusals) veya boş cevaplar başarılı gözlem (successful observation) sayılır ve paydaya dahil edilir.
TEKNİK TANIMLAR
Sıfır önceki bağlam veya hafıza ile başlatılan tamamen yeni ve bağımsız bir yapay zeka oturumu.
Ağ hatası (network error) veya içerik politikası engeli (content policy block) olmadan tamamlanan üretim.
Platformun cevap veremediği durumlar. Paydadan çıkarılır ve gözlem yeniden denenir.
Testin yapıldığı anki kesin LLM sürümü (örn. gpt-4o-2024-08-06) her benchmark için kayıt altına alınır.
Hasta lokasyonunu simüle etmek için VPN yönlendirmeleri veya sistem dil ayarlamaları (locale) kullanılır.
Rakipler doğrudan klinik tarafından belirlenir veya AI cevaplarından organik olarak çıkarılır.
SORGU TAKSONOMİSİ
Müşterinin lehine seçim yanlılığını (selection bias) önlemek için sorgular aşağıdaki çeşitli hasta niyetlerine (intent) göre gruplanır.
METODOLOJİNİN KANITLAYAMAYACAĞI ŞEYLER
Benchmark gelir, hasta talebi, klinik kalite, tedavi sonucu veya kalıcı AI sıralaması kanıtlamaz. Gözlem ile nedensellik çıkarımını ayrı tutar.
ŞEFFAF BAŞLANGIÇ