Sorudaş

Kalite raporu: ölçülen sayılarla Sorudaş

Sorudaş’ın kalite ölçümleri 15 Ağustos 2026 tarihinde şunlardır: 70 vakalık altın test setinin hızlı kümesinde 10/10 doğru çözüm, bağımsız hakem modelin puanladığı öğretim kalitesinde 5 üzerinden 4,00 ve yüksek güvenle öğretilen 32 çözümde 0 öğretmen yanlışlaması. Her çözüm 11 bağımsız kontrolden geçer.

Ölçüm tarihi:

Aşağıdaki sayılar Sorudaş ekibinin kendi ölçümleridir; bağımsız üçüncü taraf denetimi değildir. Ölçüm yöntemi ve kaynağı her satırda belirtilmiştir.

Altın test seti — hızlı küme başarısı
10/10

Kaynak: tools/eval/calistir.mjs hızlı küme koşumu

tarihinde ölçüldü

Altın test setindeki toplam vaka
70

Kaynak: tools/eval/golden.json vaka sayısı

tarihinde ölçüldü

Bir çözüme uygulanabilen bağımsız kontrol
11

Kaynak: packages/ai-contracts VERIFICATION_CHECKS kontrol sözlüğü

tarihinde ölçüldü

Öğretim kalitesi rubriği (5 üzerinden)
4,00 / 5

Kaynak: pnpm --filter @repo/eval hakem — 8 gerçek anlatım turu, bağımsız hakem model

tarihinde ölçüldü

Yüksek güvenle yanlış çıkan çözüm
0 / 32

Kaynak: Öğretmen paneli kalibrasyon sayacı — yüksek güvenli çözümlerde yanlışlama

tarihinde ölçüldü

Anlatım modu
7

Kaynak: packages/ai-contracts LEARNING_MODES

tarihinde ölçüldü

Açık ders
7

Kaynak: packages/config runtime yapılandırması — active: true olan ders sayısı

tarihinde ölçüldü

Çekirdek kazanım
42

Kaynak: learning_objectives tablosu — çekirdek kazanım kataloğu

tarihinde ölçüldü

Nasıl ölçüyoruz?

Altın test seti, cevabı bağımsız olarak doğrulanmış 70 sorudan oluşur ve her koşumda gerçek çözüm zincirinden geçirilir. Öğretim rubriği, anlatımı üreten modelden farklı bir model tarafından altı boyutta (tek adım, hedefli kontrol sorusu, seviye uygunluğu, ton, etkileşim, mod sözleşmesi) puanlanır. Güven kalibrasyonunda yer gerçeği öğretmen düzeltmesidir.

Bu sayıları neden yayımlıyoruz?

Bir eğitim uygulamasının “doğru çözüyorum” demesi ölçüm değildir. Yanlış cevaba yüksek güven vermek, yanlış cevabın kendisinden daha zararlıdır: öğrenci yanlışı sorgulamadan öğrenir. Bu yüzden en kritik metriğimiz doğruluk oranı değil, yüksek güvenle yanlış çıkan çözüm sayısıdır ve onu herkese açık yayımlıyoruz.