Kalite raporu: ölçülen sayılarla Sorudaş
Sorudaş’ın kalite ölçümleri 15 Ağustos 2026 tarihinde şunlardır: 70 vakalık altın test setinin hızlı kümesinde 10/10 doğru çözüm, bağımsız hakem modelin puanladığı öğretim kalitesinde 5 üzerinden 4,00 ve yüksek güvenle öğretilen 32 çözümde 0 öğretmen yanlışlaması. Her çözüm 11 bağımsız kontrolden geçer.
Ölçüm tarihi:
Aşağıdaki sayılar Sorudaş ekibinin kendi ölçümleridir; bağımsız üçüncü taraf denetimi değildir. Ölçüm yöntemi ve kaynağı her satırda belirtilmiştir.
- Altın test seti — hızlı küme başarısı
- 10/10
- Altın test setindeki toplam vaka
- 70
- Bir çözüme uygulanabilen bağımsız kontrol
- 11
- Öğretim kalitesi rubriği (5 üzerinden)
- 4,00 / 5
- Yüksek güvenle yanlış çıkan çözüm
- 0 / 32
- Anlatım modu
- 7
- Çekirdek matematik kazanımı
- 42
Kaynak: tools/eval/calistir.mjs hızlı küme koşumu
Kaynak: tools/eval/golden.json vaka sayısı
Kaynak: packages/domain ALL_CHECKS kontrol sözlüğü
Kaynak: pnpm --filter @repo/eval hakem — 8 gerçek anlatım turu, bağımsız hakem model
Kaynak: Öğretmen paneli kalibrasyon sayacı — yüksek güvenli çözümlerde yanlışlama
Kaynak: packages/ai-contracts LEARNING_MODES
Kaynak: learning_objectives tablosu — çekirdek matematik kazanım kataloğu
Nasıl ölçüyoruz?
Altın test seti, cevabı bağımsız olarak doğrulanmış 70 sorudan oluşur ve her koşumda gerçek çözüm zincirinden geçirilir. Öğretim rubriği, anlatımı üreten modelden farklı bir model tarafından altı boyutta (tek adım, hedefli kontrol sorusu, seviye uygunluğu, ton, etkileşim, mod sözleşmesi) puanlanır. Güven kalibrasyonunda yer gerçeği öğretmen düzeltmesidir.
Bu sayıları neden yayımlıyoruz?
Bir eğitim uygulamasının “doğru çözüyorum” demesi ölçüm değildir. Yanlış cevaba yüksek güven vermek, yanlış cevabın kendisinden daha zararlıdır: öğrenci yanlışı sorgulamadan öğrenir. Bu yüzden en kritik metriğimiz doğruluk oranı değil, yüksek güvenle yanlış çıkan çözüm sayısıdır ve onu herkese açık yayımlıyoruz.