Öğrenme yolu 01Ders 6 / 6

Modeli kanıtla seçin

Modelleri temsilî görevler, kabul ölçütleri, maliyet ve ekibinizin işletim kısıtları üzerinden karşılaştırın.

Uygulayıcı10 minİncelendi

Yayımlayan Nasıl yazıyoruz?

Neler öğreneceksiniz?

  • Gerçek görev türlerinden küçük bir değerlendirme kümesi oluşturun.
  • Model kalitesini araçların ve bağlamın etkisinden ayırın.
  • Yeni değerlendirme gerektiren koşulları kaydedin.

Kararı tanımlayın

Model karşılaştırması belirli bir kullanım gerektirir. Küçük bir fonksiyonu iyi açıklayan model, büyük bir kod deposu değişikliğini aynı başarıyla yapamayabilir. Daha düşük maliyetli model rutin dönüşümlerde kalite gereksinimini karşılayabilir. Zor bir araştırma daha güçlü akıl yürütme yeteneği gerektirebilir.

Önce görevi ve kısıtları yazın. İzin verilen verileri, gereken araçları, yanıt süresini ve kabul edilebilir en yüksek maliyeti ekleyin. Bazı kısıtlar zorunludur. Başka bir puan yüksek diye veri işleme kısıtını ortalama içinde yok saymayın.

Temsilî görevler kullanın

Ekibinizin gerçekten yaptığı işlerden küçük bir değerlendirme kümesi oluşturun. Değerlendirme ortamı ilgili veri için onaylı değilse hassas verileri çıkarın. Basit görevleri, zor görevleri ve doğru yanıtın eksik bilgi istemek olduğu görevleri ekleyin.

Kurgusal bir raporlama hizmeti için bilinen tarih kusurunu, küçük bir filtre özelliğini ve yetkilendirme kuralı açıklamasını kullanın. Karşılaştırmayı çalıştırmadan önce beklenen sonucu hazırlayın. Bilinen kusuru reddeden negatif test ekleyin.

Bazı görevleri istem geliştirmeden ayrı tutun. İstemi sürekli her örneğe göre ayarlarsanız son puan genel performansı olduğundan yüksek gösterebilir. Ayrı bir küme, iyileştirilen istemin hazırlıkta kullanılan örneklerin ötesinde çalışıp çalışmadığını ortaya çıkarmaya yardımcı olur.

Karşılaştırmayı adil tutun

Tam model sürümünü, istemi, verilen bağlamı, araçları ve izinleri kaydedin. Eşdeğer başlangıç durumları kullanın. Bir model tüm kod deposunu, diğeri tek dosyayı alırsa sonuç modellerin yanı sıra iş akışlarını da karşılaştırır.

İş akışı karşılaştırmaları yararlı olabilir. Onları doğru adlandırın. Ajan ürünü modelden fazlasını içerir: bağlam seçimi, araçlar, yürütme sınırları ve kurtarma davranışı sonucu etkileyebilir.

Çıktı değişkenliği önemliyse tekrarlı çalıştırmalar kullanın. Yalnızca en iyi sonucu bildirmek yerine başarısız denemeleri de kaydedin. Öznel ölçütlerde yazılı değerlendirme kuralları ve mümkünse birden fazla inceleyici kullanın.

Hızdan önce kaliteyi puanlayın

Önce zorunlu kabul ölçütlerini kontrol edin. Değişiklik gereksinimi karşılıyor mu? Erişim kontrollerini koruyor mu? İlgili testler geçiyor mu? İnceleyici diff’i anlayabiliyor mu?

Sonra kabul edilebilir sonuçlar için çabayı, geçen süreyi ve maliyeti karşılaştırın. Yeniden denemeleri ve insan incelemesini ekleyin. Sürekli düzeltme isteyen ucuz yanıt, görev düzeyinde pahalı olabilir.

Değerlendirme alanıKaydedilecek bilgi
Görev sonucuHangi kabul ölçütlerinin karşılandığı veya karşılanmadığı
Kapsamİstenmeyen değişiklikler veya eksik gereksinimler
İnsan çabasıHazırlık, inceleme ve düzeltme süresi
Yürütme maliyetiYeniden denemeler dâhil model ve araç maliyetleri
KanıtSürüm, girdi, çıktı, kontroller ve inceleyici notları

Açık benchmark’lar adayları belirlemeye yardımcı olabilir. Belirli görev kümeleri ve puanlama yöntemleri kullanırlar. Benchmark puanını ekibinizin verimliliğinin doğrudan ölçümü olarak değerlendirmeyin.

Kararı ve geçerliliğinin sona ereceği koşulları kaydedin

Sonuç dar kapsamlı bir öneri olabilir. Örneğin: ‘Bu modeli, mevcut inceleme gereksinimleriyle bu kod deposuna küçük testler eklemek için kullanın.’ Her görev için tek modele ihtiyacınız yoktur.

Neyin yeni değerlendirme gerektireceğini belirtin. Model sürümü değişikliği, farklı araç yapılandırması, yeni veri kategorisi veya sürekli hata örüntüsü buna örnektir. Seçilen modelin yeteneğini aşan görevler için alternatif tutun.

Değerlendirmenin amacı gerçek bir karardaki belirsizliği azaltmaktır. Desteklediği işten daha fazla çaba harcayan kalıcı bir model yarışından kaçının.

Alıştırmayı yapın

Üç görev türü için değerlendirme formu hazırlayın: bilinen kusur, küçük özellik ve kod deposu açıklaması. Modelleri karşılaştırmadan önce kabul ölçütlerini tanımlayın. Her göreve bir hata durumu ekleyin. Model sürümünü, bağlamı, araç izinlerini, denemeleri, maliyeti ve inceleme çabasını kaydedin.

Çalışma sayfasını indir (Markdown)

Anladığınızı kontrol edin

Model A daha fazla açık benchmark görevini geçiyor. Model B sizin temsilî kod deposu görevlerinizde daha iyi çalışıyor. Kararı hangi sonuç yönlendirmeli?

Kaynaklar ve ek okumalar

Taiga'dan ilgili okumalar