Yapay zeka dünyasında geliştirici platformu Artificial Analysis tarafından yürütülen performans testleri, sektördeki hızlı değişimi gözler önüne serdi. v5 güncellemesi öncesinde hızlandırılmış bir süreçle yayımlanan v4.1.1, v4.2 ve v4.3 sürümleri, yapay zeka modelleri arasındaki liderlik yarışını bir hafta içinde üç kez değiştirdi.
Sürecin başında Fable 5.1 modeli, GPT-6 Astra'nın önünde yer alıyordu. Ancak platformun yeni değerlendirme kriterlerini sisteme dahil etmesi ve test setlerini güncellemesiyle birlikte aradaki puan farkı hızla kapandı. v4.3 sürümüne gelindiğinde, her iki model de 53 puanla zirveyi paylaşarak eşitlendi. Bu durum, modellerin performans kapasitelerinin birbirine yaklaştığını gösterse de maliyet ve uzmanlık alanları açısından belirgin farklılıklar ortaya koydu.
Maliyet ve Uzmanlık Farkları
Yapılan analizler, GPT-6 Astra'nın görev başına 3,26 dolar maliyetle, 7,63 dolar maliyeti olan Fable 5.1'e göre yüzde 57 daha ekonomik olduğunu ortaya koydu. Astra'nın bu maliyet avantajını, değerlendirme sürecinde daha az çıktı çipi kullanmasına borçlu olduğu belirtildi. Uzmanlık alanlarına bakıldığında ise Fable 5.1 modeli bilimsel hesaplamalar ve bilgi odaklı görevlerde üstünlük sağlarken, Astra modeli terminal tabanlı yazılım geliştirme ve iş akışı otomasyonu süreçlerinde daha yüksek başarı gösterdi.
Güvenilirlik İçin Yeni Kriterler
Platform, modellerin test sorularını ezberlemesini engellemek amacıyla gizli test setlerinin ağırlığını artırma stratejisini sürdürüyor. v4.1 sürümünde yüzde 20 olan gizli test oranı, v4.3 itibarıyla yüzde 45 seviyesine yükseltildi. Artificial Analysis yetkilileri, gelecek v5 güncellemesinde bu oranı daha da artırmayı hedeflediklerini açıkladı.
Güncel liderlik tablosunda Astra ve Fable 5.1'i 51 puanla Claude Opus 5 takip ederken, Claude Fable 5 modeli 50 puanla dördüncü sırada yer aldı. Açık kaynaklı modeller arasında ise GLM-5.3 Flash, 42 puanlık performansıyla dikkat çekti.