Yapay zeka teknolojilerindeki baş döndürücü hız, bağımsız değerlendirme platformu Artificial Analysis'in verilerine de yansıdı. Platform, v5 güncellemesine hazırlık sürecinde v4.1.1, v4.2 ve v4.3 sürümlerini kısa aralıklarla yayımlayarak sektördeki dengelerin ne kadar hızlı değişebileceğini kanıtladı.
Zirve yarışında puanlar eşitlendi
Güncelleme serisinin başında Anthropic'in Claude Fable 5.1 modeli 66 puanla OpenAI'ın GPT-6 Astra modelinin önünde yer alıyordu. Ancak platformun değerlendirme kriterlerini güncellemesi ve GPQA Diamond testini devre dışı bırakmasıyla tablo hızla değişti. v4.2 sürümünde fark kapanırken, v4.3 sürümünde Terminal-Bench ve AutomationBench-AA testlerinin sisteme dahil edilmesiyle her iki model de 53 puanda buluşarak zirveyi paylaştı.
Maliyet ve performans dengesi
İki modelin aynı puana sahip olması, kullanıcılar için farklı avantajları beraberinde getiriyor. Maliyet analizlerine göre GPT-6 Astra, görev başına 3,26 dolarlık maliyetiyle 7,63 dolarlık maliyete sahip Claude Fable 5.1'e kıyasla yüzde 57 daha ekonomik bir seçenek sunuyor. Astra'nın daha az çıktı çipi kullanması bu farkın temel sebebi olarak gösteriliyor. Uzmanlar, Fable 5.1'in bilimsel hesaplamalarda, Astra'nın ise otomasyon ve terminal tabanlı işlerde daha yetenekli olduğunu belirtiyor.
Ezber bozacak gizli testler
Yapay zeka modellerinin eğitim verilerini ezberlemesini engellemek isteyen Artificial Analysis, gizli test setlerinin oranını v4.1'de yüzde 20 seviyesinden v4.3'te yüzde 45'e çıkardı. Bu strateji, modellerin gerçek dünya performansını daha objektif ölçmeyi hedefliyor. Güncel sıralamada Astra ve Fable 5.1'i 51 puanla Claude Opus 5 takip ederken, açık kaynaklı modeller arasında GLM-5.3 Flash 42 puanla dikkat çekiyor.