Pathway’in 150 milyon parametreli BDH-CQ modeli ARC-AGI-1’de yüzde 29,5 başarı sağlarken GPT-5.6 Luna’dan yaklaşık 11 kat düşük maliyetle çalıştı.
150 milyon parametreli BDH-CQ, yapay zekâda maliyet yarışına yeni boyut getirdi
Yapay zekâ şirketi Pathway, ara akıl yürütme adımlarını metne dönüştürmeden hesaplama yapan 150 milyon parametreli BDH-CQ modelinin sonuçlarını açıkladı. Model, ARC-AGI-1 testinde yüzde 29,5 başarıya ulaşırken görev başına hesaplanan 0,00070 dolarlık maliyetiyle GPT-5.6 Luna’nın düşük akıl yürütme ayarından yaklaşık 11 kat daha ucuz çalıştı.

Yapay zekâ modellerinin karmaşık problemleri çözerken kullandığı uzun metinsel akıl yürütme süreçlerine alternatif olabilecek yeni bir mimari geliştirildi. Yapay zekâ şirketi Pathway tarafından geliştirilen BDH-CQ, çözüm sırasında ürettiği ara adımları sözcüklere dönüştürmek yerine işlemleri modelin kendi gizli hesaplama alanında gerçekleştiriyor.
150 milyon parametreye sahip model, aldığı örnekleri işlerken tekrarlayan belleğini güncelliyor ve problemi yüksek boyutlu bir gizli temsil alanında iteratif olarak çözmeye çalışıyor. Geleneksel akıl yürütme modellerinde görülen uzun ara metinlerin aksine BDH-CQ, yalnızca aday nihai cevapları dışarı aktarıyor.
ARC-AGI-1 testinde yüzde 29,5 başarı
Pathway tarafından yayımlanan sonuçlara göre BDH-CQ, soyut akıl yürütme yeteneğini ölçmek amacıyla kullanılan ARC-AGI-1 değerlendirmesinde yüzde 29,5 pass@2 skoruna ulaştı.
ARC-AGI-1 testlerinde modellere birkaç giriş ve çıkış örneği gösteriliyor. Yapay zekâdan bu örneklerin arkasındaki kuralı herhangi bir ek açıklama olmadan keşfetmesi ve aynı kuralı yeni bir probleme uygulaması isteniyor.
BDH-CQ’nun elde ettiği yüzde 29,5’lik sonuç en yüksek genel başarı oranı değil. Karşılaştırmada kullanılan GPT-5.6 Luna’nın düşük akıl yürütme ayarı aynı değerlendirmede yüzde 34,2 skor elde ediyor.
Ancak Pathway’in çalışmasının dikkat çeken tarafını başarı oranından çok bu seviyeye ulaşmak için kullanılan hesaplama maliyeti oluşturuyor.
Görev başına maliyet 0,00070 dolar
BDH-CQ’nun ARC-AGI-1 değerlendirmesindeki hesaplanan çıkarım maliyeti görev başına yalnızca 0,00070 dolar seviyesinde bulunuyor. Bu rakam bir ABD sentinin onda birinden de düşük bir maliyete karşılık geliyor.
Pathway’in yayımladığı karşılaştırmaya göre BDH-CQ, GPT-5.6 Luna’nın düşük akıl yürütme ayarından görev başına yaklaşık 11 kat daha düşük maliyetle çalışıyor.
Bu farkın temelinde modellerin akıl yürütme biçimleri bulunuyor. Günümüzde kullanılan birçok büyük dil modeli, karmaşık görevlerde daha fazla hesaplama yapabilmek için ara tokenlar oluşturuyor. Akıl yürütme zinciri uzadıkça kullanılan işlem gücü, gecikme ve maliyet de artıyor.
BDH-CQ ise ara düşünme sürecini metin haline getirmeden tekrarlayan gizli durum içerisinde gerçekleştirerek token üretimine olan ihtiyacı azaltmayı hedefliyor.
Yalnızca 150 milyon parametre kullanıyor
Modelin dikkat çeken özelliklerinden biri de yalnızca 150 milyon parametre içermesi. Günümüzde kullanılan büyük ölçekli yapay zekâ sistemleriyle karşılaştırıldığında oldukça küçük sayılabilecek BDH-CQ, buna rağmen soyut akıl yürütme testinde kayda değer performans ortaya koydu.
Pathway, BDH mimarisinin farklı ölçeklerde nasıl davrandığını görmek amacıyla 1 milyardan 600 milyar parametreye kadar uzanan ön eğitim deneyleri de gerçekleştirdi.
Şirket, BDH-CQ yaklaşımını daha büyük ölçeklere taşımayı, ARC-AGI-2 gibi daha zor değerlendirmelerde denemeyi ve yöntemi genel dil ile matematiksel akıl yürütme görevlerine uyarlamayı planlıyor.
Siber güvenlik gibi alanlarda kullanılabilir
Pathway’e göre düşük maliyetli ve uzun süreli akıl yürütme yaklaşımı yalnızca yapay zekâ testlerinde değil, gerçek dünya uygulamalarında da kullanılabilir.
Siber saldırıların araştırılması, ulaşım ağlarının koordinasyonu, bilimsel araştırmaların yönetilmesi ve uzun süre çalışan otonom yapay zekâ sistemleri şirketin potansiyel kullanım alanları arasında gösteriliyor.
BDH-CQ’nun mevcut sonuçları daha güçlü genel amaçlı modellerin performansını aşmış değil. Buna karşın çok daha küçük bir modelle benzer seviyelere yaklaşırken hesaplama maliyetini önemli ölçüde düşürmesi, yapay zekâ geliştirmelerinde yalnızca model büyüklüğünün değil mimari verimliliğin de belirleyici olabileceğini gösteriyor.
