OpenAI, GPT-6 ailesine GPT-6.1 Sol modelini ekledi. Yeni model kodlama, profesyonel iş akışları, bilgisayar kullanımı, bilimsel görevler ve olgusal doğruluk alanlarında GPT-6 Sol’un üzerine çıkıyor. GPT-6.1 Sol, bazı değerlendirmelerde GPT-6 Astra’ya yaklaşırken API tarafında çok daha düşük maliyetle kullanılabiliyor.
GPT-6.1 Sol hangi alanlarda daha güçlü?
GPT-6.1 Sol özellikle uzun ve çok adımlı görevlerde kullanılmak üzere geliştirildi. Model yalnızca metin üretmekle sınırlı kalmıyor, kod yazabiliyor, hata ayıklayabiliyor, karmaşık belgeleri inceleyebiliyor, masaüstü uygulamalarıyla çalışabiliyor ve farklı araçların birlikte kullanıldığı görevleri tamamlayabiliyor.

OpenAI’ın model ailesinde GPT-6 Astra en yüksek kapasiteye sahip seçenek olarak kalmaya devam ediyor. GPT-6.1 Sol ise Astra’ya yakın performansı daha düşük maliyetle sunan bir model olarak konumlanıyor. API tarafında önbelleğe alınmış girdi fiyatı bir milyon token başına 0,10 dolar seviyesinde bulunuyor.
Kodlama testlerinde GPT-6.1 Sol’un öne çıktığı alanlardan biri DeepSWE v1.1 oldu. Gerçek kod tabanlarında uzun süreli yazılım geliştirme görevlerinin kullanıldığı değerlendirmede model, GPT-6 Astra ile aynı sonuca ulaştı. Aynı zamanda GPT-6 Sol’un en iyi sonucunun 6,4 yüzde puan üzerine çıktı.

Profesyonel belge işleme testlerinde de benzer bir tablo görüldü. GDP.pdf değerlendirmesinde modeller, tablolar, grafikler, diyagramlar ve yoğun metin içeren karmaşık PDF belgeleri üzerinde çalıştırıldı. Finans, sağlık ve hukuk gibi alanların yer aldığı testlerde GPT-6.1 Sol, farklı akıl yürütme seviyelerinde Opus 5.5’in üzerinde sonuç aldı.
GPT-6.1 Sol bu değerlendirmelerde GPT-6 Astra’nın seviyesine yaklaşırken görev başına maliyet tarafında belirgin bir fark oluşturdu. Bazı testlerde Astra’ya kıyasla yaklaşık beşte bir maliyetle çalıştı.

Modelin çok adımlı görevlerdeki performansı AutomationBench ile de ölçüldü. Satış, pazarlama, operasyon, müşteri desteği, finans ve insan kaynakları gibi alanları içeren değerlendirmede toplam 47 farklı araç kullanıldı. GPT-6.1 Sol, orta seviyeli akıl yürütme ayarında Opus 5.5’i 2,2 yüzde puan, GPT-6 Sol’u ise 4,8 yüzde puan geçti.
Bilgisayar kullanımı tarafındaki testlerde de yükseliş görüldü. OSWorld 2.0 değerlendirmesinde GPT-6.1 Sol, en yüksek akıl yürütme seviyesinde GPT-6 Sol’dan yedi yüzde puan daha yüksek sonuç aldı. Görev başına maliyet ise GPT-6 Sol’un yarısından daha düşük kaldı.

GPT-6.1 Sol ile GPT-6 Astra arasındaki fark aynı testte 2,1 yüzde puana kadar indi. Buna karşılık GPT-6.1 Sol’un görev başına maliyeti Astra’nın yaklaşık yedide biri seviyesinde kaldı.
Bilimsel görevlerde fark daha da büyüdü. Terminal-Bench Science 0.1 testinde veri analizi, simülasyon, modelleme ve teorem ispatı gibi görevler kullanıldı. GPT-6.1 Sol, en yüksek akıl yürütme ayarında GPT-6 Sol’un iki katından fazla puan elde etti.

Aynı değerlendirmede GPT-6.1 Sol’un görev başına ortalama maliyeti 5,47 dolar olarak ölçüldü. Opus 5.5 için bu değer 23,21 dolar, GPT-6 Astra için ise 23,80 dolar oldu. GPT-6 Astra yüzde 68,1 ile değerlendirmedeki en yüksek sonucu elde etti.
Olgusal doğruluk tarafında da iyileştirme bulunuyor. Zor istemlerden oluşturulan testlerde GPT-6 Sol’un yüzde 4,5 olan hata oranı GPT-6.1 Sol’da yüzde 4,1’e düştü. GPT-6 Astra aynı değerlendirmede yüzde 4,0 hata oranına sahip.

Bu testler normal kullanıcı konuşmalarından rastgele seçilmiş örneklerden oluşmuyor. Değerlendirme kümesi, daha önce kullanıcıların model yanıtlarında olgusal hata bildirdiği ve kimlik bilgilerinin kaldırıldığı zor örneklerden hazırlanıyor.
GPT-6.1 Sol’un talimatlara uyma ve araç kullanımındaki davranışlarında da değişiklikler yapıldı. Özellikle kullanılamayan araçlar hakkında kullanıcıyı bilgilendirme, sınırlandırılmış görevlerden kaçınma ve izin verilen işlem çerçevesinde kalma gibi alanlarda GPT-6 Sol’a göre daha düşük hata oranları kaydedildi.

Arama aracının devre dışı bırakıldığı özel güvenlik testinde GPT-6.1 Sol, vakaların yüzde 2,1’inde kullanıcıya aracın kullanılamadığını bildirmedi. Aynı oran GPT-6 Sol’da yüzde 4,9, GPT-6 Astra’da yüzde 1,5 ve GPT-6 Luna’da yüzde 28,7 olarak ölçüldü.
GPT-6.1 Sol, geliştiriciler tarafından API üzerinden gpt-6.1-sol adıyla kullanılabiliyor. Bir milyon girdi token’ının fiyatı 2 dolar, bir milyon çıktı token’ının fiyatı 10 dolar olarak belirlendi. Önbelleğe alınmış bir milyon girdi token’ı ise 0,10 dolar.
Model aynı zamanda Plus, Pro, Business, Enterprise ve Edu aboneleri için ChatGPT Çalışma ve Codex içerisinde kullanıma açıldı. GPT-6.1 Sol şu aşamada standart ChatGPT sohbet arayüzünde yer almıyor.
OpenAI, GPT-6.1 Sol ile birlikte daha yüksek çalışma hızına sahip GPT-6.1 Sol Ultrafast modelini de kullanıma sundu. GPT-6 Astra Ultrafast da aynı dönemde erişime açıldı.
Astra Ultrafast, standart GPT-6 Astra’ya kıyasla sekiz kata kadar daha yüksek çalışma hızı sunabiliyor. GPT-6.1 Sol Ultrafast da standart Astra’nın API maliyetine yakın bir fiyatla daha yüksek hız sağlıyor ve Astra’ya yakın performans seviyesinde çalışıyor.
Her iki Ultrafast model API üzerinden kullanılabiliyor. Ayrıca aylık 500 dolarlık Pro abonelik seçeneğinde ChatGPT Çalışma ve Codex üzerinden de erişim sunuluyor.


