AGI hayaline darbe
Yapay genel zekâ (AGI) konusunda umutları yeşerten modellerin, aslında insan benzeri düşünme becerilerinden uzak olduğu iddia edildi. Apple araştırmacılarına göre; LRM’ler orta zorluktaki bulmacalarda iyi performans gösterse de, basit problemler karşısında bile tökezliyor. Zor problemler karşısında ise modeller "çözüm sürecini terk ediyor".
Bu durumun, “modellerin düşünüyormuş gibi yapması” şeklinde tanımlandığı ifade edildi.
Hangi modeller test edildi?
Apple’ın analiz ettiği modeller arasında şunlar yer aldı:
OpenAI o1 ve o3
Claude 3.7 Sonnet Thinking
DeepSeek R1
Google Gemini Flash Thinking
Testler ve dikkat çeken sonuçlar
Araştırmada kullanılan mantık testleri arasında Hanoi Kulesi, dama taşlarının dizilmesi ve klasik “tilki-tavuk-buğday” bulmacası yer aldı.
Claude 3.7 Sonnet ve DeepSeek R1 modelleri, Hanoi Kulesi’nde yalnızca beş diskli versiyonda bile hata yapmaya başladı.
Hesaplama gücü artırılsa bile, bu hatalar engellenemedi.
Zorluk arttıkça modeller daha az işlem yapıyor, yani “pes ediyor”.
‘Düşünme’ değil, ‘simülasyon’
Apple’a göre yapay zekâ modelleri, çözüm algoritmaları verildiğinde bile başarılı olamıyor. Bu da, “sadece doğru adımları uygulama” konusunda bile eksik kaldıklarını gösteriyor.
Uzmanlar, bu sonuçların AGI konusunda fazla iyimser beklentilere karşı bir uyarı olduğunu belirtiyor. Gerçek “düşünme” kapasitesinin, yapay zekânın ötesinde olduğu mesajı dikkat çekiyor.

