enflasyonemeklilikötvdövizakpchpmhp
DOLAR
48,0562
EURO
56,2410
ALTIN
7.010,52
BIST
14.396,54
Adana Adıyaman Afyon Ağrı Aksaray Amasya Ankara Antalya Ardahan Artvin Aydın Balıkesir Bartın Batman Bayburt Bilecik Bingöl Bitlis Bolu Burdur Bursa Çanakkale Çankırı Çorum Denizli Diyarbakır Düzce Edirne Elazığ Erzincan Erzurum Eskişehir Gaziantep Giresun Gümüşhane Hakkari Hatay Iğdır Isparta İstanbul İzmir K.Maraş Karabük Karaman Kars Kastamonu Kayseri Kırıkkale Kırklareli Kırşehir Kilis Kocaeli Konya Kütahya Malatya Manisa Mardin Mersin Muğla Muş Nevşehir Niğde Ordu Osmaniye Rize Sakarya Samsun Siirt Sinop Sivas Şanlıurfa Şırnak Tekirdağ Tokat Trabzon Tunceli Uşak Van Yalova Yozgat Zonguldak
İstanbul
Parçalı Bulutlu
29°C
İstanbul
29°C
Parçalı Bulutlu
Cumartesi Az Bulutlu
30°C
Pazar Az Bulutlu
30°C
Pazartesi Parçalı Bulutlu
31°C
Salı Parçalı Bulutlu
30°C

Saat okumak, yapay zeka için neden bir kabusa dönüştü?

Görsel zekalarıyla övülen yapay zeka modelleri, nasıl oluyor da sıradan bir analog saati okuma vazifesinde sınıfta kalıyor? İşte farklı bir araştırma ve şaşırtan sonuçları.

Saat okumak, yapay zeka için neden bir kabusa dönüştü?
19.03.2025 17:40
17
A+
A-

Yapay zeka, son yıllarda inanılmaz yetenekler sergileyerek kıssa yazmaktan protein yapılarını tahmin etmeye, gerçekçi görseller yaratmaktan ev ödevlerini çözmeye kadar geniş bir yelpazede kullanılmaya başlandı. Fakat, her şey göründüğü kadar kusursuz değil. Yeni bir araştırma, AI’nin birtakım kolay vazifelerde – analog bir saat okuma gibi – neredeyse komik denebilecek ölçüde zorlandığını ortaya koydu.

Edinburgh Üniversitesi’nden bir grup araştırmacı, çeşitli ortamları yorumlayabilen ve içerik üretebilen yedi çok modlu büyük lisan modelini (MLLM) test etti. Çalışmalarını Nisan ayında yayınlamayı planlayan ekip, bu modellerin saat yahut takvim aynıi görseller üzerinden zamanla ilgili soruları ne kadar doğru yanıtlayabildiğini inceledi. Araştırma sonuçları, AI’nin bu temel misyonlarda beklenenden çok daha düşük bir muvaffakiyet gösterdiğini ortaya koydu.

Araştırmacılar, makalelerinde bu sorunun ehemmiyetini şöyle açıklıyor: “Görsel girdilerden vakti yorumlama ve akıl yürütme yeteneği, olay planlamasından otonom sistemlere kadar birçok gerçek dünya uygulaması için kritik bir rol oynar.” Lakin mevcut teknolojiler daha çok obje algılama, görüntü başlığı ya da sahne tahlili alanlarda ağırlaşmış durumda. Zamansal çıkarımlara yönelik araştırmalar ise hala yetersiz.

Ekip, ünlü modeller arasında yer alan OpenAI’nin GPT-4o ve GPT-o1’ini, Google DeepMind’ın Gemini 2.0’ını, Anthropic’in Claude 3.5 Sonnet’ini, Meta’nın Llama 3.2-11B-Vision-Instruct’unu, Alibaba’nın Qwen2-VL7B-Instruct’unu ve ModelBest’in MiniCPM-V-2.6’sını test etti. Modeller, farklı analog saat görselleri (örneğin Roma sayıları, farklı dizaynlar ve kimilerinde saniye kolu olmayan saatler) ile karşı karşıya bırakıldı. Ayrıyeten on yıllık bir takvim imgesi üzerinden zamanla ilgili daha karmaşık sorular soruldu; örneğin, “Yeni yıl haftanın hangi gününe denk geliyor?” ya da “Yılın 153’üncü günü hangisidir?” benzeri…

Araştırmacılar, bu vazifelerin yalnızca görsel tanıma değil,zamanda sayısal akıl yürütme yeteneğini de gerektirdiğini vurguladı. Saat kolunun açısını algılama yahut takvimdeki gün-hücre tertibini çözümleme gibi sorumluluklar AI için kolay görünse de, sonuçlar aksini gösterdi.

Şaşırtan sonuçlar

AI modelleri, bilhassa analog saatleri okuma vazifesinde büyük zorluklar yaşadı. Bu vazifede genel doğruluk oranı %25’in altında kaldı. Roma rakamlı ve stilize kollar taşıyan saatlerde, hatta saniye kolu olmayan modellerde bile şekilde kötü performans sergilendi. Araştırmacılar, bu başarısızlığın saat kollarını algılamak ve saat yüzündeki açıları yorumlamakla ilgili sıkıntılardan kaynaklandığını düşünüyor.

Google’ın Gemini 2.0 modeli saat okuma testinde en yüksek puanı alırken, OpenAI’nin GPT-o1 modeli takvim vazifelerinde rakiplerinden daha iyi performans göstererek %80 doğruluğa ulaştı. Lakin bu oran bile, en başarılı modelin hala %20 oranında yanılgı yaptığını gösteriyor.

Bu araştırma, AI’nin etkileyici yeteneklerine karşın kimi temel misyonlarda hala önemli sınırlamaları olduğunu ortaya koyuyor. Saat okuma ve takvim manaya gibi görsel ve bilişsel olarak kolay görünen vazifelerdeki bu başarısızlık, AI’nin insan akıl yürütmesinden ne kadar uzak olduğunu bir sefer daha hatırlatıyor. Gelecekteki güzelleştirmelerle bu eksiklerin giderilip giderilmeyeceğini ise zaman gösterecek.

Yorumlar

Henüz yorum yapılmamış. İlk yorumu yukarıdaki form aracılığıyla siz yapabilirsiniz.