ChatGPT, insanların kişilik testlerine nasıl cevap vereceğini şaşırtıcı doğrulukla tahmin etti

İbrani Üniversitesi'nin yürüttüğü araştırmada, OpenAI'nin GPT-4 modeli, kişilik testlerinde insanların gelir, refah ve eğitim düzeyini çarpıcı bir doğruluk oranıyla tahmin etti. 600 katılımcının yer aldığı bu deneyde, GPT-4'ün oluşturduğu sorular, geleneksel psikoloji testleriyle yarıştı. Araştırma, yapay zekânın insan davranışı analizi konusundaki potansiyelini gözler önüne serdi.
İbrani Üniversitesi'nden bilim insanları, OpenAI'nin geliştirdiği GPT-4 modelinin kişilik testlerinde gösterdiği başarıyı ortaya koyan dikkat çekici bir araştırmaya imza attı. Araştırmada, GPT-4'ün hazırladığı kişilik testleriyle, katılımcıların gelir, refah ve eğitim düzeyleri gibi önemli yaşam göstergeleri, geleneksel psikoloji testleriyle benzer doğrulukta tahmin edildi. Amerika Birleşik Devletleri ve Birleşik Krallık'tan toplam 600 yetişkinin katıldığı bu deney, yapay zekânın insan davranışlarını analiz etme kapasitesine dair yeni tartışmaların önünü açtı.
GPT-4 kişilik testlerinde bilimsel yöntemlerle sınandı
İbrani Üniversitesi'nden Rotem Monsa, Aviv Zohar ve Shahar Arzy'nin yürüttüğü araştırmada, GPT-4 modeline iki temel kaynak sunuldu: psikiyatristlerin zihinsel bozuklukları teşhis etmekte kullandığı DSM-5 kılavuzu ve popüler bir astroloji kitabı olan "İhtiyacınız Olan Tek Astroloji Kitabı". Araştırmacılar, bu kaynaklardan esinlenerek GPT-4'ün, insanların kişilik özelliklerini ölçmeye yönelik sorular üretmesini sağladı. GPT-4, DSM-5 tabanlı 50 ve astrolojiye dayalı 60 farklı kişilik ifadesi oluşturdu. Katılımcılar, bu ifadeleri 1 ile 5 arasında puanladı. Ayrıca, Big Five Envanteri'nden alınan 44 maddelik standart kişilik testi de uygulandı. Araştırmacılar, katılımcıların verdiği yanıtları, yaşam memnuniyeti, gelir, eğitim, depresyon ve anksiyete gibi yaşam göstergeleriyle karşılaştırdı. Sonuçlar, GPT-4 tarafından üretilen soruların, özellikle eğitim gibi bazı alanlarda, geleneksel testlerle benzer hatta zaman zaman daha yüksek doğrulukla sonuç verdiğini gösterdi.
Monsa: 'Astroloji temelli sorular eğitimde öne çıktı'
Araştırmanın en ilginç bulgularından biri, astrolojiye dayalı soruların eğitim düzeyini tahmin etme konusunda Big Five testinden daha iyi performans göstermesi oldu. Rotem Monsa, bu konuda yaptığı açıklamada, "Astrolojik tanımlar yüzyıllar boyunca kültürel olarak rafine edilmiştir ve günlük dildeki kişilik özellikleriyle büyük oranda örtüşmektedir. Bu nedenle, bireysel astroloji soruları anlam taşır, ancak onları organize eden çerçeve bilimsel değildir" ifadelerini kullandı. Araştırma ekibi, astrolojiye dayalı dört geleneksel unsurun (ateş, su, hava, toprak) pratikte kişilik gruplarını yansıtmadığını, ancak üretilen soruların Big Five'ın ana özelliklerine yakın kümeler oluşturduğunu tespit etti. Buna rağmen, genel puanlamada DSM-5 ve Big Five temelli testler, özellikle mental sağlık ölçümlerinde astroloji tabanlı testlerin önüne geçti.
GPT-4 ortalama yanıtları kelimelerden tahmin etti
Katılımcılar teste başlamadan önce, ekip GPT-4'e, hazırladığı her bir soru için, yalnızca kelime yapısına bakarak ortalama yanıtı tahmin etmesini istedi. 1 ile 5 arasındaki puanlama sisteminde, GPT-4'ün astroloji soruları için yaptığı tahminler ortalamada 0,27 puan, DSM-5 tabanlı sorular için ise 0,40 puan yanıldı. Ayrıca, her soru çifti için iki yanıt arasındaki bağlantının gücü de değerlendirildi ve ortalama hata 0,17 olarak belirlendi. Bu bulgular, GPT-4'ün insan yazılarını analiz ederek, kişilik testlerindeki genel eğilimleri öngörme konusunda önemli bir potansiyele sahip olduğunu ortaya koydu. Monsa, bu yöntemin laboratuvar ortamında, yüzlerce kişiye test uygulamadan önce zayıf veya gereksiz soruları ayıklamak için pratik bir araç sağlayabileceğini vurguladı.
GPT-4 farklı metinlerden de kişilik soruları üretti
Araştırmacılar, GPT-4'ün kişilik sorusu üretme kabiliyetini başka metinlerle de test etti. Model, bir Bosch fırın kılavuzu ve J.R.R. Tolkien'in "Yüzüklerin Efendisi" eserinden Mordor hakkındaki bir pasajdan yola çıkarak da kişilik soruları oluşturdu. Ancak bu tür metinlerden üretilen ifadeler, çoğunlukla mantıksız ve bağlamsız bulunduğu için katılımcılara sunulmadı. Ekip, yalnızca insan davranışını tanımlayan metinlerden elde edilen soruların anlamlı ve kullanılabilir olduğunu belirledi. Monsa, "Anket formatına yönelme, hiçbir şeyden yola çıkmadan bile güçlüdür" diyerek, modelin doğal dil işleme yeteneğine dikkat çekti.
Uzmanlar kişilik testlerinde doğrulama uyarısı yaptı
Rotem Monsa, kişilik testlerinin kim tarafından yazıldığından ziyade, doğrulanıp doğrulanmadığının önemli olduğuna dikkat çekti. Araştırmacılar, doğrulanmamış testlerin, özellikle hastaların teşhisi veya işe alım süreçlerinde kullanılmasının riskli olabileceği konusunda uyardı. Çalışmanın tüm verileri, tek bir model ve İngilizce konuşan bir katılımcı grubuyla toplandı. Monsa, modelin farklı dillerde aynı başarıyı gösteremeyebileceğini, çünkü GPT-4'ün öncelikli olarak İngilizce metinlerle eğitildiğini belirtti. Ayrıca, GPT-4'ün tahminlerinin bireylerden çok, gruplar için daha geçerli olduğu vurgulandı. Monsa, "Bir kalabalık ortalaması, içindeki herhangi bir kişi hakkında bir gerçek değildir" diyerek, bireysel tahminlerin hâlâ önemli bir zorluk oluşturduğunu ifade etti.
GPT-4 kişilik analizinde yeni bir dönemin kapısını aralıyor
İbrani Üniversitesi laboratuvarı, araştırmanın bir sonraki adımında, kişiliği doğrudan insanların doğal dilinden okuyabilen yapay zekâ modelleri geliştirmeyi hedefliyor. Monsa, "Şu anda keşfettiğimiz yön, kişiliği doğrudan insanların doğal dilinden okuyup okuyamayacağımızdır; bu, modelin içsel olarak onlarla ilgili kodladığı bilgileri kullanarak, tamamen anketlere güvenmeden" diyerek, gelecekteki çalışmalara ışık tuttu. Araştırmanın bulguları, GPT-4 gibi gelişmiş dil modellerinin, insan davranışının karmaşık yönlerini analiz etmede yeni ufuklar açabileceğini gösteriyor. Ancak uzmanlar, bu tür araçların klinik ya da profesyonel ortamlarda kullanılmadan önce titizlikle doğrulanması gerektiği konusunda hemfikir.
- Popüler Haberler -
5 ülkeyle imzalar atılacak! Türkiye'den yapay zeka çağına "mükemmel" adım
Rusya, Google ve Telegram'a içerik cezası uyguladı: 11,1 milyon ruble!
Mavi Vatan'da tarihi buluşma "Türk Bayrağını Al, Körfeze Gel"
Turkcell, müşteri deneyiminde yeni yaklaşımı olan ‘Turkcell Çözüm Gücü'nü tanıttı
Kamyon ve konteyner tarama sistemi Çekya'ya ihraç edilecek
YouTube'dan video izlenme sayısında tarihi değişiklik



