Psikall Anlatısı
Bir Görev Gerçekte Neyi Ölçer?
~9 dk okuma
Bir katılımcı, uyumsuz renk sözcüklerine yanıt verirken diğer katılımcılardan daha fazla yavaşlıyor. Bu sonuca bakarak onun ketleme becerisinin daha zayıf olduğu söylenebilir mi?
İlk bakışta bu yorum makul görünür. Görev, baskın sözcük okuma eğilimini engelleyip mürekkep rengini söylemeyi gerektirir. Fakat kişinin puanı yalnızca ketlemeye bağlı değildir. Renkleri ayırt etme hızı, sözcük okuma akıcılığı, yönergeyi sürdürme, dikkat dalgalanmaları, yanıt verme stratejisi ve ölçüm hatası da sonuca katkıda bulunabilir. Görevin adı ile ölçtüğü düşünülen zihinsel yapı bu nedenle kendiliğinden aynı şey değildir.
Zihinsel yapıdan gözlenebilir puana nasıl geçilir?
Dikkat, çalışma belleği veya ketleme doğrudan gözlenebilen nesneler değildir. Bunlar davranış örüntülerini açıklamak için kullanılan kuramsal yapılardır. Araştırmacı bu yapıları inceleyebilmek için onları gözlenebilir işlemlere bağlar: hangi uyaranların sunulacağına, katılımcının ne yapacağına ve hangi yanıtın puanlanacağına karar verir. Bu bağlantı işevuruklaştırma olarak adlandırılır.
İşevuruk tanım araştırmayı mümkün kılar; fakat kuramsal yapıyı tüketmez. Çalışma belleğini harf dizilerini hatırlama göreviyle ölçmek, çalışma belleğinin bu görevden ibaret olduğu anlamına gelmez. Aynı yapı başka görevlerle de incelenebilir; aynı görev ise birden fazla yapıya ihtiyaç duyabilir. Cronbach vd.’nin (1955) yapı geçerliği yaklaşımında temel soru tam da budur: test performansındaki değişimi hangi kuramsal yapılar açıklamaktadır?
Kuramsal yapı, görev ve puan aynı şey değildir
| Ne ifade eder? | Örnek | Temel sınırlılık | |
|---|---|---|---|
| Kuramsal yapı | Doğrudan gözlenemeyen, davranışı açıklamak için önerilen zihinsel özellik veya süreç. | Ketleme, çalışma belleği, seçici dikkat. | Daha büyük uyumsuzluk maliyetinin daha zayıf ketlemeyi gösterdiği iddiası. |
| Görev | Yapının davranışta görünür hâle gelmesi için düzenlenen uyaran, yönerge ve yanıt koşulları. | Stroop görevi, n-geri görevi, görev değiştirme paradigması. | Hedef yapı dışında başka süreçleri de gerektirir. |
| Gösterge veya puan | Görev performansından hesaplanan gözlenebilir değer. | Doğruluk oranı, ortalama tepki süresi, iki koşul arasındaki fark. | Hesaplanan sayının hangi süreçleri ve ne kadar ölçüm hatası içerdiği ayrıca incelenmelidir. |
| Yorum | Puanın ne anlama geldiğine ilişkin çıkarım. | Daha büyük uyumsuzluk maliyetinin daha zayıf ketlemeyi gösterdiği iddiası. | Hesaplanan sayının hangi süreçleri ve ne kadar ölçüm hatası içerdiği ayrıca incelenmelidir. |
Bu ayrım, bir sonuç hakkında konuşurken hangi düzeyde kalındığını görünür kılar. Katılımcının uyumsuz denemelerde 120 milisaniye daha yavaşlaması gözlenmiş bir puandır. Bu farkın ketleme kapasitesini temsil ettiği ise ayrıca desteklenmesi gereken bir yorumdur.
Görev saflığı neden sınırlıdır?
Bir bilişsel görevin yalnızca hedeflenen süreci kullanması çoğu durumda mümkün değildir. Çalışma belleği görevinde uyaranı algılamak, yönergeyi korumak, bilgiyi kısa süreli olarak etkin tutmak, uygun yanıtı seçmek ve motor tepkiyi üretmek gerekir. Ketleme görevinde ise engellenecek baskın eğilimin önce yeterince güçlü biçimde oluşması gerekir. Hedef süreç, başka süreçlerin içinde davranışa dönüşür.
Bu durum görev saflığı sorunu olarak adlandırılır. Kavramsal olarak bir görev puanı; hedeflenen süreçten gelen katkı, göreve özgü diğer talepler ve ölçüm hatasının birleşimi gibi düşünülebilir. Bu ifade gerçek puanı basitçe üç sayıya ayıran bir hesaplama değildir. Bir puanın neden doğrudan tek bir zihinsel etikete dönüştürülemeyeceğini gösteren düşünsel bir çerçevedir.
Aynı ketleme iddiası, farklı görev talepleri
Stroop görevinde baskın sözcük okuma yanıtının, dur-sinyali görevinde başlatılmış bir motor tepkinin, antisakkad görevinde ise aniden beliren uyarana doğru göz hareketinin engellenmesi istenir. Bu görevlerin tümü ketlemeyle ilişkilendirilebilir; fakat algısal girdileri, yanıt biçimleri ve ek bilişsel talepleri aynı değildir.
İki görev arasındaki zayıf ilişki bu nedenle hemen ketlemenin tek bir yapı olmadığını kanıtlamaz. Görevlere özgü talepler ortak süreci örtebilir. Tersi de geçerlidir: iki görevin ilişkili olması, ilişkinin mutlaka hedeflenen süreçten kaynaklandığını göstermez. Ortak okuma hızı, genel tepki hızı veya yönergeyi sürdürme gereksinimi de benzer puanlara katkıda bulunabilir.
Tek görev yerine ortak örüntüyü aramak
Miyake vd. (2000), yürütücü işlevleri tek tek karmaşık görevlerle eşitlemek yerine üç hedef işlev için birden fazla görev kullanmıştır: zihinsel kümeler arasında geçiş, çalışma belleği içeriğini güncelleme ve baskın yanıtları ketleme. Araştırmacılar her görevdeki bütün performansı doğrudan hedef yapıya bağlamak yerine, aynı işlevi ölçmesi beklenen farklı görevlerin ortak varyansını gizil değişkenlerle incelemiştir.
Analizler üç işlevin birbiriyle orta düzeyde ilişkili fakat birbirinden ayırt edilebilir olduğunu göstermiştir. Çalışma aynı zamanda karmaşık yürütücü görevlerin bu işlevlerden farklı oranlarda etkilendiğini ortaya koymuştur. Bu yaklaşım görev saflığı sorununu tamamen ortadan kaldırmaz; fakat tek bir göreve özgü talepler ile farklı görevlerde ortaklaşan hedef süreci kısmen ayırmaya çalışır.
Görevin adı sonuç değildir
Bir araştırmada kullanılan görev, makale başlığında veya veri dosyasında ketleme görevi olarak adlandırılmış olabilir. Bu adlandırma araştırmacının ölçme niyetini gösterir; ölçümün yalnızca ketlemeyi yansıttığını kanıtlamaz. Görevde hangi koşulların karşılaştırıldığı, puanın nasıl hesaplandığı ve alternatif süreçlerin nasıl sınandığı incelenmeden etiket üzerinden sonuca gidilemez.
Aynı nedenle bir katılımcının tek görevde düşük puan alması, o kişinin ilgili bilişsel kapasitesinin genel olarak zayıf olduğu anlamına gelmez. Böyle bir yorum için puanın yeterince tutarlı olması ve hedeflenen yapıya ilişkin geçerlik kanıtlarının bulunması gerekir.
Güvenirlik neyi gösterir?
Güvenirlik, bir puanın ölçüm koşulları içindeki tutarlılığı ve duyarlılığıyla ilgilidir. Aynı kişilerin benzer koşullarda görevi yeniden yaptıklarında sıralamalarının büyük ölçüde değişmesi, puanın kararlı bireysel farklılıkları temsil etmesini güçleştirir. Benzer biçimde görevin bir yarısında yüksek, diğer yarısında çok farklı performans elde edilmesi deneme sayısının veya ölçümün iç tutarlılığının yetersiz olabileceğini düşündürür.
Güvenirlik, herkesin her zaman aynı puanı alması demek değildir. Gerçek değişim, öğrenme, yorgunluk ve bağlamsal etkiler performansı değiştirebilir. Asıl soru, araştırmada yorumlanmak istenen farkların ölçüm hatasına göre ne ölçüde ayırt edilebildiğidir. Bu nedenle uygun güvenirlik incelemesi, puanın hangi amaçla kullanılacağına bağlıdır.
Farklı tutarlılık soruları
| Sorduğu temel soru | Bilişsel görevlerde neye dikkat edilir? | |
|---|---|---|
| Test–tekrar test güvenirliği | Kişilerin göreli konumu farklı zamanlarda ne ölçüde korunuyor? | Alıştırma etkisi, farklı strateji kullanımı ve oturumlar arasındaki koşul değişiklikleri puanı etkileyebilir. |
| Test–tekrar test güvenirliği | Kişilerin göreli konumu farklı zamanlarda ne ölçüde korunuyor? | Az deneme, nadir hata ve farklı uyaran türlerinin eşit dağılmaması tahmini kararsızlaştırabilir. |
| Puanlayıcılar arası güvenirlik | İnsan değerlendirmesi gerektiğinde puanlayıcılar aynı performansı benzer biçimde değerlendiriyor mu? | Otomatik tepki süresi kaydında çoğu zaman gerekli değildir; sözel yanıt veya strateji kodlamasında önemli olabilir. |
Bu göstergeler birbirinin yerine geçmez. Bir puan aynı oturum içinde tutarlı görünebilir fakat haftalar sonra kişileri aynı sırada tutmayabilir. Araştırma sorusu zaman içindeki kararlılıkla ilgiliyse yalnızca iç tutarlılık bilgisi yeterli değildir.
Sağlam deneysel etki, güvenilir bireysel puan mıdır?
Klasik bilişsel görevler çoğunlukla bir deneysel değişikliğin ortalama davranışı nasıl etkilediğini göstermek üzere geliştirilmiştir. Örneğin uyumsuz denemelerin uyumlu denemelerden ortalama olarak daha yavaş yanıtlanması, grup düzeyinde güçlü ve tekrarlanabilir bir etki olabilir. Fakat araştırmanın amacı kimin daha fazla, kimin daha az etkilendiğini güvenilir biçimde sıralamaksa ölçümden farklı bir özellik beklenir.
Hedge vd. (2018), yedi klasik bilişsel görevde bireysel fark puanlarının test–tekrar test güvenirliğini üç çalışmada incelemiştir. Tahminler 0 ile .82 arasında değişmiş ve görevlerin çoğunda beklenenden düşük bulunmuştur. Araştırmacılar bu durumu yalnızca yüksek rastlantısal hatayla değil, bazı deneysel etkilerde kişiler arası gerçek değişkenliğin sınırlı olmasıyla açıklamıştır. Katılımcıların çoğunda benzer yönde oluşan kararlı bir grup etkisi, kişiler arasındaki küçük farkları aynı kararlılıkla ölçmek zorunda değildir.
İki farklı araştırma amacı
| Temel soru | Başarı ölçütü | Aynı görev için olası sonuç | |
|---|---|---|---|
| Deneysel etkiyi incelemek | Belirli bir koşul değişikliği ortalama performansı etkiliyor mu? | Koşullar arasındaki ortalama farkın açık ve tekrarlanabilir olması. | Kişiler arası farkların ölçüm hatasına göre yeterince büyük ve zaman içinde tutarlı olması. |
| Bireysel farklılığı incelemek | Kişiler etkinin büyüklüğü bakımından güvenilir biçimde ayrışıyor mu? | Kişiler arası farkların ölçüm hatasına göre yeterince büyük ve zaman içinde tutarlı olması. | Ortalama etki güçlü olsa bile kişisel fark puanları kararsız olabilir. |
Buradaki sonuç klasik görevlerin işe yaramadığı değildir. Bir görev, geliştirildiği deneysel soruya güçlü yanıt verirken bireyleri sıralamak, başka değişkenlerle korelasyon kurmak veya kişisel özellik çıkarmak için yetersiz olabilir. Ölçüm niteliği kullanım amacından bağımsız değerlendirilemez.
Fark puanı neden sorun çıkarabilir?
Stroop maliyeti gibi bir gösterge çoğu zaman uyumsuz ve uyumlu koşulların tepki süreleri çıkarılarak hesaplanır. Çıkarma işlemi, kişinin genel yanıt hızını azaltarak hedeflenen koşul etkisini belirginleştirebilir. Fakat iki koşulun puanı kendi ölçüm hatasını taşıdığı için fark puanı bu hataları da bir araya getirebilir. Koşullar birbirine çok benziyor ve kişiler arası farkların çoğu çıkarma sırasında kayboluyorsa geriye kalan küçük farkı güvenilir biçimde ölçmek zorlaşır.
Hedge ve arkadaşları (2018), fark puanlarının bileşen puanlara göre toplam değişkenliği sık sık belirgin ölçüde azalttığını göstermiştir. Bu, grup düzeyindeki deneyse karşılaştırma için yararlı olabilir; fakat bireysel farklılık araştırmasında sinyalin ölçüm hatasına oranını düşürebilir. Her fark puanı zorunlu olarak güvenilmez değildir. Güvenirlik, kullanılan görev ve örneklemde doğrudan incelenmelidir.
Geçerlik neyi gösterir?
Bir ölçüm son derece tutarlı olabilir fakat araştırmacının hedeflediği yapıyı temsil etmeyebilir. Sürekli aynı miktarda fazla gösteren bir kronometre tutarlı sonuçlar verir; yine de gerçek süreyi doğru göstermez. Psikolojik ölçümde de güvenirlik gerekli bir zemin sağlar, ancak tek başına geçerlik oluşturmaz.
Geçerlik, puandan çıkarılan belirli yorumun ve bu yorumun kullanım amacının kanıt ve kuram tarafından ne ölçüde desteklendiğiyle ilgilidir. Bu nedenle bir göreve bağlamdan bağımsız biçimde geçerli damgası vurmak yanıltıcıdır. Aynı puanın bir deneysel koşul farkını göstermek için kullanılması ile bir kişide kalıcı dikkat özelliği bulunduğunu ileri sürmek için kullanılması farklı kanıtlar gerektirir. Standards for Educational and Psychological Testing, değerlendirilen şeyin testin kendisi değil, belirli kullanım için önerilen puan yorumu olduğunu vurgular (American Educational Research Association vd., 2014).
Güvenirlik ve geçerlik arasındaki fark
| Güvenirlik | Geçerlik yorumu | |
|---|---|---|
| Puanlar tekrarlandığında büyük ölçüde değişiyor. | Zayıf olabilir. | Kararsız puanın hedef yapıyla ilişkisini yorumlamak güçleşir. |
| Puanlar tutarlı fakat büyük ölçüde genel okuma hızını yansıtıyor. | Yüksek olabilir. | Ketleme yorumu yeterince desteklenmeyebilir. |
| Farklı görev ve analizler hedeflenen yapıyla uyumlu ortak bir örüntü oluşturuyor. | Her puan için ayrıca incelenir. | Yapı yorumunu destekleyen kanıt güçlenir; yine de kesin ve sonsuz bir doğrulama oluşmaz. |
| Görev grup düzeyinde kararlı bir koşul etkisi üretiyor. | Deneysel etki açısından sağlam olabilir. | Deneysel etki açısından sağlam olabilir. |
Güvenirlik ile geçerlik birbirinden kopuk değildir. Ölçüm hatası çok yüksek olduğunda başka ölçümlerle beklenen ilişkiler de zayıflar. Bununla birlikte yüksek güvenirlik, puanın doğru yapıyı temsil ettiğini tek başına göstermez.
Yapı geçerliği tek bir korelasyondan oluşmaz
Bir görevin ketlemeyi ölçtüğü öne sürülüyorsa, puanın yalnızca görev içindeki bir koşul farkı vermesi yeterli değildir. Yorum; ketlemeyle ilişkili olması beklenen farklı yöntem ve görevlerle bağlantı göstermeli, kuramsal olarak ayrı yapılardan da ayırt edilebilmelidir. Campbell vd.’nin (1959) yakınsak ve ayırt edici geçerlik yaklaşımı, aynı yapıyı hedefleyen farklı ölçümlerin ortaklaşması kadar farklı yapıların birbirine karışmamasının da önemli olduğunu göstermiştir.
Ancak beklenenden düşük bir korelasyon hemen kuramın yanlış olduğunu göstermez. Görev saflığı sorunu, düşük güvenirlik veya örneklemdeki dar değişkenlik ilişkiyi zayıflatabilir. Beklenenden yüksek ilişki de otomatik olarak başarı değildir; iki görev hedef yapı yerine aynı okuma, motor hız veya strateji talebini paylaşabilir. Geçerlik, tek bir katsayıdan çok birbiriyle uyumlu kanıtların zaman içinde birikmesiyle güçlenir.
Görev tasarımı ölçüm amacına göre değişebilir
Draheim vd. (2021), dikkat kontrolündeki bireysel farklılıkları ölçmek için geleneksel tepki süresi fark puanlarının sınırlılıklarını ele almış ve doğruluk temelli yeni görevler geliştirmiştir. Dört yüzü aşkın katılımcıyla yürütülen çalışmada son analiz örneklemi 396 kişiden oluşmuştur. Yeni doğruluk ölçümleri, geleneksel Stroop ve flanker ölçümlerine göre daha yüksek güvenirlik, birbirleriyle daha güçlü ilişkiler ve çalışma belleği kapasitesi ile akıcı zekâyla daha belirgin bağlantılar göstermiştir.
Bu sonuç, doğruluğun her araştırmada tepki süresinden üstün olduğu anlamına gelmez. Çalışmadaki görevler bireysel farklılıkları ve yordayıcı ilişkileri görünür kılmak amacıyla özellikle zorlaştırılmıştır. Önemli olan, görevin güçlüğü ve puanlama biçiminin araştırma amacıyla birlikte tasarlanması ve elde edilen ölçüm özelliklerinin varsayılmak yerine sınanmasıdır.
Bir görevin yorumunu güçlendiren kanıtlar
Araştırmacı önce hedeflenen yapıyı ve puandan çıkarılacak yorumu açık biçimde tanımlar. Ardından görevin hedef süreç dışında hangi algısal, dilsel, bellek ve motor talepleri içerdiğini inceler. Koşul karşılaştırmaları alternatif açıklamaları azaltacak biçimde düzenlenir; yeterli sayıda denemeyle puanın güvenirliği hesaplanır. Aynı yapıyı farklı taleplerle ölçen görevlerden yararlanılması, göreve özgü etkiler ile ortak sürecin ayrılmasına yardımcı olabilir.
Son aşamada puanın başka ölçümlerle ilişkileri kuramsal beklentilerle karşılaştırılır. Beklenen ilişkilerin bulunması kadar beklenmemesi gereken ilişkilerin aşırı güçlü olmaması da önemlidir. Hiçbir adım tek başına kesinlik sağlamaz. Güçlü yorum, görev tasarımı, güvenirlik bulguları, deneysel değişiklikler ve ölçümler arası ilişkilerin birbirini desteklediği kanıt bütününe dayanır.
Bir dikkat görevi, grubun tamamında güçlü ve tekrarlanabilir bir deneysel etki oluşturuyor fakat aynı kişilerin fark puanları iki hafta sonra büyük ölçüde değişiyorsa bu görev hangi araştırma sorusuna yanıt verebilir, hangi yorum için yetersiz kalır?
Ölçümün adı değil, kanıt örüntüsü belirleyicidir
Bilişsel görevler gözlenemeyen zihinsel süreçleri davranışa bağlar; fakat bir görevin puanı hedef süreçle birlikte algısal, dilsel, bellekle ilgili ve motor talepleri de içerebilir. Görev saflığı sorunu nedeniyle tek bir puan doğrudan dikkat, bellek veya ketleme kapasitesi olarak okunamaz. Farklı görevlerin ortak örüntüsünü incelemek, göreve özgü etkileri azaltmanın yollarından biridir.
Güvenirlik puanın tutarlılığıyla, geçerlik ise puandan çıkarılan belirli yorumun kanıt ve kuram tarafından desteklenmesiyle ilgilidir. Grup düzeyinde sağlam bir deneysel etki, güvenilir bireysel farklılık puanını garanti etmez; yüksek güvenirlik de hedeflenen yapının gerçekten ölçüldüğünü tek başına kanıtlamaz. Bir görev gerçekte neyi ölçer sorusunun yanıtı görev adında değil, ölçümün farklı koşullar ve yöntemler boyunca oluşturduğu kanıt bütününde bulunur.
Bir sonraki parçada, kontrollü laboratuvar görevlerinden elde edilen sonuçların gündelik davranışlara, farklı ortamlara ve daha geniş insan gruplarına ne ölçüde taşınabileceği ele alınacaktır.
Kaynaklar
American Educational Research Association, American Psychological Association ve National Council on Measurement in Education. (2014). Standards for educational and psychological testing. American Educational Research Association.
Campbell, D. T. ve Fiske, D. W. (1959). Convergent and discriminant validation by the multitrait-multimethod matrix. Psychological Bulletin, 56(2), 81–105. https://doi.org/10.1037/h0046016
Cronbach, L. J. ve Meehl, P. E. (1955). Construct validity in psychological tests. Psychological Bulletin, 52(4), 281–302. https://doi.org/10.1037/h0040957
Draheim, C., Tsukahara, J. S., Martin, J. D., Mashburn, C. A. ve Engle, R. W. (2021). A toolbox approach to improving the measurement of attention control. Journal of Experimental Psychology: General, 150(2), 242–275. https://doi.org/10.1037/xge0000783
Hedge, C., Powell, G. ve Sumner, P. (2018). The reliability paradox: Why robust cognitive tasks do not produce reliable individual differences. Behavior Research Methods, 50(3), 1166–1186. https://doi.org/10.3758/s13428-017-0935-1
Miyake, A., Friedman, N. P., Emerson, M. J., Witzki, A. H., Howerter, A. ve Wager, T. D. (2000). The unity and diversity of executive functions and their contributions to complex “frontal lobe” tasks: A latent variable analysis. Cognitive Psychology, 41(1), 49–100. https://doi.org/10.1006/cogp.1999.0734
