Kötü Veri Artık Kötü Görünmüyor: Online Araştırmanın Yeni Kalite Sorunu

Online araştırmada sahte katılımcıları bulmak giderek zorlaşıyor. Yapay zekâ, profesyonel panelistler ve otomasyon sayesinde düşük kaliteli cevaplar artık oldukça inandırıcı görünebiliyor. Asıl sorun, kötü veriyi tespit etmekten çok hangi veriye güveneceğimize karar vermek.

2026-10-05 07:41:13 - Arastiriyorum

Online araştırmalarda veri kalitesini kontrol etmek için yıllardır benzer işaretlere bakıyoruz.

Çok hızlı tamamlanan anketler.

Aynı seçeneğin sürekli işaretlenmesi.

Tutarsız cevaplar.

Şüpheli IP adresleri.

Anlamsız açık uçlu yanıtlar.

Coğrafi konum uyuşmazlıkları.

Bunların hepsi araştırmacının şüpheli katılımcıları ayıklamasına yardımcı oluyor.

Fakat artık daha rahatsız edici bir problem var:

Ya kötü veri artık kötü görünmüyorsa?

Sorun artık yalnızca açıkça sahte görünen katılımcıları bulmak değil. Daha zor olan, gerçek katılımcıdan ayırt edilmesi giderek güçleşen ve kalite kontrollerini geçebilecek kadar iyi davranan şüpheli cevapları tespit etmek.


Veri Kalitesinin Yeni Gri Alanı

Araştırma sektöründe uzun süredir kullanılan temel yaklaşım oldukça basit:

Bir katılımcının davranışında yeterince fazla anormallik varsa o cevabı veri setinden çıkar.

Bugün bu amaçla çok sayıda kontrol kullanılabiliyor:

Fakat bunların hiçbiri tek başına kesin bir doğruluk mekanizması değil.

Düşük bir reCAPTCHA skoru sahte bir katılımcıyı işaret edebilir ama gerçek bir kullanıcıyı da yanlışlıkla şüpheli hale getirebilir.

Kısa bir açık uçlu cevap düşük kaliteli olabilir. Ya da katılımcının gerçekten söyleyecek fazla bir şeyi olmayabilir.

Anketi hızlı tamamlayan biri dikkat etmemiş olabilir. Ama soruları çok iyi anlayan ve hızlı okuyan gerçek bir kullanıcı da olabilir.

Bu nedenle temel soru giderek daha zor hale geliyor:

Kaç şüpheli işaret, bir katılımcıyı veri setinden çıkarmak için yeterlidir?

Ve bu noktada konu yalnızca araştırma metodolojisi olmaktan çıkıyor.

Maliyet de devreye giriyor.


“Kalite Kontrolünden Geçti” ile “Kaliteli Veri” Aynı Şey Değil

Özellikle ulaşılması zor hedef kitlelerde her tamamlanan görüşmenin ciddi bir maliyeti vardır.

Katılımcıları veri setinden çıkarmak yeni örneklem bulunmasını, saha süresinin uzamasını, kotaların yeniden doldurulmasını ve sample sağlayıcısından replacement istenmesini gerektirebilir.

Bu da araştırma maliyetini artırır.

Dolayısıyla uygulamada tehlikeli bir eşik oluşabilir.

Bir cevap açıkça sahte değilse ve yeterince fazla kalite kontrolünden geçiyorsa veri setinde tutulabilir.

Böylece farkında olmadan kalite standardı değişmeye başlar.

“Kaliteli veri” yerine “çıkarılmasını gerektirecek kadar kötü olmayan veri” kabul edilmeye başlanabilir.

Buradaki sorun mutlaka kötü niyet değildir.

Daha temel bir problem vardır:

Araştırma sisteminin ticari teşvikleri, kalite kararlarını etkileyebilir.


Katılımcılar da Sistemi Öğreniyor

Araştırma tasarımında genellikle araştırmacının katılımcıyı ölçtüğünü varsayarız.

Fakat özellikle sürekli online panellere katılan kişiler zamanla araştırma sisteminin nasıl çalıştığını öğrenebilir.

Örneğin bir katılımcı, belirli markaları bilmediğini söylediğinde sık sık ankete kabul edilmediğini fark edebilir.

Bir süre sonra çok basit bir davranış öğrenebilir:

Daha fazla marka bildiğimi söylersem ankete devam etme ihtimalim artıyor.

Bu durumda araştırmacının kullandığı eleme mekanizması katılımcının cevap davranışını değiştirmiş olur.

Aynı şey hız kontrollerinde de yaşanabilir.

Çok hızlı anket dolduran katılımcılar eleniyorsa sistemin yapması gereken şey şaşırtıcı derecede basittir:

Biraz daha yavaş davranmak.

Başka bir deyişle, her kalite kontrolü aynı zamanda kaçınılması gereken yeni bir engel haline gelebilir.

Bu da oldukça rahatsız edici bir paradoks yaratıyor:

En temiz görünen veri, bazen en dikkatli incelenmesi gereken veri olabilir.


Yapay Zekâ Sorunu Daha da Zorlaştırıyor

Yapay zekâ bu denklemi tamamen değiştiren unsurlardan biri.

Bugün üretken yapay zekâ araçları son derece doğal görünen açık uçlu cevaplar oluşturabiliyor.

Dilbilgisi düzgün, soruyla ilgili, tutarlı ve yeterince ayrıntılı bir cevap artık tek başına gerçek bir insanın anketi doldurduğunun kanıtı değil.

Benzer şekilde görsel doğrulama da eskisi kadar güçlü bir garanti olmayabilir.

Bir katılımcıdan sahip olduğunu söylediği ürünün fotoğrafını yüklemesi istenebilir. Ancak artık gerçekçi ürün görselleri üretmek veya internetten uygun bir görsel bulmak çok daha kolay.

Bu da araştırmanın geleneksel doğrulama mekanizmalarını zayıflatıyor.

İşin ironik tarafı, yapay zekâ yalnızca kötü veriyi üretmek için kullanılmıyor.

Araştırma şirketleri de aynı teknolojiyi veri temizleme, açık uç kodlama, tutarlılık analizi, fraud detection ve anomali tespitinde kullanıyor.

Böylece yeni bir yarış ortaya çıkıyor:

Bir yapay zekâ şüpheli veriyi daha inandırıcı hale getirirken, başka bir yapay zekâ onu yakalamaya çalışıyor.

Fakat burada unutulmaması gereken temel bir nokta var.

Otomasyon kötü bir süreci düzeltmez.

Sadece daha hızlı çalıştırır.

Eğer başlangıçtaki sample kalitesi sorunluysa, dünyanın en gelişmiş otomatik veri temizleme sistemi bile temel soruyu ortadan kaldırmaz:

Bu insanların gerçekten araştırmaya katılması gerekiyor muydu?


Araştırmacının Rolü Değişiyor

Bu nedenle araştırmacının rolü yalnızca veri toplamak ve analiz yapmak olmaktan çıkıyor.

Yeni dönemde araştırmacının daha önemli görevlerinden biri şu olabilir:

Verinin güven zincirini açıklamak.

Bir araştırma raporunda yalnızca şu bilgiyi görmek artık yeterli olmayabilir:

n = 1.200

Bu sayı bize yalnızca kaç cevabın analiz edildiğini söyler.

Ama asıl önemli sorular başka:

Bu 1.200 kişi nereden geldi?

Kaç farklı sample sağlayıcısı kullanıldı?

Kaç kişi kalite kontrolünde elendi?

Neden elendi?

Şüpheli ama tamamen dışlanmayan cevapların oranı neydi?

Açık uçlu yanıtlar insan tarafından incelendi mi?

Ürün sahipliği gibi iddialar doğrulandı mı?

Ve belki de en önemlisi:

Şüpheli cevaplar çıkarıldığında araştırmanın sonucu değişiyor mu?


Yeni Kalite Metriği: Sonuç Ne Kadar Dayanıklı?

Burada araştırma sektörünün daha fazla kullanması gereken önemli bir kavram devreye giriyor:

Sensitivity analysis.

Bir araştırmanın sonucunu yalnızca bütün örneklemle hesaplamak yerine, farklı kalite eşikleri altında tekrar hesaplayabiliriz.

Örneğin ilk senaryoda sonuç şöyle olsun:

Senaryo 1

Tüm kabul edilen cevaplar

Örneklem: 1.200

Sonuç: %62

Şüpheli cevaplar çıkarıldığında

Örneklem: 1.080

Sonuç: %61

Sadece yüksek güvenli cevaplar kullanıldığında

Örneklem: 940

Sonuç: %60

Burada önemli olan örneklemin küçülmesi değil.

Önemli olan, örneklem 1.200 kişiden 940 kişiye düşerken sonucun yalnızca %62’den %60’a değişmesidir.

Bu durumda araştırmanın ana bulgusu kalite filtresine karşı oldukça dayanıklıdır.

Başka bir ifadeyle:

Şüpheli cevapları çıkardığımızda sonuç büyük ölçüde aynı kalıyorsa, bulgunun veri kalitesindeki değişimlere karşı daha sağlam olduğunu söyleyebiliriz.

Fakat ikinci senaryoyu düşünelim.

Senaryo 2

Tüm cevaplar

Örneklem: 1.200

Sonuç: %62

Şüpheli cevaplar çıkarıldığında

Örneklem: 1.080

Sonuç: %54

Sadece yüksek güvenli cevaplar kullanıldığında

Örneklem: 940

Sonuç: %47

Burada bambaşka bir tablo ortaya çıkar.

Kalite filtresi sıkılaştıkça sonuç %62’den %47’ye kadar geriliyor.

Bu durumda asıl sorun örneklem büyüklığının azalması değildir.

Asıl sorun şudur:

Araştırmanın ana bulgusu, hangi cevapların veri setinde tutulduğuna ciddi biçimde bağımlıdır.

Artık araştırmacının yalnızca nihai sonucu vermesi yeterli değildir.

Sonucun neden kalite eşiklerine bu kadar duyarlı olduğunu da açıklaması gerekir.

Dolayısıyla yeni dönemde araştırma kalitesini değerlendirirken yalnızca şu soruyu sormamalıyız:

Kaç kişiyle görüştünüz?

Şunu da sormalıyız:

Sonuç, veri kalitesini daha sıkı filtrelediğinizde ne kadar değişiyor?


Araştırma Raporlarına Yeni Bir Bölüm Eklenmeli

Bugün araştırma raporlarında metodoloji bölümünde genellikle birkaç standart bilgi bulunur:

Bunların yanına artık başka bir bölüm eklemek gerekebilir:


Veri Kalitesi Özeti

Örneğin raporda şu bilgiler açıkça gösterilebilir:

Toplam araştırmaya başlayan: 1.642 kişi

Anketi tamamlayan: 1.317 kişi

Kalite kontrollerinde çıkarılan: 117 kişi

Final örneklem: 1.200 kişi

Kalite kontrolünde çıkarılan cevapların nedenleri de ayrıca açıklanabilir.

Örneğin:

Hız kontrolü nedeniyle çıkarılanlar: %34

Tutarsız cevaplar nedeniyle çıkarılanlar: %24

Açık uçlu cevap kalitesi nedeniyle çıkarılanlar: %18

IP veya coğrafi konum problemi nedeniyle çıkarılanlar: %11

Tekrarlanan veya duplicate cevaplar: %8

Diğer nedenler: %5

Fakat bundan daha değerli olan tek bir cümle olabilir:

Şüpheli ve borderline cevaplar çıkarıldığında araştırmanın ana bulguları anlamlı biçimde değişmedi.

Bu ifade, araştırmayı kullanan kişi açısından onlarca metodoloji satırından daha fazla bilgi verebilir.

Çünkü artık yalnızca araştırmanın nasıl yapıldığını değil, sonucun ne kadar dayanıklı olduğunu da görürüz.


Kalite Artık Sadece Veri Temizleme Meselesi Değil

Online sample kalitesini yalnızca saha bittikten sonra yapılan bir temizlik işlemi olarak düşünmek de giderek yetersiz hale geliyor.

Kalite aslında araştırmanın başında başlıyor.

Sample sağlayıcısının seçimi.

Katılımcı kaynaklarının çeşitliliği.

Kimlik doğrulama mekanizmaları.

Screener tasarımı.

Anket süresi.

Teşvik modeli.

Açık uçlu soruların yapısı.

Fraud kontrolleri.

Ve saha sonunda uygulanan veri temizleme kuralları.

Bunların hepsi aynı zincirin parçaları.

Zincirin en zayıf halkası sorunluysa, son aşamada yapılan temizlik tüm problemi ortadan kaldıramaz.

Bu nedenle geleceğin araştırma kalite sistemi muhtemelen tek bir fraud skoruna dayanmayacak.

Daha çok bir güven modeli gibi çalışacak.

Bir katılımcı tamamen “gerçek” veya “sahte” olarak sınıflandırılmak yerine farklı kalite sinyallerinin birleşimiyle değerlendirilecek.

IP davranışı.

Cihaz bilgisi.

Cevap süresi.

Cevap tutarlılığı.

Açık uçlu yanıt kalitesi.

Geçmiş panel davranışı.

Kimlik doğrulama sinyalleri.

Bunların hiçbiri tek başına karar vermeyecek.

Ama birlikte bir güven seviyesi oluşturacak.


Sonuç

Online araştırmanın en büyük kalite problemi artık anlamsız cevap veren botlar olmayabilir.

Onları yakalamak görece kolay.

Asıl sorun daha sofistike.

İnsan gibi görünen botlar.

Sistemi öğrenmiş profesyonel katılımcılar.

Yapay zekâyla üretilmiş açık uçlu cevaplar.

Kalite kontrolünü geçecek kadar iyi optimize edilmiş davranışlar.

Ve bütün bunların arasında gerçekten dürüst ama alışılmadık davranan gerçek insanlar.

Bu nedenle araştırmanın geleceğinde kalite kontrolü basit bir “geçti / kaldı” mekanizması olmaktan çıkmak zorunda.

Asıl soru artık şu değil:

Bu cevap sahte mi?

Daha doğru soru şu:

Bu cevaba güvenmek için elimizde ne kadar kanıt var?

Ve belki bundan da önemlisi:

Şüpheli cevapları çıkardığımızda araştırmanın sonucu hâlâ aynı şeyi söylüyor mu?

Çünkü online araştırmanın yeni çağında en tehlikeli veri kötü görünen veri değil.

Yeterince iyi görünen kötü veri.

More Posts