Blog

Türkçe Bir Kitabın Kelime Sıklık Listesi Nasıl Çıkarılır?

Selçuk Doğan 3 dk okuma
En sık geçen gövdeleri gösteren yatay çubuk grafik

Bir metinde hangi sözcüklerin ne kadar kullanıldığını bilmek pek çok çalışmanın başlangıç noktasıdır:

  • Ders kitabının öğrenci seviyesine uygunluğunu ölçmek
  • Bir yazarın üslubunu incelemek
  • Okuma metni seçmek
  • Sözlük ya da kelime listesi hazırlamak
  • Tez için söz varlığı verisi toplamak

Bu yazıda Türkçe bir kitabın sıklık listesini doğru biçimde nasıl çıkaracağınızı ve listeyi nasıl yorumlayacağınızı anlatıyoruz.

Neden sıradan kelime sayaçları Türkçede yanıltır?

İnternetteki kelime sayaçlarının çoğu boşlukla ayrılan her diziyi ayrı bir sözcük sayar. İngilizce için bu kabaca işe yarar; Türkçe için yaramaz. Şu cümleye bakın:

Kitaplarımızı okuduk, kitapçıdan yeni kitaplar aldık.

Basit bir sayaç burada kitaplarımızı, kitapçıdan, kitaplar diye üç ayrı sözcük görür ve her birine 1 yazar. Oysa araştırmacının sorusu genellikle "kitap sözcüğü kaç kez geçiyor?" sorusudur. Eklemeli bir dilde tek bir isim onlarca farklı biçimde görünebilir. Biçim sayan bir liste uzar, dağınık olur ve asıl sözcüklerin ağırlığını gizler.

Doğru yöntem: Önce çözümle, sonra say

Türkçede güvenilir bir sıklık listesi için her sözcüğün biçimbilimsel çözümlemesi yapılmalıdır:

  1. Metni temizleyin: Satır sonunda tireyle bölünmüş sözcükleri birleştirin, sayfa üst ve alt bilgilerini atın.
  2. Cümlelere ayırın: Aynı yazılışın farklı çözümlemeleri olabilir; doğru olanı cümle bağlamı belirler. Yüz sayı mı, organ mı, yüzmek fiili mi?
  3. Her sözcüğü çözümleyin: Kökü, yapım eklerini ve çekim eklerini ayırın.
  4. Birimi seçip sayın: Kök ve gövde için ayrı listeler oluşturun.

Bu adımlar sonunda kitaplarımızı ve kitaplar biçimleri kitap gövdesine, kitapçıdan ise kitapçı gövdesine yazılır. İkisi de kitap kökünün altında toplanır.

Kök listesi mi, gövde listesi mi?

İki liste farklı sorulara cevap verir:

SoruUygun liste
Hangi kavram aileleri metne hâkim?Kök
Öğrenci hangi sözcükleri tanımalı?Gövde
Bir yazar hangi türetmeleri tercih ediyor?Gövde (kök altında)
Metin ne kadar çeşitli bir söz varlığı kullanıyor?İkisi birlikte

Örnek kitaptan bir veri: etmek fiili kök listesinde 705 kez görünüyor, gövde listesinde ise 501 kez. Aradaki fark edilmek gibi edilgen gövdelerden geliyor; bunlar gövde listesinde ayrı maddedir. Dil öğretimi açısından edilmek ayrıca öğretilmesi gereken bir yapı olduğu için bu ayrım önemlidir.

Gerçek bir sıklık listesi neye benzer?

314 sayfalık, tamamen taranmış bir akademik Türkçe ders kitabını Kelime Dizini ile çözümledik. Sonuçlar şöyle:

  • Toplam sözcük: 68.580
  • Farklı kök: 4.713
  • Farklı gövde: 5.802
  • Farklı özel ad: 775 (ayrı listede)

Gövde listesinin başı beklendiği gibi işlev sözcükleriyle dolu: ve, olmak, bir, bu, da, için, göre. Bunlar her Türkçe metinde üst sıralardadır. Asıl bilgi biraz aşağıda başlıyor: metin (497), insan (461), etkinlik (404), çocuk (295), hak (240), bilgi (194).

Ders kitabının kimliği bu sözcüklerden hemen okunuyor. Biri dikkat çekici: aşağı (681). Ders kitaplarındaki "aşağıdaki soruları cevaplayınız" türü yönergeler bu sözcüğü ilk sıralara taşıyor. Sıklık listesi böylece metnin türünü de ele veriyor.

Sıklık listesini yorumlarken bilinmesi gerekenler

Az sayıda sözcük metnin büyük bölümünü oluşturur. Örnek kitapta en sık 100 gövde metindeki sözcüklerin %39'unu, en sık 1.000 gövde %80'ini, en sık 2.000 gövde ise %90'ını karşılıyor. Bir öğrencinin metni rahat okuyabilmesi için hangi sözcükleri bilmesi gerektiğini bu kapsam oranları gösterir.

Tek geçen sözcükler azımsanmamalı. Örnek kitaptaki 5.802 gövdenin 2.170'i, yani %37'si yalnızca bir kez geçiyor. Metnin çeşitliliği büyük ölçüde bu uzun kuyruktan gelir. Öğretim materyali hazırlarken bu sözcüklerin bağlamdan anlaşılır olup olmadığına ayrıca bakmak gerekir.

Bağlam olmadan sıklık eksik kalır. Bir sözcüğün 50 kez geçmesi, 50 kez aynı anlamda kullanıldığı anlamına gelmez. Her geçişin cümlesini görebilmek, listeyi yorumlanabilir kılar.

Taranmış kitaplarda OCR hatası payı vardır. Taranmış sayfalarda bazı sözcükler yanlış okunabilir. Bunlar "tanınmayan sözcükler" listesinde ayrıca gösterilmelidir; örnek kitapta bu oran %2,7'de kaldı.

Kelime Dizini ile sıklık listesi çıkarmak

Kelime Dizini yukarıdaki adımların hepsini sizin yerinize yapar:

  • PDF, Word ve metin dosyası kabul eder; dilerseniz metni doğrudan yapıştırabilirsiniz.
  • Taranmış sayfaları OCR ile okur.
  • Her sözcüğü bağlamına göre çözümleyip kök ve gövde listelerini ayrı ayrı çıkarır.
  • Özel adları ve tanınmayan sözcükleri ayrı listelerde gösterir.
  • Her maddeye tıkladığınızda sözcüğün geçtiği sayfaları ve cümleleri görürsünüz.
  • Sıklık listesini ve bütün bağlam cümlelerini Excel olarak indirip kendi analizlerinizde kullanabilirsiniz.

Sonuç

Türkçede sıklık listesi, boşlukları saymakla değil sözcükleri çözümlemekle başlar. Kök ve gövde listelerini birlikte okumak, işlev sözcüklerinin ötesine bakmak, kapsam oranlarını ve tek geçen sözcükleri hesaba katmak sizi doğru yorumlara götürür.

Kitap Dizini Oluştur sayfasından kendi metninizin sıklık listesini çıkarabilirsiniz.

Kitabınızın kelime dizinini çıkarın
PDF, Word ya da metin: kök ve gövde dizini, sıklık listesi, sayfa numaraları ve bağlam cümleleri birkaç dakikada hazır.
Kitap Dizini Oluştur
Blog

Diğer yazılar