मोफत शब्द वारंवारता काउंटर

तुमच्या मजकुरात प्रत्येक शब्द किती वेळा येतो ते मोजा. टॉप शब्द व्हिज्युअलाइझ करा, CSV मध्ये एक्सपोर्ट करा आणि स्टॉप शब्द फिल्टर करा.

एकदा लोड झाल्यावर ऑफलाइन काम करते

.txt, .md, .csv, .docx किंवा .pdf लोड करा. फाइल तुमच्या डिव्हाइसवर वाचल्या जातात.

किमान लांबी:
किमान संख्या:
टॉप दाखवा:
क्रमवारी:

हे कसे कार्य करते

शब्द वारंवारता विश्लेषण गराज-लिहिलेला tokenizer आणि JavaScript Map वापरून पूर्णपणे तुमच्या ब्राउझरमध्ये चालते — लायब्ररी, सर्व्हर नाही. तुम्ही टाइप किंवा पेस्ट करताच मजकूर स्थानिक पातळीवर पार्स, मोजला, आणि क्रमवारी लावला जातो.

  1. 1
    Unicode-जाणकार tokenization
    साधन तुमचा मजकूर lowercase करते, नंतर Unicode property regex \p{L}\p{M} ने tokens काढते — जो accented अक्षरे व non-Latin scripts योग्यरित्या हाताळतो. CJK मजकुरासाठी (Chinese, Japanese, Korean), ते जागांशिवाय असलेली अक्षरे विभागण्यासाठी granularity: 'word' सह ब्राउझरच्या बिल्ट-इन Intl.Segmenter API कडे वळते.
  2. 2
    Stop-word आणि लांबी फिल्टरिंग
    पर्यायी फिल्टरिंग तुमच्या साइट locale शी जुळणाऱ्या hardcoded Set वापरून सामान्य function शब्द (the, a, is, आणि Spanish, French, German, Italian, आणि Portuguese मधील समतुल्य) काढते. किमान-लांबी स्लायडर मोजणी सुरू होण्याआधी तुमच्या निवडलेल्या थ्रेशोल्डपेक्षा लहान tokens काढतो.
  3. 3
    Map-आधारित वारंवारता मोजणी आणि n-gram मोड
    Tokens JavaScript Map मध्ये मोजले जातात — 'constructor' सारखी राखीव property नावे मोजलेल्या शब्दांशी टक्कर देऊ नयेत यासाठी विशेषतः निवडलेले. bigram किंवा trigram मोडमध्ये, tokenizer कच्च्या token stream वर एक window सरकवतो आणि मोजण्याआधी लगतचे शब्द वाक्यांशांत जोडतो.
  4. 4
    क्रमवारी लावलेले निकाल आणि CSV एक्सपोर्ट
    निकाल मोजणीने उतरत्या क्रमाने लावले जातात आणि क्रमवारी लावलेला bar chart म्हणून दाखवले जातात. एक्सपोर्ट ब्राउझरच्या Blob API वापरून मेमरीत plain-text CSV blob बनवतो आणि डाउनलोड सुरू करतो — कोणत्याही टप्प्यावर काहीही सर्व्हरला पाठवले जात नाही.

संबंधित साधने

वारंवार विचारले जाणारे प्रश्न