LibraTool logoLibraTool

ਮੁਫ਼ਤ ਸ਼ਬਦ ਬਾਰੰਬਾਰਤਾ ਗਿਣਤੀਕਾਰ

ਆਪਣੇ ਟੈਕਸਟ ਵਿੱਚ ਹਰ ਸ਼ਬਦ ਕਿੰਨੀ ਵਾਰ ਆਉਂਦਾ ਹੈ ਗਿਣੋ। ਚੋਟੀ ਦੇ ਸ਼ਬਦਾਂ ਨੂੰ ਦ੍ਰਿਸ਼ਟੀਗਤ ਬਣਾਓ, CSV ਵਿੱਚ ਐਕਸਪੋਰਟ ਕਰੋ, ਅਤੇ ਸਟਾਪ ਸ਼ਬਦ ਫਿਲਟਰ ਕਰੋ।

ਲੋਡ ਹੋਣ ਤੋਂ ਬਾਅਦ ਔਫ਼ਲਾਈਨ ਕੰਮ ਕਰਦਾ ਹੈ

.txt, .md, .csv, .docx ਜਾਂ .pdf ਲੋਡ ਕਰੋ। ਫ਼ਾਈਲਾਂ ਤੁਹਾਡੇ ਡਿਵਾਈਸ ਉੱਤੇ ਪੜ੍ਹੀਆਂ ਜਾਂਦੀਆਂ ਹਨ।

ਘੱਟੋ-ਘੱਟ ਲੰਬਾਈ:
ਘੱਟੋ-ਘੱਟ ਗਿਣਤੀ:
ਟਾਪ ਦਿਖਾਓ:
ਲੜੀ:

ਇਹ ਕਿਵੇਂ ਕੰਮ ਕਰਦਾ ਹੈ

ਸ਼ਬਦ ਆਵ੍ਰਿਤੀ ਵਿਸ਼ਲੇਸ਼ਣ ਹੱਥ ਨਾਲ ਲਿਖੇ tokenizer ਅਤੇ JavaScript Map ਨਾਲ ਪੂਰੀ ਤਰ੍ਹਾਂ ਤੁਹਾਡੇ ਬ੍ਰਾਊਜ਼ਰ ਵਿੱਚ ਚੱਲਦਾ ਹੈ — ਕੋਈ ਲਾਇਬ੍ਰੇਰੀ, ਕੋਈ ਸਰਵਰ ਨਹੀਂ। ਟੈਕਸਟ ਟਾਈਪ ਜਾਂ ਪੇਸਟ ਕਰਦੇ ਹੀ ਲੋਕਲ ਤੌਰ 'ਤੇ ਪਾਰਸ, ਗਿਣਿਆ ਅਤੇ ਦਰਜਾਬੰਦ ਹੁੰਦਾ ਹੈ।

  1. 1
    Unicode-ਜਾਣੂ tokenization
    ਟੂਲ ਤੁਹਾਡੇ ਟੈਕਸਟ ਨੂੰ ਛੋਟੇ ਅੱਖਰਾਂ ਵਿੱਚ ਕਰਦਾ ਹੈ, ਫਿਰ Unicode property regex \p{L}\p{M} ਨਾਲ tokens ਕੱਢਦਾ ਹੈ — ਜੋ ਮਾਤਰਾ ਵਾਲੇ ਅੱਖਰਾਂ ਅਤੇ ਗ਼ੈਰ-ਲਾਤੀਨੀ ਲਿਪੀਆਂ ਨੂੰ ਸਹੀ ਸੰਭਾਲਦਾ ਹੈ। CJK ਟੈਕਸਟ (ਚੀਨੀ, ਜਾਪਾਨੀ, ਕੋਰੀਆਈ) ਲਈ, ਇਹ ਉਨ੍ਹਾਂ ਅੱਖਰਾਂ ਨੂੰ ਵੰਡਣ ਲਈ ਜਿਨ੍ਹਾਂ ਵਿਚਕਾਰ ਸਪੇਸ ਨਹੀਂ, granularity: 'word' ਨਾਲ ਬ੍ਰਾਊਜ਼ਰ ਦੀ ਬਿਲਟ-ਇਨ Intl.Segmenter API 'ਤੇ ਜਾਂਦਾ ਹੈ।
  2. 2
    Stop-word ਅਤੇ ਲੰਬਾਈ ਫ਼ਿਲਟਰ
    ਵਿਕਲਪਿਕ ਫ਼ਿਲਟਰ ਤੁਹਾਡੇ ਸਾਈਟ ਲੋਕੇਲ ਨਾਲ ਮੇਲ ਖਾਂਦੇ ਪੱਕੇ Set ਨਾਲ ਆਮ function words (the, a, is, ਅਤੇ ਸਪੇਨੀ, ਫ਼ਰਾਂਸੀਸੀ, ਜਰਮਨ, ਇਤਾਲਵੀ ਅਤੇ ਪੁਰਤਗਾਲੀ ਵਿੱਚ ਬਰਾਬਰ) ਹਟਾਉਂਦਾ ਹੈ। ਇੱਕ ਘੱਟੋ-ਘੱਟ-ਲੰਬਾਈ ਸਲਾਈਡਰ ਗਿਣਤੀ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਤੁਹਾਡੀ ਚੁਣੀ ਹੱਦ ਤੋਂ ਛੋਟੇ tokens ਹਟਾਉਂਦਾ ਹੈ।
  3. 3
    Map-ਅਧਾਰਿਤ ਆਵ੍ਰਿਤੀ ਗਿਣਤੀ ਅਤੇ n-gram ਮੋਡ
    Tokens ਇੱਕ JavaScript Map ਵਿੱਚ ਗਿਣੇ ਜਾਂਦੇ ਹਨ — ਖ਼ਾਸ ਤੌਰ 'ਤੇ ਚੁਣਿਆ ਤਾਂ ਜੋ 'constructor' ਵਰਗੇ ਰਾਖਵੇਂ property ਨਾਮ ਗਿਣੇ ਸ਼ਬਦਾਂ ਨਾਲ ਨਾ ਟਕਰਾਉਣ। bigram ਜਾਂ trigram ਮੋਡ ਵਿੱਚ, tokenizer ਕੱਚੇ token ਪ੍ਰਵਾਹ 'ਤੇ ਇੱਕ ਖਿੜਕੀ ਖਿਸਕਾਉਂਦਾ ਹੈ ਅਤੇ ਗਿਣਨ ਤੋਂ ਪਹਿਲਾਂ ਨਾਲ-ਨਾਲ ਦੇ ਸ਼ਬਦਾਂ ਨੂੰ ਵਾਕੰਸ਼ਾਂ ਵਿੱਚ ਜੋੜਦਾ ਹੈ।
  4. 4
    ਦਰਜਾਬੰਦ ਨਤੀਜੇ ਅਤੇ CSV ਐਕਸਪੋਰਟ
    ਨਤੀਜੇ ਗਿਣਤੀ ਮੁਤਾਬਕ ਘਟਦੇ ਕ੍ਰਮ ਵਿੱਚ ਛਾਂਟ ਕੇ ਦਰਜਾਬੰਦ bar chart ਵਜੋਂ ਦਿਖਾਏ ਜਾਂਦੇ ਹਨ। ਐਕਸਪੋਰਟ ਬ੍ਰਾਊਜ਼ਰ ਦੀ Blob API ਨਾਲ ਮੈਮਰੀ ਵਿੱਚ ਸਾਦਾ-ਟੈਕਸਟ CSV blob ਬਣਾਉਂਦਾ ਹੈ ਅਤੇ ਡਾਊਨਲੋਡ ਸ਼ੁਰੂ ਕਰਦਾ ਹੈ — ਕਿਸੇ ਵੀ ਸਮੇਂ ਸਰਵਰ ਨੂੰ ਕੁਝ ਨਹੀਂ ਭੇਜਿਆ ਜਾਂਦਾ।

ਸੰਬੰਧਿਤ ਟੂਲ

ਅਕਸਰ ਪੁੱਛੇ ਜਾਂਦੇ ਸਵਾਲ