Besplatan Brojač učestalosti riječi

Brojite koliko se često svaka riječ pojavljuje u vašem tekstu. Vizualizirajte najčešće riječi, izvezite u CSV i filtrirajte stop riječi.

Radi offline nakon učitavanja

Učitajte .txt, .md, .csv, .docx ili .pdf. Datoteke se čitaju na vašem uređaju.

Min. dužina:
Min. broj:
Prikaži top:
Sortiraj:

Kako radi

Analiza frekvencije riječi se odvija u potpunosti u vašem pregledniku koristeći ručno napisan tokenizator i JavaScript Map — bez biblioteke, bez servera. Tekst se raščlanjuje, broji, i rangira lokalno u trenutku kada ga kucate ili lijepite.

  1. 1
    Unicode-svjesna tokenizacija
    Alat pretvara vaš tekst u mala slova, zatim izvlači tokene sa Unicode regularnim izrazom svojstva \p{L}\p{M} — koji ispravno rukuje akcentovanim slovima i neLatiničnim pismima. Za CJK tekst (kineski, japanski, korejski), prebacuje se na ugrađeni Intl.Segmenter API preglednika sa granularity: 'word' da podijeli znakove koji nemaju razmake između sebe.
  2. 2
    Filtriranje stop-riječi i dužine
    Opciono filtriranje uklanja uobičajene funkcijske riječi (the, a, is, i ekvivalenti na španskom, francuskom, njemačkom, italijanskom, i portugalskom) koristeći ugrađen Set podudaran vašem jezičkom regionu stranice. Klizač minimalne dužine uklanja tokene kraće od vašeg odabranog praga prije nego što brojanje počne.
  3. 3
    Brojanje frekvencije zasnovano na Map i mod n-grama
    Tokeni se broje u JavaScript Map — odabranom specifično tako da rezervisani nazivi svojstava poput 'constructor' ne mogu sudariti se sa brojanim riječima. U modu bigrama ili trigrama, tokenizator klizi prozor kroz sirov tok tokena i spaja susjedne riječi u fraze prije brojanja.
  4. 4
    Rangirani rezultati i CSV izvoz
    Rezultati se sortiraju po broju opadajuće i prikazuju kao rangirani trakasti grafikon. Izvoz gradi blob običnog tekstualnog CSV-a u memoriji koristeći Blob API preglednika i pokreće preuzimanje — ništa se nikada ne šalje serveru.

Povezani alati

Često postavljana pitanja