LibraTool logoLibraTool

ነፃ የቃል ድግግሞሽ ቆጣሪ

እያንዳንዱ ቃል በጽሑፍዎ ውስጥ ስንት ጊዜ እንደሚታይ ይቁጠሩ። ከፍተኛ ቃላትን ይመልከቱ፣ ወደ CSV ያውጡና stop wordsን ያጣሩ።

ከተጫነ በኋላ ከመስመር ውጭ ይሠራል

.txt፣ .md፣ .csv፣ .docx ወይም .pdf ይጫኑ። ፋይሎች በመሣሪያዎ ላይ ይነበባሉ።

ዝቅተኛ ርዝመት:
ዝቅተኛ ቁጥር:
ከፍተኛዎቹን አሳይ:
ደርድር:

እንዴት እንደሚሠራ

የቃላት ድግግሞሽ ትንተና ሙሉ በሙሉ በአሳሽዎ ውስጥ በእጅ በተጻፈ ከፋፋይ እና በJavaScript Map ይሠራል — ምንም ላይብረሪ፣ ምንም አገልጋይ የለም። ጽሑፍ እንደተየቡት ወይም እንደለጠፉት ወዲያውኑ በአካባቢው ይተነተናል፣ ይቆጠራል እና ይደረደራል።

  1. 1
    Unicodeን የሚያውቅ መከፋፈል
    መሣሪያው ጽሑፍዎን ወደ ትንሽ ፊደል ይቀይራል፣ ከዚያም በUnicode ንብረት regex \p{L}\p{M} ቁራጮችን ያወጣል — ይህም አክሰንት ያላቸውን ፊደላት እና የላቲን ያልሆኑ ፊደላትን በትክክል ያስተናግዳል። ለCJK ጽሑፍ (ቻይንኛ፣ ጃፓንኛ፣ ኮሪያኛ)፣ በመካከላቸው ክፍተት የሌላቸውን ቁምፊዎች ለመከፋፈል ወደ አሳሹ አብሮገነብ Intl.Segmenter API ከgranularity: 'word' ጋር ይቀየራል።
  2. 2
    የማቆሚያ ቃላት እና የርዝመት ማጣሪያ
    አማራጭ ማጣሪያ ከጣቢያዎ ቋንቋ ጋር የሚዛመድ ቋሚ Set በመጠቀም የተለመዱ ተግባራዊ ቃላትን (the፣ a፣ is እና በስፓኒሽ፣ በፈረንሳይኛ፣ በጀርመንኛ፣ በጣሊያንኛ እና በፖርቱጋልኛ ያሉ አቻዎቻቸውን) ያስወግዳል። የዝቅተኛ ርዝመት ተንሸራታች ቆጠራው ከመጀመሩ በፊት ከመረጡት ገደብ ያጠሩ ቁራጮችን ያስወግዳል።
  3. 3
    በMap ላይ የተመሠረተ የድግግሞሽ ቆጠራ እና የn-gram ሁነታ
    ቁራጮች በJavaScript Map ውስጥ ይቆጠራሉ — እንደ 'constructor' ያሉ የተጠበቁ የንብረት ስሞች ከተቆጠሩ ቃላት ጋር እንዳይጋጩ በተለይ የተመረጠ። በbigram ወይም trigram ሁነታ፣ ከፋፋዩ በጥሬው የቁራጭ ፍሰት ላይ መስኮት ያንሸራትታል እና ከመቁጠሩ በፊት ተጎራባች ቃላትን ወደ ሐረጎች ያጣምራል።
  4. 4
    የተደረደሩ ውጤቶች እና የCSV ማውጣት
    ውጤቶቹ በብዛት ከብዙ ወደ ትንሽ ይደረደራሉ እና እንደ ደረጃ ያለው የአምድ ገበታ ይታያሉ። ማውጫው የአሳሹን Blob API በመጠቀም በማህደረ ትውስታ ውስጥ የቀላል ጽሑፍ CSV blob ይገነባል እና ማውረድን ያስነሳል — በየትኛውም ጊዜ ወደ አገልጋይ ምንም አይላክም።

ተዛማጅ መሳሪያዎች

ተደጋጋሚ ጥያቄዎች