字串分析器:字元計數、UTF-8 位元組大小、熵和文字診斷
文字看起來很簡單——只是一串字元。但問問電腦「這個字串有多長?」答案取決於你所說的「長度」是什麼意思。是 140 個字元?160 個位元組?10 個字詞?還有那些不可見的屬性——測量隨機性的熵、字母的頻率分佈,或者「e」出現的頻率是「k」的三倍這一事實?字串分析器同時解開所有這些維度。我們的免費線文字分析器為你提供從基本計數(帶空格和不帶空格的字元數、字數、列數、段落數)到進階診斷(UTF-8/UTF-16/UTF-32 中的位元組大小、夏農熵、字元頻率分佈、唯一字詞比率、最長字詞和迴文檢測)的所有內容——所有計算都在瀏覽器中即時完成,零資料發送到任何伺服器。
字元串分析器
免費 · 無需註冊
分步指南
貼上或輸入你的文字
在輸入區域中輸入你的文字——從單個字詞到完整文件。分析器在你輸入時即時更新,顯示即時計數。字詞計數器追蹤你寫作時的變化;字元計數器區分總字元數和排除空白的字元數。文字完全保留在瀏覽器中——不會有資料透過網路發送,因此對於敏感內容、正在分析的密碼或機密文件是安全的。
查看基本和進階指標
結果面板顯示:字元數(總計和不含空格)、字數(使用 Unicode 感知的字詞邊界檢測)、列數、段落數、句子數、平均字詞長度、最長字詞、唯一字詞計數和比率(唯一/總字詞,詞彙多樣性的度量)以及估計閱讀時間。在基本指標下方,進階指標顯示三種編碼的位元組大小(UTF-8、UTF-16、UTF-32)、夏農熵和字元頻率分佈。
探索位元組大小、熵和頻率
編碼部分顯示你的文字在 UTF-8(每個字元 1-4 位元組,ASCII 字元使用 1 位元組,CJK 字元使用 3)、UTF-16(每字元 2 或 4 位元組)和 UTF-32(每字元始終 4 位元組)中消耗多少位元組。熵分數(每字元 0-8 位元)告訴你文字的隨機性和不可預測性——對於密碼強度估計很有用。頻率表按出現次數和百分比排列每個唯一字元,揭示模式,如英語經典的 ETAOIN SHRDLU 頻率順序。
使用技巧與最佳實踐
UTF-8 是網路上佔主導地位的編碼(98% 以上的網站使用)。它是可變寬度的:ASCII 字元(英文字母、數字、常見標點)佔 1 位元組;拉丁擴展和希臘/西里爾佔 2 位元組;CJK(中文、日文、韓文)字元佔 3 位元組;表情符號和罕見文字佔 4 位元組。這意味著字串 "Hello" 在 UTF-8 中是 5 位元組,而 "こんにちは" 是 15 位元組——相同字元數但三倍大小。
UTF-16 被 JavaScript、Java 和 Windows API 內部使用。基本多語言平面(BMP,U+0000 到 U+FFFF,覆蓋大多數現存語言)中的字元使用 2 位元組,超出部分——如表情符號、歷史文字和罕見 CJK 字元——使用 4 位元組(代理對)。字串 "Hello😀" 是 5 個字元但在 UTF-16 中為 10 位元組(5*2),在 UTF-8 中為 9 位元組(5+4)。
夏農熵測量每字元的平均資訊內容。由於可預測的字母頻率和模式,英文文字通常得分為 3.5-4.5 位元/字元。完全隨機的文字(所有 26 個字母等機率)接近 4.7 位元/字元。混合大小寫、數字和符號的隨機密碼可達到 6.5+ 位元/字元。更高的熵 = 更隨機 = 更強的密碼。經驗法則:低於 2.5 位元/字元是高度結構化的文字;3.5-4.5 是自然語言;5.5 以上是隨機/產生的。
對於 SEO 元標籤:Google 通常顯示標題標籤最多 600 像素寬(約 50-60 個字元)和元描述最多 920 像素(約 150-160 個字元)。超出這些限制,你的文字將在搜尋結果中被截斷為省略號。我們的字串分析器的「SEO 模式」新增了針對這些顯示限制專門校準的計數器,在你超出可見閾值時標記。
SMS 訊息對於標準 GSM 7 位元編碼(拉丁字元 + 基本符號)使用 160 字元限制,但包含非 GSM 字元(西里爾、CJK、表情符號)的訊息使用 UCS-2 編碼,將限制降至每段 70 字元。超過一個段的訊息被拼接,進一步減少有效長度。我們的分析器指示你的文字是否適合一個 SMS 段以及適用哪種編碼。
字元頻率分析揭示對密碼學和語言學有用的模式。在英語散文中,字母「e」出現約 12.7% 的時間,其次是「t」(9.1%)、「a」(8.2%)和「o」(7.5%)。最少見的字母(q、z、j、x)每個出現不到 0.2% 的時間。可以透過將密文的頻率分佈與明文語言的已知分佈對齊來破解替換密碼——分析器的頻率圖表使這一點視覺化。
唯一字詞比率(唯一字詞 / 總字詞)是型別-標記比率(TTR),詞彙多樣性的度量。對於對話英語,TTR 通常在 0.45-0.55 之間。較高的值(0.6+)表示詞彙變化豐富;較低的值(低於 0.3)表示重複。兒童書籍和教學文字的 TTR 較低;文學小說 TTR 較高。TTR 低於 0.2 的文字讀起來通常像機器產生或關鍵字堆砌——是 SEO 內容品質的紅旗。
常見問題解答
文字是計算中最常見的資料型別,然而其隱藏屬性——跨編碼的位元組大小、熵、頻率模式、詞彙多樣性——在沒有字串分析器的情況下是不可見的。我們的工具即時揭示關於你的文字的一切,從 SEO 的字元計數到密碼強度的熵分數。貼上你的文字,看看真正有什麼。
免費試用此工具 →open_in_new