字串分析器:字符數、UTF-8 位元組大小、熵同文字診斷
文字睇起嚟好簡單——只係一串字符。但問一部電腦「呢個字串有幾長?」答案取決於你嘅「長度」係咩意思。係 140 個字符?160 個位元組?10 個字?仲有啲隱形特性——量度亂數程度嘅熵、字母嘅頻率分佈、或者 "e" 出現嘅次數係 "k" 嘅三倍?一個字串分析器會一次過拆解晒所有呢啲維度。我哋嘅免費網上文字分析器俾到你由基本計數(包含同唔包含空格嘅字符數、字數、行數、段落數)到進階診斷(UTF-8/UTF-16/UTF-32 位元組大小、Shannon 熵、字符頻率分佈、唯一字比例、最長字、同回文檢測)嘅一切——全部喺你嘅瀏覽器入面即刻計算,唔會發送任何數據去任何伺服器。
字元串分析器
免費 · 無需註冊
分步指南
貼上或輸入你嘅文字
喺輸入區域輸入你嘅文字——由單一個字到完整文檔都得。分析器會隨你打字即時更新,顯示實時計數。字數計數器追踪你寫作時嘅變化;字符計數器區分總字符數同排除空白嘅字符數。文字完全留喺你嘅瀏覽器入面——永遠唔會透過網絡發送任何數據,令呢個工具對敏感內容、分析中嘅密碼或機密文檔都係安全嘅。
檢視基本同進階指標
結果面板顯示:字符數(總數同唔計空格)、字數(使用 Unicode 感知字邊界檢測)、行數、段落數、句子數、平均字長、最長字、唯一字數同比例(唯一字/總字數,一個詞彙多樣性嘅量度)、同估計閱讀時間。喺基本指標下面,進階指標顯示三種編碼嘅位元組大小(UTF-8、UTF-16、UTF-32)、Shannon 熵、同字符頻率分佈。
探索位元組大小、熵同頻率
編碼部分顯示你嘅文字喺 UTF-8(每個字符 1-4 位元組,ASCII 字符用 1 位元組,CJK 字符用 3)、UTF-16(每個字符 2 或 4 位元組)同 UTF-32(每個字符永遠 4 位元組)入面消耗幾多位元組。熵評分(每個字符 0-8 位元)告訴你文字有幾亂同不可預測——對密碼強度評估有用。頻率表按出現次數同百分比排列每個唯一字符,揭示模式好似英文經典嘅 ETAOIN SHRDLU 頻率順序。
使用技巧與最佳實踐
UTF-8 係網上嘅主導編碼(98%+ 網站使用)。佢係可變寬度嘅:ASCII 字符(英文字母、數字、常見標點符號)佔 1 位元組;拉丁擴展同希臘/西里爾字母佔 2 位元組;CJK(中文、日文、韓文)字符佔 3 位元組;表情符號同罕見文字佔 4 位元組。呢個表示字串 "Hello" 喺 UTF-8 係 5 位元組,而 "こんにちは" 係 15 位元組——相同數量字符但大三倍。
UTF-16 被 JavaScript、Java 同 Windows API 內部使用。佢對基本多文種平面(BMP,U+0000 到 U+FFFF,涵蓋大多數現存語言)入面嘅字符使用 2 位元組,對超越嘅字符——好似表情符號、歷史文字同罕見 CJK 字符——使用 4 位元組(代理對)。字串 "Hello😀" 係 5 個字符但喺 UTF-16 係 10 位元組(5×2)同喺 UTF-8 係 9 位元組(5+4)。
Shannon 熵量度每個字符嘅平均資訊內容。英文文字由於可預測嘅字母頻率同模式,通常得分 3.5-4.5 位元/字符。完全亂數文字(所有 26 個字母等概率)接近 4.7 位元/字符。一個混合大細階、數字同符號嘅亂數密碼可以達到 6.5+ 位元/字符。更高熵 = 更亂 = 更強密碼。作為經驗法則:低於 2.5 位元/字符係高度結構化文字;3.5-4.5 係自然語言;高於 5.5 係亂數/生成嘅。
對於 SEO 元標籤:Google 通常顯示標題標籤最多 600 像素闊(大約 50-60 個字符)同元描述最多 920 像素(大約 150-160 個字符)。超過呢啲限制你嘅文字會喺搜尋結果中被截斷同顯示省略號。我哋字串分析器嘅「SEO 模式」添加咗專門校準到呢啲顯示限制嘅計數器,當你超過可見閾值時標記。
SMS 訊息對標準 GSM 7 位元編碼(拉丁字符 + 基本符號)使用 160 字符限制,但包含非 GSM 字符(西里爾、CJK、表情符號)嘅訊息使用 UCS-2 編碼,將限制降到每段 70 字符。長過一段嘅訊息會被串聯,進一步減少有效長度。我哋嘅分析器指示你嘅文字係咪適合一個 SMS 段同適用邊種編碼。
字符頻率分析揭示對密碼學同語言學有用嘅模式。喺英文散文入面,字母 "e" 出現約 12.7% 嘅時間,跟住係 "t"(9.1%)、"a"(8.2%)同 "o"(7.5%)。最唔常見嘅字母(q、z、j、x)每個出現少過 0.2% 嘅時間。一個替換密碼可以透過將密文嘅頻率分佈同明文語言嘅已知分佈對齊嚟破解——分析器嘅頻率圖令呢個變得視覺化。
唯一字比例(唯一字 ÷ 總字數)係類型-令牌比(TTR),一個詞彙多樣性嘅量度。對於會話英文,TTR 通常範圍喺 0.45-0.55。較高數值(0.6+)表示多樣化詞彙;較低數值(低於 0.3)表示重複。兒童書同教學文字有低 TTR;文學小說有高 TTR。TTR 低於 0.2 嘅文字通常讀起嚟好似機械人或關鍵字堆砌——SEO 內容品質嘅一個紅旗。
常見問題解答
文字係運算中最常見嘅數據類型,但佢嘅隱藏特性——跨編碼嘅位元組大小、熵、頻率模式、詞彙多樣性——冇一個字串分析器係睇唔到嘅。我哋嘅工具即時揭示關於你文字嘅一切,由 SEO 嘅字符數到密碼強度嘅熵評分。貼上你嘅文字,睇下真正有咩喺度。
免費試用此工具 →open_in_new