Unicode文字確認
見えない文字や、見た目が同じ文字の違いを確認。コードポイントと正規化結果を比べられます。
コードポイント0
書記素(見た目の単位)0
UTF-16コード単位0
UTF-8バイト数0
正規化のプレビュー
1コードポイントずつ確認
テキストを入力すると文字の詳細が表示されます。
| 位置 | 文字・表記 | コードポイント | UTF-16 | UTF-8 | 説明 |
|---|
Unicode文字確認の使い方
- 確認したいテキストを貼り付けると、入力全体のコードポイント数・書記素数・UTF-8バイト数が表示されます。
- 詳細表で文字ごとの U+ 表記とUTF-16表現を確認できます。空白やゼロ幅スペース、結合文字には説明を表示します。
- 右側の4つの正規化プレビューを比較し、必要な形式をコピーします。元の入力は書き換えません。
具体例:見た目が同じ文字の違い
éは U+00E9 の1コードポイント、éは U+0065 と U+0301 の2コードポイントです。どちらも通常は1書記素で、NFCでは前者にそろいます。😀は U+1F600 の1コードポイントですが、UTF-16では\uD83D \uDE00の2コード単位、UTF-8では4バイトです。- 家族の絵文字
👨👩👧👦は複数の絵文字を U+200D(ゼロ幅接合子)で結んでいます。コードポイント数と書記素数は一致しません。 - ゼロ幅スペース U+200B は通常見えませんが、表では「ZWSP」と表示します。NFCなどの正規化で、すべての不可視文字が削除されるわけではありません。
正規化と集計について
- NFC・NFDは標準的に等価な文字を合成・分解します。NFKC・NFKDは互換文字も変換するため、全角の
AがA、丸数字の①が1になるなど、表記の意味や見た目が変わる場合があります。 - 書記素数はブラウザの Intl.Segmenter で数えます。未対応のブラウザでは「未対応」と表示します。絵文字の扱いはブラウザのUnicode対応状況によって異なる場合があります。
- 表は先頭500コードポイントまでです。集計と正規化は入力全体を対象にします。「不可視・空白」には通常の空白や改行も含みます。
- UTF-8バイト数はTextEncoderによる変換結果です。単独のサロゲートは U+FFFD に置換して数えます。すべての文字の正式名称を表示する辞書ではありません。
- 解析・正規化はブラウザ内で行い、入力テキストを変換のためにサーバーへ送信しません。
関連ツール
- 文字数カウンター:文章全体の文字数・行数などを確認します。
- 文字種変換:半角・全角やひらがな・カタカナを変換します。
- 文字コード変換:UTF-8やShift_JISなどのファイル形式を変換します。
- すべての変換ツールを見る