Unicode文字確認

見えない文字や、見た目が同じ文字の違いを確認。コードポイントと正規化結果を比べられます。

コードポイント0
書記素(見た目の単位)0
UTF-16コード単位0
UTF-8バイト数0

調べるテキスト

最大20,000 UTF-16コード単位(多くの漢字・英数字は1、一般的な絵文字は2)。表には先頭500コードポイントを表示します。

正規化のプレビュー

1コードポイントずつ確認

テキストを入力すると文字の詳細が表示されます。

位置文字・表記コードポイントUTF-16UTF-8説明

Unicode文字確認の使い方

  • 確認したいテキストを貼り付けると、入力全体のコードポイント数・書記素数・UTF-8バイト数が表示されます。
  • 詳細表で文字ごとの U+ 表記とUTF-16表現を確認できます。空白やゼロ幅スペース、結合文字には説明を表示します。
  • 右側の4つの正規化プレビューを比較し、必要な形式をコピーします。元の入力は書き換えません。

具体例:見た目が同じ文字の違い

  • é は U+00E9 の1コードポイント、é は U+0065 と U+0301 の2コードポイントです。どちらも通常は1書記素で、NFCでは前者にそろいます。
  • 😀 は U+1F600 の1コードポイントですが、UTF-16では \uD83D \uDE00 の2コード単位、UTF-8では4バイトです。
  • 家族の絵文字 👨‍👩‍👧‍👦 は複数の絵文字を U+200D(ゼロ幅接合子)で結んでいます。コードポイント数と書記素数は一致しません。
  • ゼロ幅スペース U+200B は通常見えませんが、表では「ZWSP」と表示します。NFCなどの正規化で、すべての不可視文字が削除されるわけではありません。

正規化と集計について

  • NFC・NFDは標準的に等価な文字を合成・分解します。NFKC・NFKDは互換文字も変換するため、全角の A が A、丸数字の ① が 1 になるなど、表記の意味や見た目が変わる場合があります。
  • 書記素数はブラウザの Intl.Segmenter で数えます。未対応のブラウザでは「未対応」と表示します。絵文字の扱いはブラウザのUnicode対応状況によって異なる場合があります。
  • 表は先頭500コードポイントまでです。集計と正規化は入力全体を対象にします。「不可視・空白」には通常の空白や改行も含みます。
  • UTF-8バイト数はTextEncoderによる変換結果です。単独のサロゲートは U+FFFD に置換して数えます。すべての文字の正式名称を表示する辞書ではありません。
  • 解析・正規化はブラウザ内で行い、入力テキストを変換のためにサーバーへ送信しません。

関連ツール