文字コード・BOM確認
ファイルのBOM(Byte Order Mark)の有無・種別と、判定可能な範囲でのencoding候補を確認します。文字コードの自動判定には本質的な曖昧性があるため、確実に分かることと確実には分からないことを区別して表示します。
ファイルを確認する
ファイルをここにドラッグ&ドロップ、または
このツールでできること
ファイルの文字コード・BOMを確認するための主な機能です。
- ファイルを選択またはドラッグ&ドロップでアップロードできます
- ファイル先頭のBOM有無・種別(UTF-8/UTF-16LE/UTF-16BE/UTF-32LE/UTF-32BE)を確認できます
- BOM付きファイルは、BOMが示すencodingで本文全体が正しく解釈できるかどうかも分けて確認できます
- BOMなしファイルは、UTF-8・Shift_JIS(Windows-31J/CP932互換)のうちどちらが候補として成立するかを確認できます
- 先頭部分のraw byte列をhex表示で確認できます
- 判定カテゴリによっては、decodeされた内容のpreview(先頭部分)を確認できます
- 判定結果は7つのカテゴリに分けて表示され、確実に分かることと分からないことを区別して確認できます
手順を見る
- 確認したいファイルを「ファイルを選択」またはドラッグ&ドロップでアップロードします
- 自動的に解析が始まり、結果が表示されます処理はブラウザ内で完結し、ファイルは送信されません
- BOM有無・種別、判定カテゴリ、(該当する場合の)候補一覧を確認します
- 必要に応じて、raw byte列のhex表示やdecodedプレビューで詳細を確認します
こんなときに使えます
こんな場面で文字コード・BOM確認が役立ちます。
利用シーンを見る
- CSVやテキストファイルを開いたら文字化けしていて、原因を調べたいとき
- ファイルにUTF-8のBOMが付いているかどうかを確認したいとき
- ファイルがUTF-8なのかShift_JISなのか、判断材料が欲しいとき
- 他システムやツールへファイルを渡す前に、文字コードやBOMの有無を確認しておきたいとき
- BOMが原因でCSV取込エラーになっていないか切り分けたいとき
文字コード・BOMについて
詳しい解説を見る
文字コードとは
文字コードとは、文字とその対応する数値(byte列)を結びつけるルールです。コンピュータは文字を直接扱うことができず、内部的にはすべて数値として保存・処理しています。同じ文字であっても、UTF-8やShift_JISなど異なる文字コードでは、割り当てられる数値(byte列)が異なります。ファイルを開くときに文字コードの解釈を誤ると、文字化けが発生します。
BOM(Byte Order Mark)とは
BOM(Byte Order Mark)とは、ファイルの先頭に付与される数byteの目印で、そのファイルがどの文字コードで保存されているかを示す手がかりになります。UTF-8では3byte(EF BB BF)、UTF-16では2byte(FF FEまたはFE FF)、UTF-32では4byteのBOMが定義されています。BOMはあくまで「目印」であり、BOMが付いていても本文が実際にそのencodingとして正しく解釈できるとは限りません。本ツールは、BOMの検出と本文の妥当性確認を別の手順として扱います。
UTF-8とUTF-8 BOM付きの違い
UTF-8とUTF-8 BOM付きは、文字の並び自体(本文のbyte列)は同じです。違いは、ファイルの先頭にBOM(EF BB BF)が付いているかどうかだけです。多くのソフトウェアはBOMの有無を意識せず正しく開けますが、一部のソフトウェアやプログラムはBOMの有無によって挙動が変わったり、BOMを文字列の一部として誤って読み込んでしまったりすることがあります。他システムへファイルを渡す前にBOMの有無を確認しておくと、予期しない不具合を避けやすくなります。
Shift_JIS(Windows-31J/CP932互換)について
Shift_JISは、日本語環境で古くから使われてきた文字コードの一つです。本ツールでは、WHATWG Encoding Standardのshift_jisラベル(Windows-31J/CP932相当のデコード仕様)を採用しています。Shift_JISには標準化されたBOMが存在しないため、本ツールはBOMが検出されなかった場合にのみ、Shift_JISとして本文が解釈可能かどうかを確認します。BOM付きのファイルではShift_JISの候補判定は行いません。
なぜ文字コードを100%自動判定できない場合があるのか
BOMが付いていないファイルは、byte列だけを見て「どの文字コードで保存されたか」を確実に特定することができません。あるbyte列が、UTF-8として解釈しても、Shift_JISとして解釈しても、どちらも文字として成立してしまうことがあるためです(ASCII文字だけのファイルなど)。この場合、本ツールはどちらか一方に絞り込まず、成立する候補をすべて提示します。逆に、どちらの文字コードとしても正しく解釈できないbyte列は「判定不能」として表示し、断定はしません。
BOMがない場合の判定について(本ツールでの扱い)
BOMが検出されない場合、本ツールはUTF-8とShift_JIS(Windows-31J/CP932互換)の2つについてのみ、本文全体が正しく解釈できるかを確認します。UTF-16はBOMなしでは自動的な判定対象にしていません。BOMなしのUTF-16は、他の文字コードとして解釈しても偶然成立してしまうことがあり、誤った候補を提示するリスクが高いと判断したためです。同じ理由から、EUC-JPやISO-2022-JPなど、その他の文字コードについても自動判定の対象にはしていません。
よくある質問
BOM(Byte Order Mark)とは何ですか?
ファイルの先頭に付与される数byteの目印で、UTF-8やUTF-16などのencodingを判別する手がかりになります。本ツールはUTF-8/UTF-16LE/UTF-16BE/UTF-32LE/UTF-32BEの5種類のBOMを検出できます。
UTF-8とUTF-8 BOM付きは何が違いますか?
どちらも文字の並び自体は同じUTF-8ですが、UTF-8 BOM付きはファイル先頭に3byte(EF BB BF)の目印が付いている点が異なります。一部のソフトウェアはBOMの有無で挙動が変わることがあります。
Shift_JISかUTF-8か確実に判定できますか?
いいえ、確実な判定を保証するものではありません。本ツールはBOMがない場合、UTF-8・Shift_JIS(Windows-31J/CP932互換)それぞれとして本文を解釈できるかを確認し、成立する候補を提示します。両方成立する場合(ASCIIのみの内容など)は両方を候補として表示します。
UTF-16のファイルも確認できますか?
BOM付きのUTF-16LE/UTF-16BEファイルであれば、BOMの検出と本文の妥当性確認まで行えます。BOMが無いUTF-16ファイルの自動判定には対応していません(誤判定を避けるためです)。
UTF-32のファイルも確認できますか?
UTF-32LE/UTF-32BEはBOMの識別までを行います。本文がUTF-32として妥当かどうかの検証(decode)は対象外です。
アップロードしたファイルはサーバーへ送信されますか?
いいえ。ファイルの読み込み・解析はすべてお使いのブラウザ内で行われ、サーバーへの送信や保存は行いません。