原文、字节、候选结果的验证关系,强调可逆不等于确认来源
阅读口径

本文保留原字符串;操作在副本上进行,候选结果需由来源证据核对。

文件开头的签名

BOM 与 U+FEFF 有关,在 UTF-16 中用于识别字节序;UTF-8 不存在大小端区别,其 BOM 是可选签名。应区分文件开头的字节标记和正文里的实际字符。

规范参考:Unicode:UTF 与 BOM 问答。操作场景与排查建议为本站说明。

签名不能恢复错误文本

若错误四字已经保存为 UTF-8,添加或移除开头签名不会把正文改回原候选字符。检查工具识别与正文是否正确,是两个不同问题。

规范参考:Unicode:UTF 与 BOM 问答。操作场景与排查建议为本站说明。

按目标格式决定

部分导入工具使用签名辅助识别,其他格式可能有自己的约束。测试带签名和不带签名的副本,并记录接收工具的实际行为,不给所有文件统一盲加 BOM。

可执行检查单

  1. 01查看副本开头字节并记录有无签名。
  2. 02核对格式与接收工具要求。
  3. 03对比导入后的首字段与完整正文。

一个常见问题

首列多出奇怪字符一定是正文乱码吗?

也可能是签名被当成普通文本读取;需要核对文件头与解析设置,不能直接删除每行首字。

本页结论

BOM 是文件级线索;内容级修复仍需原字节与转换链。