原文、字节、候选结果的验证关系,强调可逆不等于确认来源
阅读口径

本文保留原字符串;操作在副本上进行,候选结果需由来源证据核对。

声明应与文件一致

HTML 的 meta charset 应声明 UTF-8,并完整位于文档前 1024 字节内。文件实际也需要用 UTF-8 保存;只添加声明不会替你转换已有文件内容。

规范参考:WHATWG:HTML 字符编码声明。操作场景与排查建议为本站说明。

检查响应与生成环节

记录 Content-Type 中的字符集,以及模板读取源文件时使用的编码。如果源 JSON 已包含错误文字,浏览器按正确 UTF-8 显示出来仍然会是错误文字。

规范参考:WHATWG:HTML 字符编码声明。操作场景与排查建议为本站说明。

用本地副本进行比较

用开发用的小页面放置 ASCII、中文、表情和原字符串,比较构建前数据与生成后的 HTML。看到实体转义时先判断解析结果,不把源码中 & 符号的存在当成乱码。

可执行检查单

  1. 01查看文件保存编码与开头的 meta charset。
  2. 02比较生成前文本与生成后 HTML 字节。
  3. 03在受控环境核对响应字符集。

一个常见问题

把 charset 改为 GBK 可以吗?

只有文件与完整链路确实采用该编码时才有意义;新站应统一 UTF-8,不靠反复切换声明猜测原文。

本页结论

HTML 声明、服务器响应和源文本处理需要互相一致。