阅读口径
本文保留原字符串;操作在副本上进行,候选结果需由来源证据核对。
报错能保留线索
Python 编解码支持 strict、replace、ignore 等错误处理方式。诊断时 strict 会在不可转换处报错;ignore 跳过失败部分,容易掩盖损失,不能用于证明无损恢复。
规范参考:Python:编解码与错误处理。操作场景与排查建议为本站说明。
往返只是必要证据之一
候选文本应能沿相反步骤回到原字符串,并逐码点一致。往返成功证明此路径可逆,但不证明它就是历史上实际发生的处理链。
规范参考:Python:编解码与错误处理。操作场景与排查建议为本站说明。
失败应分段标注
若一个文件只有部分行符合候选路径,记录成功与失败范围。不要为提高成功率改用忽略模式;失败行可能采用不同来源或已遭不可逆替换。
可执行检查单
- 01用 strict 转换单个小样本。
- 02反向转换并精确比较。
- 03保存异常位置和未修改原件。
一个常见问题
可以遍历所有编码选最像中文的吗?
可读性只能给候选排序,不能充当真实性证据;自动挑选最顺眼的结果会误改本来正确的文字。
本页结论
保留原文、明确假设、严格转换、往返核对是实验的最小记录。