先做一件事:不要打开那个导出文件,而是找到它生成时对应的字段说明。旧工具导出的 .csv 或 .xls 打不开,通常不是数据坏了,而是编码、分隔符或软件版本变了;但只要字段含义没记下来,即使文件能打开,你也不知道哪一列是工具自己的估算值、哪一列是查询时间。保存原始字段含义的正确做法是:把导出文件当证据封存,另建一份字段字典,用可读文本记录每列的名称、来源、量纲和采集口径。
这两种情况处理方式不同。打不开是格式问题,读不懂是含义问题。区分方法很简单:用文本编辑器直接查看文件头部,如果能看到分隔符和列名,说明数据还在,只是表格软件不认;如果连列名都是乱码,则要先解决编码,再谈字段含义。
这里有一个容易走偏的判断:文件打不开,并不等于当年的数据无效。同样,文件能打开,也不等于字段含义可信。旧工具里的 PR 值多为第三方估算或工具栏缓存,与 Google 官方数据不是一回事,字段字典里必须写清这一点,否则后人会把它当成官方指标使用。
字段字典不是把列名抄一遍,而是让没参与当年工作的人也能正确理解。建议每列至少记录以下内容:
假设你手上有一份多年前导出的表格,其中一列叫 rank。如果字典只写“排名”,后来的人可能把它当成搜索排名;如果写“某工具栏显示的页面级别估算值,0–10 整数,非官方,采集于导出当日”,误读概率会大幅下降。这个假设说明的是记录方法,不代表任何具体工具的真实字段。
具体动作可以按这个顺序做,每一步的结果都会决定下一步:
抽样核对的结果会直接影响下一步。如果发现某列的值域与字典描述不符,比如写的是 0–10 却出现三位数,就要回头确认这列是否被工具改过口径,而不是直接修改字典去迁就数据。
保存字段含义的最终目的是决定这批数据还能不能用。可以用两个条件来区分:
需要提醒的是,旧工具页面打不开、查询结果为零,都不能单独证明这个指标已经失效。页面无法访问可能是迁移、下线或临时故障,结果为零也可能是查询条件或接口变化。真正能支撑判断的,是字段字典里记录的口径是否还成立。
字段字典写完并不算结束,还要让它能被找到、被读懂。把字典放在与数据同一目录,文件名包含数据批次而非工具名称,开头用一段话说明这批数据的用途和禁区。如果团队里还有人记得当年的查询方式,趁现在把口头信息补进字典的来源一栏;等到没人记得时,再想重建字段含义,成本会高得多。做到这一步,旧导出文件即使永远打不开,它的字段含义也已经以可读形式保存下来,后续无论是继续用于历史对比还是正式停用,都有明确依据。