检查用户访问路径,核心是从网站日志里按“同一访客、同一时间段”把多条请求串起来,还原他从哪个页面进入、点了什么、最后停在哪里。网站日志通常记录的是单次请求,而不是完整会话,所以你需要先确认日志里有没有可用的访客标识和时间戳,再决定用表格手工整理还是用脚本聚合。第一次做这件事,建议只取一小段日志、只跟一条路径,跑通流程后再扩大范围。
不同服务器和日志格式记录的字段不一样,能不能还原路径,取决于三样东西:时间、访客标识、请求地址。常见组合是 IP、时间戳、请求方法、URL、状态码、来源页(Referer)和 User-Agent。检查时逐项确认:
如果日志里连 IP 和时间戳都不完整,就无法可靠还原路径,此时应先调整日志格式再采集,而不是硬猜。
同一访客的请求要切成一次访问,常用判断条件是:同一访客标识,且相邻请求间隔不超过某个阈值(例如 30 分钟)。超过阈值就视为新会话。这个阈值没有统一标准,取决于你的业务:内容站阅读间隔可能较长,工具类站点操作间隔较短。
切分后,按时间排序,每条会话就是一条路径。例如一段假设日志(非真实项目数据):
10:01:02 访客A GET /home 200<br>10:01:20 访客A GET /list?cat=1 200<br>10:02:05 访客A GET /detail/88 200<br>10:03:40 访客A GET /contact 200
这条路径可以读作:首页 → 分类列表 → 详情页 → 联系页。判断结果是否可信,要看中间有没有缺失请求,比如静态资源是否被单独记录、是否被过滤掉。若日志只记 HTML 不记图片脚本,路径会更干净;若全记,需要先排除 css、js、图片等非页面请求。
选择依据是数据量和复查频率,不是工具高低。
如果只是想回答“用户从哪进来、在哪离开”,不必一开始就还原完整链路,先做入口和出口统计更省力。若要看站内导航是否有效,才需要完整路径。
得到路径后,重点看三类现象:
这些判断只说明“发生了什么”,不直接等于原因。一个现象可能有多个解释,比如跳出高既可能是内容不匹配,也可能是页面打不开,需要结合状态码和页面内容再确认。
下一步,取最近一天中访问量较高的一小段日志,按上面的会话切分方法跑一遍,先输出十条完整路径,再对照入口页和中断页做一次检查。