以Harvard Art Museum的网页作为案例,邓国亮介绍了Google Chrome网页抓取插件Web Scrapter的结构和具体使用方法。运用Web Scrapter的第一步在于分析所需网页的具体结构和操作,将下拉网页、点击进入相关连接、浏览网页等具体步骤抽象化为流程图。具体到Harvard Art Museum网页,邓国亮老师带领大家分析了在该网页上查询“China”的检索结果,可以看到,浏览该结果需要注意的地方在于,中途需要点击Load More加载全部搜索结果。这些在日常检索网页中不会引起注意的细节,却是在网页抓取过程中需要特殊设置的。
随后,第二步在于将上述操作流程具体化为Web Scrapter里面的select,具体到Harvard Art Museum网页上“China”的检索,相应select包括下拉页面(scroll-down)、点击Load More加载全部页面(pagination)、点击进入具体页面的链接、获取具体页面上的展品的信息等四个操作。在每一个select的设置中,邓国亮老师也带领大家具体实践了设置ID、选择任务类型、选取页面范围、设置延迟时间等具体操作细节,并耐心解答了大家在初次操作中遇见的各种问题。