熟练用Python的requests、lxml、pyquery库,能做静态网页分页抓取、列表加详情页多层采集,会解析公开AJAX接口,能批量下载图片,把数据清洗后导出成Excel或CSV表格,可根据客户指定的公开网页规则定制采集逻辑,交付可直接运行的脚本和整理好的结构化表格。。。
做过图书商品公开站点的全量采集项目,从列表页翻页到详情页取信息,自动下载商品图,最后整理成带完整字段的Excel表,还做过公开文章名录的批量抓取整理,完成公开图书站点采集项目,实现分页列表+详情页多层抓取,自动提取标题、价格等信息,批量下载图片,清洗数据并导出CSV/Excel表格。还完成公开文章名录抓取,按照需求定制采集规则,交付完整脚本与结构化数据表,适合网页公开资料批量整理。
可兼职时间
可兼职地点
0条评论 雇主评价