主攻 Python 爬虫与数据采集 3 年,能独立打通全链路:请求层控速重试,解析层处理 HTML/JSON 与动态渲染(Playwright),清洗层去重与增量入库,调度层用定时任务与日志。也做 Web 后端(FastAPI)与数据库,把数据接进接口看板;会用大模型做分类、抽取与摘要、自动打标。交付脚本、README、配置(密钥走 .env 不写死)、数据样本与自测报告。全远程,先出小样再开发,按天或里程碑结算,验收标准提前书面确认。不接需登录态或绕验证码风控的采集、个人信息与敏感数据、站点条款禁止的采集,以及先付费押金的。
某客户要长期跟踪某垂直行业站点的商品,数据分散在列表页与详情页、每天更新,人工整理又慢又漏。难点:列表页翻到一定页数后重复返回同一批数据导致漏采;详情页部分字段缺失,原脚本碰空值就整批中断;站点一改版解析全失效,排查要半天。我改用基于唯一标识的游标翻页;清洗层做空值分级,必填缺失告警、选填置空继续跑,单条异常不拖垮整批;解析规则拆成独立配置,改版只改一个文件。上线后必填字段非空率从 92% 提到 100%,单次采集由人工 1.5 小时变为定时自动完成,稳定运行 6 个月无中断,改版恢复从半天压到 2 小时。
可兼职时间
可兼职地点
0条评论 雇主评价