爬虫:1. 破解知乎、小红书已知的反爬首段,例如滑块,扭曲英文+数字验证码,以通过跳转的方式登录获取到数据,进行数据高分析,得到产品的有效数据,进行竞品和品牌分析,为客户了有价值的线索
2. 招标数据。反爬完成对360剑鱼、招标网、千里马等站点数据的获取,为企业提供实时的招标数据,同时实现了页面可视化。
NLP: 现阶段主要从事部门词库的拓词,包括行业词、长尾词等。开发了文本相似度接口,面向中文的切词接口。
框架开发: 开发了基于twisted网络框架的数据获取框架。大大节省了公司的成本,同时简单易上手。