爬虫掌握scala/java等编程语言,理解JVM原理以及常见GC原理,
熟悉linux,理解常用算法、数据结构,
理解并熟练使用数据挖掘、机器学习常用算法(Naive Bayes、Kmeans++、LR、KNN、随机森林、Item-based CF、FP-Growth)熟练使用spark2.0.0 ML进行特征处理以及算法应用
理解HMM(隐马算法)原理并能使用常见NLP工具(Jieba、Hanlp)进行文本处理,
理解并掌握Hadoop、yarn、spark、hive等开源框架,
熟悉spark、hive常用调优方法,
熟悉Kafka、Flume等开源工具,理解数据仓库原理,
熟练使用HBase、MongoDB等非关系型数据库的常用操作,具有较强的理解能力、学习能力,以及分析问题、解决问题的能力。