人工智能风头正盛,无论你是支持还是怀疑,AI对这个时代的影响都已逐渐渗透到各行各业当中,哪怕身处非互联网行业,也能感受到AI的滚滚浪潮。学习已成刚需,不过对于初学者而言,要正正经经上手机器学习,如何入门就有点让人手足无措了。

AI大法该当如何掌握?吴恩达就曾经说到,想要入门机器学习,应该进行一些项目实践。纸上谈兵是禁忌。
所以入门第一步,从选择一个数据集开始:
找到一个大小合宜,并且相对容易分析的数据集。UCL ML Repository和Kaggle盛产此物。 对数据集进行试验。挑几个顶级的机器学习算法跑一跑这些数据,看看数据的表现,了解一下每种算法的性能。 挑选表现最佳的算法进行操作。
下面分享三大项目,可以实操。
1项目:监督式机器学习
数据集:鸢尾花数据集
鸢尾花数据集堪称机器学习领域的“Hello World”。对数据一无所知?那么选择它就对了。
这个数据集的好处是足够小,仅仅只有150行,并且它只有四个属性:花瓣长度,花瓣宽度,萼片长度和萼片宽度。
通过判别四个已知属性,四种不同类型的鸢尾花在数据集中被标记出来,所以你可以拿它来学监督式机器学习。
这里建议使用多元分类训练方法。
另外,记得给自己设立一个小目标:根据花瓣和萼片的大小对三种花进行分类。
相关链接:
UCI机器学习仓库(UCI ML Repository):
https://archive.ics.uci.edu/ml/index.php
Kaggle数据集:
https://www.kaggle.com/datasets
2项目:交易预测
平台:GNY选择GNY团队的机器学习平台,这个平台挺好挺强大,最重要的是提供免费的下载安装。GNY团队还发布了一个通过神经网络预测零售交易的demo,正式版本将在今夏登陆,还将提供定制服务。

对于机器学习新人小白来说,这个demo不失为一个有趣的入门项目。你可以到MLWave上找一个数据集,根据消费历史来预测哪些人会成为回头客。
相关链接:
GNY机器学习平台:
https://www.gny.io/
3项目:情绪分析
数据集:twitter
情绪分析是机器学习里非常有趣的一种应用,检索数据也很容易获得,Reddit、Facebook和Linkedln都提供了易于使用的API。不过首选还是Twitter的数据,Twitter平台上的数据格式一致,预处理也要容易得多。

相关链接:Twitter数据集:https://github.com/shaypal5/awesome-twitter-data
以上是三大项目分享,小伙伴们可以操作起来。注:AI只负责产生结果,不对结果负责。选择一门顺应世界互联网趋势发展的技术,还是比较很重要的。