电子发烧友网 > 人工智能 > 正文

统计学对于机器学习有什么作用

2020年04月05日 21:51 次阅读

统计学和机器学习是两个密切相关的领域。实际上,两者之间的界限有时可能非常模糊。但是,有一些方法显然属于统计领域,不仅在机器学习项目中有用,而且非常有价值。可以公平地说,需要统计方法才能有效地通过机器学习预测建模项目工作。

统计学对于机器学习有什么作用

统计学是先决条件

机器学习和统计学是两个紧密相关的研究领域。因此许多统计学家将机器学习称为“ 应用统计学 ”或“ 统计学习 ”,而不是以计算机科学为中心的名称。

所有的机器学习初学者都应该学习一点统计学的知识。下面有几个精心挑选的例子来具体说明。

从一本流行的应用机器学习书《 Applied Predictive Modeling 》的开头看一下这句话:

… the reader should have some knowledge of basic staTIsTIcs, including variance, correlaTIon, simple linear regression, and basic hypothesis tesTIng (e.g. p-values and test statistics)。

— Page vii, Applied Predictive Modeling, 2013

这是流行的《 Introduction to Statistical Learning 》一书中的另一个示例:

We expect that the reader will have had at least one elementary course in statistics.

— Page 9, An Introduction to Statistical Learning with Applications in R, 2013.

即使不是统计学的先决 条件,也需要一些原始的先验知识,这可以从广泛阅读的“ Programming Collective Intelligence ”的引用中看出:

… this book does not assume you have any prior knowledge of […] or statistics. […] but having some knowledge of trigonometry and basic statistics will help you understand the algorithms.

— Page xiii, Programming Collective Intelligence: Building Smart Web 2.0 Applications, 2007.

为了能够理解机器学习,需要对统计信息有一些基本的了解。

想要知道为什么会这样,我们必须了解为什么首先需要统计领域。

为什么要学习统计?

原始观测值本身就是数据,但它们不是信息或知识。

数据引发了一些问题,例如:

最常见或最期望的观察是什么?

观察的极限是什么?

数据是什么样的?

尽管它们看起来很简单,但必须回答这些问题才能将原始观察结果转化为我们可以使用和共享的信息。

除了原始数据,我们还可以通过设计实验来收集观察数据。从这些实验结果中,我们可能会遇到更复杂的问题,例如:

哪些变量最相关?

两次实验的结果有何不同?

差异是真实存在的还是因为数据噪声产生的?

这些问题很重要。问题的答案对项目,利益相关者以及有效的决策都是至关重要的。

需要统计方法来找到关于数据的问题的答案。

我们可以看到,为了了解用于训练机器学习模型的数据并解释测试不同机器学习模型的结果,都需要统计方法。

这只是冰山一角,因为预测建模项目中的每个步骤都将需要使用统计方法。

什么是统计学?

统计学是数学的一个子领域。

它指的是处理数据和使用数据回答问题的方法的集合。

Statistics is the art of making numerical conjectures about puzzling questions. […] The methods were developed over several hundred years by people who were looking for answers to their questions.

— Page xiii, Statistics, Fourth Edition, 2007.

这是因为该领域包括处理数据的方法包,对于初学者而言,它看起来像是很大的东西,而且是不确定的。很难看出属于统计方法的方法与属于其他研究领域的方法之间的界限。通常,技术既可以是统计中的经典方法,又可以是用于特征选择或建模的现代算法。

尽管统计工作知识不需要深入的理论知识,但一些重要的且易于理解的定理可以为统计和概率之间的关系提供有价值的基础。

两个例子包括大数定律和中心极限定理;第一个有助于理解为什么较大的样本通常更好,第二个则为我们如何比较样本之间的期望值(例如平均值)提供了基础。

对于我们在实践中使用的统计工具,将统计领域分为两大类方法可能会有所帮助:用于汇总数据的描述性统计和用于从数据样本中得出结论的推论统计。

Statistics allow researchers to collect information, or data, from a large number of people and then summarize their typical experience. […] Statistics are also used to reach conclusions about general differences between groups. […] Statistics can also be used to see if scores on two variables are related and to make predictions.

Pages ix-x, Statistics in Plain English, Third Edition, 2010.

描述统计

描述性统计指的是将原始观察汇总为我们可以理解和共享的信息的方法。

通常,我们将描述性统计视为对数据样本的统计值的计算,以便总结数据样本的属性,例如共同的期望值(例如,均值或中位数)和数据的传播范围(例如,方差或标准差)。

描述性统计信息还可能涵盖可用于可视化数据样本的图形方法。图表和图形可以对观察的形状或分布以及变量之间如何相互关联提供有用的定性理解。

推论统计

推论统计是一些方法的统称,这些方法可以帮助从较小的一组称为样本的观测值中量化域或总体的属性。

通常,我们认为推论统计是根据总体分布估算的数量,例如期望值或传播数量。

更复杂的统计推断工具可用于量化在给定假设的情况下观察数据样本的可能性。这些通常被称为统计假设检验的工具,其中检验的基本假设称为原假设。

给定我们可以假设的假设范围以及我们可能施加在数据上的约束条件,以提高检验结果正确的能力或可能性,推理性统计方法的例子很多。

统计方法在机器学习项目中的使用示例

在下面的内容中,展示了统计方法的一些特定示例,这些示例在预测建模问题的关键步骤中非常重要。可以公平地说,需要统计方法才能有效地通过机器学习方法完成预测建模的工作。

1.问题框架

在预测建模问题中较大的影响力也许就是问题的框架。

这是问题类型的选择,例如回归或分类,也许是问题的输入和输出的结构和类型。

问题的框架并不总是很明显。对于某个领域的新手,可能需要对该领域中的观察结果进行大量探索。

对于可能不从常规角度看问题的领域专家,他们也可能会从多个角度考虑数据而获取一些有用信息。

可以在问题分类期间帮助探索数据的统计方法包括:

探索性数据分析。进行汇总和可视化以探索数据的临时视图。

数据挖掘。自动发现数据中的结构化关系和模式。

2.数据理解

数据理解意味着对变量的分布以及变量之间的关系有密切的了解。

其中一些知识可能来自领域专业知识,或者需要领域专业知识才能进行解释。尽管如此,研究领域的专家和新手都将从实际处理领域问题中的实际观察有所受益。

统计方法的两个大分支用于帮助理解数据。他们是:

摘要统计。使用统计量总结变量之间的分布和关系的方法。

数据可视化。使用图表和图形等可视化方法总结变量之间的分布和关系的方法。

3.数据清理

来自某个领域的观察通常不是原始的。

尽管数据是数字的,但会受到可能破坏数据保真度的过程的影响,进而可能会影响使用该数据的任何下一步过程或模型。

一些示例包括:

数据损坏。

数据错误。

数据丢失。

识别和修复数据问题的过程称为数据清理

统计方法用于数据清理,例如:

离群值检测。识别与分布中的期望值相差甚远的观测值的方法。

归责。修复或填充观测值中损坏或缺失的方法。

4.数据选择

建模时,并非所有观察值或所有变量都可能相关。

将数据范围缩小到对做出预测最有用的那些元素的过程称为数据选择。

用于数据选择的两种统计方法包括:

数据样本。从较大的数据集中系统创建较小的代表性样本的方法。

特征选择。自动识别与结果变量最相关的那些变量的方法。

5.数据准备

数据通常不能直接用于建模。

通常需要进行一些转换,以更改数据的形状或结构,使其更适合问题的选定框架或学习算法。

使用统计方法进行数据准备。一些常见的示例包括:

缩放比例。标准化和归一化等方法。

编码。整数编码和One-hot编码等方法。

转换。诸如Box-Cox方法之类的幂变换方法。

6.模型评估

预测建模问题的关键部分是评估学习方法。

在对模型训练期间未看到的数据进行预测时,通常需要估计模型的技能。

通常,训练和评估预测模型的过程的计划称为实验设计。这是统计方法的整个子领域。

实验设计。设计系统实验以比较自变量对结果的影响的方法,例如选择机器学习算法来提高预测精度。

作为实施实验设计的一部分,使用方法对数据集进行重新采样,以便经济地利用可用数据,从而估算模型的技能。

重采样方法。为了训练和评估预测模型而将数据集系统地分为子集的方法。

7.模型超参数配置

给定的机器学习算法通常具有一整套超参数,这些超参数允许使用者根据特定问题而定制学习方法。

超参数的配置在本质上通常是经验性的,而不是分析性的,需要大量的实验才能评估不同的超参数的取值对模型效果的影响。

使用两个统计子字段之一对不同的超参数配置之间的结果进行解释和比较:

统计假设检验。给定对结果的假设或期望,量化观察结果的可能性的方法(使用临界值和p值表示)。

估计统计。使用置信区间量化结果不确定性的方法。

8.模型选择

对于给定的预测建模问题,可能有不止一个机器学习算法适合于此问题。选择一种方法作为解决方案的过程称为模型选择。这可能涉及项目利益相关者的一套标准,也包括对问题评估方法的估计技能的仔细解释。

与模型配置一样,出于模型选择的目的,可以使用两类统计方法来解释不同模型的估计技能。他们是:

统计假设检验。给定对结果的假设或期望,量化观察结果的可能性的方法(使用临界值和p值表示)。

估计统计。使用置信区间量化结果不确定性的方法。

9.模型介绍

一旦对最终模型进行了训练,就可以在使用或部署最终模型以对实际数据进行实际预测之前将其呈现给利益相关者。

呈现最终模型的一部分涉及呈现模型的估计方法。

估计统计领域的方法可用于通过使用公差区间和置信区间来量化机器学习模型的估计技能中的不确定性。

估计统计。通过置信区间量化模型技能不确定性的方法。

10.模型预测

最后,是时候开始使用最终模型对我们不知道实际结果的新数据进行预测了。

作为进行预测的一部分,量化预测的置信度很重要。

就像模型表示过程一样,我们可以使用估计统计领域的方法来量化此不确定性,例如置信区间和预测区间。

估计统计。通过预测区间量化预测不确定性的方法。

从上面的例子可以看到统计方法在整个预测建模项目过程中的重要性。 探索性的数据分析,数据汇总和数据可视化可用于帮助构建预测性建模问题并更好地理解数据。统计方法可用于清理和准备用于建模的数据。统计假设检验和估计的统计数据可以在模型的选择和从最终模型展示的技能和预测帮助。

责任编辑:ct

下载发烧友APP

打造属于您的人脉电子圈

关注电子发烧友微信

有趣有料的资讯及技术干货

关注发烧友课堂

锁定最新课程活动及技术直播

电子发烧友观察

一线报道 · 深度观察 · 最新资讯
收藏 人收藏
分享:

评论

相关推荐

【现场直播】第五届IoT大会之人工智能分论坛

直播主题:● AI知名企业大佬现场分享观点,解读行业趋势● 中国AI产品制造商和系统集成商的产品、技术和市场战略● AI
发烧友学院发表于 2018-12-18 00:00 1912次阅读
【现场直播】第五届IoT大会之人工智能分论坛

人工智能对于销售行业有什么影响

人工智能和机器学习现在很容易采用,并且人们也知道可以使现在执行的许多重复性任务和过程实现自动化。
发表于 2020-04-05 21:57 0次阅读
人工智能对于销售行业有什么影响

机器学习可以准确的预测股市?

机器学习是一种数据分析技术,它可以借鉴使用计算数据的经验,直接从数据中“学习”信息,而无需依赖预先确....
发表于 2020-04-05 21:53 5次阅读
机器学习可以准确的预测股市?

怎样的人工智能系统适合城市战环境

美国陆军开展的主要工作是寻找能够成功分析与人认知和行为相关的主观性判断方法,如识别言语模式或与人过往....
发表于 2020-04-05 21:50 6次阅读
怎样的人工智能系统适合城市战环境

人工智能对数据中心有什么影响

人工智能在汽车、制造、医疗和国防行业的应用将最为广泛;数据中心和云计算基础设施将成为人工智能训练的主....
发表于 2020-04-05 21:47 18次阅读
人工智能对数据中心有什么影响

web前端可以在AI时代做一些什么

人工智能是计算机科学的一个分支,它企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应....
发表于 2020-04-05 21:45 6次阅读
web前端可以在AI时代做一些什么

人工智能怎样应对网络欺骗

人工智能分析过去的行为,并使用该信息来评估其正在尝试进行的当前交易的风险。
发表于 2020-04-05 21:45 17次阅读
人工智能怎样应对网络欺骗

人工智能如何让景区拥有智慧

随着5G、人工智能、物联网等技术逐渐成熟,智慧景区成了又一落地应用场景,各地旅游区开始加快智慧景区建....
发表于 2020-04-05 21:42 16次阅读
人工智能如何让景区拥有智慧

人工智能以后会如何影响教育行业

众所周知,人工智能正在改变人类社会的方方面面,无论是自动停车系统、移动支付、社交媒体订阅还是我们每天....
发表于 2020-04-05 21:42 5次阅读
人工智能以后会如何影响教育行业

人工智能什么误区你可能会相信

总而言之,过早地采用人工智能可能会很有趣,就像人们在数据中心消亡之前就试图将其埋葬一样。
发表于 2020-04-05 21:36 6次阅读
人工智能什么误区你可能会相信

人工智能数据存储的选择有哪些准则

企业选择错误的人工智能存储平台可能会产生严重影响。因此,人们需要了解可能影响企业选择人工智能数据存储....
发表于 2020-04-05 21:27 27次阅读
人工智能数据存储的选择有哪些准则

大规模存储基础设施对于AI有着怎样的要求

人工智能/机器学习环境创建使用内部或直接连接存储(DAS)的计算服务器集群的情况并不少见。
发表于 2020-04-05 21:23 20次阅读
大规模存储基础设施对于AI有着怎样的要求

哪一些行业需要人工智能带来颠覆

以消费者为中心的人工智能和自动化应用正在帮助消除一些公众的误解,即这些技术只会对企业有益,而对就业和....
发表于 2020-04-05 21:12 59次阅读
哪一些行业需要人工智能带来颠覆

机器设计会受到AI技术的影响吗

人工智能如今应用越来越广泛。在大多数情况下,健壮和自适应的人工智能可以为人类的专业知识提供补充,而不....
发表于 2020-04-05 21:09 9次阅读
机器设计会受到AI技术的影响吗

人工智能真的可以和人类一样学习吗

随着企业将人工智能集成到自己的系统中,科技人员将目光投向了人工智能创新的新领域。
发表于 2020-04-05 21:04 59次阅读
人工智能真的可以和人类一样学习吗

为什么要采用人工智能技术

人工智能能够为企业提供更好、更清晰的视野,从而根据客户需求塑造服务和产品。
发表于 2020-04-05 20:58 61次阅读
为什么要采用人工智能技术

AI数据服务野蛮生长后是怎样的

随着科技技术不断更新迭代,企业变革的方向已由信息化向智能化发展,而在此过程中,如何获取数据成为最重要....
发表于 2020-04-03 16:40 215次阅读
AI数据服务野蛮生长后是怎样的

产业链上下互联互通“三化”战略助力煤炭产业智能化...

4月3日消息,针对煤炭产业的智能化发展需求,找煤网推出了“通过互联网化助推行业交易效率;通过信息化作....
发表于 2020-04-03 16:29 239次阅读
产业链上下互联互通“三化”战略助力煤炭产业智能化...

人工智能如何显示自己的神通

疫情发生以来,企业的生存与发展成为全社会关注的问题。对于大多数企业来说,如何在疫情中变被动为主动,能....
发表于 2020-04-03 16:19 59次阅读
人工智能如何显示自己的神通

人工智能有可能冲击国际安全吗

演进派则认为人工智能更应被看作是武器的“放大器”,其作为武器本身并不是直接引发国际安全范式性变革的主....
发表于 2020-04-03 16:07 43次阅读
人工智能有可能冲击国际安全吗

谷歌Art Transfer工具将照片转换

随着机器学习和人工智能技术的发展,搜索巨头谷歌已经将自家研究成果应用于方方面面。比如近日推出的一款名....
发表于 2020-04-03 15:55 174次阅读
谷歌Art Transfer工具将照片转换

人工智能助力新药研发,它的优势是什么

近日,一家英国初创公司表示,该公司成功使用人工智技术开发出了一款药物。据悉,这款借助人工智能而开发的....
发表于 2020-04-03 15:52 159次阅读
人工智能助力新药研发,它的优势是什么

人工智能技术怎样升级

不管是VR逛展或看房能够带来多么真实的体验,还是各式机器人灵活强大的功能,非接触式服务的兴起依靠的是....
发表于 2020-04-03 15:50 79次阅读
人工智能技术怎样升级

人工智能技术如何控制水下机器人

爱丁堡机器人中心提供机器人平台和基于深度强化学习的算法框架指导,沈自所面向机器人平台特点进一步深入进....
发表于 2020-04-03 15:44 43次阅读
人工智能技术如何控制水下机器人

AI赋能新客服可以强化什么

随着“新基建”的提出,给中国的科技发展带来新的发展机遇,人工智能基础设施面临全面升级。
发表于 2020-04-03 15:36 29次阅读
AI赋能新客服可以强化什么

人工智能拓展的领域有哪一些

人工智能是一门贯穿性的综合学科,主要包含计算机、控制论、信息论、神经生理学、语言学,人工智能是从计算....
发表于 2020-04-03 15:33 39次阅读
人工智能拓展的领域有哪一些

人工智能主要在哪一些场景出现

深度学习作为人工智能领域的一个应用分支,不管是从市面上公司的数量还是投资人投资喜好的角度来说,都是一....
发表于 2020-04-03 15:30 30次阅读
人工智能主要在哪一些场景出现

你有没有发现你身边的人工智能

人工智能是计算机科学的一个分支,它企图了解智能的实质,并生产出一种新的能以人类智能相似的方式做出反应....
发表于 2020-04-03 15:24 30次阅读
你有没有发现你身边的人工智能

传统产业如何快速驶入数字化新基建,中琛源多重优势...

从传统的“铁公基”,到如今涉及5G、特高压、城际高速铁路和城市轨道交通、新能源汽车充电桩、大数据中心....
发表于 2020-04-03 15:21 147次阅读
传统产业如何快速驶入数字化新基建,中琛源多重优势...

如何让AI走上“高速”

随着国家加速新基建的步伐,人工智能企业即将进入发展的快车道,安顿将直接受益于5G、大数据中心、人工智....
发表于 2020-04-03 15:18 12次阅读
如何让AI走上“高速”

人工智能产业进入哪里怎样的拐点

近期的AI领域处于震动与酝酿的时期,一些看似寻常的新闻线索,却隐含着不平凡的市场迹象。
发表于 2020-04-03 15:14 292次阅读
人工智能产业进入哪里怎样的拐点

AI应用的落地还需要解决哪一些难题

人工智能的应用落地,需要市场、应用场景、各行各业海量的专业数据和专业人才的共同支持参与,这是人工智能....
发表于 2020-04-03 15:10 107次阅读
AI应用的落地还需要解决哪一些难题

人工智能在预测单机风电功率上有什么优势

人工智能在处理非线性预测问题上具有优势,对单机风电功率预测建模有一定的价值。
发表于 2020-04-03 15:05 73次阅读
人工智能在预测单机风电功率上有什么优势

英特尔扩大与中国百度的AI合作

这家芯片制造商表示, 与百度的合作非常重要,因为它已发展成为一种“普遍的能力”,将被用于增强中国的几....
发表于 2020-04-03 15:04 346次阅读
英特尔扩大与中国百度的AI合作

智能机器人面对疫情有哪一些挑战

作为“新基建”的一部分,工业互联网行业近日迎来诸多利好,随着疫情的日渐好转,在后疫情时代,利用人工智....
发表于 2020-04-03 15:01 47次阅读
智能机器人面对疫情有哪一些挑战

一款利用人工智能和物联网来帮助老年人和他们的看护...

凯伦·罗比:机器学习,人工智能——我们在TechRepublic和ZDNet上谈论了很多这方面的内容....
发表于 2020-04-03 15:01 186次阅读
一款利用人工智能和物联网来帮助老年人和他们的看护...

阿里巴巴云为冠状病毒医疗提供人工智能平台

例如,CT图像分析解决方案被吹捧为提高COVID-19诊断的检测准确性和检测速度。阿里巴巴表示,该人....
发表于 2020-04-03 14:59 145次阅读
阿里巴巴云为冠状病毒医疗提供人工智能平台

一项关于可解释人工智能规划(XAIP)的工作调查

可解释AI(X AI)近年来一直是一个积极的研究课题,受到DARPA2016年倡议的推动。 计算机视....
发表于 2020-04-03 14:57 165次阅读
一项关于可解释人工智能规划(XAIP)的工作调查

人工智能和5G技术怎样带领各行业的转型

基于云计算、5G、大数据技术的助力,数字经济正在进化到以人工智能为核心驱动力的智能经济新阶段,与之相....
发表于 2020-04-03 14:56 121次阅读
人工智能和5G技术怎样带领各行业的转型

KiloGram是一种用于管理文件中的大型n-g...

在KDD 2019网络安全学习和采矿研讨会上发表的论文中,来自马里兰大学和网络安全公司Endgame....
发表于 2020-04-03 14:55 121次阅读
KiloGram是一种用于管理文件中的大型n-g...

人工智能正在改变我们与技术互动的方式

对客户体验的期望已经改变,并且对于这种改变越来越重要的一个因素是机器学习。我们经常使用的大多数数字产....
发表于 2020-04-03 14:54 140次阅读
人工智能正在改变我们与技术互动的方式

微软和合作伙伴宣布Deepfake检测挑战

在最近的博客文章中,Facebook的首席技术官Mike Schroepfer宣布,Facebook....
发表于 2020-04-03 14:52 411次阅读
微软和合作伙伴宣布Deepfake检测挑战

大脑活动可以利用人工智能来变成文本?

计算机生成的大脑图像美国的研究人员跟踪了人们说话时的神经数据。
发表于 2020-04-03 14:51 19次阅读
大脑活动可以利用人工智能来变成文本?

人工智能放射科医生是如何兴起的

人工智能应用程序正迅速进入诊所,医生们对这项技术既感到兴奋,又担心自己的工作被机器抢走。
发表于 2020-04-03 14:45 22次阅读
人工智能放射科医生是如何兴起的

机器学习的异常检测算法

吴恩达机器学习Coursera-week9
发表于 2020-04-03 11:34 21次阅读
机器学习的异常检测算法

机器学习的决策树介绍

机器学习——决策树算法分析
发表于 2020-04-02 11:48 24次阅读
机器学习的决策树介绍

我是如何掌握CCD视觉检测系统项目的?

《双ccd+视觉通用框架-LabVIEW视觉必学高阶课程》报名链接:视觉软件工程师目前现状 自动化行业当前最热且高薪的...
发表于 2020-03-27 15:34 480次阅读
我是如何掌握CCD视觉检测系统项目的?

吴恩达机器学习clustering分类算法

吴恩达机器学习Coursera-week8
发表于 2020-03-27 07:34 44次阅读
吴恩达机器学习clustering分类算法

【战疫专题】第五期:智慧物流,疫情之中显担当

2020年,新型冠状病毒席卷了整个中国,同时也在促进着产业的变革与生活变化。 电子发烧友在此期间推出【战疫专题】活...
发表于 2020-03-18 11:00 2095次阅读
【战疫专题】第五期:智慧物流,疫情之中显担当

人工智能、数据挖掘、机器学习和深度学习的关系

人工智能、数据挖掘、机器学习和深度学习之间,主要有什么关系?...
发表于 2020-03-16 11:35 98次阅读
人工智能、数据挖掘、机器学习和深度学习的关系

人工智能侦查有哪些应用

【人工智能侦查的应用领域】
发表于 2020-03-16 11:28 82次阅读
人工智能侦查有哪些应用

Spark机器学习协同过滤推荐算法

十三 Spark机器学习ALS设计
发表于 2020-03-12 06:12 62次阅读
Spark机器学习协同过滤推荐算法

吴恩达机器学习实际训练模型过程

吴恩达机器学习Coursera-week6
发表于 2020-03-09 10:55 98次阅读
吴恩达机器学习实际训练模型过程