从回归分析到数据挖掘


  本文标签:回归分析 数据挖掘

回归 综合是探究两种或两种以上变量中间 彼此依赖的定量关系的统计 综合 步骤,在众多行业都有 宽泛的 利用  。无论是银行、保险、电信等服务行业的业务 综合人员在进行数据库营销、欺诈风险侦测,还是半导体、电子、化工、医药、钢铁等创造行业的研发技术人员在进行新产品 试验设计与 综合、流程优化与过程监控,或者更广义地说,不同类型的企业在 发展 品质治理和六西格玛 名目时,都 一般会用到回归 综合  。

回归 综合 可以协助我们推断哪些因素的影响是卓著的,哪些因素的影响是不卓著的,还 可以利用求得的回归方程进行预测和操纵  。然而,略微对回归模型的有效程度和预测精度有 定然要求时,我们就会发现回归 综合有一些先 秉性的缺乏和隐患:

1. 缺乏用实际数据验证模型有效性的环节, 时常听到的 报怨是:模型看上去很美,然而一到 利用环节就发现预测不精确;

2. 建模 目的单一,不能多角度地考量问题,从而更好地拟合数据;

3. 无奈系统地 比较通过不同 步骤得到的不同模型,更谈不上在众多候选模型中甄选出一个 绝对最佳的模型  。

这时,想要 肃清上述隐患, 打破工具瓶颈的 事实 步骤便是从“回归 综合”的 品位 回升到“数据 开掘”的 品位  。

数据 开掘是一个更大的数据 综合概念,重要指从大量的企业数据中揭示出隐含的、先前未知的并有潜在价格的信息的整个过程  。从统计技术层面上讲,数据 开掘至少 存在三大 特色:

1. 强调 综合建模之前的数据源划分,一般需求将全部原始数据分为模型训练数据training data、模型验证数据validation data、模型测试数据test data三类  。从而从源头上确保了由此求得的模型是经得起 事实复杂状况的严重考验  。

2. 提供了 丰硕的建模 目的,除了基于最小二乘法、逐渐法和Logistic法等传统的回归 综合之外,还包括众多 别致又有用的建模技术,如:决策树(Decision Tree)、神经网络(Neural Network)、关联 规定(Association Rule)、 支撑向量机(Support Vector Machine)、文本 开掘(Text Mining)等  。这使我们在遇到回归 综合失效的状况下,依旧具备解决问题的 威力  。

3.“模型 比较(Model Comparison)”是数据 开掘后期的过程中必不可少的一个环节,这样一来,我们就 可以科学、客观地从不同的候选模型中找到最 事实的模型来做最精准的预测 综合,将预测误差减低到最低  。

显然,数据 开掘的这三个 特色有效地 补偿了回归 综合的缺乏,为我们的建模预测工作奠定了扎实的 根底  。下面用一个 实在案例来 注明从回归 综合到数据 开掘的实际 利用,出于数据安全性的考量,核心数据(包括变量名称)已做了相应的编码 解决  。

某知名钢铁公司的研发部门在一个构建 构造钢端淬曲线预测模型的 名目中,先用用SAS公司面向一般工程师和科学家开发的交互式可视化统计发现软件JMP中的逐渐回归做了一个预测模型(见下图)  。

从 综合报告上来看,这个预测模型还是不错的  。但在模型的推广过程中, 频繁发现预测误差很大,甚至严重 波动了技术人员 利用统计建模的 信念  。所幸在权威 征询机构的 指导下,发现造成模型预测失误的重要缘由是模型 适度拟合,包括了众多 毋庸要拟合的噪声信息  。 名目成员再一次思量了技术攻关中需求用到的 步骤论,最后决定 晋级到高级版JMP Pro,没有多做一次现场 试验,没有申请任何额外 估算,却卓著改善了模型的预测 动机,达到了预期 动机  。

从技术细节上来看, 名目后期与前期的不同之处也 凑巧体现了前面所介绍的数据 开掘的三大 特色,即:

第一,没有囫囵吞枣地把全部数据全都用来构建模型,而是有 方案地依照 定然比例将全部数据分为训练数据、验证数据、测试数据三类,各类数据各司其职,确保由此产生的模型在生产阶段的有效性  。

第二,开辟思路,有机地 使用除了回归 综合之外的多种数据 开掘建模工具,如决策树、神经网络,以及其衍生工具(如随机森林Bootstrap Forest、 晋升树Boosted Tree等),幸免了因为单一 步骤的生搬硬套而招致的建模 舛误  。

 

第三,先松后紧,整合之前求得的各个候选模型,将科学 谨严的统计量化指标与实际业务 教训相 联合, 取舍出整体上最 合适的预测模型,体现了“博采众长, 取长补短”的建模理念  。

总之,“从回归 综合到数据 开掘”是企业在 详尽化治理进展到 定然阶段后必然会遇到的一个问题  。固然, 有关于传统的回归 综合,数据 开掘会显得 绝对复杂一些  。然而, 交融先进算法而关注界面 友爱的现代化统计 综合软件(如案例中用到的JMP Pro软件),已经大大减低了数据 开掘的技术门槛,使得无论是科班出身的统计学家,还是没有统计学功底的一般技术人员,都能 快捷上手,真正地数据中 开掘出对企业 经营 有利的信息  。