统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
神经网络-二进制与离散/连续输入
是否有充分的理由选择二进制值(0/1)而不是离散或连续的规范化值(例如(1; 3))作为所有输入节点(带有或不带有反向传播)的前馈网络的输入? 当然,我只是在谈论可以转换为两种形式的输入。例如,当您拥有一个可以接受多个值的变量时,可以将它们作为一个输入节点的值直接输入,或者为每个离散值形成一个二进制节点。并假设所有输入节点的可能值范围都相同。有关这两种可能性的示例,请参见图片。 在研究此主题时,我找不到关于此的冷酷事实。在我看来,或多或少地,这最终总是“试错”。当然,每个离散输入值的二进制节点意味着更多的输入层节点(因此也意味着更多的隐藏层节点),但是与一个节点中具有相同值的情况相比,它确实会产生更好的输出分类,并且具有合适的阈值函数。隐藏层? 您是否同意这只是“尝试一下”,还是对此有其他意见?

4
特征缩放和均值归一化
我正在上学的吴安德(Andrew Ng)的机器学习课程,经过几次尝试都无法正确回答这个问题。请帮助解决此问题,尽管我已经通过了该级别。 假设学生参加了某堂课,并且该班进行了期中考试和期末考试。您已经收集了两次考试的分数数据集,如下所示:m=4m=4m=4 midterm (midterm)^2 final 89 7921 96 72 5184 74 94 8836 87 69 4761 78 您想使用多项式回归来根据学生的期中考试成绩来预测学生的期末考试成绩。具体而言,假设您要拟合以下形式的模型:,其中是中期得分,是(中期得分)^ 2。此外,您计划同时使用特征缩放(除以特征的“最大-最小”或范围)和均值归一化。X 1 X 2hθ(x)=θ0+θ1x1+θ2x2hθ(x)=θ0+θ1x1+θ2x2h_\theta(x) = \theta_0 + \theta_1 x_1 + \theta_2 x_2x1x1x_1x2x2x_2 什么是归一化特征?(提示:中期= 89,最终= 96是培训示例1。)请在下面的文本框中输入答案。如果适用,请在小数点后至少提供两位数字。x(4)2x2(4)x_2^{(4)}


4
为什么说“残留标准误差”?
标准误差是估计的标准偏差σ(θ)的估计的θ为参数θ。σ^(θ^)σ^(θ^)\hat \sigma(\hat\theta)θ^θ^\hat\thetaθθ\theta 为什么将残差的估计标准偏差称为“残差标准误差”(例如,在R summary.lm函数的输出中)而不称为“残差标准差”?我们在此为什么参数估计配备标准误差? 我们是否将每个残差都视为“其”误差项的估计量,并估计所有这些估计量的“合并”标准误差?

2
为什么平方差如此常用?
当我研究新的统计方法和概念时,常常会遇到平方差(或均方误差,或其他过多的表述)。举例来说,Pearson的r是根据与这些点所在的回归线的均方差确定的。对于方差分析,您正在查看平方和,依此类推。 现在,我了解到,通过对所有数据求平方,可以确保包含异常值的数据确实受到惩罚。但是,为什么指数正好使用2?为什么不使用2.1或e或pi?使用2还是有某种特殊的原因?我怀疑这种解释可能与钟形曲线有关,但我很确定。


1
R中具有多个外生变量的Arima时间序列预测(auto.arima)
我想基于具有多个外生变量的多个时间序列ARIMA模型进行预测。由于我对统计数据和RI都不希望保持尽可能简单(3个月的趋势预测就足够了)。 我有1个相关的时间序列和3-5个预测器时间序列,所有月度数据,无间隔,同时为“水平”。 我遇到了auto.arima函数,并问自己这是否适合我的问题。我有不同的商品价格和用它们制成的产品的价格。所有原始数据都是非平稳的,但是通过一阶微分,它们都变成了平稳数据。ADF,KPSS对此进行了说明。(这意味着我已经对集成进行了测试,对吗?)。 我现在的问题是:如何将它与auto.arima函数一起应用,而且ARIMA是否是正确的方法?一些人已经建议我使用VAR,但是ARIMA也可以吗? 下表是我的数据。实际上,数据集直到105个观测值为止,但前50个观测值可以。在这里,趋势和季节性显然很有趣。 感谢您的任何建议和帮助!格奥尔格
14 r  time-series  arima 

1
为什么在多重共线性的情况下Ridge回归能很好地工作?
我正在学习有关岭回归的知识,并且知道在存在多重共线性的情况下,岭回归往往会更好地工作。我想知道为什么这是真的吗?直观的答案或数学的答案都将令人满意(两种类型的答案都将更加令人满意)。 我也知道 β^β^\hat{\beta} 总是可以得到的,但是在存在精确共线性的情况下(一个独立变量是另一个的线性函数),岭回归的效果如何?

4
数据倾斜时应使用均值吗?
入门级应用统计文本通常通过解释均值对样本数据和/或样本中的异常值敏感,从而将均值与中值区分开来(通常是在描述性统计的背景下,并使用均值,中值和众数来激发集中趋势的汇总)。与偏斜的人口分布有关,这可以用作断言当数据不对称时首选中位数的理由。 例如: 给定数据集中集中趋势的最佳度量通常取决于值的分布方式...。当数据不对称时,中位数通常是集中趋势的最佳度量。因为均值对极端观察敏感,所以它会向偏远的数据值的方向拉动,结果可能会导致过度膨胀或过度缩小。” —Pagano和Gauvreau,(2000年),《生物统计学原理》,第二版。 (宝洁公司就在眼前,顺便说一句,本身并没有单独列出。) 作者因此定义了“集中趋势”:“一组数据最常被研究的特征是其中心,即观察趋向于聚集的点。” 这让我感到不那么直截了当的说仅使用中位数period的方式,因为只有在数据/分布对称时才使用均值与仅在等于中位数时才使用均值是同一回事。编辑: whuber正确地指出,我正在将中央趋势的有效度量与中位数相混淆。因此,重要的是要牢记,我正在讨论算术平均值与入门级应用统计学中的中位数的特定框架(此处不考虑模式,其他动机不倾向于集中趋势)。 与其以均值偏离中位数的行为来判断均值的效用,不应该简单地将它们理解为两种不同的中心度度量方法吗?换句话说,对偏度敏感是均值的特征。同样可以有效地辩称“中位数不好,因为它对偏斜度不敏感,因此仅在等于均值时才使用它。” (该模式显然不涉及此问题。)


3
Logistic回归中的拦截项
假设我们有以下逻辑回归模型: logit(p)=β0+β1x1+β2x2logit(p)=β0+β1x1+β2x2\text{logit}(p) = \beta_0+\beta_{1}x_{1} + \beta_{2}x_{2} 是事件时的赔率和?换句话说,当和处于最低级别(即使它不为0)时,这是事件的几率吗?例如,如果和仅采用值和则我们不能将它们设置为0。β0β0\beta_0x1=0x1=0x_1 = 0x2=0x2=0x_2=0x1x1x_1x2x2x_2x1x1x_1x2x2x_2222333


5
从平滑数据中找到R中的拐点
我有一些可以平滑使用的数据loess。我想找到平滑线的拐点。这可能吗?我确定有人已经找到了解决这个问题的好方法...我的意思是...毕竟是R! 我可以更改使用的平滑功能。我刚刚使用过,loess因为那是我过去使用过的。但是任何平滑功能都可以。我确实意识到拐点将取决于我使用的平滑功能。我可以。我想通过仅具有任何有助于吐出拐点的平滑功能来开始。 这是我使用的代码: x = seq(1,15) y = c(4,5,6,5,5,6,7,8,7,7,6,6,7,8,9) plot(x,y,type="l",ylim=c(3,10)) lo <- loess(y~x) xl <- seq(min(x),max(x), (max(x) - min(x))/1000) out = predict(lo,xl) lines(xl, out, col='red', lwd=2)
14 r  smoothing  loess 

3
我如何解释我从PCA中获得的收益?
作为大学任务的一部分,我必须对相当庞大的多元(> 10)原始数据集进行数据预处理。我不是一个统计学家,所以我对发生的事情有些困惑。提前道歉可能是一个可笑的简单问题-在查看了各种答案并试图通过统计数据发言后,我的头开始旋转。 我读过: PCA使我可以减少数据的维数 它是通过合并/删除大量相关的属性/维度来实现的(因此是不必要的) 它是通过在协方差数据上找到特征向量来实现的(这要归功于我学习了一个很好的教程) 太好了 但是,我真的很想知道如何将其实际应用到我的数据中。例如(如果我要使用类似...的数据集,这不是我将要使用的数据集,而是尝试一个不错的示例,人们可以使用)。 PersonID Sex Age Range Hours Studied Hours Spent on TV Test Score Coursework Score 1 1 2 5 7 60 75 2 1 3 8 2 70 85 3 2 2 6 6 50 77 ... ... ... ... ... ... ... …
14 pca 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.