统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么这些回归方差分析表相同?
我有两个相同Y的回归和三个级别的X。总体n = 15,X的每个组或级别中的n = 5。第一个回归将X视为分类,将指标变量分配给级别2和3一个作为参考。指示器/虚拟对象如下:如果级别= 2,则X1 = 1;否则,则为0;如果级别= 3,则X2 = 1;否则,则为0。 结果,我的拟合模型看起来像这样:y = b0 + b1(x1)+ b2(x2) 我运行回归,并且输出包括此方差分析表: 其余输出与此处无关。 好吧,现在我对相同的数据进行不同的回归。我放弃分类分析并将X视为连续的,但是我向方程式中添加了一个变量:X ^ 2,即X的平方。因此,现在我具有以下模型:y = b0 + b1(X)+ b2(X) ^ 2 如果我运行它,它将吐出与我上面显示的完全相同的方差分析表。为什么这两个回归会产生相同的表? [这个小难题的贷方是加利福尼亚大学洛杉矶分校生物统计学系的托马斯·贝林。
11 regression  anova 

3
如何对空间中的任意点实施L2正则化?
这是我在伊恩·古德费洛(Ian Goodfellow)的《深度学习》一书中读到的。 在神经网络的上下文中,“ L2参数范数罚则通常称为权重衰减。这种正则化策略使权重更接近原点。更普遍地,我们可以将参数正则化为任何特定点附近在空间中”,但更常见的是将模型参数调整为零。(深度学习,Goodfellow等。) 我只是好奇。我了解到,只需在成本函数中添加一个正则项,并通过使总成本最小化,就可以影响模型的参数以使其保持较小:JJJ J(Θ,X,y)=L(Θ,X,y)+λ||w||22J(Θ,X,y)=L(Θ,X,y)+λ||w||22J(\boldsymbol{\Theta}, \boldsymbol{X}, \boldsymbol{y}) = L(\boldsymbol{\Theta}, \boldsymbol{X}, \boldsymbol{y}) + \lambda||\boldsymbol{w}||_{2}^{2} 但是,如何实现该正则化策略的一种版本,该版本会将参数引向任意点?(例如,我们希望规范趋向于5)

4
人工神经网络是否等效于具有多项式特征的线性回归?
与其他机器学习算法相比,我想提高对神经网络及其好处的理解。我的理解如下,我的问题是: 你能纠正和补充我的理解吗?:) 我的理解: (1)人工神经网络=根据输入值预测输出值的函数。根据通用近似定理(https://en.wikipedia.org/wiki/Universal_approximation_theorem),只要有足够的神经元,通常就可以具有任何可能的预测功能(尽管它应该表现良好)。 (2)通过将输入值的多项式作为附加输入值,对于线性回归也是如此,因为您可以通过多项式很好地近似(比较泰勒展开)。 (3)这意味着,从某种意义上说,就最佳可能结果而言,这两种方法是等效的。 (4)因此,它们的主要区别在于哪种方法适合于更好的计算实现。换句话说,根据训练示例,您可以使用哪种方法为最终定义预测函数的参数找到更快的良好值。 我欢迎对其他链接或书籍的任何想法,评论和建议,以改善我的想法。

2
错误率是正则化参数lambda的凸函数吗?
在Ridge或Lasso中选择正则化参数lambda时,建议的方法是尝试使用不同的lambda值,测量验证集中的错误,最后选择返回最低错误的lambda值。 如果函数f(lambda)= error是凸的,这对我来说并不束手无策。会是这样吗?即,该曲线是否可以具有多个局部最小值(这意味着在lambda的某个区域中找到Error的最小值并不排除在某些其他区域中存在返回较小的Error的Lambda的可能性) 您的建议将不胜感激。

4
X和XY之间的相关性
如果我有两个独立的随机变量X和Y,那么X与乘积XY之间的相关性是什么?如果这是未知的,那么我很想知道至少在X和Y为零且均值为零的正常情况下会发生什么,如果这样更容易解决。

3
为什么使用滤波器结果而不是更平滑的结果来计算卡尔曼滤波器中的似然性?
我以非常标准的方式使用卡尔曼滤波器。该系统由状态方程和观察方程。Xt + 1= FXŤ+ vt + 1XŤ+1个=FXŤ+vŤ+1个x_{t+1}=Fx_{t}+v_{t+1}ÿŤ= 高XŤ+ A zŤ+ wŤÿŤ=HXŤ+一种žŤ+wŤy_{t}=Hx_{t}+Az_{t}+w_{t} 教科书教导,在应用卡尔曼滤波器并获得“一步一步的预测”(或“滤波后的估计”)之后,我们应该使用它们来计算似然函数:X^t | t − 1X^Ť|Ť-1个\hat{x}_{t|t-1} FÿŤ| 一世t − 1,žŤ(yŤ| 一世t − 1,žŤ) = DET [ 2 π(高Pt | t − 1H′+ R ) ]− 12经验值{ − 12(yŤ- 高X^t | t − 1- 一个žŤ)′(高Pt | t − 1H′+ R )− …

2
互信息作为概率
莫非在联合熵的互信息: 0 ≤ 我(X,Y)H(X,Y)≤ 10≤I(X,Y)H(X,Y)≤1 0 \leq \frac{I(X,Y)}{H(X,Y)} \leq 1 被定义为:“将一条信息从X传递到Y的概率”? 我很天真,对不起,但是我从未学习过信息理论,我只是在试图理解其中的一些概念。

5
为什么我们拒绝0.05级而不是0.5级的原假设(就像我们在分类中所做的那样)
假设检验类似于分类问题。可以这么说,对于观察(主题),我们有2个可能的标签-有罪与无罪。令“非罪”为原假设。如果我们从分类的观点来看问题,我们将训练一个分类器,该分类器在给定数据的情况下预测受试者属于这两个分类中的每一个的概率。然后,我们将选择概率最高的类别。在那种情况下,0.5的概率将是自然阈值。如果我们将不同的成本分配给误报与误报错误,我们可能会更改阈值。但是很少有我们会极端地将阈值设置为0.05,即仅在概率为0.95或更高的情况下才将主体分配为“有罪”类别。但是如果我了解得很好,当我们将相同的问题视为假设检验的问题时,这就是我们作为标准实践所做的事情。在后一种情况下,仅当“非罪犯”的概率小于5%时,我们才不会分配标签“非罪犯”(等同于分配标签“有罪”)。如果我们真正想避免对无辜者定罪,也许这可能是有道理的。但是,为什么在所有领域和所有情况下都应遵循此规则? 确定采用哪种假设等同于在给定数据的情况下定义真相的估计量。在最大似然估计中,我们接受给定数据的可能性更高的假设-尽管绝对可能性更大,但不一定。参见下图: 如果预测变量的值大于3(例如4),则使用最大似然方法在此示例中我们会偏爱替代假设,尽管从零假设得出该值的可能性将大于0.05。 虽然我开始撰写该帖子的示例可能会引起感慨,但我们可以想到其他情况,例如技术改进。当数据告诉我们新解决方案是一种改进的可能性大于非新解决方案的可能性时,为什么要对状态现状给予这样的优势?

5
如何生成均值为的序列?
我知道如何生成均值为的序列。例如,在Matlab中,如果我想生成长度为的序列,则为:0 ± 1 10000±1±1\pm 1000±1±1\pm 1100001000010000 2*(rand(1, 10000, 1)<=.5)-1 然而,如何产生一个与平均序列,即,具有稍微优选?0.05 1±1±1\pm 10.050.050.0511个1

2
将数据分为测试和训练集纯粹是一种“统计”事情吗?
我是一名学习机器学习/数据科学的物理专业学生,所以我并不是要这个问题引起任何冲突:)但是,任何物理本科课程的很大一部分都是做实验室/实验,这意味着很多数据处理和统计分析。但是,我注意到物理学家处理数据的方式与我的数据科学/统计学习书籍处理数据的方式之间存在巨大差异。 关键区别在于,当尝试对从物理实验获得的数据进行回归时,将回归算法应用于WHOLE数据集,因此绝对不会拆分为训练集和测试集。在物理学世界中,基于整个数据集为模型计算R ^ 2或某种类型的伪R ^ 2。在统计世界中,几乎总是将数据分为80-20、70-30等...,然后根据测试数据集对模型进行评估。 还有一些重大的物理实验(ATLAS,BICEP2等)从未进行过数据拆分,所以我想知道为什么物理学家/实验学家进行统计的方式与数据科学家的方式之间存在如此严格的差异做统计。

1
RandomForest和类权重
一句话问:有人知道如何为随机森林确定良好的班级权重吗? 说明:我正在研究不平衡的数据集。我想使用该R软件包randomForest来在非常偏斜的数据集上训练模型,该数据集只有很少的正例和许多负例。我知道,还有其他方法,最后我会使用它们,但是出于技术原因,建立随机森林是中间步骤。所以我玩弄了参数classwt。我在半径2的圆盘中建立了一个非常人工的数据集,包含5000个负样本,然后在半径1的圆盘中采样了100个正样本。 1)在没有类别加权的情况下,模型变得“退化”,即FALSE到处预测。 2)通过公平的类别权重,我将在中间看到一个“绿点”,即它将预测半径为1的圆盘,就像TRUE有负面的例子一样。 数据如下所示: 这是一个没有权重发生了什么:(电话是:randomForest(x = train[, .(x,y)],y = as.factor(train$z),ntree = 50)) 为了进行检查,我还尝试了当我通过对负类进行下采样来剧烈平衡数据集时发生什么情况,以使关系再次为1:1。这给了我预期的结果: 但是,当我用“ FALSE” = 1的类加权来计算模型时,“ TRUE” = 50(这是一个合理的加权,因为负数比正数多50倍),我得到了: 只有当我将权重设置为“ FALSE” = 0.05和“ TRUE” = 500000之类的怪异值时,我才得到有意义的结果: 这是非常不稳定的,即将“ FALSE”权重更改为0.01会使模型再次退化(即,它可以TRUE随处进行预测)。 问题:有人知道如何为随机森林确定良好的班级权重吗? R代码: library(plot3D) library(data.table) library(randomForest) set.seed(1234) amountPos = 100 amountNeg = 5000 # positives r = runif(amountPos, 0, 1) phi …
11 r  random-forest 

1
如果您的自由度超出了桌子的末端,该怎么办?
F表的自由度无法满足我的大样本要求。 例如,如果我有一个自由度为5和6744的F,我如何找到方差分析的5%临界值? 如果我在进行具有较大自由度的卡方检验该怎么办? [这样的问题是在不久前发布的,但是OP出错了,实际上是一个较小的df,将其减少为重复的-但原来的大df问题应该在现场的某个地方有一个答案]

1
贝叶斯尖峰和平板与惩罚方法
我正在阅读Steven Scott关于BSTS R包的幻灯片(您可以在这里找到它们:slides)。 在某个时候,当谈到在结构时间序列模型中包括许多回归变量时,他介绍了回归系数的尖峰和板坯先验,并说与惩罚方法相比,它们更好。 斯科特(Scott)说,以一个具有100个预测变量的数据集为例: 惩罚方法对包含/排除哪些变量做出单一决定,这意味着它们决定了一个预测子集,即在可能变量中的一个模型。210021002^{100} “套索(和相关)先验不稀疏,它们在模式下而不是后验分布上引起稀疏” 在这一点上,他介绍了Spike和Slab先验。 我想我有直觉,但我想确定一下: 从根本上说,他们基本上使用蛮力方法测试要包括的每个回归变量子集是否更好? 这样做的缺点是计算时间吗? 当您说“套索(及相关)...但不在后验分布中”时,您认为他是什么意思?

1
Netflix为什么会从其五星级评级系统转换为喜欢/不喜欢的系统?
Netflix过去常常根据用户提交的其他电影/节目的评分来提供建议。该评级系统获得了五颗星。 现在,Netflix允许用户喜欢/不喜欢(竖起/竖起)电影/节目。他们声称对电影进行评分更容易。 从统计角度上讲,这种2向分类是否比5向分类系统更具预测性?它不会捕获更少的变化吗?

2
我应该报告不重要的结果吗?
我已经进行了Kruskal Wallis测试,对于某些问题,p值并不重要。我是否会以有意义的方式报告此问题,并说明df,检验统计量和p值?因此,将进行这样的Kruskal Wallis检验,但发现结果并不显着H(3)= 2.119,p> 0.05(或者我在此处声明确切的p值(.548))

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.