统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
“所有这些数据点都来自同一分布。”如何进行测试?
我觉得以前已经在这里讨论过这个主题,但是我找不到任何具体的东西。再说一次,我也不确定要搜索什么。 我有一维数据集。我假设集合中的所有点均来自同一分布。 我如何检验这个假设?对“该数据集中的观测值来自两个不同的分布”的一般选择进行检验是否合理? 理想情况下,我想确定哪些点来自“其他”分布。由于我的数据是有序的,因此在以某种方式测试切割数据是否“有效”之后,我是否可以确定切割点? 编辑:根据Glen_b的回答,我会对严格正,单峰分布感兴趣。我也对假设分布然后测试不同参数的特殊情况感兴趣。

1
插入符号-重复的K折叠交叉验证与嵌套的K折叠交叉验证,重复n次
该插入符包是构建多机器学习模型辉煌[R库,并有模型构建和评估多种功能。对于参数调整和模型训练,插入符号包提供“ repeatedcv”作为方法之一。 作为一种好的做法,可以使用嵌套的K折交叉验证执行参数调整,其工作方式如下: 将训练集划分为“ K”子集 在每次迭代中,将“ K减1”子集用于模型训练,并保留1个子集(保持集)用于模型测试。 进一步将“ K减1”训练集划分为“ K”个子集,并迭代使用新的“ K减1”子集和“验证集”进行参数调整(网格搜索)。此步骤中确定的最佳参数用于测试步骤2中设置的保持。 另一方面,我假设重复的K折交叉验证可能会重复选择步骤1和2,因为我们选择查找模型方差的次数很多。 但是,仔细阅读插入符号手册中的算法,看起来“ repeatedcv”方法除了重复进行交叉验证外,还可能执行嵌套的K折交叉验证。 我的问题是: 我对插入符号'repeatedcv'方法的低估是正确的吗? 如果没有,您能否举一个使用插入的K折叠交叉验证的示例,并使用带有插入符号的'repeatedcv'方法? 编辑: 在本方法论文章中将解释和比较不同的交叉验证策略。 Krstajic D,Buturovic LJ,Leahy DE和Thomas S:选择和评估回归和分类模型时的交叉验证陷阱。化学信息杂志2014 6(1):10。doi:10.1186 / 1758-2946-6-10 我对使用插入符号包的“算法2:重复分层嵌套的交叉验证”和“算法3:针对变量选择和参数调整的重复网格搜索交叉验证”感兴趣。

1
是否应该使用重复的交叉验证来评估预测模型?
我碰到了Gitte Vanwinckelen和Hendrik Blockeel 在2012年发表的这篇文章,对重复交叉验证的实用性提出了质疑,该方法已成为减少交叉验证方差的一种流行技术。 作者证明,尽管重复交叉验证确实减少了模型预测的方差,但是由于对同一样本数据集进行了重新采样,因此重新采样的交叉验证估计的均值收敛于真实预测准确性的偏差估计,因此没有用。 尽管有这些限制,是否应该使用重复的交叉验证?


2
为什么脊回归不像套索那样将某些系数缩小为零?
在解释LASSO回归时,通常使用菱形和圆形图。据说因为LASSO中约束的形状是菱形,所以获得的最小二乘解可能会触及菱形的角,从而导致某些变量的收缩。但是,在山脊回归中,因为它是一个圆,所以它通常不会接触轴。我不明白为什么它不能接触轴,或者收缩某些参数的可能性比LASSO低。最重要的是,为什么LASSO和ridge的方差比普通的最小二乘法低?以上是我对ridge和LASSO的理解,可能是错误的。有人可以帮助我理解为什么这两种回归方法的方差较低吗?

5
您如何了解最新研究?
在阅读了有关arXiv的问题并找到了我以前没有意识到的GitXiv的链接之后,我想知道人们使用了哪些网站/资源来了解其领域的最新研究?
16 academia 

1
在多元线性回归中,为什么预测点的图不位于一条直线上?
我正在使用多元线性回归来描述Y与X1,X2之间的关系。 从理论上,我理解多元回归假设Y与每个X(Y和X1,Y和X2)之间存在线性关系。我没有使用X的任何转换。 因此,我得到的模型具有R = 0.45和所有显着X(P <0.05)。然后我针对X1绘制Y。我不明白为什么作为模型预测的红色圆圈没有形成一条线。正如我之前所说,我希望每对Y和X都由一条线拟合。 该图以这种方式在python中生成: fig, ax = plt.subplots() plt.plot(x['var1'], ypred, 'o', validation['var1'], validation['y'], 'ro'); ax.set_title('blue: true, red: OLS') ax.set_xlabel('X') ax.set_ylabel('Y') plt.show()

3
两阶段模型:Heckman模型(用于处理样本选择)和工具变量(用于处理内生性)之间的差异
我试图弄清样本选择和内生性之间的差异,进而弄清Heckman模型(处理样本选择)与工具变量回归(处理内生性)之间的区别。 说样品选择是内生性的一种特定形式是正确的,内生性变量是被治疗的可能性吗? 另外,在我看来,Heckman模型和IV回归都是两个阶段的模型,其中第一阶段预测了被治疗的可能性-我认为,根据经验,目标和假设,他们必须有所不同,但是如何?

1
逻辑回归中的Pearson VS Deviance残差
我知道标准化的Pearson残差是以传统的概率方式获得的: ri=yi−πiπi(1−πi)−−−−−−−−√ri=yi−πiπi(1−πi) r_i = \frac{y_i-\pi_i}{\sqrt{\pi_i(1-\pi_i)}} 和偏差残差通过更统计的方式获得(每个点对可能性的贡献): di=si−2[yilogπi^+(1−yi)log(1−πi)]−−−−−−−−−−−−−−−−−−−−−−−−−−√di=si−2[yilog⁡πi^+(1−yi)log⁡(1−πi)] d_i = s_i \sqrt{-2[y_i \log \hat{\pi_i} + (1 - y_i)\log(1-\pi_i)]} 其中 = 1,如果 = 1和 = -1,如果 = 0。sisis_iyiyiy_isisis_iyiyiy_i 您能直观地向我解释如何解释偏差残差的公式吗? 此外,如果我要选择一个,那一个更合适,为什么呢? 顺便说一句,一些参考文献声称我们基于以下项得出偏差残差 −12ri2−12ri2-\frac{1}{2}{r_i}^2 其中是上面提到的。ririr_i


4
误解了P值?
因此,我已经阅读了很多有关如何正确解释P值的知识,从我读到的内容来看,P值对空假设为真还是假的可能性一无所知。但是,在阅读以下语句时: p –值表示发生I型错误或在原假设为真时拒绝原假设的概率。p值越小,您错误地拒绝原假设的可能性就越小。 编辑:然后5分钟后,我读到: 对P值的错误解释非常普遍。最常见的错误是将P值解释为通过拒绝真实的零假设(I类错误)而犯错的可能性。 这让我感到困惑。哪一个是正确的?谁能解释如何正确解释p值,以及它如何正确地与产生I型错误的可能性相关联?

2
为什么在执行主成分分析之前先对数据进行日志转换?
我在这里遵循教程:http : //www.r-bloggers.com/computing-and-visualizing-pca-in-r/以更好地了解PCA。 本教程使用Iris数据集,并在PCA之前应用对数转换: 注意,在下面的代码中,我们按照[1]的建议对连续变量应用了对数转换,center并在调用中设置和scale等于,以在应用PCA之前标准化变量。TRUEprcomp 有人可以用简单的英文给我解释为什么您首先在Iris数据集的前四列上使用log函数。我知道它与使数据相对有关,但对日志,中心和刻度的确切功能感到困惑。 上面的参考文献[1]涉及Venables和Ripley,S-PLUS的Modern Applied Statistics,第11.1节,其中简要说明: 数据是物理测量,因此合理的初始策略是按对数比例工作。贯穿整个过程。


3
为什么我们需要引导程序?
我目前正在阅读拉里·瓦瑟曼(Larry Wasserman)的“所有统计信息”,并对他在有关估计非参数模型的统计函数的章节中写的内容感到困惑。 他写了 “有时我们可以通过一些计算找到统计函数的估计标准误差。但是,在其他情况下,如何估计标准误差并不明显”。 我想指出的是,在下一章中,他将讨论引导程序以解决此问题,但是由于我不太了解该声明,因此我没有完全获得引导程序背后的动力吗? 当不清楚如何估计标准误差时,有什么例子呢? 所有迄今为止我见过的例子已经“明显”,如然后^ 小号È(p Ñ)= √X1个,。。。Xñ 乙ë - [R (p )X1,...Xn Ber(p)X_1,...X_n ~Ber(p)小号Ë^(p^ñ)= p^⋅ (1 − p^)/ n----------√se^(p^n)=p^⋅(1−p^)/n \hat{se}(\hat{p}_n )=\sqrt{\hat{p}\cdot(1-\hat{p})/n}

1
Metropolis-Hastings集成-为什么我的策略不起作用?
假设我有一个函数,我想集成 当然,假设在端点处为零,没有爆炸,功能很好。一种方式,我已经和摆弄是使用大都市斯算法来生成列表的样品从分配比例,以,其缺少归一化常数 ,我将其称为,然后在这些上计算一些统计量: g(x)g(x)g(x)∫∞−∞g(x)dx.∫−∞∞g(x)dx. \int_{-\infty}^\infty g(x) dx.g(x)g(x)g(x)克(X )ñ = ∫ ∞ - ∞克(X )d X p (X )˚F (X )X 1x1,x2,…,xnx1,x2,…,xnx_1, x_2, \dots, x_ng(x)g(x)g(x)N=∫∞−∞g(x)dxN=∫−∞∞g(x)dxN = \int_{-\infty}^{\infty} g(x)dx p(x)p(x)p(x)f(x)f(x)f(x)xxx1n∑i=0nf(xi)≈∫∞−∞f(x)p(x)dx.1n∑i=0nf(xi)≈∫−∞∞f(x)p(x)dx. \frac{1}{n} \sum_{i=0}^n f(x_i) \approx \int_{-\infty}^\infty f(x)p(x)dx. 由于,我可以用代替以从积分中消除,从而得到形式的表达式 因此,假设沿该区域积分为,我应该得到结果,我可以取倒数来获得我想要的答案。因此,我可以取样品的范围(以最有效地利用这些点),让我绘制的每个样品的U(x)= 1 / r。这样U(x)f (x )= U (x )/ g (x )g 1p(x)=g(x)/Np(x)=g(x)/Np(x) = g(x)/Nf(x)=U(x)/g(x)f(x)=U(x)/g(x)f(x) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.