统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
测试两个二项分布的样本是否符合相同的p
假设我已经完成: ñ1个ñ1个n_1独立试验,成功率未知,观察到成功。p1个p1个p_1ķ1个ķ1个k_1 ñ2ñ2n_2独立试验,成功率未知,观察到成功。p2p2p_2ķ2ķ2k_2 如果现在但仍然未知,则对于给定的观测的概率(反之亦然)与,所以如果我要测试p_1 \ neq p_2,则只需要查看观察值对应分布的哪个分位数即可。p1个=p2= : pp1个=p2=:pp_1 = p_2 =: pp (ķ2)p(ķ2)p(k_2)ķ2ķ2k_2ķ1个ķ1个k_1∫1个0B (ñ1个,p ,ķ1个)B (ñ2,p ,ķ2)d p =1个ñ1个+ñ2+ 1(ñ1个ķ1个)(ñ2ķ2)(ñ1个+ñ2ķ1个+ķ2)− 1∫01个乙(ñ1个,p,ķ1个)乙(ñ2,p,ķ2)dp=1个ñ1个+ñ2+1个(ñ1个ķ1个)(ñ2ķ2)(ñ1个+ñ2ķ1个+ķ2)-1个\int_0^1 B(n_1,p,k_1) B(n_2, p, k_2) \text{d}p = \frac{1}{n_1+n_2+1}\binom{n_1}{k_1}\binom{n_2}{k_2}\binom{n_1+n_2}{k_1+k_2}^{-1}p1个≠p2p1个≠p2p_1 \neq p_2 到目前为止,是为了重新发明轮子。现在我的问题是我无法在文献中找到它,因此我想知道:此测试的技术术语是什么?

1
scikit学习中的聚类惯性公式
我想使用pandas和scikit learning在python中编码kmeans集群。为了选择好的k,我想对Tibshirani和al 2001(pdf)中的Gap Statistic进行编码。 我想知道是否可以使用scikit的惯性_结果并调整间隙统计公式,而不必重新编码所有距离计算。 有谁知道scikit中使用的惯性公式/是否知道使用高级距离函数重新编码间隙统计信息的简便方法?

1
正常样本的最小订单统计量的期望值
2014年1月25日更新: 错误已得到纠正。请忽略上载图像中的“期望值”的计算值-它们是错误的-我不会删除图像,因为它已经生成了该问题的答案。 2014年1月10日更新: 发现了错误-所使用的一种来源中存在数学错字。正在准备更正... 从集合的最低次序统计的密度 IID连续随机变量与CDF和pdf是 ñnnFX(x )FX(x)F_X(x)FX(x )fX(x)f_X(x)FX(1 )(X(1 ))= nFX(X(1 ))[ 1 -FX(X(1 ))]n − 1[ 1 ]fX(1)(x(1))=nfX(x(1))[1−FX(x(1))]n−1[1]f_{X_{(1)}}(x_{(1)}) = nf_X(x_{(1)})\left[1-F_X(x_{(1)})\right]^{n-1} \qquad [1] 如果这些随机变量是标准正态的,则 FX(1 )(X(1 ))= n ϕ (X(1 ))[ 1 - Φ (X(1 ))]n − 1= n ϕ (X(1 ))[ Φ (-X(1 ))]n − 1[ 2 ]fX(1)(x(1))=nϕ(x(1))[1−Φ(x(1))]n−1=nϕ(x(1))[Φ(−x(1))]n−1[2]f_{X_{(1)}}(x_{(1)}) …

2
分类名义变量之间的类别之间的相关性
我有一个包含两个分类名义变量的数据集(均包含5个分类)。我想知道是否(以及如何)能够从这两个变量中识别类别之间的潜在关联。 换句话说,例如类别的结果 一世一世i变量1中的变量与变量2中的特定类别有很强的相关性。由于我有两个具有5个类别的变量,因此所有类别的总相关性分析将归结为25个结果(至少以我希望的方式/希望它能正常工作)。ĴĴj 我试图将问题表达为具体的问题: 问题1:假设我将分类变量转换为每个值(类别)5个不同的虚拟变量。我也为第二个变量运行相同的过程。然后,我想确定虚拟1.i和2.i之间的相关性(例如)。对我来说,通过普通的相关系数过程执行此过程在统计上是否正确?通过此过程得出的相关系数是否可以正确了解两个虚拟变量之间的相关性? 问题2:如果问题一中描述的过程是有效过程,是否可以同时对所有2个(或更多)分类名义变量类别进行分析? 我正在使用的程序是SPSS(20)。

1
R:方差分析和线性回归
我是统计学的新手,我试图了解ANOVA和线性回归之间的区别。我正在使用R进行探索。我阅读了许多有关为何方差分析和回归分析为何不同但仍然相同以及如何可视化等方面的文章。我认为我的确很不错,但仍然缺少一点。 我了解到,方差分析将组内的方差与组间的方差进行比较,以确定任何测试组之间是否存在差异。(https://controls.engin.umich.edu/wiki/index.php/Factor_analysis_and_ANOVA) 对于线性回归,我在该论坛上找到了一篇帖子,其中说到当我们测试b(斜率)= 0时,也可以进行测试。) 对于两个以上的小组,我发现一个网站指出: 零假设是:H0:µ1=µ2=µ3H0:µ1=µ2=µ3\text{H}_0: µ_1 = µ_2 = µ_3 线性回归模型为:y=b0+b1X1+b2X2+ey=b0+b1X1+b2X2+Ëy = b_0 + b_1X_1 + b_2X_2 + e 但是,线性回归的输出是一组的截距,其他两组的截距之差。(http://www.real-statistics.com/multiple-regression/anova-using-regression/) 对我来说,这看起来像是实际上比较了截距,而不是斜率? 在这里可以找到截距而不是斜率的另一个示例:(http://www.theanalysisfactor.com/why-anova-and-linear-regression-are-the-same-analysis/) 我现在正在努力了解线性回归中实际比较的是什么?斜坡,拦截或两者兼而有之?
9 r  regression  anova 

4
套用滞后的顺序?
假设我有形式的纵向数据(我有多个观察结果,这只是一个形式)。我对限制感兴趣。不受限制的等效于 与。Y=(Y1,…,YJ)∼N(μ,Σ)Y=(Y1,…,YJ)∼N(μ,Σ)\mathbf Y = (Y_1, \ldots, Y_J) \sim \mathcal N(\mu, \Sigma)ΣΣ\SigmaΣΣ\SigmaYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εjYj=αj+∑ℓ=1j−1ϕℓjYj−ℓ+εj Y_j = \alpha_j + \sum_{\ell = 1} ^ {j - 1} \phi_{\ell j} Y_{j-\ell} + \varepsilon_j εj∼N(0,σj)εj∼N(0,σj)\varepsilon_j \sim N(0, \sigma_j) 通常不这样做,因为它需要估计协方差参数。如果我们采用则模型为“ ” 即我们仅使用前面的项可以根据历史预测。O(J2)O(J2)O(J^2)kkkYj=αj+∑ℓ=1kϕℓjYj−ℓ+εj,Yj=αj+∑ℓ=1kϕℓjYj−ℓ+εj, Y_j = \alpha_j + \sum_{\ell = 1} ^ k \phi_{\ell j} Y_{j - \ell} + \varepsilon_j, …

2
自举样本的样本均值方差
令为不同的观察值(无联系)。令表示引导程序样本(来自经验CDF的样本),并令。找到E(\ bar {X} _ {n} ^ {*})和\ mathrm {Var}(\ bar {X} _ {n} ^ {*})。X1,...,XnX1,...,XnX_{1},...,X_{n}X∗1,...,X∗nX1∗,...,Xn∗X_{1}^{*},...,X_{n}^{*}X¯∗n=1n∑ni=1X∗iX¯n∗=1n∑i=1nXi∗\bar{X}_{n}^{*}=\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*}E(X¯∗n)E(X¯n∗)E(\bar{X}_{n}^{*})Var(X¯∗n)Var(X¯n∗)\mathrm{Var}(\bar{X}_{n}^{*}) 到目前为止,我得到的是X∗iXi∗X_{i}^{*}是X1个,。。。,XñX1,...,XnX_{1},...,X_{n}每个概率为1个ñ1n\frac{1}{n}所以 Ë(X∗一世)=1个ñË(X1个)+ 。。。+1个ñË(Xñ)=ñ μñ= μË(X一世∗)=1个ñË(X1个)+。。。+1个ñË(Xñ)=ñμñ=μ E(X_{i}^{*})=\frac{1}{n}E(X_{1})+...+\frac{1}{n}E(X_{n})=\frac{n\mu}{n}=\mu 和 Ë(X* 2一世)=1个ñË(X21个)+ 。。。+1个ñË(X2ñ)=n (μ2+σ2)ñ=μ2+σ2,Ë(X一世∗2)=1个ñË(X1个2)+。。。+1个ñË(Xñ2)=ñ(μ2+σ2)ñ=μ2+σ2,E(X_{i}^{*2})=\frac{1}{n}E(X_{1}^{2})+...+\frac{1}{n}E(X_{n}^{2})=\frac{n(\mu^{2}+\sigma^{2})}{n}=\mu^{2}+\sigma^{2}\>, 给出 V 一[R (X∗一世)= E(X* 2一世)- (E(X∗一世))2=μ2+σ2-μ2=σ2。V一个[R(X一世∗)=Ë(X一世∗2)-(Ë(X一世∗))2=μ2+σ2-μ2=σ2。 \mathrm{Var}(X_{i}^{*})=E(X_{i}^{*2})-(E(X_{i}^{*}))^{2}=\mu^{2}+\sigma^{2}-\mu^{2}=\sigma^{2} \>. 然后, Ë(X¯∗ñ)= E(1个ñ∑我= 1ñX∗一世)=1个ñ∑我= 1ñË(X∗一世)=ñ μñ= μË(X¯ñ∗)=Ë(1个ñ∑一世=1个ñX一世∗)=1个ñ∑一世=1个ñË(X一世∗)=ñμñ=μE(\bar{X}_{n}^{*})=E(\frac{1}{n}\sum_{i=1}^{n}X_{i}^{*})=\frac{1}{n}\sum_{i=1}^{n}E(X_{i}^{*})=\frac{n\mu}{n}=\mu 和 V 一[R (X¯∗ñ)= V a r(1个ñ∑我= 1ñX∗一世)=1个ñ2∑我= …

1
两个二维点阵列之间的相关系数?
我有两个二维点数组,我需要估计它们的相关性。我应该使用什么配方? 数组示例: X:((1 ,5 ),(2 ,5 ),(1 ,7 ),(4 ,1 )),X:((1个,5),(2,5),(1个,7),(4,1个)),X: ((1,5),(2,5),(1,7),(4,1)), ÿ:((3 ,4 ),(1 , 6 ),(4 ,6 ),(4 ,3 ))。ÿ:((3,4),(1个,6),(4,6),(4,3))。Y: ((3,4),(1,6),(4,6),(4,3)).

2
IID随机变量和的商的期望(剑桥大学工作表)
我正在准备一个面试,要求对基础概率有相当的了解(至少要通过面试本身)。从学生时代开始,我正在整理以下表格。这通常是相当简单的,但是我完全被问题12困扰。 http://www.trin.cam.ac.uk/dpk10/IA/exsheet2.pdf 任何帮助,将不胜感激。 编辑:问题是: 假设是具有和独立均匀分布的正随机变量。令。显示当时,并且时。X1个,X2,。。。X1,X2,...X_1, X_2, ... E(X1个)= μ &lt; ∞E(X1)=μ&lt;∞\mathbb{E}(X_1) = \mu < \inftyE(X− 11个)&lt; ∞E(X1−1)&lt;∞\mathbb{E}(X_1^{-1}) < \infty小号ñ=∑ñ我= 1X一世Sn=∑i=1nXiS_n = \sum_{i=1}^n X_iE(小号米/小号ñ)= m / nE(Sm/Sn)=m/n\mathbb{E}(S_m/S_n) = m/nm &lt; = nm&lt;=nm<=nE(小号米/小号ñ)= 1 + (米- ñ )μ È(小号− 1ñ))E(Sm/Sn)=1+(m−n)μE(Sn−1))\mathbb{E}(S_m/S_n) = 1 + (m-n)\mu\mathbb{E}(S_n^{-1}))m &gt; = n米&gt; =ñm>=n 实际上,在键入内容的过程中,我已经解决了第二部分。 对于,m &gt; = …

2
统计学中的三个开放性哲学问题
我最近读完了《品尝女士茶》,这是一本有关统计历史的有趣书籍。在书的最后,作者大卫·萨尔斯堡(David Salsburg)提出了统计学中的三个开放性哲学问题,他认为解决这些问题将对统计理论在科学中的应用产生更大的影响。我以前从未听说过这些问题,所以我对其他人对它们的反应很感兴趣。我正在冒险进入一个我所不了解的领域,所以我将仅描述萨尔斯堡对这些问题的描述,并在下面提出关于这些问题的两个一般性问题。 萨尔斯堡的哲学问题是: 可以使用统计模型进行决策吗? 当应用于现实生活时,概率是什么意思? 人们真的了解概率吗? 统计与决策 为了说明问题1,Salsburg提出了以下悖论。假设我们组织了一张有10000张未编号彩票的彩票。如果我们通过拒绝概率低于0.001的票证的假设来使用概率来决定任何给定的票证是否会赢得彩票,我们将拒绝彩票中所有票证的中奖票证的假设! 萨尔斯堡大学(Salsburg)使用此示例辩称,由于当前了解概率论,因此逻辑与概率论不一致,因此,我们目前尚没有一种很好的方法来集成统计信息(以现代形式,它主要基于概率论)与决策的逻辑手段。 概率的含义 作为数学上的抽象,萨尔斯堡认为概率很好,但是当我们尝试将结果应用于现实生活时,我们遇到了这样的问题:概率在现实生活中没有具体的意义。更具体地说,当我们说明天有95%的机会下雨时,尚不清楚95%适用于哪些实体。它是否适用于我们可能进行以获取有关降雨知识的一组可能的实验?它适用于可能会出门弄湿的那一组人吗?萨尔斯堡(Salsburg)认为,缺乏解释概率的方法会给基于概率的统计模型(即大多数概率模型)造成问题。 人们了解概率吗? 萨尔斯堡争辩说,一种试图通过缺乏具体的概率解释方法解决问题的尝试是通过吉米·萨维奇和布鲁诺·德·芬内蒂提出的“ 个人概率 ” 概念。,将概率理解为对未来事件可能性的个人信念。但是,为了使个人概率为概率提供连贯的基础,人们需要对什么是概率有一个共同的理解,并需要一种使用证据得出有关概率结论的通用方法。不幸的是,诸如卡尼曼和特维尔斯基所产生的证据表明,个人信念可能是很难为概率建立连贯基础的基础。萨尔斯堡(Salsburg)建议,将概率建模为信念的统计方法(也许是贝叶斯方法?在这里我要扩展我的知识)将需要处理这个问题。 我的问题 萨尔斯堡的问题在多大程度上真正成为现代统计的问题? 我们在寻找解决这些问题的方法方面是否取得了进展?

3
评估正态性检验的功效(用R表示)
我想评估R中不同样本量的正态性检验的准确性(我意识到正态性检验可能会产生误导)。例如,要查看Shapiro-Wilk检验,我正在进行以下模拟(以及绘制结果),并希望随着样本数量的增加,拒绝null的可能性降低: n &lt;- 1000 pvalue_mat &lt;- matrix(NA, ncol = 1, nrow = n) for(i in 10:n){ x1 &lt;- rnorm(i, mean = 0, sd = 1) pvalue_mat[i,] &lt;- shapiro.test(x1)$p.value } plot(pvalue_mat) 我的想法是,随着样本数量的增加,拒绝率应该会降低,但是看起来相当一致。我想我对此有误解-任何想法都欢迎。

1
具有时间相关变量的周期性事件数据的数据结构和函数调用
我试图估算的2种药物(的影响drug1,drug2在(病人的跌倒的可能性)event)。患者可以跌倒不止一次,并且可以在任何时候穿上或脱下药物。 我的问题是,关于时间段(天)的数据应如何组织,特别是两天之间是否需要重叠。我认为我的结构有错误的原因有两个,第一个是看似不正确的N。在时间段为一天(即)的情况下,我也遇到了一些错误time1=4,time2=4并且不确定如何编码。后续输入的开始时间应该是先前输入的停止时间吗?我已经尝试了两种方式(有和没有重叠),并且尽管重叠消除了警告,但N仍然不正确。 Warning message: In Surv(time = c(0, 2, 7, 15, 20, 0, 18, 27, 32, 35, 39, 46, 53, : Stop time must be &gt; start time, NA created 现在,我已经设置了数据,下一个条目的开始是第二天。独特的患者由其识别chart numbers。 Time1 Time2 Drug1 Drug2 Event ChartNo 0 2 1 0 0 123 3 10 1 1 1 123 …
9 r  survival  cox-model 

3
逻辑回归:最大化正阳性-误阳性
我有一个逻辑回归模型(通过弹性网络正则化通过R中的glmnet拟合),并且我想最大化真实肯定和错误肯定之间的差异。为此,请注意以下步骤: 拟合标准逻辑回归模型 使用预测阈值为0.5,确定所有积极预测 为肯定预测的观测值分配权重1,为所有其他权重分配权重0 拟合加权逻辑回归模型 这种方法有什么缺点?解决此问题的正确方法是什么? 希望最大程度地提高正负数之间的差异的原因是由于我的应用程序的设计。作为课堂项目的一部分,我正在在线市场上建立一个自主参与者-如果我的模型预测它可以购买某些东西并以后以更高的价格出售,它就会出价。我想坚持逻辑回归并根据固定成本和单价增量(我在每笔交易中获得或损失相同的金额)输出二进制结果(成功,失败)。误报会伤害我,因为这意味着我买了东西,无法以更高的价格出售。但是,错误的否定并不会伤害我(仅就机会成本而言),因为这仅意味着如果我不购买,但如果我有购买,我就可以赚钱。同样, 我同意0.5的临界值是完全任意的,并且当我在预测阈值上优化了步骤1中的模型时,该模型在真/假阳性之间产生了最大差异,结果接近0.4。我认为这是由于数据的偏斜性质-负数与正数之比约为1:3。 现在,我正在执行以下步骤: 将数据拆分为训练/测试 在训练中拟合模型,在测试集中进行预测并计算真假阳性之间的差异 完全拟合模型,在测试集中进行预测并计算真假阳性之间的差异 尽管训练集是全套的子集,但在步骤3中,正确/错误肯定之间的差异小于在步骤2中。由于我不在乎#3中的模型是否具有更多的真实负数和更少的虚假负数,因此我可以做些什么而无需更改似然函数本身?

4
足球比分建模
在Dixon,Coles(1997)中,他们对(4.3)中的两个改进的独立Poisson模型使用了最大似然估计来对足球得分进行建模。 我试图使用R来“重现” alpha和beta以及家庭效果参数(第274页,表4),而无需使用任何程序包(也可以使用通常的独立Poisson模型)。我曾尝试使用bivpois包,但不确定如何修改其参数。 如果有人可以通过R代码帮助我为数据建模,我将不胜感激-2012/13赛季英超联赛中来自主队和客队的得分。

2
模拟数据以适应中介模型
我有兴趣找到一种过程来模拟与指定的中介模型一致的数据。根据测试调解模型的一般线性结构方程模型框架,该模型首先由Barron和Kenny(1986)概述,并在Judd,Yzerbyt和Muller(2013)等其他地方进行了介绍,其结果模型为调解模型YYY,介体和预测变量,并由以下三个回归方程式控制: 通过对 的间接作用或中介作用可以定义为或等效地定义为。在旧的调解测试框架下,通过测试方程式1中的,建立了调解medmed\newcommand{\med}{\rm med} \medXXXYmedY=b11+b12X+e1=b21+b22X+e2=b31+b32X+b32med+e3(1)(2)(3)(1)Y=b11+b12X+e1(2)med=b21+b22X+e2(3)Y=b31+b32X+b32med+e3\begin{align} Y &= b_{11} + b_{12}X + e_1 \tag{1} \\ \med &= b_{21} + b_{22}X + e_2 \tag{2} \\ Y &= b_{31} + b_{32}X + b_{32} \med + e_3 \tag{3} \end{align}XXXYYYmedmed\medb22b32b22b32b_{22}b_{32}b12−b32b12−b32b_{12}-b_{32}b12b12b_{12}b22b22b_{22}等式2中的。b32b32b_{32} 到目前为止,我已经尝试使用in 来模拟与各种回归系数的值一致的和值,例如以下代码:medmed\medYYYrnormR x &lt;- rep(c(-.5, .5), 50) med &lt;- 4 + .7 * x + …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.