统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
怀疑(但不反对数学)读者的推理
我刚刚观看了有关统计推断(“比较比例和均值”)的讲座,这是统计在线课程简介的一部分。对于我来说,这种材料一如既往地毫无意义(到现在为止,我必须已经看过数十遍这种材料,并且在过去的三十年中一直散布着)。 我正在寻找一本有关“基本Stats-101”的书(分数估算,估算评估,统计推断,假设检验,研究设计),该书认真对待了说服怀疑论者的问题。 下面,我给出了一些我正在寻找的作者会认真对待并知道如何令人信服地解决的问题类型的示例。 但是首先让我花点时间强调一下,在这篇文章中我没有问这些问题。 请不要回答他们! 我以“石蕊试纸法”(针对搜索作者的类型)为例进行举例说明。 如果“比例”只是布尔变量的均值(即仅取值0和1的布尔变量),那么为什么要教不同的过程来对“比例”和“均值”进行统计推断呢? 如果正态分布非常健壮,即使在数据不是非常正态分布的情况下,假设正态性也会产生良好的结果,并且如果t分布看起来很正态,那么为什么所有关于使用t分布而不是正常? “自由度” 到底是什么?为什么我们担心它们? 考虑到我们只是使用恰好看起来与数据相似的分布,说一个参数的“真实”值意味着什么? 为什么“探索性数据分析”是一件好事,而“数据监听”却是一件坏事? 正如我已经说过的,我对忽略此类问题所隐含的态度感到不满意。我不想在教给我一些东西的人中看到“认识论立场”。我正在寻找尊重读者的怀疑和理性,并且知道如何解决这些问题的作者(不必深入探讨形式主义和技术性的页面)。 我意识到这是一个艰巨的任务,尤其是在统计方面。因此,我不希望有很多作者能够成功。但是现在我只满足于找到一个。 让我补充一点,我不是数学上的厌恶者。相反,我喜欢数学。(我对分析(又称“高级演算”),线性代数,概率论,甚至基本测度论感到满意。) 也就是说,我目前的兴趣是“应用”,“实用”,“日常”,“现实”统计(与理论上的细微差别相反)。(但我也不想要食谱!) FWIW,我已经阅读了Gelman和Hill的使用回归和多层次/层次模型进行数据分析的前几章,并且我喜欢作者的语气。他们的重点是实际的,但在需要时可以进行理论探讨。他们还经常退后一步,对标准做法进行严格评估,并提出坦率的见解,以引起怀疑的读者的常识。不幸的是,这些作者还没有写一本书专门讨论我在这篇文章中要问的话题(如上所述,“ Stats 101”一词)。我还知道,其中一位作者(Gelman)与人共同撰写了备受赞誉的贝叶斯数据分析,但是,这又不是我目前正在寻找的东西。 编辑: Dikran Marsupial提出以下反对意见: 我认为忽略问题并不一定有什么不对,有一个观点认为,解决每个问题有损于通常更重要的基本概念的阐述(尤其是在统计101本书中!)。 我同意这一点。如果我说我正在寻找“第二眼基本统计数据”,那对我来说会更准确。实际上,以此为动力,我看了研究生课程中有关推理(说)的教科书,发现它们太像我列出的问题而被忽略了。如果有的话,他们似乎甚至不太愿意去研究这样的问题(这样他们就可以专注于诸如某些融合条件或其他……)的问题。 问题在于,更高级的书籍针对的是完全不同的读者群体,其中“局外人”的怀疑已被彻底耗尽。IOW,那些正在做研究生水平统计的人已经超出了困扰我的问题的地步。他们不再对这些东西持怀疑态度。(他们是如何克服怀疑态度的?然后统计一下。其他人可能有老师填写了他们的课本不足的地方。一些人可能很聪明,可以自己找出这些问题的答案。

3
如何解释GARCH参数?
我使用标准的GARCH模型: rtσ2t=σtϵt=γ0+γ1r2t−1+δ1σ2t−1rt=σtϵtσt2=γ0+γ1rt−12+δ1σt−12\begin{align} r_t&=\sigma_t\epsilon_t\\ \sigma^2_t&=\gamma_0 + \gamma_1 r_{t-1}^2 + \delta_1 \sigma^2_{t-1} \end{align} 我对系数有不同的估计,需要解释它们。因此,我想知道一个很好的解释,那么,和代表什么?γ0γ0\gamma_0γ1γ1\gamma_1δ1δ1\delta_1 我看到就像是不变的部分。因此,这代表了一种“环境波动”。该代表调整过去的冲击。另外,对我来说不是很直观:它表示对波动的调整。但我想对这些参数有更好,更全面的解释。γ0γ0\gamma_0γ1γ1\gamma_1δ1δ1\delta_1 因此,谁能给我一个很好的解释,说明这些参数代表什么以及如何解释参数的变化(例如,如果增加,这意味着什么?)。γ1γ1\gamma_1 另外,我在几本书中(例如在Tsay中)进行了查询,但是找不到很好的信息,因此,任何有关这些参数解释的文献建议都将受到赞赏。 编辑:我也将对如何解释持久性感兴趣。那么持久性到底是什么? 在我读过的一些书中,GARCH(1,1)的持久性是,但是例如在Carol Alexander第283页的书中,他仅谈到参数(我的)是持久性参数。那么,波动率的持续性()和震荡的持续性()之间有区别吗?γ1+δ1γ1+δ1\gamma_1+\delta_1ββ\betaδ1δ1\delta_1σtσt\sigma_trtrtr_t

5
产生相关非正态数据的方法
我对寻找一种生成相关的非正常数据的方法感兴趣。因此,理想情况下,某种类型的分布将协方差(或相关)矩阵作为参数,并生成近似该分布的数据。但是这里有个要点:我试图找到的方法应该具有灵活性,也可以控制其多元偏度和/或峰度。 我熟悉Fleishman的方法和正态变量的幂方法的使用,但是我相信大多数扩展只允许用户使用边际偏度和峰度的某些组合,而将多元偏度/峰度留在那儿。我想知道的是,是否有一种方法可以帮助指定多元偏度和/或峰度,以及一些相关性/协方差结构。 大约一年前,我参加了一次关于系蝇分布的研讨会,我记得这位教授随便提到了通过使用葡萄系蝇,一个人可以产生的数据在其一维边缘中的每一个都对称,但共同偏斜,反之亦然。 -反之亦然。或者,甚至更进一步,任何维数较低的边距在保持最大维数对称(或不对称)的同时,可能会有些偏斜或峰度。我一直对这种灵活性可能存在的想法感到惊讶,我一直试图找到某种描述上述方法的文章或会议论文,但我没有成功:(。不必通过使用copulas,我愿意接受任何可行的方法。 编辑:我添加了一些R代码,以尝试显示我的意思。到目前为止,我只熟悉Mardia对多元偏斜和峰度的定义。当我第一次解决问题时,我天真地想到如果我使用具有偏斜边线(在本例中为beta)的对称copula(在本例中为高斯),则对边沿的单变量检验会产生显着性,但Mardia对多变量偏斜/峰度的检验会很有意义。不重要。我尝试了一下,但并没有按我预期的那样出来: library(copula) library(psych) set.seed(101) cop1 <- {mvdc(normalCopula(c(0.5), dim=2, dispstr="un"), c("beta", "beta"),list(list(shape1=0.5, shape2=5), list(shape1=0.5, shape2=5)))} Q1 <- rmvdc(cop1, 1000) x1 <- Q1[,1] y1 <- Q1[,2] cop2 <- {mvdc(normalCopula(c(0.5), dim=2, dispstr="un"), c("norm", "norm"),list(list(mean=0, sd=1), list(mean = 0, sd=1)))} Q2 <- rmvdc(cop2, 1000) x2 <- Q2[,1] y2 <- Q2[,2] …

2
McNemar检验与条件逻辑回归之间的关系
我对成对观测中的二进制响应数据建模感兴趣。我们的目的是对小组进行事前干预的有效性进行推断,可能会针对多个协变量进行调整,并确定接受过特别培训的小组作为干预措施的一部分是否会影响效果。 给定以下形式的数据: id phase resp 1 pre 1 1 post 0 2 pre 0 2 post 0 3 pre 1 3 post 0 和一个的配对响应信息列联表:2 × 22×22 \times 2 发布正确不正确的预正确一种C不正确的bd预正确不正确的发布正确一种b不正确的Cd\begin{array}{cc|cc} & & \mbox{Pre} & \\ & & \mbox{Correct} & \mbox{Incorrect} \\ \hline \mbox{Post} & \mbox{Correct} & a & b&\\ & \mbox{Incorrect} …

2
逐步回归是否提供总体r平方的有偏估计?
在心理学和其他领域,通常采用逐步回归的形式,涉及以下内容: 查看其余的预测变量(最初在模型中没有),并确定导致最大r平方变化的预测变量; 如果r平方变化的p值小于alpha(通常为.05),则包括该预测变量并返回步骤1,否则停止。 例如,请参阅SPSS中的此过程。 出于各种原因,通常会对该程序进行批判(请参阅Stata网站上的讨论并提供参考资料)。 特别是,Stata网站总结了Frank Harrell的一些评论。我对索赔感兴趣: [逐步回归]产生严重偏高的R平方值。 具体来说,我目前的一些研究集中在估计总体r平方。通过总体r平方,我指的是总体中由总体数据生成方程式解释的方差百分比。我正在审查的许多现有文献都使用了逐步回归程序,我想知道所提供的估计数是否有偏差,以及有多少偏差。特别是,典型的研究将有30个预测变量,n = 200,输入的alpha为0.05,r平方估计约为0.50。 我所知道的: 渐近地,具有非零系数的任何预测变量将是统计上显着的预测变量,并且r平方将等于调整后的r平方。因此,渐进式逐步回归应该估计真实的回归方程和真实的总体r平方。 对于较小的样本量,与模型中所有预测变量相比,某些预测变量的可能省略将导致较小的r平方。但是,通常r平方对样本数据的偏见也会增加r平方。因此,我天真的想法是,这两个相反的力在一定条件下可能导致无偏的r平方。更一般而言,偏差的方向将取决于数据的各种特征和alpha包含标准。 设置更严格的alpha包含准则(例如.01,.001等)应会降低预期的估计r平方,因为在任何数据生成中包含任何预测变量的可能性都较小。 通常,r平方是总体r平方的向上偏差估计,并且随着更多的预测变量和较小的样本量,该偏差的程度也会增加。 题 最后,我的问题是: 逐步回归的r平方在多大程度上导致总体r平方的估计偏差? 这种偏差在多大程度上与样本数量,预测变量数量,alpha包含标准或数据属性有关? 是否有关于此主题的参考?


6
如何拆分数据集以进行10倍交叉验证
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 现在我有了一个R数据框(训练),有人可以告诉我如何随机拆分此数据集以进行10倍交叉验证吗?

3
中位数的标准误
如果我想在非正态分布的小样本(我正在使用python)的情况下测量中位数的标准误差,以下公式正确吗? sigma=np.std(data) n=len(data) sigma_median=1.253*sigma/np.sqrt(n)


5
KNN归因R包
我正在寻找KNN归因软件包。我一直在查看插补包(http://cran.r-project.org/web/packages/imputation/imputation.pdf),但是由于某种原因,KNN 插补功能(即使遵循描述中的示例)也似乎归零(如下所示)。我一直在环顾四周,但仍找不到任何东西,因此想知道是否有人对好的KNN插补包有其他建议? w ^ 在下面的代码中-NA值替换为零-不替换为Knn平均值 require(imputation) x = matrix(rnorm(100),10,10) x.missing = x > 1 x[x.missing] = NA kNNImpute(x, 3) x

1
混杂因素-定义
根据卡茨(M. Katz)在其《多变量分析》(第1.2节,第6页)中的说法,“ 混杂因素与风险因素相关,并且与结果有因果关系。 ”为什么混杂因素必须与结果有因果关系?将混杂因素与结果关联起来就足够了吗?

4
R中的Brant测试[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6个月前关闭。 在顺序逻辑回归中测试平行回归假设时,我发现有几种方法。我既使用了图形方法(如Harrell的书中所述),也使用了R中使用 序数包的方法。 但是,我还要对单个变量和整个模型运行Brant测试(来自Stata)。我环顾四周,但找不到在R中实现的代码。 R中有Brant测试的实现吗?

3
为什么我们使用k-means代替其他算法?
我研究了k均值,这就是我得到的:k均值是最简单的算法之一,它使用无监督学习方法来解决已知的聚类问题。它对于大型数据集非常有效。 但是,K均值也存在以下缺点: 对异常值和噪声具有很强的敏感性 不适用于非圆形的簇形状-簇的数量和初始种子值需要事先指定 通过局部最优的能力低。 k均值有什么好处,因为缺点似乎超出了k均值的好处。 请教我。

3
估计
我有一个如下的理论经济模型, y=a+b1x1+b2x2+b3x3+uy=a+b1x1+b2x2+b3x3+u y = a + b_1x_1 + b_2x_2 + b_3x_3 + u 因此,理论认为存在,和因子来估计。x1x1x_1x2x2x_2x3x3x_3yyy 现在我有了真实的数据,我需要估计,,。问题在于实际数据集仅包含和数据;没有数据。所以我实际上可以拟合的模型是:b1b1b_1b2b2b_2b3b3b_3x1x1x_1x2x2x_2x3x3x_3 y=a+b1x1+b2x2+uy=a+b1x1+b2x2+uy = a + b_1x_1 + b_2x_2 + u 可以估计这个模型吗? 我会失去任何估计吗? 如果我确实估计,b_2,那么b_3x_3项去哪儿?b 2 b 3 x 3b1b1b_1b2b2b_2b3x3b3x3b_3x_3 它由错误项uuu吗? 并且我们想假设x3x3x_3与x1x1x_1和x_2不相关x2x2x_2。

1
总体R平方的无偏估计是多少?
我有兴趣在多元线性回归中获得的无偏估计。R2R2R^2 通过反思,我可以想到的无偏估计可能试图匹配的两个不同值。R2R2R^2 出样品的:R2R2R^2如果从样品获得的回归方程时得到的R平方(即)施加于外部的样本数据的无限量,但是从同一数据生成处理。β^β^\hat{\beta} 人口R2R2R^2:如果获得了一个无限样品并且装配到无穷大样品(即,模型时得到的R平方),或者只是R平方由已知数据生成处理暗示。ββ\beta 我知道调整后的R2R2R^2旨在补偿样品观察到的过拟合。尽管如此,现在还不清楚是否调整ř 2实际上是的无偏估计- [R 2,并且如果它是一个无偏估计,其中上述两个定义的R2R2R^2R2R2R^2R2R2R^2它的目标是估计。R2R2R^2 因此,我的问题是: 我对以上所说的样本的无偏估计是多少 ?R2R2R^2 我所说的高于人口的无偏估计是多少 ?R2R2R^2 有没有提供模拟或其他证明无偏见的参考文献?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.