统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
QQ线的置信带
这个问题不是专门针对 R,但我选择用R它来说明。 考虑一下围绕(正常)qq线产生置信带的代码: library(car) library(MASS) b0<-lm(deaths~.,data=road) qqPlot(b0$resid,pch=16,line="robust") 我正在寻找一种解释(或替代性的解释为纸/在线文档的链接)这些置信带的构造方式(我已经在R的帮助文件中看到了对Fox 2002的引用,但可惜我没有这个方便的书)。 我的问题将通过一个例子更加精确。这是R计算这些特定CI的方式(我已经缩短/简化了中使用的代码car::qqPlot) x<-b0$resid good<-!is.na(x) ord<-order(x[good]) ord.x<-x[good][ord] n<-length(ord.x) P<-ppoints(n) z<-qnorm(P) plot(z,ord.x,type="n") coef<-coef(rlm(ord.x~z)) a<-coef[1] b<-coef[2] abline(a,b,col="red",lwd=2) conf<-0.95 zz<-qnorm(1-(1-conf)/2) SE<-(b/dnorm(z))*sqrt(P*(1-P)/n) #[WHY?] fit.value<-a+b*z upper<-fit.value+zz*SE lower<-fit.value-zz*SE lines(z,upper,lty=2,lwd=2,col="red") lines(z,lower,lty=2,lwd=2,col="red") 问题是:用于计算这些SE的公式的合理性是什么(例如line SE<-(b/dnorm(z))*sqrt(P*(1-P)/n))。 FWIW该公式与线性回归中常用的置信带公式非常不同

4
评审团的偏见?
刑事审判后,一位朋友代表客户提出上诉,陪审团的选择似乎带有种族偏见。 评审团由4个种族组成的30人组成。检方使用了强制性的挑战,以从池中消除了10个人。每个种族群体的人数和实际挑战的数量分别是: A: 10, 1 B: 10, 4 C: 6, 4 D: 4, 1 total: 30 in pool, 10 challenges 被告来自种族C组,受害者来自种族A和D组,因此先验问题是C组是否受到过挑战,而A和D组受到了挑战。从法律上讲(IIUC; IANAL),辩方不需要证明种族偏见,而只是表明数据似乎表明存在偏见,这便使控方有责任从非种族角度解释每项挑战。 以下分析的方法正确吗?(我认为计算很好。): 有10个池成员的nCr(30,10)= 30,045,015个不同的集合。在这些不同的集合中,我计算出433,377个集合同时包含(不超过A组和D组的2个成员)和(不少于C组的4个成员)。 因此,达到观察到的明显偏见水平的机会比A组和D组优于C组(其中10项挑战中不包括偏爱)是它们的比率,即433/30045 = 1.44%。 因此,原假设(无此类偏差)在5%的显着性水平上被拒绝。 如果这种分析在方法上是正确的,那么向法院描述它的最简洁方法是什么,包括学术/专业参考文献(即不是Wikipedia)?虽然论点看起来很简单,但如何能最清楚,最简洁地向法院证明它是正确的,而不是恶作剧呢? 更新:在上诉摘要中,该问题已作为三级辩论进行了审议。考虑到此处讨论的技术复杂性(从律师的角度来看)以及明显缺乏法律先例,律师选择不提出建议,因此在这一点上,问题主要是理论上/教育上的。 要回答一个细节:我相信挑战的数量是10个。 在研究了周到且具有挑战性的答案和评论(谢谢!)之后,似乎这里有4个独立的问题。至少对我来说,将它们分开考虑(或听听为什么它们不可分离的争论)是最有帮助的。 1)在陪审团的挑战中,是否优先考虑被告人和受害者的种族?上诉论点的目的仅是引起合理关注,这可能导致司法命令,要求检方陈述每个单独质疑的理由。在我看来,这不是一个统计问题,而是一个社会/法律问题,由律师酌情决定是否提出。 2)假设(1),我对替代假设的选择(定性:对分享被告人的种族的陪审员的偏见,而赞成分享被害人的种族的偏见)是合理的,还是事后不允许?从我的外行角度来看,这是最令人困惑的问题-是的,如果一个人不遵守,当然不会提出!据我了解,问题在于选择偏见:一个人的测试不仅应考虑这个陪审团池,还应考虑所有此类陪审团池的范围,包括所有未发现辩护方存在差异并因此不愿意提出该问题的陪审员池。 。如何解决这个问题?(例如,安迪的测验如何解决这个问题?)看来,尽管我对此可能有误,但大多数受访者并未为可能的事后调查感到困扰1尾测试,仅针对被告所在的群体进行偏见测试。假设(1),同时测试受害者群体的偏见在方法上有何不同? 3)如果有人规定我选择(2)中所述的定性替代假设,那么检验它的合适统计量是什么?这是我最困惑的地方,因为我建议的比率似乎与安迪关于更简单的“偏于C的”替代假设的检验的保守度稍高(更保守,因为我的检验也将所有情况都排除在外)在尾部,而不仅仅是观察到的确切数字。) 两种检验都是简单的计数检验,具有相同的分母(样本的相同宇宙),并且分子精确地对应于与各个替代假设相对应的那些样本的频率。那么,@ whuber,为什么它和安迪的计数测试不一样,因为它“可以基于规定的空值[相同]和替代性的[描述的]假设,并使用内曼-皮尔森引理证明是正确的”? 4)如果有人规定(2)和(3),那么在判例法中是否存在可以说服怀疑上诉法院的内容?从迄今为止的证据来看,可能还没有。同样,在上诉的这个阶段,没有任何“专家证人”的机会,因此参考就是一切。

2
频率统计的主观性
我经常听到有人声称贝叶斯统计数据可能是高度主观的。主要论点是推论取决于先验的选择(即使可以使用无差异或最大熵的原理来选择先验)。相比之下,常客统计通常更客观。这句话有多少道理? 另外,这让我感到奇怪: 经常性统计的具体要素(如果有)中哪些是特别主观的,在贝叶斯统计中不存在或不太重要? 贝叶斯主义的主观性是否比常客主义的统计更为普遍?

3
逻辑回归系数有含义吗?
我有几个功能的二进制分类问题。(正规化的)逻辑回归的系数是否具有可解释的含义? 考虑到这些功能已预先标准化,我认为它们可以表明影响的大小。但是,在我的问题中,系数似乎敏感地取决于我选择的特征。甚至系数的符号也会随着选择为输入的不同特征集而变化。 检查系数的值是否有意义,找到最有意义的系数并用词表示其含义的正确方法是什么?某些拟合模型及其系数的符号是​​否错误-即使它们对数据进行排序也是如此? (我在要素之间具有的最高相关性仅为0.25,但这肯定起了作用吗?)

1
Gelman和Rubin收敛性诊断,如何泛化以使用向量?
Gelman和Rubin诊断程序用于检查并行运行的多个mcmc链的收敛性。它将链内方差与链间方差进行比较,说明如下: 步骤(针对每个参数): 从过度分散的起始值运行m≥2个长度为2n的链。 丢弃每个链中的前n个平局。 计算链内和链间方差。 将参数的估计方差计算为链内方差和链间方差的加权和。 计算潜在的水垢减少因子。 项目清单 我想使用此统计信息,但我想使用的变量是随机向量。 在这种情况下,取协方差矩阵的均值是否有意义?

4
“相关性”是否也意味着回归分析中的斜率?
我正在阅读一篇论文,作者写道: 通过多元回归分析研究了A,B,C对Y的影响。以Y为因变量,将A,B,C输入回归方程。方差分析如表3所示。B对Y的影响非常显着,B与Y的相关性为0.27。 英语不是我的母语,我在这里真的很困惑。 首先,他说他将进行回归分析,然后向我们展示方差分析。为什么? 然后他写了相关系数,这不是来自相关分析吗?还是这个词也可以用来描述回归斜率?

1
Karl Pearson是如何得出卡方统计量的?
培生(Pearson)是如何在1900年得出以下培生(Pearson)卡方统计量的? K=∑(Oij−Eij)2EijK=∑(Oij−Eij)2Eij K = \sum \frac{(O_{ij} -E_{ij})^2}{E_{ij}} 即 K∼χ2K∼χ2 K \sim \chi^2 他是否考虑过卡方并设计度量(自下而上的方法),还是他设计了统计量,后来证明它遵循卡方分布(自上而下)?KKK 我想知道为什么他选择了这种特定形式,而不选择或,以及他为什么将平方除以分母。∑(Oij−Eij)2∑(Oij−Eij)2\sum(O_{ij} -E_{ij})^2∑|Oij−Eij|∑|Oij−Eij|\sum|O_{ij} -E_{ij}|

3
如何计算经验概率密度之间的重叠?
我正在寻找一种方法来计算R中两个内核密度估计之间的重叠区域,以度量两个样本之间的相似性。为了澄清,在下面的示例中,我需要量化紫色重叠区域的面积: library(ggplot2) set.seed(1234) d <- data.frame(variable=c(rep("a", 50), rep("b", 30)), value=c(rnorm(50), runif(30, 0, 3))) ggplot(d, aes(value, fill=variable)) + geom_density(alpha=.4, color=NA) 这里讨论了一个类似的问题,不同之处在于我需要对任意经验数据而不是预定义的正态分布进行此操作。该overlap软件包解决了这个问题,但显然仅用于时间戳记数据,这对我不起作用。Bray-Curtis索引(在vegan包的vegdist(method="bray")函数中实现)似乎也很相关,但对于有些不同的数据也是如此。 我对理论方法和我可能会采用的R函数都感兴趣。

1
机器学习分类器big-O或complex
为了评估一种新的分类器算法的性能,我正在尝试比较准确性和复杂性(训练和分类中的big-O)。来自Machine Learning:a review,我得到了完整的监督分类器列表,还有算法之间的准确性表,以及来自UCI数据存储库的 44个测试问题。但是,对于常见的分类器,我找不到带有big-O的评论,论文或网站: C4.5 RIPPER(我认为这不可能,但谁知道) 人工神经网络与反向传播 朴素贝叶斯 神经网络 支持向量机 如果有人对这些分类器有任何表达,它将非常有用,谢谢。

1
回归系数和部分回归系数有什么区别?
我在阿卜迪(2003)中读到 当自变量成对正交时,通过计算此自变量与因变量之间的回归斜率,可以评估它们各自在回归中的作用。在这种情况下(即IV的正交性),部分回归系数等于回归系数。在所有其他情况下,回归系数将与部分回归系数不同。 但是,该文档先前并未解释这两种回归系数之间的区别。 Abdi,H.(2003年)。偏回归系数。在Lewis-Beck M.,Bryman,A.,Futing T.(编)(2003年)《社会科学百科全书:研究方法》中。加利福尼亚州千橡市:SAGE出版物。

3
培训,测试,验证生存分析问题
我一直在这里浏览各种线程,但我认为我的确切问题没有得到回答。 我有约50,000名学生及其辍学时间的数据集。我将使用大量潜在的协变量进行比例风险回归。我还将对辍学/留学情况进行逻辑回归。主要目标是为新的学生群体做预测,但我们没有理由相信他们与去年的学生群体会有很大不同。 通常,我没有这么多的数据,并且通过某种形式的惩罚进行模型拟合,但是这次我想将int训练和测试数据集分离,然后在训练集上进行变量选择。然后使用测试数据集估算参数和预测能力。 这是个好策略吗?如果没有,哪个更好? 欢迎引用,但不是必须的。

1
情景强盗的成本函数
我正在用vowpal wabbit解决上下文强盗问题。我正在向用户展示广告,并且我有很多有关显示广告的上下文的信息(例如,用户是谁,他们在哪个网站等)。如John Langford所述,这似乎是一个非常经典的情境强盗问题。 在我的情况下,用户可以对广告有2个主要响应:单击(可能多次)或不单击。我大约可以选择1,000个广告。Vowpal Wabbit要求action:cost:probability每个上下文形式的目标变量。在我的情况,action并probability很容易搞清楚:action是广告我选择显示,并且probability是选择给我的展示广告目前的政策,即广告的可能性。 但是,我在想出一种将收益(点击)映射为费用的好方法时遇到了麻烦。点击显然很不错,对同一广告的多次点击也比对同一广告的单次点击要好。但是,不点击广告是中立的:除了错过点击机会之外,它实际上并不会花我任何钱(我在奇怪的广告环境中工作)。 我有一些想法: 费用= -1 *符号(点击)+ 0 *(未点击) 费用= -1 *点击次数+ 0 *(未点击) 费用= -1 *符号(点击)+ 0.01 *(未点击) 费用= -1 *点击次数+ 0.01 *(未点击) 对于一个行动矢量,(0, 1, 5, 0)这四个功能的成本为: (0, -1, -1, 0) (0, -1, -5, 0) (0.01, -1, -1, 0.01) (0.01, -1, -5, 0.01) 很显然,许多其他的方式来表示clicks=good,并no clicks=bad.在一般情况下,我应该如何建模为vowpal wabbit上下文匪问题成本?是否可以将收益表示为负成本,还是应该重新调整所有规模以使所有成本均为正?相对中立的行为将成本设为零是否可以,或者我应该给它们一个小的正成本,以将模型推向积极的行为?


1
测试2个经验离散分布之间的差异
我有测试数据,其中有一些来自离散分布的大型样本,这些样本被用作经验分布。我想测试分布是否实际上不同,以及那些实际上不同的分布的均值差异是什么。 由于它们是离散分布,因此我的理解是,由于潜在的连续分布假设,Kolmogorov-Smirnov检验无效。对于分布是否实际不同,Chi-Squared检验是否是正确的检验? 对于均值差异,我将使用什么测试?更好的方法是从分布中取样并获取差异,然后对差异的分布进行分析吗?

2
正方变量和卡方变量平方的卷积分布?
最近在分析数据时出现了以下问题。如果随机变量X遵循正态分布且Y遵循χ2nχn2\chi^2_n分布(其中n自由度),如何是Z=X2+Y2Z=X2+Y2Z = X^2 + Y^2分布?到现在为止我想出的PDF Y2Y2Y^2: ψ2n(x)====∂F(x−−√)∂x(∫x√0tn/2−1⋅e−t/22n/2Γ(n/2)dt)′x12n/2Γ(n/2)⋅(x−−√)n/2−1⋅e−x√/2⋅(x−−√)′x12n/2−1Γ(n/2)⋅xn/4−1⋅e−x√/2ψn2(x)=∂F(x)∂x=(∫0xtn/2−1⋅e−t/22n/2Γ(n/2)dt)x′=12n/2Γ(n/2)⋅(x)n/2−1⋅e−x/2⋅(x)x′=12n/2−1Γ(n/2)⋅xn/4−1⋅e−x/2\begin{eqnarray} \psi^2_n(x) &=& \frac{\partial F(\sqrt{x})}{\partial x} \\ &=& \left( \int_0^{\sqrt{x}} \frac{t^{n/2-1}\cdot e^{-t/2}}{2^{n/2}\Gamma(n/2)} \mathrm{d}t \right)^\prime_x \\ &=& \frac{1}{2^{n/2}\Gamma(n/2)} \cdot \left( \sqrt{x} \right)^{n/2-1} \cdot e^{-\sqrt{x}/2} \cdot \left( \sqrt{x} \right)^\prime_x \\ &=& \frac{1}{2^{n/2-1}\Gamma(n/2)} \cdot x^{n/4-1} \cdot e^{-\sqrt{x}/2} \end{eqnarray} 以及一些简化的卷积积分(具有PDF χ 2 米,其中m自由度):X2X2X^2χ2mχm2\chi^2_m Kmn(t):===(χ2m∗ψ2n)(t)∫t0χ2m(x)⋅ψ2n(t−x)dx(2(n+m)2+1Γ(m2)Γ(n2))−1⋅∫t0(t−x)n4−1⋅xm2−1⋅exp(−(t−x−−−−√+x)/2)dxKmn(t):=(χm2∗ψn2)(t)=∫0tχm2(x)⋅ψn2(t−x)dx=(2(n+m)2+1Γ(m2)Γ(n2))−1⋅∫0t(t−x)n4−1⋅xm2−1⋅exp⁡(−(t−x+x)/2)dx\begin{eqnarray} K_{mn}(t) &:=& ( \chi^2_m …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.