统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
Spearman相关系数差异的显着性检验
(非常感谢您的快速回复!我在提出问题方面做得很差,所以让我重试。) 我不知道如何找出两个Spearman相关系数之间的差异是否在统计上显着。我想知道如何找到它。 我想发现的原因是在以下论文中:Gabrilovich和Markovitch 撰写的基于Wikipedia的自然语言处理语义解释(《人工智能研究杂志》 34(2009)443-498)。 在表2(p。457)中,作者表明他们的方法(ESA-Wikipedia)比其他方法具有更高的统计学上显着的Spearman相关性,并且我想这样做也是为了证明我的方法比以前的方法更好一些问题的方法。 我不知道他们如何计算统计显着性,我想知道。该论文的作者确实指出,Spearman的等级相关被视为Pearson的相关。我不确定这是否是正确的方法。我有两个Spearman的相关性,我想知道它们之间的差异是否在统计上显着。 我知道网站(例如http://faculty.vassar.edu/lowry/rdiff.html)提供了在线计算器,用于获取两个Pearson相关性之间的差异。对于两个Spearman相关系数之间的差异,我找不到类似的在线计算器。 Peter Flom提供的链接中的解决方案 注意:这些过程仅支持Spearman的相关性低于0.6。 令 =观察到的集合相关性的Fisher变换, z_B =观察到的集合B的相关性的Fisher变换。zAzAz_AAAAzBzBz_BBBB 对于,让,其中是费希尔转换集的所述的一左通过删除 ,重新排序并重新计算相关性获得的相关性。(每个 基于对;每个删除都是临时的,仅对于i而言,不是永久的。)对集合重复。i=1,…,ni=1,…,ni = 1,\dots,nyAi=nzA−(n−1)zA′iyAi=nzA−(n−1)zA′iy_{A_i} = nz_A- (n - 1)z_{A'i}zA′izA′iz_{A'i}AAA(xi,yi)(xi,yi)(x_i,y_i)zA′izA′iz_{A'i}n−1n−1n-1BBB y¯A=∑yAi/ny¯A=∑yAi/n\bar y_A = \sum y_{A_i}/n是已知的Fisher变换。重复集。BBB vy¯A=∑(yAi−y¯A)2/(n(n−1))vy¯A=∑(yAi−y¯A)2/(n(n−1))v_{\bar y_A} = \sum (y_{A_i}-\bar y_A)^2 /(n(n-1))是的方差。重复集。y¯Ay¯A\bar y_ABBB 使用异方差(Welch-Satterthwaite)检验比较两个粗略估计:ttt nAnBABt=y¯A−y¯Bvy¯A+vy¯B−−−−−−−−√,df=(vy¯A+vy¯B)2v2y¯AnA−1+v2y¯BnB−1t=y¯A−y¯Bvy¯A+vy¯B,df=(vy¯A+vy¯B)2vy¯A2nA−1+vy¯B2nB−1 t = \frac{\bar y_A - \bar y_B}{\sqrt{v_{\bar y_A} + v_{\bar …

3
如果事先声明,可以动态增加样本数量吗?
我将研究一种刺激与受试者内部设计相比另一种刺激的优点。我有一个排列方案,旨在减少研究某些部分的顺序影响(任务类型顺序,刺激顺序,任务集顺序)。排列方案规定样本大小可被8整除。 要确定样本数量,我必须大胆猜测(在我的领域中是一个很好的传统),或者为我所需的功效计算样本数量。现在的问题是,我没有丝毫线索要观察多大的效果(这也是我所在领域的良好传统)。这意味着功率计算有些困难。另一方面,大胆猜测可能也是不好的,因为我要么得出的样本量太小,要么向参与者支付太多的钱,而在实验室中花费了太多的时间。 是否可以预先声明我分8个人加入参与者,直到我离开两个p值的通道?例如0.05 <p <0.30?或者,您会建议我如何继续?

3
如何证明阶乘方差分析中的误差项合理?
关于多元ANOVA的一个可能非常基本的问题。假设采用双向设计,我们同时测试主要效果A,B和交互作用A:B。在测试类型为I SS的A的主要效果时,效果SS的计算方式为差异,其中是仅具有截距的模型的残差平方误差和,和的RSS与因子A的模式添加。我的问题涉及错误术语的选择:- [R 小号小号(1 )- [R 小号小号(甲)[R 小号小号(1 )- [R 小号小号(一)RSS(1)−RSS(A)RSS(1) - RSS(A)[R 小号小号(1 )RSS(1)RSS(1)[R 小号小号(一)RSS(A)RSS(A) 您如何证明此测试的误差项通常是从包含主效应和相互作用的完整模型A + B + A:B的RSS计算而来的? F一种= (R S小号1个− R S小号一种)/(dF[R 小号小号1个- dF[R 小号小号一种)[R 小号小号A + B + A :B/天F[R 小号小号A + B + A :BFA=(RSS1−RSSA)/(dfRSS1−dfRSSA)RSSA+B+A:B/dfRSSA+B+A:B F_{A} = \frac{(RSS_{1} - RSS_{A}) / (df_{RSS 1} - …

2
经济学家如何量化黑市运作?
我对东亚的有组织犯罪进行了大量研究,目的是为了支持我的一位作者朋友的项目。我注意到,一些著名的经济学家和新闻工作者共同估算了全球黑市运作的价值。 这是什么方法?这些数字如何相加?这些数字是在传统市场模型中捕获的吗?

1
从RMSE计算似然
我有一个模型来预测带有几个参数的轨迹(x作为时间的函数)。目前,我计算了预测轨迹与实验记录的轨迹之间的均方根误差(RMSE)。当前,我使用单纯形(matlab中的fminsearch)将这种差异(RMSE)最小化。虽然此方法可以很好地拟合,但我想比较几种不同的模型,所以我认为我需要计算似然性,以便可以使用最大似然估计而不是最小化RMSE(然后使用AIC或BIC比较模型)。有什么标准的方法可以做到这一点吗?

2
如果没有多级建模,如何在荟萃分析中处理研究内复制,而研究是复制的单位?
研究说明: 我已经观察到荟萃分析之间在研究内复制方面的一个常见错误。在陈述假设时,我不清楚错误是否使研究无效。但是,据我了解,这些假设违反了统计学的基本前提。 例如,一项研究测试了化学品对响应。ÿXXXÿYY 对数响应比率进行分析:处理(在的情况下)与控件(无)的比率: X Y 0 Xÿ+ XY+XY_{+X}XXXY0Y0Y_{0}XXX R=ln(Y+XY0)R=ln⁡(Y+XY0)R = \ln(\frac{Y_{+X}}{Y_{0}}) 荟萃分析中包含的某些研究包含多种处理方法,例如不同含量或化学形式。对于每种处理,都有一个不同的值,尽管始终使用相同的值。R R Y 0XXXRRRRRRY0Y0Y_0 方法说明: 在一项研究中对不同治疗(水平和形式)的反应被视为独立观察。XXX 问题: 这不是伪复制吗? 即使在方法中声明了违反独立性,这是否不合适? 在研究复制中进行处理的简便方法(例如,在简单的荟萃分析软件包的能力范围内)会是什么? 最初的想法: 总结每项研究的结果,例如通过平均反应 根据先验标准(例如最高剂量,首次测量)从每个研究中仅选择一种治疗? 还有其他解决方案吗?

2
样本最大值的方差是多少?
我正在寻找一组随机变量的最大值的方差的界限。换句话说,我想找的闭合形式的公式乙BB,使得 其中 X = { X 1,... ,X 中号 }是一组固定的中号与有限装置的随机变量 μ 1,... ,μ 中号和方差 σ 2 1,... ,σ 2 中号。瓦尔(最大一世X一世)≤ 乙,Var(maxiXi)≤B, \mbox{Var}(\max_i X_i) \leq B \enspace, X= { X1个,… ,X中号}X={X1,…,XM}X = \{ X_1, \ldots, X_M \}中号MMμ1个,… ,μ中号μ1,…,μM\mu_1, \ldots, \mu_Mσ21个,… ,σ2中号σ12,…,σM2\sigma_1^2, \ldots, \sigma_M^2 我可以推断出 但是这个界限似乎很松散。数值试验似乎表明,乙= 最大值我σ 2 我可能是一种可能性,但我一直没能证明这一点。任何帮助表示赞赏。瓦尔(最大一世X一世)≤ Σ一世σ2一世,Var(maxiXi)≤∑iσi2, \mbox{Var}(\max_i X_i) …

2
如何将频率表转换为值向量?
使用R或Excel,将频率表转换为值向量的最简单方法是什么? 例如,您如何转换以下频率表 Value Frequency 1. 2 2. 1 3. 4 4. 2 5. 1 进入以下向量? 1, 1, 2, 3, 3, 3, 3, 4, 4, 5
13 r  dataset  excel 

2
高斯的“判别式”分析模型为何如此称呼?
高斯判别分析模型学习,然后应用贝叶斯规则评估 因此,它们是生成模型。为什么将其称为判别分析?如果是因为我们最终得出了类之间的判别曲线,则所有生成模型都将发生这种情况。P (y | x )= P (x | y )P p r i o r(y )P(x | y)P(x|y)P(x|y)P(y| x)= P(x | y)Pp - [R 我ö ř(y)ΣG∈ ÿP(x | g)Pp - [R 我ö ř(克)。P(y|x)=P(x|y)Pprior(y)Σg∈YP(x|g)Pprior(g).P(y|x) = \frac{P(x|y)P_{prior}(y)}{\Sigma_{g \in Y} P(x|g) P_{prior}(g) }.

2
采用过采样进行打包以建立罕见事件预测模型
有谁知道是否描述了以下内容以及(无论哪种方式)听起来像是一种学习目标变量非常不均衡的预测模型的合理方法? 通常在数据挖掘的CRM应用程序中,我们将寻求一个模型,其中相对于大多数事件(负面事件)而言,积极事件(成功)非常罕见。例如,我可能有500,000个实例,其中只有0.1%是感兴趣的正类(例如,购买的客户)。因此,为了创建预测模型,一种方法是对数据进行采样,从而保留所有正类实例,而仅保留一个负类实例的样本,以使正类与负类的比率更接近1(可能为25%达到75%(从正面到负面)。文献中有过采样,欠采样,SMOTE等所有方法。 我很好奇的是将上面的基本采样策略与否定类的装袋相结合。 保留所有积极的课堂实例(例如1,000个) 对否定类实例进行采样,以创建一个平衡的样本(例如1,000)。 拟合模型 重复 有人听说过吗?似乎没有装袋的问题是,当存在500,000个样本时,仅对1,000个否定类实例进行采样是因为预测变量空间将稀疏,并且您很可能无法表示可能的预测变量值/模式。套袋似乎对此有所帮助。 我看了rpart,当其中一个样本没有一个预测变量的所有值时都没有“中断”(然后用这些预测变量的值预测实例时也没有中断): library(rpart) tree<-rpart(skips ~ PadType,data=solder[solder$PadType !='D6',], method="anova") predict(tree,newdata=subset(solder,PadType =='D6')) 有什么想法吗? 更新: 我获取了一个真实世界的数据集(营销直接邮件响应数据),并将其随机划分为训练和验证。有618个预测变量和1个二进制目标(非常罕见)。 Training: Total Cases: 167,923 Cases with Y=1: 521 Validation: Total Cases: 141,755 Cases with Y=1: 410 我从训练集中选取了所有阳性样本(521),并从平衡样本中随机抽取了相同大小的阴性样本。我适合一棵rpart树: models[[length(models)+1]]<-rpart(Y~.,data=trainSample,method="class") 我重复了此过程100次。然后针对这100个模型中的每一个,在验证样本的情况下预测Y = 1的概率。我只是将这100个概率取平均值进行最终估算。我在验证集上确定了概率,并在每个十分位中计算了Y = 1(模型估算能力的传统方法)的百分比。 Result$decile<-as.numeric(cut(Result[,"Score"],breaks=10,labels=1:10)) 表演如下: 为了了解与没有套袋相比的情况,我仅使用第一个样本(所有阳性病例和相同大小的随机样本)预测了验证样本。显然,所采样的数据太稀疏或过拟合,以至于无法对保留的验证样本生效。 当发生罕见事件且n和p较大时,建议套袋程序的有效性。

2
轮廓似然的Hessian用于标准误差估计
这个问题是由这个问题引起的。我查找了两个来源,这就是我发现的内容。 A. van der Vaart,渐进统计: 几乎不可能显式计算轮廓似然,但其数值评估通常是可行的。然后,轮廓似然可用于减小似然函数的维数。轮廓似然函数通常以与参数模型的(普通)似然函数相同的方式使用。除了上述的最大的他们的点作为估计,在二阶导数用作的估计减去e的渐近协方差矩阵的逆矩阵。最近的研究似乎证实了这种做法。 θθ^θ^\hat\thetaθ^θ^\hat\theta J. Wooldridge,《截面和面板数据的计量经济学分析》(两个版本均相同): 作为研究渐近性质的设备,由于通常取决于所有,因此集中目标函数的值是有限的,在这种情况下,目标函数不能写为独立的,均匀分布的求和的和。当我们从某些非线性面板数据模型集中特定于个体的效果时,就会出现一种方程式(12.89)是iid函数之和的设置。此外,集中目标函数对于建立看似不同的估算方法的等效性可能很有用。WG(W,β)g(W,β)g(W,\beta)w ^WW Wooldridge在更广泛的M估计量上下文中讨论了这个问题,因此它也适用于最大似然估计量。 因此,对于同一个问题,我们得到两个不同的答案。我认为魔鬼在于细节。对于某些模型,对于某些模型,我们可以安全地使用轮廓似然的hessian。是否有任何一般结果为我们何时(或不能这样做)提供条件?

4
报告逻辑回归的结果
我有以下逻辑回归输出: Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) 0.5716 0.1734 3.297 0.000978 *** R1 -0.4662 0.2183 -2.136 0.032697 * R2 -0.5270 0.2590 -2.035 0.041898 * 是否可以通过以下方式进行报告: Beta系数,赔率,Zvalue,P值。如果是,我如何获得赔率?
13 logistic 

2
具有多个变量的类内相关系数(ICC)
假设我在同胞中测量了一些变量,这些变量嵌套在家庭中。数据结构如下所示: 家庭同胞价值 ------ ------- ----- 1 1 y_11 1 2 y_12 2 1 y_21 2 2 y_22 2 3 y_23 …… 我想知道同一家庭中对兄弟姐妹进行的测量之间的相关性。常用的方法是根据随机拦截模型计算ICC: res <- lme(yij ~ 1, random = ~ 1 | family, data=dat) getVarCov(res)[[1]] / (getVarCov(res)[[1]] + res$s^2) 这等效于: res <- gls(yij ~ 1, correlation = corCompSymm(form = ~ …

2
了解引导进行验证和模型选择
我想我了解引导程序的基本原理,但是不确定如何使用引导程序进行模型选择或避免过度拟合。 例如,对于模型选择,您是否只选择在其自举样本中产生最低误差(也许是方差?)的模型? 是否有任何文章讨论如何使用自举进行模型选择或验证? 编辑:请参阅此线程,以及@ mark999的答案,以获取此问题后面的更多上下文。

3
如何用英语报告Cox比例风险模型的风险比率?
我的理解是一个危险比从Cox比例风险模型进行比较的给定因子的危险率与参考组的效果。您如何将其报告给不了解统计信息的受众? 让我们尝试举一个例子。假设我们让人们参与研究他们购买沙发需要多长时间。我们对3年进行右审查。对于此示例,我们有两个因素:年龄<30或> = 30,无论他们是否养猫。结果表明,“家猫”与参考组(年龄<30,“不家猫”)的危险比为1.2,且显着(例如p <0.05)。 我是否正确地说这一切:猫主人在3年内有更多活动(购买沙发),或者活动时间(猫购买)对于猫主人来说更快,还是这两种方式的结合? 编辑:假设该事件是他们在这段时间内首次购买沙发(如果发生)。此模型无法帮助我们分析该时段内的多次购买。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.