统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

5
在n项伯努利试验序列中,有k次成功的概率
我正在尝试找出在25个试验的区块中连续进行8个试验的概率,您总共有8个区块(在25个试验中)要连续进行8个试验。根据猜测使任何试验正确的概率为1/3,在连续获得8个正确的块之后,该块将终止(因此,从技术上讲不可能连续获得8个以上的正确)。我将如何查找发生这种情况的可能性?我一直在考虑使用(1/3)^ 8作为连续正确获得8的可能性,如果我乘以17,则有17种可能的机会在25个试验的区块中连续获得8可能性*我得到136的8个块,在这种情况下1-(1-(1/3)^ 8)^ 136是否会让我有可能连续获得8个正确的数据?


2
如何测试数据样本是否符合伽玛分布族?
我有一个从连续随机变量X生成的数据样本。从我使用R绘制的直方图中,我想也许X的分布服从一定的Gamma分布。但是我不知道这种伽马分布的确切参数。 我的问题是如何测试X的分布是否属于Gamma分布族?拟合检验有一些好处,例如Kolmogorov-Smirnov检验,Anderson-Darling检验等,但是使用这些检验的限制之一是应事先知道理论分布的参数。谁能告诉我如何解决这个问题?

2
非嵌套模型选择
似然比检验和AIC都是在两种模型之间进行选择的工具,并且两者均基于对数似然法。 但是,为什么AIC不能使用似然比检验在两个非嵌套模型之间进行选择?


2
托比模型说明
我们分为两组,每组100人,每组。我们使用了四个时间点的基本功能能力评估。评估包括6个问题,每个问题的得分为0 –5。我们没有每个问题的单独得分,只是总得分在0 – 30之间。得分越高,说明功能越好。问题在于评估是非常基础的,并且有很大的上限效应。结果非常不利。大多数参与者的得分接近30分,尤其是在3个随访时间点。可能并非所有得分上限的参与者的能力都是真正相等的:一些参与者得分仅为30分,而其他参与者则轻松得分为30分,如果可能的话,得分会高得多,因此数据是从上方进行审查。n = 50n=50n=50 我想对这两组进行比较,但随着时间的推移,显然,鉴于结果的性质,这非常困难。任何形式的转换都没有区别。我被告知,Tobit模型最适合此评估,并且我可以使用Arne Henningen的论文中的示例在R中运行分析,即使用censReg包估计R中的删失回归模型。 但是,我只有统计学的基本知识,并且发现有关Tobit模型的信息非常复杂。我需要能够用通俗易懂的语言来解释该模型,而我无法找到通俗易懂的语言来说明Tobit模型的实际作用和工作方式。谁能在没有复杂的统计和数学解释的情况下解释Tobit模型或将我指向可读的参考文献? 非常感谢您的帮助

4
在哪里可以找到有关临床试验的原始数据?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我希望将有关临床试验的原始数据用于我的硕士生的期末考试。只要试验完成(第1到第4阶段),这些数据就可以处理任何种类的分子。 您是否有想法在网上找到这样的免费数据集? 谢谢。

3
通常的回归与变量不同时的回归
我只是想了解当变量不同时,正常多元/简单回归与多元/简单回归之间的关系。 例如,我正在分析存款余额()与市场利率()之间的关系。如果运行简单的线性回归,则相关性为负且非常显着(大约-.74)。但是,如果我采用对数和因变量和自变量之差,所以我的方程现在是与回归,我的相关性和R ^ 2根本不重要()。ř Ť dÿŤYTY_T[RŤRTR_Tddln(是Ť)dln⁡(YT)d\, \ln(Y_T)R 2 = .004d[R (Ť)dR(T)d\, R(T)[R2= .004R2=.004R^2 = .004 我只是想知道这样低的甚至意味着什么吗?这是否意味着我的模型不合适,或者在查看差异数据时是否忽略了?从数据中我知道原始的两个变量之间存在显着的相关性,但是对于我的模型,我需要查看不同的变量,因此只是想知道如何解决这个问题。R 2[R2R2R^2[R2R2R^2

2
使用统计显着性检验验证聚类分析结果
我正在调查使用统计显着性检验(SST)来验证聚类分析的结果。我发现了有关该主题的几篇论文,例如 “ 对于高维,低样本量数据聚类的统计显着性科幻通过” 刘,玉峰等人。(2008年) Bock(1985)的 “ 关于聚类分析中的一些显着性检验 ” 但是我有兴趣找到一些争论说SST 不适合验证聚类分析结果的文献。我发现声称它的唯一来源是软件供应商的网页 澄清: 我对测试是否因聚类分析而发现了重要的聚类结构感兴趣,因此,我想了解支持或驳斥“关于事后测试探索性数据结果的可能性”的论文。用来寻找聚类的分析”。 我刚刚发现了Milligan和Hirtle于2003年发表的一篇论文《聚类和分类方法》,该论文说,例如,使用ANOVA将是无效的分析,因为数据没有对组进行随机分配。

3
模型选择:Logistic回归
假设我们有协变量和二进制结果变量。这些协变量中的一些属于多个级别。其他是连续的。您将如何选择“最佳”模型?换句话说,您如何选择要在模型中包含哪些协变量?x 1,… ,x n yñnnX1个,… ,xñx1,…,xnx_1, \dots, x_nÿyy 您是否会使用简单的逻辑回归分别对每个协变量建模并选择具有显着关联的变量?ÿyy

3
如何比较自举回归斜率?
让我们假设我有两个数据集,分别具有n个对独立变量x和因变量y的数据对的观察。让我们进一步假设,我想通过将观察值(替换后)自举N次并计算回归y = a + bx来生成每个数据集的回归斜率分布。每一次。我如何比较两个分布,以说斜率明显不同?用于测试分布中位数之间差异的U检验将严重依赖于N,即,我重复自举的次数越多,差异将越显着。我如何计算分布之间的重叠来确定显着差异?

2
我可以对重复的数据缩减措施进行PCA吗?
我在2种情况下分别对87只动物进行了3次试验(一些缺失数据;无缺失数据= 64只动物)。在一个情况下,我有很多具体措施(时间进入,次返回住所号等),所以我想开发描述在这方面的行为2至3复合行为评分(打电话给他们C1,C2,C3)。我希望C1在所有3个试验和87个动物中都具有相同的含义,以便我可以进行回归分析以检验年龄,性别,血统和单个动物对行为的影响。然后,我想研究C1在特定年龄段内其他情况下的行为得分与它们之间的关系。(在1岁时,上下文1中的活动是否强烈预测了上下文2中的活动?) 如果不采取重复措施,则PCA会很好用–对上下文的多个度量进行PCA,然后使用PC1,PC2等检查一个上下文中的PC1与PC1(或2或2)之间的关系(Spearman相关性)。 3)在其他情况下。问题是重复的措施,属于伪复制。我曾经有一个审阅者断言“不行”,但是我找不到任何明确的参考资料来说明在进行数据缩减时是否存在问题。 我的推理是这样的:重复的措施不是问题,因为我在PCA中所做的只是相对于原始措施的描述。如果我通过命令宣布我正在花时间进入竞技场作为上下文1中的“大胆”度量,那么我将获得上下文1大胆性度量,该度量在所有年龄段的所有个人中都是可比的,没有人会大吃一惊。如果我按法令声明我将使用的进入时间的进入远端时间,则同样。因此,如果我纯粹是出于还原目的使用PCA,为什么不能将其设为PC1(输入完成+ 0.5 ⋅ 0.28 ⋅ + 0.63 ⋅ + 0.02 ⋅0.5 ⋅0.5⋅0.5\cdot+ 0.5 ⋅ + 0.5⋅+\ 0.5\cdot0.28 ⋅0.28⋅0.28\cdot+ 0.63 ⋅ + 0.63⋅+\ 0.63\cdot+ 0.02 ⋅ + 0.02⋅+\ 0.02\cdot 总时间...),这至少是由我的多项指标所决定的,而不是我猜测进入时间通常是一种有益的,具有代表性的特征? (请注意,我对度量的基本结构不感兴趣……我的问题是关于我们如何解释特定于上下文的行为。哈里在上下文2中活跃吗?如果他随着年龄的增长而改变了我们在上下文1中所解释的活动,他是否还会在上下文2中改变其活动?) 我看过PARAFAC,看过SEM,但我不认为这两种方法对我的样本量更好或更合适。有人可以称体重吗?谢谢。

2
评估逻辑回归模型
这个问题源于我对如何确定逻辑模型是否足够好的实际困惑。我有一些模型在成对变量两年后使用成对的个体项目状态。结果成功(1)或不成功(0)。我有在形成双时测量的自变量。我的目的是测试我假设会影响配对成功的变量是否对成功产生影响,并控制其他潜在影响。在模型中,关注变量很重要。 使用中的glm()函数估算模型R。为了评估模型的质量,我做了几件事:默认情况下glm()为您提供residual deviance,AIC和BIC。此外,我已经计算了模型的错误率并绘制了合并残差。 完整模型的残差,AIC和BIC小于我估计的其他模型(嵌套在完整模型中),这使我认为该模型比其他模型“更好”。 该模型的错误率相当低,恕我直言(如Gelman and Hill,2007,pp.99): error.rate <- mean((predicted>0.5 & y==0) | (predicted<0.5 & y==1)约为20%。 到目前为止,一切都很好。但是,当我绘制合并的残差(再次遵循Gelman和Hill的建议)时,大部分合并箱位于95%CI之外: 该图使我认为该模型存在某些错误。那应该导致我放弃模型吗?我是否应该承认该模型是不完美的,但可以保留并解释感兴趣变量的影响?我开玩笑地依次排除了变量,并且进行了一些变换,但并没有真正改善合并残差图。 编辑: 目前,该模型具有十几个预测变量和5种交互作用。 这些对是相对“彼此”独立的,因为它们都是在短时间内形成的(但严格来说不是同时发生的),并且有很多项目(13k)和很多个人(19k) ),因此相当多的项目只能由一个人(大约2万对)加入。

2
给定顺序逻辑回归模型,您如何预测响应类别?
我想预测一个健康问题。我按顺序排列了3个结果类别:“正常”,“轻度”和“严重”。我希望从两个预测变量(测试结果(连续,区间协变量)和有此问题的家族史(是或否)中进行预测。在我的样本中,概率为55%(正常),35%(轻度)和10%(严重)。从这个意义上讲,我总是可以预测“正常”,并且在55%的时间是正确的,尽管这不会给我有关单个患者的任何信息。我适合以下模型: (y的切点 ≥ 1 )ˆ(y的切点 ≥ 2 )ˆβ^牛逼Ë 小号ŧβ^F一米我升ý ħ 我š 吨ö ř ÿ = − 2.18= - 4.27= 0.60= 1.05the cut point for (y≥1)^=−2.18the cut point for (y≥2)^=−4.27β^test=0.60β^family history=1.05\begin{align} \text{the cut point for }\widehat{(y \ge 1)} &= -2.18 \\ \text{the cut point for }\widehat{(y \ge 2)} &= -4.27 \\ …

1
使用时间序列交叉验证计算预测误差
我有一个时间序列的预测模型,我想计算其样本外预测误差。目前,我遵循的策略是Rob Hyndman的博客(在页面底部附近)建议的策略(假设时间序列和大小为的训练集)y1,…,yny1,…,yny_1,\dots,y_nkkk 使模型适合数据并让作为下一个观测值的预测。yt,…,yt+k−1yt,…,yt+k−1y_t,\dots,y_{t+k-1}y^t+ky^t+k\hat{y}_{t+k} 将预测误差计算为。et=y^t+k−yt+ket=y^t+k−yt+ke_{t} = \hat{y}_{t+k} - y_{t+k} 重复t=1,…,n−kt=1,…,n−kt=1,\dots,n-k 将均方误差计算为MSE=1n−k∑n−kt=1e2tMSE=1n−k∑t=1n−ket2\textrm{MSE}=\frac{1}{n-k}\sum_{t=1}^{n-k} e_t^2 我的问题是,由于我的训练集重叠,我有多少需要担心相关性。特别要说的是,我不仅要预测下一个值,还要预测接下来的值,这样我就可以预测\ hat {y} _ {t + k},\ dots,\ hat {y} _ {t + k + m-1}和错误e_ {t,1},\ dots,e_ {t,m},我想构造一个预测错误的术语结构。mmmy^t+k,…,y^t+k+m−1y^t+k,…,y^t+k+m−1\hat{y}_{t+k},\dots,\hat{y}_{t+k+m-1}et,1,…,et,met,1,…,et,me_{t,1},\dots,e_{t,m} 我是否仍可以每次将训练集的窗口向前滚动1个,还是应该向前滚动mmm?如果我要预测的序列中存在显着的自相关,那么这些问题的答案将如何改变(可以想象这是一个长记忆过程,即自相关函数随幂定律而不是指数衰减。) 我希望在这里提供解释,也可以链接到可以找到有关MSE(或其他误差度量)的置信区间的理论结果的地方。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.