统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
方差不相等的两个样本t检验的贝叶斯对应物是什么?
我正在寻找方差不相等的两个样本t检验的贝叶斯对应物(韦尔奇检验)。我也在寻找多变量检验,例如Hotelling的T统计量。参考文献表示赞赏。 对于多元情况,假设我们有和(z 1,⋯ ,z N),其中y i(resp z i)是样本均值,样本标准差和数量的捷径点。我们可以假设点数在整个数据集中是恒定的,所有y i的标准偏差都相同(resp z i),并且y i的样本均值(resp z i)(y1个,⋯ ,yñ)(y1,⋯,yN)(y_1,\cdots,y_N)(z1个,⋯ ,zñ)(z1,⋯,zN)(z_1,\cdots,z_N)ÿ一世yiy_iž一世ziz_iÿ一世yiy_iž一世ziz_iÿ一世yiy_iž一世ziz_i)是相关的。如果绘制样本均值,它们将彼此跟随并通过连接它们,您将获得平滑的变化函数。现在,在一些地方功能与同意ž功能,但别人没有,因为米Ë 一个ñ (Ÿ 我)- 米Ë 一个ñ (ž 我)yyyzzz变大。我想对此陈述进行量化。 mean(yi)−mean(zi)std(yi)+std(zi)mean(yi)−mean(zi)std(yi)+std(zi)\frac{mean(y_i)-mean(z_i)}{std(y_i)+std(z_i)}

1
在R中处理大数据集-教程,最佳实践等
我是R新手,需要对R中的大数据集进行各种分析。因此,在浏览此站点和其他地方时,在我看来,这里涉及许多深奥而鲜为人知的问题-例如何时使用哪个包,对数据进行哪些转换(不进行转换)等。 我只是想知道是否有一本书/教程/指南使所有这些事情变得神秘,并以系统的方式呈现信息?我更喜欢这样做,而不是四处寻找,并在线整理来自不同来源的信息。 提前致谢。
11 r  large-data 

2
决策树空间与随机森林的MCMC采样
一个随机森林是一家集决策树通过随机选择只是某些功能建立与(有时装袋训练数据),每棵树形成。显然,他们学习并概括得很好。是否有人对决策树空间进行了MCMC采样或将它们与随机森林进行了比较?我知道运行MCMC并保存所有采样树可能在计算上更加昂贵,但是我对这个模型的理论特性感兴趣,而不是计算成本。我的意思是这样的: 构造一个随机决策树(它可能会表现得很差) 用类似计算树的可能性,或者添加一个项。P(T[R Ë Ë | D a t a )∝ P(D a t a | T[R Ë Ë )P(Ť[RËË|d一种Ť一种)∝P(d一种Ť一种|Ť[RËË)P(Tree|Data) \propto P(Data|Tree)Pp - [R 我ö ř(T[R Ë Ë )Pp[R一世Ø[R(Ť[RËË)P_{prior}(Tree) 选择一个随机步骤来更改树,然后根据似然度。P(T[R Ë Ë | d一吨一)P(Ť[RËË|d一种Ť一种)P(Tree|Data) 每N步,保存当前树的副本 返回3进行大的N * M次 使用M个保存的树的集合进行预测 这会给随机森林一个类似的表现吗?请注意,与随机森林不同,我们在任何步骤都不会丢弃好数据或功能。

1
如何使用R进行4 x 4混合方差分析,在对象间和对象内进行对比?
R的初学者在这里一直在反复测量方差分析。 我有一个数据集,该数据集由一个具有4个级别的主体因素之间的代码(编码为一个称为“组”的单个变量)和一个具有4个级别的主体因素内的数据集(分别编码为四个单独的变量“ DV1”,“ DV2”,“ DV3” ','DV4')。 我的目标如下: 运行总体重复测量方差分析。 使用自定义对比来比较组(如SPSS中的LMATRIX命令)。 使用自定义对比度(如SPSS中的MMATRIX命令)比较不同级别的DV。 同时进行2)和3)的组合,因此我只比较对象内因素处于特定水平的特定组。 运行一组不为零的对比。 我知道我可以在SPSS中做到这一点,但没有很多问题,但是我不清楚如何在R中做到这一点。到目前为止,还没有看到这在R中的一个过程或一组相关过程中如何工作。

1
将用于零膨胀伽玛回归的SAS NLMIXED代码转换为R
我正在尝试为R中的连续响应变量运行零膨胀回归。不幸的是,代码位于SAS中,我不确定如何为nlme之类的代码重新编写代码。 代码如下: proc nlmixed data=mydata; parms b0_f=0 b1_f=0 b0_h=0 b1_h=0 log_theta=0; eta_f = b0_f + b1_f*x1 ; p_yEQ0 = 1 / (1 + exp(-eta_f)); eta_h = b0_h + b1_h*x1; mu = exp(eta_h); theta = exp(log_theta); r = mu/theta; if y=0 then ll = log(p_yEQ0); else ll = log(1 - p_yEQ0) …
11 r  sas  gamlss 

2
威尔科克森签名秩检验的适当性
我在“交叉验证”档案中打了一下,似乎找不到我的问题的答案。我的问题如下:Wikipedia给出了Wilcoxon签名等级测试需要保留的三个假设(针对我的问题稍作修改): 令Zi = Xi-Yi,i = 1,...,n。 假设差异Zi是独立的。 (a。)每个Zi都来自相同的连续种群,并且(b。)每个Zi都是关于一个共同的中位数对称的; Xi和Yi表示的值是有序的...因此比较“大于”,“小于”和“等于”是有用的。 但是,R中的?wilcox.test文档似乎表明(2.b)实际上是由该过程测试的: “ ...如果x和y都给出且配对为TRUE,则执行x y的分布(在成对的两个样本的情况下)关于mu对称的null的Wilcoxon有符号秩检验。” 这个声音以我,好像该测试为零假设,即“Z是symetrically周围分布中值亩= SomeMu”执行-使得拒绝FO空可能是要么拒绝的对称性或拒绝其围绕该亩Z是对称的SomeMu。 这是对wilcox.test R文档的正确理解吗?当然,这很重要的原因是,我正在对一些前后数据(上面的“ X”和“ Y”)进行许多成对差异测试。“之前”和“之后”数据分别高度偏斜,但差异几乎没有偏斜(尽管仍然有些偏斜)。我的意思是,单独考虑的“之前”或“之后”数据的偏斜度约为7到21(取决于我正在查看的样本),而“差异”数据的偏斜度约为0.5到5。但没有那么多。 如果我的“差异”数据中存在偏斜会导致Wilcoxon检验给我错误/偏见的结果(如Wikipedia文章所表明的那样),那么偏斜可能是一个大问题。但是,如果Wilcoxon检验实际上是在检验差异分布是否“关于mu = SomeMu对称”(正如?wilcox.test似乎表明的那样),那么就不必担心了。 因此,我的问题是: 上面哪种解释是正确的?我的“差异”分布中的偏斜度会偏向我的Wilcoxon检验吗? 如果偏斜是一个问题,那就:“偏斜多少?” 如果在这里Wilcoxon签署的等级测试似乎非常不合适,那么我应该使用什么建议? 非常感谢。如果您对如何进行此分析有任何进一步的建议,我很高兴听到他们的声音(尽管我也可以为此目的打开另一个线程)。另外,这是我关于交叉验证的第一个问题;如果您对我的提问方式有任何建议/评论,我也欢迎您! 一些背景知识:我正在分析一个数据集,其中包含对我称之为“公司生产中的错误”的观察。我对意外检查前后在生产过程中发生的错误进行了观察,分析的目的之一是回答以下问题:“检查是否会显着减少错误的发生?” 数据集如下所示: ID, errorsBefore, errorsAfter, size_large, size_medium, typeA, typeB, typeC, typeD 0123,1,1,1,0,1,1,1,0 2345,1,0,0,0,0,1,1,0 6789,2,1,0,1,0,1,0,0 1234,8,8,0,0,1,0,0,0 大约有4000个观测值。其他变量是描述公司特征的分类观察。规模可以小,中或大,每个公司都是其中之一,并且只有其中之一。企业可以是任何一种或所有“类型”。 我被要求进行一些简单的测试,以查看在检查所有公司和各个子组(基于大小和类型)之前和之后观察到的错误率是否存在统计学上的显着差异。之所以进行T检验,是因为数据在R之前和之后都严重偏斜,例如,在R中,之前的数据看起来像这样: summary(errorsBefore) # Min. 1st Qu. Median …

2
为一个说能影响骰子的通灵设计测试
假设我有一个朋友(我们称他为“乔治”),他说他可以用自己的思想来控制骰子的掷骰(即,使骰子更可能落在他正在考虑的特定数字上)。 我如何设计科学严谨的测试来确定他是否真的可以做到这一点?(当然,我真的不认为他可以,但是我希望他在测试开始之前就同意Amazing Randi风格的测试细节。)我想减少(很有可能)发布测试后的借口他会想出的。 这是我到目前为止的内容: 确定掷骰子的物理方法(骰子,振动杯,着陆面等) 定义一个“测试会话”,由X卷骰子组成。这个大小必须足够小,可以一次坐下,但是要足够大(可以确定)(经过分析),在95%-99%的置信度内骰子是公平的,还是偏向一方的 在所选骰子上运行Y次会话(不受George的影响),以此作为“对照”,以确保骰子自身显示“公平”结果 运行ž会议与乔治。在每次练习之前,请滚动一个单独的骰子以确定在整个会话期间George将“专注于”哪个数字。 编译并分析结果。 乔治为他的惨淡表现做了一些借口。 所以我对您的问题: 我的整体方法是否有缺陷或问题?乔治可能会反对吗? 我应该使用D6吗?还是D20?有关系吗?具有更多面的模具是否需要更多的轧辊才能产生类似的可信结果?还是相反?出于实际考虑,我宁愿少卷也不要多卷:) X,Y和Z的合理值是多少?它们并非完全无关。如果我选择的X值仅允许一次会话具有95%的置信度,那么即使没有George的影响,每20个会话中有1个可能“失败” 如何为单个会话定义“成功”或“失败”?(我确实找到了这个问题涉及卡方检验的细节,所以我认为这是我的评估方法,但是合理的置信度阈值是多少?) 如何为整体测试定义“成功”或“失败”?乔治可能会凭借一次偶然的机会“赢得”单个比赛,但是要通过整个测试,他必须通过多少Z个比赛? 如果有什么不同,我可能会在MS Excel电子表格中分析这些结果。

5
我可以将样本中的“左眼”和“右眼”用作两个不同的主题吗?
我的数据如下。我有两组病人。每组患者均进行了不同类型的眼科手术。在每组患者中测量了5个变量。我想使用置换检验或MANOVA比较两组之间的变量。进行分析的眼睛在分析中并不重要。但是,例如,A组的患者2在两只眼睛上都进行了手术,因此对这5个变量进行了两次测量,每只眼睛一次。我可以将患者2左和患者2右视为两个不同的观察结果吗?B组中的患者31相同。 Patient122.313132.Surgery typeAAA.BBB.SideLeftLeftRight.LeftRightRight.V1918790908891…………………V5221923171924PatientSurgery typeSideV1…V51ALeft91…222ALeft87…192ARight90…23...31BLeft90…1731BRight88…1932BRight91…24... \begin{array} \hline \text{Patient} & \text{Surgery type} & \text{Side} & \text{V1}& \ldots & V5\\ 1 & \text{A} & \text{Left} & 91 & \ldots & 22\\ 2 & \text{A} & \text{Left} & 87 & \ldots & 19\\ 2 & \text{A} & \text{Right} & 90 & \ldots & 23\\ …
11 sampling 

1
高相关变量的和与差几乎不相关的参考
在我写的一篇论文中,我对和而不是和进行了随机建模,以有效消除和高度相关且方差相等(如在我的应用程序中)时出现的问题。裁判员希望我提供参考。我可以很容易地证明这一点,但是作为应用期刊,他们更喜欢引用简单的数学推导。X − Y XX+ YX+YX+YX- ÿX−YX-YXXXX YÿYYXXXÿYY 有没有人有适当建议的建议?我以为Tukey的EDA书(1977)中有关于总和与差异的内容,但我找不到。

1
确定来自连续分布的最佳数据离散化
假设您有一个数据集Y1,...,YnY1,...,YnY_{1}, ..., Y_{n}从连续分布密度p(y)p(y)p(y)支撑在[0,1][0,1][0,1]是未知的,但nnn是相当大,使得核密度(例如)估计p^(y)p^(y)\hat{p}(y),是相当准确的。用于特定应用的需要我所观察到的数据变换为有限数量的类别,以产生一个新的数据集的Z1,...,ZnZ1,...,ZnZ_{1}, ..., Z_{n}隐含质量函数g(z)g(z)g(z)。 一个简单的例子是Zi=0Zi=0Z_{i} = 0时Yi≤1/2Yi≤1/2Y_{i} \leq 1/2和Zi=1Zi=1Z_{i} = 1时Yi>1/2Yi>1/2Y_{i} > 1/2。在这种情况下,诱导质量函数为 g^(0)=∫1/20p^(y)dy, g^(1)=∫11/2p^(y)dyg^(0)=∫01/2p^(y)dy, g^(1)=∫1/21p^(y)dy \hat{g}(0) = \int_{0}^{1/2} \hat{p}(y) dy, \ \ \ \hat{g}(1) = \int_{1/2}^{1} \hat{p}(y)dy 这里的两个“调整参数”是组的数量mmm和阈值λ的(m−1)(m−1)(m-1)长度向量。表示由感应质量函数克米,λ(ÿ )。λλ\lambdag^m,λ(y)g^m,λ(y)\hat{g}_{m,\lambda}(y) 我想一个过程,它的答案,例如“什么是最好的选择因此,增加组数米+ 1(并选择最优的λ那里)将产生一个可以忽略不计的改进?”。我觉得也许可以创建一个检验统计量(也许与KL散度的差异或类似的差异),并得出其分布。有什么想法或相关文献吗?m,λm,λm, \lambdam+1m+1m+1λλ\lambda 编辑:我有一个连续变量的时间测量均匀分布,并且正在使用不均匀的马尔可夫链来建模时间依赖性。坦白说,离散状态的马尔可夫链更容易处理,这就是我的动机。观察数据为百分比。我目前正在使用临时离散化,这对我来说看起来非常好,但是我认为这是一个有趣的问题,可以采用正式(通用)解决方案。 编辑2:实际上,将KL差异最小化就等于根本不离散化数据,因此该想法已被完全排除。我已经相应地编辑了正文。

2
如何在纵向数据中找到分组(轨迹)?
语境 我想先设定一下场景,然后再扩展问题。 我有纵向数据,大约每3个月对受试者进行一次测量,主要结果是数值(从连续到1dp),范围是5到14,(所有数据点的)大部分在7到10之间。意大利面条图(x轴上有年龄,每个人都有一条线),因为我有超过1500名受试者,这显然是一团糟,但是随着年龄的增长,向更高的价值迈进了明显的步伐(这是众所周知的)。 更广泛的问题是:我们想做的是首先能够确定趋势组(开始时高并保持高位,开始时低并保持低位,开始时低并增加到高位等),然后我们可以查看与“趋势组”成员资格相关的个人因素。 我在这里的问题专门针对第一部分,即按趋势分组。 题 我们如何对单个纵向轨迹进行分组? 哪种软件适合执行此操作? 我正在研究一位同事建议的SAS和M-Plus中的Proc Traj,但我想知道其他人对此有何想法。


1
如何在python中绘制碎石图?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 去年关闭。 我在矩阵上使用奇异矢量分解,并获得了U,S和Vt矩阵。在这一点上,我试图为保留的维数选择一个阈值。有人建议我看一下碎石图,但想知道如何用numpy绘制它。目前,我正在使用python中的numpy和scipy库执行以下操作: U, S, Vt = svd(A) 有什么建议么?

4
是否存在k均值中没有最优k的情况?
这在我心中至少存在了几个小时。我试图为k-means算法(具有余弦相似性度量)的输出找到最佳k,因此最终将失真作为簇数的函数进行了绘制。我的数据集是在600维空间中的800个文档的集合。 据我了解,在此曲线上找到拐点或肘点应该至少告诉我大约需要将数据放入的簇数。我把图放在下面。通过使用最大二阶导数测试获得绘制红色垂直线的点。完成所有这些操作之后,我陷入了一个简单得多的难题:这张图告诉我有关数据集的什么信息? 它是否告诉我不值得进行聚类并且我的文档缺乏结构,或者我需要设置一个很高的k?尽管有一个奇怪的事情,就是即使k很小,我也看到类似的文档被聚集在一起,所以我不确定为什么要得到这种曲线。有什么想法吗?

2
卡方变量的无穷集合的阶数统计(例如最小值)?
这是我第一次来,因此,请让我知道我是否可以以任何方式(包括格式,标签等)来澄清我的问题。(希望我以后可以编辑!)我试图找到参考,并尝试使用归纳法解决自己,但都失败了。 我正在尝试简化一种分布,该分布似乎可以简化为具有不同自由度的无数独立随机变量的无穷集合的有序统计。具体而言,在独立的中第个最小值的分布是什么?χ2χ2\chi^2mmmχ22,χ24,χ26,χ28,…χ22,χ42,χ62,χ82,…\chi^2_2,\chi^2_4,\chi^2_6,\chi^2_8,\ldots 我会对特殊情况感兴趣:(独立)的最小值的分布是什么?m=1m=1m=1χ22,χ24,χ26,…χ22,χ42,χ62,…\chi^2_2,\chi^2_4,\chi^2_6,\ldots 对于最小的情况,我能够将累积分布函数(CDF)编写为无限乘积,但无法进一步简化。我使用了的CDF 为 (对于m = 1,这确认了下面关于等价指数为2的等价物的第二条评论。)则最小CDF可以写为F_ {min}(x)= 1-(1-F_2(x) )(1-F_4(x))\ ldots = 1- \ prod_ {m = 1} ^ \ infty(1-F_ {2m}(x))= 1- \ prod_ {m = 1} ^ \ infty \ left (e ^ {-x / 2} \ sum_ {k = 0} ^ {m-1} \ frac {x ^ …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.