统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
下大注,更聪明
我一直在尝试编码一种算法,以建议在1X2(加权)游戏中下注。 基本上,每个游戏都有一组比赛(主队与客队): 1:主场胜利 X: 画 2:客胜 对于每个匹配项和符号(1,X和2),我将分配一个百分比,该百分比表示该符号正确匹配结果的机会/可能性。这是代表结构的数组: $game = array ( 'match #1' => array // stdev = 0.0471 ( '1' => 0.3, // 30% home wins 'X' => 0.4, // 40% draw '2' => 0.3, // 30% away wins ), 'match #2' => array // stdev = 0.4714 ( …

11
如何开始学习R?
我已经尝试过几次以“自行完成”-但取得的成功有限。我是SPSS的临时用户,并且有一些SAS经验。 将感谢背景相似并且现在使用R的某人的一个或两个指针。
16 r  references 

1
我可以使用Kolmogorov-Smirnov来比较两个经验分布吗?
是否可以使用Kolmogorov-Smirnov拟合优度检验来比较两个经验分布以确定它们是否似乎来自相同的基础分布,而不是将一个经验分布与预先指定的参考分布进行比较? 让我尝试以另一种方式询问。我从一个位置的某个分布收集了N个样本。我在另一个位置收集了M个样本。数据是连续的(例如,每个样本都是0到10之间的实数),但不是正态分布的。我想测试这些N + M样本是否全部来自相同的基础分布。为此目的使用Kolmogorov-Smirnov检验是否合理? 特别是,我可以从N个样本中计算出经验分布F0F0F_0,从M个样本中计算出经验分布F 1。然后,我可以计算Kolmogorov-Smirnov检验统计量以测量F 0和F 1之间的距离:即,计算D = sup x | F 0(x )− F 1(x )| ,并使用DNNNF1F1F_1MMMF0F0F_0F1F1F_1D=supx|F0(x)−F1(x)|D=supx|F0(x)−F1(x)|D = \sup_x |F_0(x) - F_1(x)|DDD作为我在Kolmogorov-Smirnov检验中拟合优度的检验统计量。这是合理的方法吗? (我在其他地方读到,关于拟合优度的Kolmogorov-Smirnov检验不适用于离散分布,但我承认我不明白这是什么意思,或者为什么它是正确的。这是否意味着我提出的方法是一种不好的方法? ) 或者,您是否推荐其他东西呢?

2
我们何时将降维与聚类结合在一起?
我正在尝试执行文档级群集。我构建了术语文档频率矩阵,并尝试使用k均值对这些高维向量进行聚类。我所做的不是直接聚类,而是首先应用LSA(潜在语义分析)奇异矢量分解来获得U,S,Vt矩阵,然后使用scree图选择合适的阈值,然后对归约矩阵进行聚类(特别是Vt,因为它给了我一个概念文件信息),似乎给了我很好的结果。 我听说有人说SVD(奇异矢量分解)正在聚类(通过使用余弦相似性度量等),并且不确定是否可以在SVD的输出上应用k-均值。我认为这在逻辑上是正确的,因为SVD是降维技术,为我提供了许多新矢量。另一方面,k均值将采用簇数作为输入,并将这些向量划分为指定的簇数。这个程序有缺陷吗,或者有什么方法可以改进?有什么建议么?

2
“合并数据”到底意味着什么?
我认为,“合并数据”只是意味着将以前划分为多个类别的数据进行合并……实质上是忽略类别,并使数据集成为一个巨大的数据“合并”。我想这更多是关于术语的问题,而不是统计学的应用。 例如:我想比较两个站点,并且在每个站点中,我有两种年份类型(好和差)。如果我想比较两个站点的“整体”(即忽略年份类型),那么说我在每个站点内汇总数据是否正确?除此之外,由于数年的数据包含好和坏的年份类型,所以说我将数据汇总到不同年份以实现每个站点内的“好年”和“差年”数据集是否正确呢?谢谢你的帮助!猫


1
从自定义分布生成随机样本
我正在尝试使用R从自定义pdf生成随机样本。我的pdf是: fX(x)=32(1−x2),0≤x≤1fX(x)=32(1−x2),0≤x≤1f_{X}(x) = \frac{3}{2} (1-x^2), 0 \le x \le 1 我生成了统一的样本,然后尝试将其转换为我的自定义发行版。我通过找到分布的cdf(FX(x)FX(x)F_{X}(x))并将其设置为统一样本(uuu)并求解xxx。 FX(x)=Pr[X≤x]=∫x032(1−y2)dy=32(x−x33)FX(x)=Pr[X≤x]=∫0x32(1−y2)dy=32(x−x33) F_{X}(x) = \Pr[X \le x] = \int_{0}^{x} \frac{3}{2} (1-y^2) dy = \frac{3}{2} (x - \frac{x^3}{3}) 为了生成与上述分布的随机样本,得到均匀的样品和求解X在3u∈[0,1]u∈[0,1]u \in[0,1]xxx32(x−x33)=u32(x−x33)=u\frac{3}{2} (x - \frac{x^3}{3}) = u 我实现了它,R但没有得到预期的分布。谁能指出我的理解上的缺陷? nsamples <- 1000; x <- runif(nsamples); f <- function(x, u) { return(3/2*(x-x^3/3) - u); } …
16 r  sampling  uniform 

2
是否可以使用R创建“平行集”图?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 感谢Tormod的问题(在此处发布),我遇到了“ 平行集”图。这是一个看起来像的例子:( 这是泰坦尼克号数据集的可视化。例如,显示了大多数未幸存的妇女是属于第三类的。) 我希望能够用R复制这样的情节。这有可能吗? 谢谢,塔尔

2
评估问卷的可靠性:维度,有问题的项目以及是否使用alpha,lambda6或其他某种指数?
我正在分析参加实验的参与者给出的分数。我想估计问卷的可靠性,该问卷由6个项目组成,旨在估计参与者对产品的态度。 我计算了克朗巴赫(Cronbach)的alpha值,将所有项目视为一个比例(alpha约为0.6),并一次删除了一项(最大alpha约为0.72)。我知道,根据项目的数量和底层构造的维数,alpha可能会被低估和高估。因此,我还执行了PCA。该分析表明,有三个主要成分解释了大约80%的方差。所以,我所有的问题都是关于我现在该如何进行? 我是否需要在每个维度上执行alpha计算? 我是否已移除影响可靠性的物品? 此外,在网上搜索时,我发现还有另一种可靠性度量:guttman的lambda6。 此度量与alpha的主要区别是什么? lambda的高价值是什么?


6
如何删除R数据帧中除一个特定的重复记录以外的所有记录?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4年前关闭。 我有一个包含一些重复ID的数据框。我想删除具有重复ID的记录,仅保留具有最大值的行。 因此对于这样的结构(其他变量未显示): id var_1 1 2 1 4 2 1 2 3 3 5 4 2 我想生成这个: id var_1 1 4 2 3 3 5 4 2 我知道unique()和重复的(),但我不知道如何合并最大化规则...
16 r 

2
用面板/纵向数据对回归数据进行标准化是否是一种好习惯?
通常,为了标准化比较系数,我在回归中对独立变量进行了标准化(这样,它们具有相同的单位:标准偏差)。但是,对于面板/纵向数据,我不确定如何标准化我的数据,特别是如果我估计一个层次模型。 要了解为什么这可能是一个潜在问题,请假设您有i=1,…,ni=1,…,ni = 1, \ldots, n个沿着t=1,…,Tt=1,…,Tt=1,\ldots, T周期测量的个体,并且测量了因变量yi,tyi,ty_{i,t}和一个自变量xi,txi,tx_{i,t}。如果运行完整的池回归,则可以通过以下方式标准化数据:x.z=(x−mean(x))/sd(x)x.z=(x−mean(x))/sd(x)x.z = (x- \text{mean}(x))/\text{sd}(x),因为它不会更改t统计量。另一方面,如果您适合一个非池化回归,即每个个体的一个回归,那么您应该仅按个体而不是整个数据集(在R代码中)对数据进行标准化: for (i in 1:n) { for ( t in 1:T) x.z[i] = (x[i,t] - mean(x[i,]))/sd(x[i,]) } 但是,如果您将简单的层次模型拟合为具有不同个体截距的模型,那么您将使用收缩估计量,即,您正在估计池回归和非池回归之间的模型。我应该如何标准化我的数据?像汇总回归一样使用整个数据?只使用个人,例如在不公开的情况下?

2
您如何计算科恩d的置信区间?
我已经计算了Cohen的d的回归系数(根据t统计量),比值比和均值差,希望在荟萃分析中汇总结果并了解其工作原理。但是,在Stata中,似乎没有Cohen d的置信区间就无法合并这些结果,所以我的问题是如何解决这个问题?在没有此信息的情况下,是否有一种计算方法,还是有办法在Stata中合并结果? 我知道这种荟萃分析有几个不利方面,但是很高兴看到与特定效果大小的几个较小的分析相比,它是如何工作的。
16 cohens-d 


4
聚类分析的假设
对于基本问题,我很抱歉这种分析形式,并且到目前为止对原理的理解非常有限。 我只是想知道多变量/单变量测试的许多参数假设是否适用于聚类分析?我已经阅读了许多有关聚类分析的信息资源,但未指明任何假设。 我对观察独立性的假设特别感兴趣。我的理解是,违反此假设(例如在ANOVA和MAVOVA中)很严重,因为它会影响误差估计。从到目前为止的阅读来看,聚类分析似乎主要是一种描述性技术(仅在某些特定情况下涉及统计推断)。因此,是否需要诸如独立性和正态分布数据之类的假设? 任何讨论此问题的文章的建议,将不胜感激。非常感谢。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.