统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
不等方差条件下的Mann-Whitney零假设
我只是对Mann-Whitney U检验的零假设感到好奇。我经常看到它指出零假设是两个总体具有相等的分布。但是我在想-如果我有两个均值相同但方差极不相等的正常群体,则Mann-Whitney检验可能不会检测到这种差异。 我还看到它表明曼·惠特尼检验的原假设是或一个总体(X)的观察结果超过第二总体(Y)的观察结果的概率(在排除并列)等于0.5。这似乎更有意义,但似乎不等同于我陈述的第一个零假设。Pr(X>Y)=0.5Pr(X>Y)=0.5\Pr(X>Y)=0.5XXXYYY 我希望能对此有所帮助。谢谢!

1
III型平方和
我有一个带有类别变量的线性回归模型 一个一个A(男性和女性)和一个连续可变。乙乙B 我在的R中设置了对比代码options(contrasts=c("contr.sum","contr.poly"))。现在,我有了,以及它们之间的相互作用(A:B)的类型III平方和。一个一个A乙乙Bdrop1(model, .~., test="F") 我坚持的是如何为计算平方和。我乙乙B认为是sum((predicted y of the full model - predicted y of the reduced model)^2)。简化的模型看起来像y~A+A:B。但是当我使用时predict(y~A+A:B),R返回的预测值与完整模型的预测值相同。因此,平方和将为0。 (对于 一个一个A,我使用的简化模型y~B+A:B,该模型与相同y~A:B。) 这是随机生成的数据的示例代码: A<-as.factor(rep(c("male","female"), each=5)) set.seed(1) B<-runif(10) set.seed(5) y<-runif(10) model<-lm(y~A+B+A:B) options(contrasts = c("contr.sum","contr.poly")) #type3 sums of squares drop1(model, .~., test="F") #or same result: library(car) Anova(lm(y~A+B+A:B),type="III") #full model predFull<-predict(model) #Calculate sum of squares …

1
Logistic回归模型变量的p值的含义
因此,我正在R中使用逻辑回归模型。尽管我还不熟悉统计学,但我现在似乎对回归模型有了一些了解,但仍然有些困扰我: 查看链接的图片,您会看到我创建的示例模型的摘要R打印。该模型正在尝试预测是否将重新找到数据集中的电子邮件(二进制变量isRefound),并且数据集中包含与密切相关的两个变量isRefound,即- next24和next7days-均为二进制,并告知是否将在下一个单击邮件。从日志中的当前点开始的24小时/接下来的7天。 高p值应表明,此变量对模型预测的影响是相当随机的,不是吗?基于这一点,我不明白为什么当这两个变量被排除在计算公式之外时,模型预测的精度为什么会下降到10%以下。如果这些变量的重要性不高,为什么将它们从模型中删除会产生如此大的影响? 最好的问候和预先的感谢,Rickyfox 编辑: 首先,我仅删除了next24,这会产生很小的影响,因为它的系数很小。正如预期的那样,变化不大-不会为此上传图片。 移除next7day会对模型产生重大影响:AIC提升200k,精度降低至16%,召回率降低至73%

1
EFA显然支持单一因素,措施在内部是一致的,但是CFA是否适合?
我正在探索一项10项自我报告测评的心理测量特性。我有两个独立样本中的大约400个案例。这些项目以4点李克特量表完成。全民教育显然支持单因素解决方案(例如,第一特征值超过6,所有其他本征值低于1),而克朗巴赫的alpha值很好(例如.90)。没有项目具有较低的项目-总相关性。 我最初想做一个CFA(EFA只是我发现CFA不好之后的后续工作),测试一个单因素模型。令我惊讶的是,该模型的适用性相对较差: CFI=.91 TLI=.88 RMSEA=.13 此外,每个项目的负载都非常好(.65+)。 奇怪的是SRMR=.05,这是可以接受的/很好。 修改索引建议我将各地的错误相关联。如果有明确的理由这样做(例如,某些项目的措词非常相似),我会这样做;但是,所有度量的措词都类似,并且将所有错误术语关联起来将是奇怪而痛苦的。 我从未见过这样的情况。这项措施在内部是一致的,显然是全民教育中的一个因素,但在CFA中显示不佳。在两个独立的样本(来自不同大陆)中,结果是一致的。我尝试了两因素CFA(将5个随机项目分组),拟合度相同,甚至略胜一筹。 这是我的问题: 考虑到EFA / Cronbach alpha /因子负荷,为什么CFI / TLI / RMSEA的拟合度如此差? 为什么SRMR好,而其他指数却不好?我知道他们会衡量不同的事物,但以我的经验,他们几乎总是会聚在一起。 我应该关联一些错误吗? 示例项目: 你有缺点的想法 您的想法很难忘记 你一直在想情况

1
从基于GPS的报告中确定未知数量的现实世界位置
我正在开发一些软件,该软件应从多个基于GPS的报告中确定现实世界的位置(高速摄像头)。当报告位置时,用户将在驾驶,因此报告非常不准确。为了解决该问题,我必须对同一位置的报告进行聚类并计算平均值。 我的问题是关于如何将这些报告归类。我阅读了有关期望最大化算法和k均值聚类的信息,但据我了解,我需要提前确定实际位置的数量。 是否有其他算法不需要真正位置的确切数目,而是使用一些边缘条件(最小距离)? 报告包含经度,纬度和精度(以米为单位)。没有名称或其他可用于识别重复项的名称。 另一个障碍可能是这很常见,一个真实位置的报告只有一个。这使得很难将异常数据与正常数据区分开。

2
具有O(1)更新效率的稳健均值估计
我正在寻找对具有特定属性的均值的可靠估计。我有一组要为其计算此统计信息的元素。然后,我一次添加一个新元素,对于每个其他元素,我想重新计算统计信息(也称为在线算法)。我希望此更新计算速度很快,最好是O(1),即不依赖于列表的大小。 通常的平均值具有此属性,可以有效地对其进行更新,但对异常值不具有鲁棒性。均值的典型鲁棒估计量(如四分位数间均值和修剪均值)无法有效更新(因为它们需要维护排序列表)。 对于可以有效计算/更新的可靠统计信息的任何建议,我将不胜感激。

2
ARIMA预测具有季节性和趋势,结果奇怪
当我开始使用ARIMA模型进行预测时,我试图了解如何根据ARIMA随季节和漂移的变化来改进预测。 我的数据是以下时间序列(超过3年,趋势清晰且季节性明显,似乎在滞后12、24、36?时自相关不支持)。 > bal2sum3years.ts Jan Feb Mar Apr May Jun Jul Aug 2010 2540346 2139440 2218652 2176167 2287778 1861061 2000102 2560729 2011 3119573 2704986 2594432 2362869 2509506 2434504 2680088 2689888 2012 3619060 3204588 2800260 2973428 2737696 2744716 3043868 2867416 Sep Oct Nov Dec 2010 2232261 2394644 2468479 2816287 2011 2480940 …


1
动态时间规整和规范化
我正在使用动态时间规整来匹配“查询”和“模板”曲线,到目前为止取得了一定的成功,但是我有一些基本问题: 我正在通过评估DTW结果是否小于我启发式得出的某个阈值来评估“匹配”。这是使用DTW确定“匹配”的一般方法吗?如果没有,请说明... 假设(1)的答案是“是”,那么我感到困惑,因为DTW结果对a)曲线幅度的差异和b)查询向量的长度以及“模板”矢量。 我正在使用对称步长函数,因此对于(b),我通过除以M + N(DTW矩阵的宽度+高度)来归一化我的DTW结果。这似乎有些有效,但是似乎会惩罚距离对角线更远的DTW匹配(即,通过DTW矩阵的路径更长)。对于“规范化”方法来说,这似乎是任意的。除以通过矩阵的步数似乎有直觉的意义,但根据文献,这似乎并不是解决问题的方法。 那么,是否有更好的方法来针对查询和模板矢量的大小调整DTW结果? 最后,如何针对查询和模板向量之间的幅度差异归一化DTW结果? 实际上,由于缺乏可靠的归一化技术(或我缺乏理解),在处理样本数据以识别用于定义“匹配”的最佳阈值水平时,似乎需要大量的人工工作。我想念什么吗?

2
Doane直方图合并的公式
我正在实现各种算法,以估计用于直方图的最佳bin数量。我要实现的大多数方法在Wikipedia“直方图”页面上的“ 箱数和宽度 ” *部分中进行了描述。 我对Doane的公式感到困惑: 1 + log(n) + log(1 + kurtosis(data) * sqrt(n / 6.)) n数据大小在哪里。 问题是峰度为负,并且n >> 1因为的参数log变为负。 *(该页面自发布以来已更改,链接已编辑为指向发布时的页面)


2
从真实数据中创建“演示”数据:伪装而不毁容
(我不知道该用什么标记,因为我不是统计学家,我也不知道它属于哪个领域。请随意添加更合适的标记。) 我在一家生产数据分析软件的公司工作,我们需要一套不错的数据来测试和演示我们的最新产品。我们不能只用随机数生成器的输出填充数据库,因为程序的输出将变得毫无意义。获取此类数据的最简单方法之一是从客户端获取数据。我们从运行的试验中获得了大量数据。现在,显然我们无法发布客户的实际数据,因此我们需要对其进行一些更改,但仍然需要使其表现得像真实数据一样。 这里的目的是获取他们的数据集,并对其应用“模糊”,以使其无法被识别为特定于他们的。我对统计理论的记忆本身有点模糊,所以我想由你们来做: 本质上,我们(来自客户端)的数据本身就是(在该国家或整个世界中)存在的所有数据的样本。我想知道的是,可以使用哪种类型的操作来使样本不再强有力地代表客户的样本人口,同时仍然使样本大致代表世界人口。 作为参考,据我们所知,我们一般遵循粗糙的正态(高斯)分布。 原始数据集尚不广泛,但是从理论上可以从某些特定于区域的特征中识别出来(我们不知道这些特征是什么,并且是否有人达到足够的水平还值得怀疑,但是我们知道不同地方存在差异放置)。无论如何,我对这种理论比对实践更感兴趣-我想知道某个操作是否使得不可能(或至少很难)通过参数X识别源数据集,无论有人是否有能力工作首先是参数X。 我想出的方法是将读数分为不同的类型(在不付出太多的情况下,假设一组可能是“长度”或“花费X的时间”。)对于每个读数,计算标准偏差。然后,对每个值在(n * stddev)的正负之间添加一个随机值,其中n是我可以用来调整结果直到数据充分“模糊化”的分数。我不想简单地应用静态范围(例如,在原始值的90%到110%之间随机变化),因为某些值的差异要大得多或小得多-在某些度量中,平均值的10%几乎不明显,但在其他情况下则会使您成为严重的异常值。 这足以掩盖原始数据的来源吗?如果不能,那么仍可以通过哪些统计手段来识别数据,我又应该如何掩盖这些数据,同时又仍然使所得的数据模糊不清呢?

1
如何为一个级别与另一个级别的平均值之差指定对比度矩阵(以R为单位)?
我有一个看起来像这样的回归模型:Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y=β0+β1X1+β2X2+β3X3+β12X1X2+β13X1X3+β123X1X2X3Y = \beta_0+\beta_1X_1 + \beta_2X_2 + \beta_3X_3 +\beta_{12}X_1X_2+\beta_{13}X_1X_3+\beta_{123}X_1X_2X_3 ...或用R表示法: y ~ x1 + x2 + x3 + x1:x2 + x1:x3 + x1:x2:x3 假设和是分类变量,而是数字。复杂之处在于具有三个级别并且我需要测试以下内容而不是标准对比:X1X1X_1X2X2X_2X3X3X_3X1X1X_1X1a,X1b,X1cX1a,X1b,X1cX_{1a}, X_{1b}, X_{1c} 级的截距是否与和级的平均截距明显不同。X1aX1aX_{1a}X1bX1bX_{1b}X1cX1cX_{1c} 的响应在级与和级的平均值之间是否显着不同。X2X2X_2X1aX1aX_{1a}X1bX1bX_{1b}X1cX1cX_{1c} 的斜率在级别与级别和的平均值之间是否显着不同。X3X3X_3X1aX1aX_{1a}X1bX1bX_{1b}X1cX1cX_{1c} 根据这篇文章,看来我想要的矩阵是... 2 -1 -1 我也是contrasts(mydata$x1)<-t(ginv(cbind(2,-1,-1)))。的估计更改,其他的更改。我可以重现的新的估计通过减去的预测值和组装置(当和处于其基准电平)从值的两倍在这些级别。但是我不能相信自己正确地指定了对比度矩阵,除非我也可以类似地得出其他系数。β1β1\beta_1beta1beta1beta_1X1bX1bX_1bX1cX1cX_1cX3=0X3=0X_3=0X2X2X_2X1aX1aX_1a 有人对如何将我的头脑包扎在单元均值和对比度之间的关系上有任何建议吗?谢谢。这种对比有标准名称吗? 啊哈!根据Glen_b答案中发布的链接,最重要的是,您可以将想要的组的任何比较转换为R样式的对比度属性,如下所示: 制作一个方矩阵。行代表因子水平,列代表对比。除了第一个,它告诉模型截距应该代表什么。 如果您想让截距成为平均值,请在第一列中填写所有相同的非零值,无论如何。如果要让截距成为水平均值之一,则在该行中放置一个数字,并用零填充其余部分。如果您希望截距是多个级别的平均值,则在这些行中输入数字,在其余行中输​​入零。如果希望它是加权平均值,请使用不同的数字,否则请使用相同的数字。您甚至可以在intercept列中输入负值,这也可能意味着某些事情,但是它完全改变了其他对比度,所以我不知道那是什么意思 在正数和负数中填充其余的列,以指示您要与其他水平进行比较的水平。我忘记了为什么总和为零很重要,但是要调整值以使列的总和为零。 使用t()函数转置矩阵。 ginv()从MASS包装中使用或solve()以获得转置矩阵的逆。 删除第一列,例如mycontrast<-mycontrast[,-1]。现在您有了apx p-1矩阵,但是在第5步中,您为截取输入的信息被整体编码为矩阵。 如果您希望摘要输出中的标签比其他lm()人的默认输出更易于阅读,请相应地为矩阵的列命名。截距将始终自动被命名(Intercept)。 使矩阵成为相关因素的新对比,例如 contrasts(mydata$myfactor)<-mymatrix 运行lm()(和使用公式可能很多其他功能)为在标准的R正常,而无需负载glht,doBy或contrasts。 Glen_b,谢谢,也感谢您加州大学洛杉矶分校统计咨询小组。我的应用统计专家花了几天时间研究这个话题,但我仍然不知道如何实际编写自己的对比度矩阵。而现在,一个小时的阅读和使用R的乐趣,我终于觉得我明白了。猜猜我应该改为申请UCLA。或大学StackExchange。
9 r  contrasts 

2
如何找到两个均匀分布点之间的预期距离?
如果我要定义坐标 (X1,Y1)(X1,Y1)(X_{1},Y_{1}) 和 (X2,Y2)(X2,Y2)(X_{2},Y_{2}) 哪里 X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40).X1,X2∼Unif(0,30) and Y1,Y2∼Unif(0,40)。X_{1},X_{2} \sim \text{Unif}(0,30)\text{ and }Y_{1},Y_{2} \sim \text{Unif}(0,40). 我如何找到它们之间距离的期望值? 我在想,因为距离是由(X1个-X2)2+ (ÿ1个-ÿ2)2-------------------√)(X1个-X2)2+(ÿ1个-ÿ2)2)\sqrt{(X_{1}-X_{2})^{2} + (Y_{1}-Y_{2})^{2}}) 期望值就是 (1/30+1/30)2+(1/40+1/40)2(1/30+1/30)2+(1/40+1/40)2(1/30 + 1/30)^2 + (1/40+1/40)^2?

3
为k均值选择聚类:1个聚类情况
有谁知道一种确定使用kmeans进行聚类是否合适的好方法?也就是说,如果您的样品实际上是同质的,该怎么办?我知道类似混合模型(通过R中的mclust)可以为1:k群集情况提供适合的统计信息,但是似乎所有评估kmeans的技术都至少需要2个群集。 有谁知道一种比较kmeans的1和2集群案例的技术?
9 r  clustering  k-means 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.