统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
当PR只有一个值时,如何形成Precision-Recall曲线?
我有一个数据挖掘任务,负责制作基于内容的图像检索系统。我有5张动物的20张图像。因此,总共100张图片。 我的系统将10个最相关的图像返回到输入图像。现在,我需要使用Precision-Recall曲线评估系统的性能。但是,我不理解精确召回曲线的概念。假设我的系统返回了10张大猩猩图像,但其中只有4张是大猩猩。返回的其他6张图片是其他动物的图片。从而, 精度为4/10 = 0.4(返回的相关数)/(所有返回的数) 召回是4/20 = 0.2(返回的相关人员)/(所有相关人员) 所以我只有一个点<0.2,0.4>,没有曲线。如何绘制曲线(即一组点)?我应该更改返回的图像数量(在我的情况下固定为10)吗?


1
测试大型数据集的正态性-可靠性如何?
我正在检查数据集中包含46840个双精度值(一部分从1到1690)的两组数据的一部分。为了分析这些组之间的差异,我首先检查了值的分布以选择正确的测试。 按照有关正常性测试的指南,我做了一个qqplot,直方图和boxplot。 这似乎不是正态分布。由于指南在某种程度上正确地指出仅凭图形检查是不够的,因此我也想测试分布的正态性。 考虑到数据集的大小和R中shapiro-wilks检验的局限性,应如何测试给定分布的正态性并考虑数据集的大小,这是否可靠?(请参阅对此问题的公认答案) 编辑: 我指的Shapiro-Wilk检验的局限性在于,要测试的数据集仅限于5000点。引用有关此主题的另一个好答案: Shapiro-Wilk检验的另一个问题是,当您向它提供更多数据时,被拒绝原假设的机会就更大。因此,发生的情况是,对于大量数据,甚至可以检测到与正态性的很小偏差,从而导致出于实际目的拒绝原假设事件,数据已经足够正常。 幸运的是,shapiro.test通过将数据大小限制为5000,可以保护用户免受上述影响。 至于为什么我要首先测试正态分布: 一些假设检验假设数据为正态分布。我想知道是否可以使用这些测试。

2
如何对PCA执行交叉验证以确定主成分的数量?
我正在尝试编写自己的用于主成分分析的函数PCA(当然已经编写了很多东西,但我只是想自己实现一些东西)。我遇到的主要问题是交叉验证步骤和计算预测的平方和(PRESS)。我使用哪种交叉验证都没有关系,这主要是关于背后的理论的问题,但请考虑留一法交叉验证(LOOCV)。从理论上我发现,要执行LOOCV,您需要: 删除对象 扩展其余部分 使用一些组件执行PCA 根据(2)中获得的参数缩放删除的对象 根据PCA模型预测对象 计算该对象的压力 对其他对象重新执行相同的算法 汇总所有PRESS值 利润 因为我是该领域的新手,所以为了确定我是对的,我将结果与我所拥有的某些软件的输出进行比较(同样为了编写一些代码,我遵循该软件中的说明进行操作)。计算残差平方和,我得到完全相同的结果,但是计算PRESS是个问题。[R2[R2R^2 您能否告诉我在交叉验证步骤中实施的方法是否正确: case 'loocv' % # n - number of objects % # p - number of variables % # vComponents - the number of components used in CV dataSets = divideData(n,n); % # it is just a variable responsible …


3
开发适当的时间序列模型以根据上个月的记录预测销售
我已经连续两年从事在线业务,因此我拥有大约两年的月度销售数据。我每个月的业务肯定会受到季节性波动的影响(圣诞节期间的表现更好,等等),可能还有一些我不知道的其他因素。 为了更好地预测未来的销售,并评估我的销售活动的有效性或新竞争对手的影响,我希望能够开发一个适当的时间序列模型,以将我当前的销售数据推算到未来。这样,当我将预测结果与实际结果进行比较时,我可以定量地测试销售活动的有效性或竞争对手的影响。 我的问题是,鉴于我拥有2年的销售数据,无论如何,我是否可以为此制定一个预测性的时间序列模型? 注意:我对背景概念和理论更感兴趣,而不是黑匣子工具。说到工具,我有mathematica,matlab,R,Excel,Google Spreadsheet...。

2
MCMC方法-燃烧样品?
在MCMC方法中,我一直在阅读有关burn-in时间或的样本数的信息"burn"。这到底是什么?为什么需要它? 更新: 一旦MCMC稳定下来,它会保持稳定吗?burn-in时间的概念与混合时间的概念有何关系?
12 sampling  mcmc 

4
仅使用距离矩阵执行PCA
我想将只有成对距离的海量数据集聚类。我实现了k-medoids算法,但是运行时间太长,因此我想首先通过应用PCA减小问题的范围。但是,我知道执行此方法的唯一方法是使用我在我的情况下没有的协方差矩阵。 有没有一种方法可以仅知道成对距离来应用PCA?

1
比较同一模型在不同数据集上的回归系数
我正在评估同一制冷系统中使用的两(2)种制冷剂(气体)。我有饱和吸气温度(),冷凝温度()和安培数()数据用于评估。有两(2)套数据;第一制冷剂()和第二制冷剂()。我正在使用线性多元(&)三阶多项式模型进行回归分析。我想确定第二种制冷剂平均消耗多少/更多的安培数(或类似的性能比较指标)。SSSDDDYYYR1R1R_1R2R2R_2SSSDDD 我的第一个想法是: 确定要使用的模型:Y=b0+b1S+b2D+b3SD+b4S2+b5D2+b6S2D+b7D2S+b8D3+b9S3Y=b0+b1S+b2D+b3SD+b4S2+b5D2+b6S2D+b7D2S+b8D3+b9S3Y = b_0 + b_1S + b_2D + b_3SD + b_4S^2 + b_5D^2 + b_6S^2D + b_7D^2S + b_8D^3 + b_9S^3 从基准数据()推导系数()。bibib_iR1R1R_1 使用这些系数,对于每一个&在数据集,计算每一个预期安培平局(),然后平均。SSSDDDR2R2R_2Y^Y^\hat{Y} 比较平均值与数据的实际平均安培数()。Y^Y^\hat{Y}Y2Y2Y_2R2R2R_2 percent (%) change=(Y2−Y^)/Y^percent (%) change=(Y2−Y^)/Y^\text{percent (%) change} = (Y_2 - \hat{Y}) / \hat{Y} 但是,由于第二种制冷剂的热性能略有不同,并且制冷系统的变化很小(TXV和过热调节),因此我认为这种“基准比较方法”并不准确。 我的下一个想法是做两(2)个单独的回归分析: Y1Y2=a0+a1S1+a2D1+a3S1D1+a4S21+a5D21+a6S21D1+a7D21S1+a8D31+a9S31=b0+b1S2+b2D2+b3S2D2+b4S22+b5D22+b6S22D2+b7D22S2+b8D32+b9S32Y1=a0+a1S1+a2D1+a3S1D1+a4S12+a5D12+a6S12D1+a7D12S1+a8D13+a9S13Y2=b0+b1S2+b2D2+b3S2D2+b4S22+b5D22+b6S22D2+b7D22S2+b8D23+b9S23\begin{align} Y_1 &= a_{0} + a_{1}S_1 + a_{2}D_1 + …

2
创建“整理数据”的最佳做法
Hadley Wickham 去年在JSS中撰写了一篇名为“ Tidy Data”(链接)的恒星文章,内容涉及数据操纵和使数据处于“最佳”状态以便进行分析。但是,我想知道在工作环境中显示表格数据方面的最佳实践是什么?假设您的同事要您向他提供一些数据。在构造数据时使用哪些一般规则?“整理数据”中的准则是否适用于与非数据专业人员共享数据的情况?显然,这是非常特定于上下文的,但是我要问的是高层“最佳实践”。
12 dataset  tables 

1
重要抽样的直观示例
我的背景是计算机科学。我对蒙特卡洛采样方法还很陌生,尽管我了解数学原理,但我很难拿出直观的示例进行重要性采样。更准确地说,有人可以提供以下示例: 一个原始分布,一个人不能从中抽样,但一个人可以估算 重要度分布,可以从原始分布中进行抽样并得到足够的信息。

3
泊松分布的正态近似
这里在维基百科上这样说的: 对于足够大的λλλ值(例如λ>1000λ>1000λ>1000),均值λλλ和方差λλλ(标准偏差λ−−√λ\sqrt{\lambda})的正态分布是泊松分布的极佳近似值。如果λλλ大于约10,则如果执行了适当的连续性校正,则正态分布是一个很好的近似值,即P(X≤x),P(X≤x),P(X ≤ x),其中(小写)xxx是一个非负整数,被替换为P(X≤x+0.5).P(X≤x+0.5).P(X ≤ x + 0.5). FPoisson(x;λ)≈Fnormal(x;μ=λ,σ2=λ)FPoisson(x;λ)≈Fnormal(x;μ=λ,σ2=λ)F_\mathrm{Poisson}(x;\lambda) \approx F_\mathrm{normal}(x;\mu=\lambda,\sigma^2=\lambda) 不幸的是,这没有被引用。我希望能够严谨地展示/证明这一点。当\ lambda> 1000时,您怎么能说正态分布是一个很好的近似值,您如何量化这种“优秀”的近似值,使用了哪些度量?λ>1000λ>1000\lambda > 1000 我已经与这引起了最远的是在这里了约翰谈到用浆果Esseen定理和近似误差在这两个的CDF。从我可以看到,他没有尝试任何λ≥1000λ≥1000\lambda \geq 1000。

1
Fisher精确检验和超几何分布
我想更好地理解费舍尔的精确测试,因此设计了以下玩具示例,其中f和m分别对应于男性和女性,而n和y对应于“苏打水消耗”,如下所示: > soda_gender f m n 0 5 y 5 0 显然,这是一个极大的简化,但是我不希望上下文妨碍您。在这里,我只是假设男性不喝苏打水,女性不喝苏打水,并想看看统计程序是否得出相同的结论。 在R中运行fisher精确测试时,得到以下结果: > fisher.test(soda_gender) Fisher's Exact Test for Count Data data: soda_gender p-value = 0.007937 alternative hypothesis: true odds ratio is not equal to 1 95 percent confidence interval: 0.0000000 0.4353226 sample estimates: odds ratio 0 在这里,由于p值为0.007937,我们可以得出结论,性别和苏打水消费是相关的。 我知道费舍尔精确检验与超基因组分布有关。因此,我想使用该方法获得相似的结果。换句话说,您可以按以下方式查看此问题:有10个球,其中5个标记为“雄性”,5个标记为“雌性”,您随机抽出5个球而不进行替换,并且看到0个雄性球。这种观察的机会是什么?为了回答这个问题,我使用了以下命令: > …

2
为什么托马斯·贝叶斯(Thomas Bayes)觉得贝叶斯定理如此具有挑战性?
这更多是关于科学史的问题,但我希望这里成为话题。 我读到托马斯·贝叶斯(Thomas Bayes)仅设法发现了统一先验的特殊情况下的贝叶斯定理,即使如此,他显然仍在努力。 考虑到一般贝叶斯定理在现代处理中是多么琐碎,为什么它对当时的贝叶斯和其他数学家提出了挑战?为了进行比较,艾萨克·牛顿的《自然哲学的数学原理》在贝叶斯的主要作品出版36年后出版。

1
使用带有插入符号包的RandomForest的FinalModel进行预测之前是否需要进行预处理?
我使用插入符号包训练10x10CV的randomForest对象。 library(caret) tc <- trainControl("repeatedcv", number=10, repeats=10, classProbs=TRUE, savePred=T) RFFit <- train(Defect ~., data=trainingSet, method="rf", trControl=tc, preProc=c("center", "scale")) 之后,我在testSet上测试randomForest(新数据) RF.testSet$Prediction <- predict(RFFit, newdata=testSet) 混乱矩阵向我展示了该模型还不错。 confusionMatrix(data=RF.testSet$Prediction, RF.testSet$Defect) Reference Prediction 0 1 0 886 179 1 53 126 Accuracy : 0.8135 95% CI : (0.7907, 0.8348) No Information Rate : 0.7548 P-Value …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.