统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
逻辑回归和数据集结构
我希望我能以正确的方式问这个问题。我可以访问逐个播放的数据,因此,最好的方法和正确构建数据的问题更多。 我要做的是根据给定的分数和时间来计算赢得NHL比赛的概率。我认为我可以使用逻辑回归,但不确定数据集的外观。在我感兴趣的每场比赛中,每场比赛我都会有多个观察结果吗?我会每场比赛进行一次观察并在每个时间段内使用单独的模型吗?逻辑回归甚至是正确的方法吗? 您能提供的任何帮助将不胜感激! 最好的祝福。

2
统计景观
有没有人对各种统计方法写过简短的调查?初步估计,您具有常客和贝叶斯统计。但是,当您仔细观察时,还可以使用其他方法,例如似然论和经验贝叶斯。然后在组内进行细分,例如贝叶斯统计中的主观贝叶斯目标贝叶斯等。 调查文章会很好。如果包含图表,那就更好了。

7
中位数比平均值还公平吗?
我最近阅读了有关建议,您通常不应使用中位数来消除异常值。示例:以下文章 http://www.amazon.com/Forensic-Science-Introduction-Scientific-Investigative/product-reviews/1420064932/ 目前有16条评论: review= c(5, 5, 5, 5, 5, 5, 5, 5, 5, 5, 4, 4, 3, 2, 1, 1) summary(review) ## "ordinary" summary Min. 1st Qu. Median Mean 3rd Qu. Max. 1.000 3.750 5.000 4.062 5.000 5.000 因为他们使用平均数,所以该文章获得4星,但是如果使用中位数,它将获得5星。 中位数不是“更公平”的法官吗? 实验表明,中位数误差始终大于平均值。中位数更糟吗? library(foreach) #the overall population of bookjudgments n<-5 p<-0.5 expected.value<-n*p …
17 mean  median  average 

4
计算所需的样本量,方差估计的精度?
背景 我有一个未知分布的变量。 我有500个样本,但是我想证明我可以计算方差的精度,例如说500的样本量就足够了。我也想知道以的精度估算方差所需的最小样本量X%X%X\%。 问题 我该如何计算 给定样本量,我估计方差的精度n=500n=500n=500?的n=Nn=Nn=N? 如何计算以精度估算方差所需的最小样本数XXX? 例 图1基于500个样本的参数密度估计。 图2这是我使用500个样本的子样本计算出的x轴上的样本大小与y轴上的方差估计值之间的关系图。想法是随着n的增加,估计值将收敛到真实方差。 然而,估计是无效的独立自样品用于估计方差n∈[10,125,250,500]n∈[10,125,250,500]n \in [10,125,250,500]是不相互独立的或在用于计算方差的样本n∈[20,40,80]n∈[20,40,80]n\in [20,40,80]

8
聚类质量测度
我有一个输入参数为(聚类数)的聚类算法(不是k均值)。执行聚类后,我想对这种聚类的质量进行一些定量的衡量。聚类算法具有一个重要的特性。对于如果我将数据点之间没有任何明显区别地馈入该算法,结果我将得到一个包含数据点的群集和一个包含1个数据点的群集。显然这不是我想要的。因此,我想计算此质量度量以估计此聚类的合理性。理想情况下,我将能够比较不同k的度量。所以我将在k范围内运行聚类kkkk=2k=2k=2NNNN−1N−1N-1111kkkkkk并选择质量最好的一种。我该如何计算这种质量指标? 更新: 这是是不良聚类的示例。假设在形成等边三角形的平面上有3个点。将这些点分为2个群集显然比将它们分为1个或3个群集要差。(N−1,1)(N−1,1)(N-1, 1)
17 clustering 

2
为什么要使用普拉特的缩放比例?
为了将置信度水平校准为监督学习中的概率(例如使用过采样的数据从SVM或决策树映射置信度),一种方法是使用Platt的定标(例如,从Boosting获取校准的概率)。 基本上,人们使用逻辑回归将映射到。因变量是真实标签,预测变量是未校准模型的置信度。我不理解的是使用目标变量而不是1或0。该方法需要创建一个新的“标签”:[−∞;∞][−∞;∞][-\infty;\infty][0;1][0;1][0;1] 为了避免过度拟合S型火车,使用了样本外模型。如果训练集中有正例和负例,则对于每个训练例,普拉特校准将使用目标值和y _-(分别为1和0),其中 y _ + = \ frac {N_ + +1} {N _ ++ 2}; \ quad \ quad y _- = \ frac {1} {N _- + 2} N+N+N_+N−N−N_-y+y+y_+y−y−y_-y+=N++1N++2;y−=1N−+2y+=N++1N++2;y−=1N−+2 y_+=\frac{N_++1}{N_++2};\quad\quad y_-=\frac{1}{N_-+2} 我不明白的是这个新目标是如何有用的。逻辑回归不只是将因变量视为二进制标签(与给出的标签无关)吗? 更新: 我发现,在SAS中,将依赖项从更改为其他值会还原为同一模型(使用)。也许是我的错误,或者是SAS缺乏通用性。我能够在R中更改模型。例如:1/01/01/0PROC GENMOD data(ToothGrowth) attach(ToothGrowth) # 1/0 coding dep <- ifelse(supp == "VC", 1, 0) …

5
简单,可靠,开放且可互操作的纯文本格式,用于存储数据
在上一个问题中,我询问了用于编辑CSV文件的工具。 加文 链接到邓肯·默多克(Duncan Murdoch)对R Help的评论, 暗示数据交换格式比CSV是一种更可靠的数据存储方式。 对于某些应用程序,需要专用的数据库管理系统。但是,对于小规模的数据分析项目,更轻量的东西似乎更合适。 考虑以下用于评估文件格式的条件: 可靠:输入的数据应与输入的内容保持真实;数据应在不同软件中一致打开; 简单:如果文件格式易于理解并且理想情况下可以通过简单的文本编辑器读取,那将是很好的选择;编写简单的程序来读写格式应该很容易。 open:格式应该是开放的 可互操作的:许多系统应支持文件格式 我发现制表符和逗号分隔的值格式无法满足可靠性要求。尽管我想我可以责怪导入和导出程序,而不是文件格式。我经常发现自己不得不对选项进行一些调整, read.table以防止某些奇怪的字符破坏数据帧的加载。 问题 哪种文件格式最能满足这些需求? 数据交换格式是否是更好的选择?还是有自己的问题? 还有其他更可取的格式吗? 我是否在不公平地评估TSV和CSV?是否有一组简单的技巧来处理此类文件,从而使文件格式更可靠?

2
R中的非参数贝叶斯分析
我正在寻找有关R使用分层狄利克雷过程(HDP)(最近和流行的非参数贝叶斯方法之一)中的数据聚类的良好教程。 非参数贝叶斯分析有DPpackage(恕我直言,是所有可用方法中最全面的)R。但是我无法充分理解R News软件包参考手册中或软件包参考手册中提供的示例来编写HDP。 任何帮助或指针,表示赞赏。 此处提供了用于主题建模的HDP的C ++实现(请在底部查看C ++代码)

6
R:按组计算相关性
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 在R中,我有一个数据帧,包括一个类别标签C(一个因数)和两个测量值M1和M2。如何计算每个类别中M1和M2之间的相关性? 理想情况下,我将返回一个数据帧,其中每个类一行一行,两列:类标签C和相关性。
17 r  correlation 

9
统计和生物统计学之间有什么区别?
我想到,尽管多年来我就统计学和生物统计学之间的差异整理了一些想法,但从未听说过正式的解释。这两个学科之间的区别是什么(当前)?为什么这种区别首先出现? 编辑:我在最初的问题中不够具体。我了解到生物统计学是生物医学领域中统计学的应用和发展。但是,区别的一些具体示例是什么?例如,这两个领域的研究生教育有何区别?为这两个学科设立不同的学术部门的目的是什么(我在其他领域没有看到这种区别)?

1
重复测量的不平衡混合效应方差分析
我有手术期间接受2种不同治疗方法治疗的患者的数据。我需要分析它对心率的影响。每15分钟测量一次心率。 鉴于每个患者的手术时间可能不同,因此每个患者可以进行7到10次心率测量。因此,应使用不平衡的设计。我正在使用R进行分析。并且一直在使用ez软件包重复测量混合效果方差分析。但是我不知道如何分析不平衡的数据。有人可以帮忙吗? 也欢迎有关如何分析数据的建议。 更新: 按照建议,我使用lmer函数拟合了数据,发现最好的模型是: heart.rate~ time + treatment + (1|id) + (0+time|id) + (0+treatment|time) 结果如下: Random effects: Groups Name Variance Std.Dev. Corr id time 0.00037139 0.019271 id (Intercept) 9.77814104 3.127002 time treat0 0.09981062 0.315928 treat1 1.82667634 1.351546 -0.504 Residual 2.70163305 1.643665 Number of obs: 378, groups: subj, 60; time, …

3
您能说统计和概率就像归纳法和演绎法吗?
我已经阅读了该线程,在我看来可以这样说: 统计=归纳? 概率=扣除? 但是我想知道我所缺少的比较是否还有更多细节。例如,统计量等于归纳法,还是仅仅是其特殊情况?似乎概率是演绎的一个子案例(因为它是数学思维的一个子案例)。 我知道这是一个挑剔的问题,但是从某种意义上讲,这就是为什么我要问这个问题-因为我想确保如何准确比较这些术语。

2
如果可变的内核宽度通常对内核回归有利,那么为什么它们通常对内核密度估计不利?
这个问题是由其他地方的讨论引起的。 变量核通常用于局部回归。例如,黄土被广泛使用并且可以作为回归平滑器使用,并且基于适应数据稀疏性的可变宽度内核。 另一方面,通常认为可变核在核密度估计中导致较差的估计量(请参见Terrell和Scott,1992年)。 他们有一个直观的原因,为什么它们可以很好地进行回归而不是密度估计?

4
结合两个置信区间/点估计
假设其中有两个来自相同总体的独立样本,并且对这两个样本使用了不同的方法来得出点估计和置信区间。在平凡的情况下,明智的人只会合并两个样本并使用一种方法进行分析,但是现在让我们假设由于样本之一的局限性(例如缺少数据)而不得不使用不同的方法。这两个单独的分析将为感兴趣的人口属性生成独立的,同样有效的估计。凭直觉,我认为应该有一种方法可以在点估计和置信区间方面适当地组合这两个估计,从而产生更好的估计程序。我的问题是最好的方法是什么?我可以想象根据每个样本中的信息/样本大小进行某种加权平均,但是置信区间又如何呢?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.