统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
学生(Gosset)对t检验的贡献是什么?
一个最近的问题,相关的问题,并引用来源,最近让我知道,ñ− 1N−1N-1人口方差样本估计的校正称为贝塞尔校正。贝塞尔(Bessel)于1846年去世(维基百科引文),t检验于1908年发布(维基百科引文)。由于某些原因,我一直认为Gosset(又名Student)在制定t检验中的贡献是使用了ñ− 1N−1N-1 在计算 s2s2s^2。现在看来,这项贡献显然属于贝塞尔。因此,我想问戈塞特在制定t检验方面的贡献是什么?

2
预订非参数统计
对于非参数统计而言,这将是一本好书。不只是介绍,而是高级。另外,我正在寻找可用于学习而非参考的东西。 特别是我正在寻找一本书,其中可能包含非参数方法,非参数推断,评估非参数的方法(例如KS测试,检验等),自举...的基础知识。ttt


3
回归平均谜题
在丹尼尔·卡尼曼(Daniel Kahneman)的“思考,快速和慢速”的“回归均值”一章中,给出了一个示例,并要求读者根据整体销售预测和上一年的销售数量来预测各个商店的销售。例如(这本书的示例有4家商店,为简单起见,我在这里使用2家): Store 2011 2012 1 100 ? 2 500 ? Total 600 660 天真的预测是商店1和2分别为110和550,每个商店增加10%。但是,作者声称这种幼稚的方法是错误的。绩效较差的商店更有可能增加10%以上,而绩效较好的商店则增加(甚至减少)少于10%。因此,预测115(增加15%)和535(增加7%)将比幼稚的预测“更正确”。 我不明白的是,我们如何得出结论,商店1的销售额为100必然是表现较差的商店?也许由于位置差异,商店1和2的真实时间序列平均值是10和550,商店1在2011年是超级年份,商店2在2011年是灾难性年份。那么这没有道理吗预测商店1的减少和商店2的增加? 我知道原始示例中未提供时间序列信息,但我的印象是“均值回归”是指横截面均值,因此时间序列信息并不重要。我有什么误会?

2
使用EM算法进行记录链接
我对按名字,姓氏和出生年份跨2个数据集链接记录感兴趣。使用EM算法可能可行,如果可以,怎么办? 以第一个记录中的以下记录为例:Carl McCarthy,1967。我将搜索第二个数据集中的所有记录,并在第一个名字和Carl之间分配一个jaro-winkler距离,在姓和麦卡锡之间分配一个jaro-winkler距离。这些距离是概率,出生年龄之间的距离也是概率。我们将这3个概率(乘以平均值)相乘为1。 现在是决策规则部分。让我们对所有概率从最高到最低进行排名。首先,我们希望P(第一个匹配项)> =阈值。其次,我们还希望P(第二次匹配)/ P(第二次匹配)> =如果P(第二次匹配)阈值存在。第三,我们希望第二个数据集中的第一个匹配项与Carl McCarthy,1967年的第一个数据集中的匹配人数不超过1个。 如何确定这些阈值? 我更喜欢Stata和/或Perl中的方法。 参见,例如: http://www.ncbi.nlm.nih.gov/pmc/articles/PMC1479910/pdf/amia2003_0259.pdf (尽管如此,我仍然没有完全理解为什么或如何,以及输入和输出是什么,以及假设和约束的严格性)。

2
对于黑盒非线性模型,我如何可视化不同输入对预测的重要性?
我正在构建一个交互式预测工具(使用python),以帮助组织中进行预测。迄今为止,预报过程很大程度上是由人为驱动的,预报员将其自然神经网络中的数据同化并利用他们学到的内脏感觉进行预报。通过长期的预测验证和预测建模研究,我发现了您可能期望的结果;不同的预测器表现出不同的偏差,某些预测器的作用似乎被夸大了,而其他重要预测器的作用似乎被忽略了,总的来说,与相对简单的经验模型相比,预测性能中等。 预测将继续是手动的,但我正在尝试构建一个有用的工具,以为预测者更好地量化预测者的相对影响。我还希望工具向用户强调一些重要的影响,例如季节性影响,这些影响经常被忽略。我期望一些“经验丰富”的预测人员(其中许多人对统计数据缺乏正式知识)会对建模过程产生一定程度的抵制和怀疑,因此,沟通至少同样重要,而模型性能本身在预测准确性方面取得可衡量的提高。 我正在开发的模型具有很强的自回归成分,有时会因事件而显着地对其进行修改,这些事件在某些预测变量中显示为测量值,在非事件时间内,这些值接近于零。这符合预报员使用的心理模型。关键部分是能够证明对于任何给定的预测而言,哪些“事件”度量值在使预测偏离自回归值时最有影响力。我以这种方式对过程进行成像;预报员认为他们的最佳猜测值是正确的,模型提出了一个不同的猜测值,预报员问为什么。该模型的回答是:“请参见此处,此预测变量的值将增加夏季的预测值。如果是冬季,它将以其他方式移动。我知道还有其他度量, 现在,假设模型是简单的线性回归。可以想象通过将值乘以模型系数并显示为简单的条形图来显示基于事件的预测变量的相对“效果”。来自不同预测变量的所有条形加起来与AR值的总偏差,这简洁明了地显示了在这种情况下具有很大影响力的那些。 问题在于,被预测的过程在预测变量中显示出高度的非线性,或者至少,对于使用黑盒非线性机器学习算法(随机森林和GBM),我的成功要比用于GLM的更多。此数据集。理想情况下,我希望能够在不改变用户体验的情况下无缝更改“在幕后”工作的模型,因此我需要一种通用的方式来以简单的方式展示不同测量的重要性,而无需使用某些特定于算法的方法。我当前的方法是通过将除一个预测变量以外的所有值都设置为零来准线性化效果,记录预测的偏差,然后对所有预测变量重复,在上述条形图中显示结果。在存在强非线性的情况下,这可能无法很好地工作。

1
使用分类变量模拟逻辑回归数据
我正在尝试为逻辑回归创建一些测试数据,并且发现了这篇文章如何模拟逻辑回归的人工数据? 这是一个很好的答案,但它仅创建连续变量。对于与链接相同的示例,与y关联的具有5个级别的分类变量x3(ABCDE)如何处理?

2
了解箱线图的晶须
我对箱线图的晶须的解释有疑问。我已阅读以下内容:“在矩形的顶部和底部,“晶须”显示的范围是0.25分位数和0.75分位数之间的距离的1.5倍”,但并不完全理解“距离”的含义。 不可能表示概率质量,因为在0.25和0.75分位数之间,我们显然总是具有相同百分比的数据。那是什么主意?

2
广义线性模型的假设
在“应用回归的R伴侣”的第232页上,Fox和Weisberg注意 只有高斯族具有恒定的方差,在所有其他GLM中,处y的条件方差取决于XX\bf{x}μ (x )μ(X)\mu(x) 先前,他们注意到泊松的条件方差是,而二项式的条件方差是。μμ\muμ (1 - μ )ñμ(1个-μ)ñ\frac{\mu(1-\mu)}{N} 对于高斯人来说,这是一个熟悉且经常检查的假设(均方差)。同样,我经常看到讨论的Poisson条件方差是Poisson回归的假设,以及对违反Poisson的情况(例如负二项式,零膨胀等)的补救措施。但是,我从未将讨论的二项式的条件方差视为逻辑回归中的假设。有点谷歌搜索没有发现它。 我在这里想念什么? 在@whuber的评论之后进行编辑: 根据建议,我正在浏览Hosmer&Lemeshow。这很有趣,我认为这表明了为什么我(可能还有其他人)感到困惑。例如,单词“假设”不在书的索引中。另外,我们有这个(第175页) 在逻辑回归中,我们必须主要依靠视觉评估,因为仅在某些有限的条件下才知道模型适合的假设下的诊断分布 他们显示了很多图,但专注于各种残差的散点图与估计的概率。这些图(即使是一个好的模型,在OLS回归中也没有类似图的“破旧”模式特征,因此很难判断。此外,它们与分位数图没有任何相似之处。 在R中,plot.lm提供了一套漂亮的默认绘图来评估模型;我不知道逻辑回归的等效项,尽管它可能在某些软件包中。这可能是因为每种类型的模型都需要不同的图。SAS确实在PROC LOGISTIC中提供了一些地块。 当然,这似乎是一个潜在的混乱领域!


3
使用矩阵乘法计算二进制数据的Jaccard或其他关联系数
我想知道是否有任何可能的方法可以使用矩阵乘法来计算Jaccard系数。 我用了这段代码 jaccard_sim <- function(x) { # initialize similarity matrix m <- matrix(NA, nrow=ncol(x),ncol=ncol(x),dimnames=list(colnames(x),colnames(x))) jaccard <- as.data.frame(m) for(i in 1:ncol(x)) { for(j in i:ncol(x)) { jaccard[i,j]= length(which(x[,i] & x[,j])) / length(which(x[,i] | x[,j])) jaccard[j,i]=jaccard[i,j] } } 在R中实现这一点是完全可以的。我完成了骰子的相似性,但是被Tanimoto / Jaccard所卡住。有人可以帮忙吗?

2
用于二进制分类问题的哪个SVM内核?
我是支持向量机的初学者。是否有一些准则说明哪个内核(例如线性,多项式)最适合特定问题?就我而言,我必须根据网页是否包含某些特定信息对网页进行分类,即我存在二进制分类问题。 您能否总体说出最适合此任务的内核?还是我必须在特定的数据集上尝试其中的几个才能找到最佳数据集?顺便说一句,我正在使用利用libSVM库的Python库scikit-learn。


1
Logistic回归中的巨大系数-这意味着什么,该怎么做?
我在逻辑回归中获得了巨大的系数,请参见的系数krajULKV: > summary(m5) Call: glm(formula = cbind(ml, ad) ~ rok + obdobi + kraj + resid_usili2 + rok:obdobi + rok:kraj + obdobi:kraj + kraj:resid_usili2 + rok:obdobi:kraj, family = "quasibinomial") Deviance Residuals: Min 1Q Median 3Q Max -2.7796 -1.0958 -0.3101 1.0034 2.8370 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) -486.72087 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.