统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何找到GBM预测间隔
我正在使用插入符号包处理GBM模型,并希望找到一种方法来解决我的预测数据的预测间隔。我进行了广泛的搜索,但只提出了一些想法来找到随机森林的预测间隔。任何帮助/ R代码将不胜感激!

3
如何解释修整百分比与修整平均值的关系图?
对于作业问题的一部分,我被要求通过删除最小和最大的观测值来计算数据集的修整平均值,并解释结果。修整后的平均值低于未修整的平均值。 我的解释是,这是因为基础分布正偏,所以左尾比右尾更密。由于这种偏斜,删除高基准数据会比平均低基准数据向下拖累平均值下降更多,因为从非正式的角度来说,还有更多的低数据在“等待取代”。(这合理吗?) 然后,我开始怀疑修整百分比如何对其产生影响,因此我针对各种计算了修整后的平均值。我得到了一个有趣的抛物线形状: x¯tr(k)x¯tr⁡(k)\bar x_{\operatorname{tr}(k)}k=1/n,2/n,…,(n2−1)/nk=1/n,2/n,…,(n2−1)/nk = 1/n, 2/n, \dotsc, (\frac{n}{2}-1)/n 我不太确定该如何解释。从直觉上看,似乎曲线图的斜率应该(与中位数的数据点内的分布部分的负偏度成正比)。(这个假设确实可以验证我的数据,但是我只有,所以我不太有把握。)kkkn=11n=11n = 11 这种类型的图是否有名称,还是常用的?我们可以从该图中收集哪些信息?有标准解释吗? 作为参考,数据为:4、5、5、6、11、17、18、23、33、35、80。

1
Fisher信息的决定因素
(我在math.se上发布了类似的问题。) 在信息几何中,Fisher信息矩阵的行列式是统计流形上的自然体积形式,因此它具有很好的几何解释。例如,它出现在Jeffreys先验的定义中的事实与其在重新参数化下的不变性相关,这是(imho)几何性质。 但是统计中的决定因素是什么?它衡量任何有意义的东西吗?(例如,我想说的是如果它为零,那么参数不是独立的。这会进一步吗?) 此外,至少在某些“简单”情况下,是否有任何封闭的形式可以计算出来?

1
t.test返回错误“数据本质上是恒定的”
R version 3.1.1 (2014-07-10) -- "Sock it to Me" > bl <- c(140, 138, 150, 148, 135) > fu <- c(138, 136, 148, 146, 133) > t.test(fu, bl, alternative = "two.sided", paired = TRUE) Error in t.test.default(fu, bl, alternative = "two.sided", paired = TRUE) : data are essentially constant 然后,我仅更改fu数据集中的一个字符: …
12 r  t-test 

4
消除异常值的好形式?
我正在为软件构建进行统计。对于每个通过/失败和经过时间的构建,我都有数据,我们每星期生成约200个数据。 成功率很容易累计,我可以说在任何给定的一周内有45%的人通过了考试。但是我也想汇总经过的时间,并且我想确保我不会太误解数据。想通了我最好问专业人士:-) 说我有10个持续时间。它们代表通过和失败情况。一些构建会立即失败,这会使持续时间异常短。一些在测试期间挂起并最终超时,导致持续时间很长。我们会开发不同的产品,因此即使成功构建也会在90秒到4个小时之间变化。 我可能会得到这样的一套: [50, 7812, 3014, 13400, 21011, 155, 60, 8993, 8378, 9100] 我的第一种方法是通过对集合进行排序并选择中间值来获得中值时间,在这种情况下为7812(我不理会偶数集的算术平均值)。 不幸的是,这似乎产生了很多差异,因为我只挑选了一个给定的值。因此,如果我趋向于此值,则取决于哪个构建在中间,它会在5000-10000秒之间反弹。 为了解决这个问题,我尝试了另一种方法-移除异常值,然后对剩余值进行均值计算。我决定将其拆分为三分位数,并且仅在中间的一个上工作: [50, 60, 155, 3014, 7812, 8378, 8993, 9100, 13400, 21011] -> [50, 60, 155], [3014, 7812, 8378, 8993], [9100, 13400, 21011] -> [3014, 7812, 8378, 8993] 在我看来,这看起来更好的原因有两个: 我们不希望对更快的构建采取任何措施,它们已经可以了 最长的构建可能是超时引起的,并且将始终存在。我们还有其他机制可以检测到这些 因此在我看来,这就是我要寻找的数据,但我担心通过消除真实性来实现平滑性。 这有争议吗?方法理智吗? 谢谢!

2
为什么对于二项式glmm,SAS PROC GLIMMIX给我的随机斜率与glmer(lme4)有很大不同
我是一位更熟悉R的用户,并且一直在尝试针对5个生境针对四个栖息地变量在5年内估计约35个个体的随机斜率(选择系数)。响应变量是某个位置是“已使用”(1)还是“可用”(0)栖息地(下面的“使用”)。 我正在使用Windows 64位计算机。 在R版本3.1.0中,我使用下面的数据和表达式。PS,TH,RS和HW是固定效应(对生境类型的标准化测量距离)。lme4 V 1.1-7。 str(dat) 'data.frame': 359756 obs. of 7 variables: $ use : num 1 1 1 1 1 1 1 1 1 1 ... $ Year : Factor w/ 5 levels "1","2","3","4",..: 4 4 4 4 4 4 4 4 3 4 ... $ ID : …

3
使用
简介:是否有任何统计理论支持使用(自由度基于残差)进行逻辑回归系数检验,而不是标准正态分布检验?Ťtt 不久前,我发现在SAS PROC GLIMMIX中拟合逻辑回归模型时,在默认设置下,将使用分布而不是标准正态分布来测试逻辑回归系数。1即,GLIMMIX报告与所述比率的柱β 1 / √Ťtt1个1^1(我将称之为Ž在这一问题的其余部分),但也报道了“自由度”一栏,以及一个p基于假设-值吨分发ž与自由度基于剩余偏差-即自由度=观测总数减去参数数目。在此问题的底部,我提供了一些R和SAS代码和输出以进行演示和比较。2β^1个/ var (β^1个)------√β^1/var(β^1)\hat{\beta}_1/\sqrt{\text{var}(\hat{\beta}_1)}žzzpppŤttzzz22^2 这让我感到困惑,因为我认为对于逻辑回归等广义线性模型,在这种情况下没有统计理论支持的使用。相反,我以为我们对此案了解的是ttt 是“近似”正态分布的;zzz 对于小样本量,这种近似值可能会很差; 但是,不能像我们在正态回归的情况下那样假设具有t分布。zzzttt 现在,在直觉上,对我来说似乎合理的是,如果近似正态分布,则实际上它可能具有某种基本呈“ t状”的分布,即使它不完全是t。因此,在这里使用t分布似乎并不疯狂。但是我想知道的是以下几点:zzzttttttttt 实际上是否有统计理论表明在逻辑回归和/或其他广义线性模型的情况下确实遵循t分布?zzzttt 如果没有这样的理论,那么至少有论文表明以这种方式假设分布与假设正态分布一样好甚至更好。ttt 更笼统地说,除了直觉上基本上是明智的直觉之外,对GLIMMIX在这里所做的事情是否有任何实际的支持? R代码: summary(glm(y ~ x, data=dat, family=binomial)) R输出: Call: glm(formula = y ~ x, family = binomial, data = dat) Deviance Residuals: Min 1Q Median 3Q Max -1.352 -1.243 1.025 1.068 1.156 Coefficients: …

1
理解R中中介分析的输出
我正在尝试使用R的小插图来了解R中的中介程序包。 我正在努力了解该mediate()函数的输出。 require("mediation") require("sandwich") data("framing") med.fit <- lm(emo ~ treat + age + educ + gender + income, data = framing) out.fit <- glm(cong_mesg ~ emo + treat + age + educ + gender + income, data = framing, family = binomial("probit")) summary(out.fit) # OR for sending a message to …
12 r  mediation 

4
可以使用ARIMA对趋势平稳序列进行建模吗?
我对使用ARIMA(X)进行建模所需的平稳序列有疑问/困惑。我在推理(干预效果)方面考虑的更多,但我想知道预测与推理是否会对响应产生任何影响。 题: 我阅读的所有介绍性资源都指出该系列需要固定下来,这对我来说很有意义,这就是有马中的“ I”出现的地方(与众不同)。 让我感到困惑的是,ARIMA(X)中趋势和漂移的使用以及对平稳需求的暗示(如果有)。 使用常数/漂移项和/或趋势变量作为外生变量(即加“ t”作为回归变量)是否否定了序列是平稳的要求?答案是否不同取决于序列是否具有单位根(例如adf检验)或具有确定性趋势但没有单位根? 要么 在使用ARIMA(X)之前,通过微分和/或去趋势使序列始终保持静止吗?

3
使数据具有零均值的想法
我经常看到人们通过删除所有元素的均值来使数据集的维/特征为零均值。但是我从来不明白为什么要这么做?将其作为预处理步骤有什么作用?它会提高分类性能吗?回答有关数据集的问题是否有帮助?在进行可视化以了解数据时是否有帮助?

2
对离散数据使用折线图是否错误?
我经常看到离散数据集绘制为线图,但是在我看来,该线会在测量间隔之间的某个点推断出一个值,这对于离散数据集是没有意义的。因此,对离散数据使用折线图是否错误? 例如,以两个时间序列数据集为例,一个是连续的(我的体重,每天早晨测量),另一个是离散的(我每天吃的甜甜圈的数量)。将第一个数据集作为线形图是有意义的,因为可以合理地推断出在任何给定的下午我的体重将与前一天和之后的早上的体重有关。但是,如果将甜甜圈的数量表示为线图,则点之间的线将无法从该线中推断出含义。 编辑 再举一例:联邦小时最低工资自成立以来,在情节http://mste.illinois.edu/courses/ci330ms/youtsey/lineinfo.html 除非我没有记错,否则最低工资变动是离散的,因此不可能查找一些任意选择的时间,并使用将点互连的线在该点确定最低工资。

3
重塑/重组数据的最佳方法是什么?
我是实验室(志愿者)的研究助理。我和一小群人被要求进行数据分析,以从大型研究中提取一组数据。不幸的是,这些数据是通过某种在线应用程序收集的,并且没有编程为以最可用的形式输出数据。 下图说明了基本问题。有人告诉我这叫做“重塑”或“重组”。 问题:从图1到图2进入具有超过10k条目的大数据集的最佳过程是什么?
12 r  excel  data-cleaning 

3
指数上限
假设我们有分布为 IID随机变量。我们要观察的样本的下列方式:让独立随机变量,假定所有的的和的是独立的,并定义样本大小。该的指示哪个的的是样本中,我们要研究成功的比例所规定的样品中 X1,…,XnX1,…,XnX_1,\dots,X_nBer(θ)Ber(θ)\mathrm{Ber}(\theta)XiXiX_iY1,…,YnY1,…,YnY_1,\dots,Y_nBer(1/2)Ber(1/2)\mathrm{Ber}(1/2)XiXiX_iYiYiY_iN=∑ni=1YiN=∑i=1nYiN=\sum_{i=1}^n Y_iYiYiY_iXiXiX_iZ={1N∑ni=1XiYi0ifN>0,ifN=0.Z={1N∑i=1nXiYiifN>0,0ifN=0. Z = \begin{cases} \frac{1}{N}\sum_{i=1}^n X_i Y_i & \text{if}\quad N > 0\, , \\ 0 & \text{if} \quad N = 0 \, . \end{cases} 对于,我们想找到的上界,该上界随呈指数衰减。由于变量之间的依赖性,Hoeffding的不等式不能立即应用。P rϵ>0ϵ>0\epsilon>0 ñPr(Z≥θ+ϵ)Pr(Z≥θ+ϵ)\mathrm{Pr}\!\left(Z \geq \theta + \epsilon\right)nnn

2
正态分布的X和Y是否更有可能导致正态分布的残差?
这里讨论了线性回归中对正态性假设的误解(“正态性”是指X和/或Y而不是残差),并且张贴者询问是否可能具有非正态分布的X和Y并且仍然具有正态分布的残差。 我的问题是:正态分布的X和Y 更有可能导致正态分布的残差吗?有很多相关的帖子,但是我不相信有人会问这个问题。 我意识到,如果只进行一次回归,那么这也许是微不足道的,但是如果有多个测试,那么就不那么重要了。假设我有100个X变量,且所有变量具有相同的偏斜度,我想测试所有这些变量。如果我将它们全部转换为正态分布,那么由于非正态分布的残差,我可能需要较少的X变量进行重新检验(具有不同/无转换),或者回归前的转换是完全任意的吗?

3
A / B测试使用什么统计测试?
我们有两个队列,每个队列1000个样本。我们在每个队列中测量2个数量。第一个是二进制变量。第二个是遵循重尾分布的实数。我们想评估哪个同类群组对每个指标的效果最佳。有很多统计测试可供选择:人们建议使用z检验,其他人使用t检验,其他人使用Mann–WhitneyU。 对于我们的案例,我们应该为每个指标选择哪种测试? 如果一项测试表明同类人群之间存在显着差异,而另一项测试表明存在显着性差异,将会发生什么?
12 ab-test 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.