统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
SD大于平均值,非负比例
我收到了一篇报道我的研究非常类似于我实验室希望进行的研究的文章。但是,我注意到,对于感兴趣的变量“持续时间”,SD大于平均值...因为这是以分钟为单位的持续时间,所以它永远不会为负,这对我来说似乎很奇怪。据报道有2项研究发生了这种情况,以下是其中一项。 除此之外,这是一个混合设计。对照v处理(组之间)和时间1,时间2,时间3(重复测量)。这是平均值(SD),N> 200 Time1 Time2 Time3 Control 15.1 (14.6) 14.4 (14.8) 13.3 (15.7) Treatment 14.8 (13.2) 10.0 (12.2) 8.2 (9.9) ...他们进行了方差分析,报告p <.001。 我被要求以此为基础进行功效分析,以确定我们研究的样本量。我很确定这表明数据不正常或有异常值,因此我不愿意根据此来确定样本量。我离基地不远吗?

2
列联表的贝叶斯分析:如何描述效应大小
我正在研究Kruschke的《做贝叶斯数据分析》中的示例,特别是ch中的泊松指数方差分析。22,他作为对偶发表独立性的频繁卡方检验的替代品。 我可以看到我们如何获得有关变量交互比独立变量(即,当HDI排除零时)所期望的交互频率更高或更低的信息。 我的问题是如何在此框架中计算或解释效果大小?例如,克鲁什克(Kruschke)写道:“蓝眼睛和黑发的组合发生的频率要比如果眼睛的颜色和头发的颜色独立的情况下发生的频率要低”,但是我们如何描述这种关联的强度?我如何分辨哪些互动比其他互动更极端?如果我们对这些数据进行卡方检验,则可以计算Cramér的V,作为整体效果大小的度量。如何在这种贝叶斯语境中表达效果大小? 这是本书中的独立示例(代码为R),以防万一答案在我眼前隐藏在我眼前…… df <- structure(c(20, 94, 84, 17, 68, 7, 119, 26, 5, 16, 29, 14, 15, 10, 54, 14), .Dim = c(4L, 4L), .Dimnames = list(c("Black", "Blond", "Brunette", "Red"), c("Blue", "Brown", "Green", "Hazel"))) df Blue Brown Green Hazel Black 20 68 5 15 Blond 94 7 16 …

1
模型选择中AIC和p值的等效性
在对这个问题的答案的评论中,有人指出在模型选择中使用AIC等于使用p值为0.154。 我在R中进行了尝试,在其中我使用了“向后”子集选择算法来排除完整规范中的变量。首先,依次丢弃具有最高p值的变量,并在所有p值均低于0.154时停止,其次,然后删除该变量,删除该变量会导致AIC最低,直到无法进行改进为止。 原来,当我使用0.154的p值作为阈值时,它们给出的结果大致相同。 这是真的吗?如果是这样,是否有人知道原因或可以参考解释它的来源? PS我不能要求对方发表评论或发表评论,因为刚刚注册。我知道这不是最适合模型选择和推断的方法。

2
分布\ CLT中的收敛
鉴于 N=nN=nN = n,条件限制区。的YYY 是 χ2(2n)χ2(2n)\chi ^2(2n)。 NNN有边际收益。泊松(θθ\theta), θθ\theta 是一个正常数。 证明为 θ→∞θ→∞\theta \rightarrow \infty, (Y−E(Y))/Var(Y)−−−−−−√→N(0,1) (Y−E(Y))/Var⁡(Y)→N(0,1)\space \space (Y - E(Y))/ \sqrt{\operatorname{Var}(Y)} \rightarrow N(0,1) 在分配。 谁能提出解决这个问题的策略。似乎我们需要使用CLT(中心极限定理),但是要获取任何信息似乎很难YYY在其自己的。是否可以引入rv来取样,生成YYY? 这是家庭作业这样的提示理解。

1
不存在力矩时的CLT示例
考虑Xñ=⎧⎩⎨1个− 12ķWP (1 -2− n)/ 2WP (1 -2− n)/ 2wp 2− k 对于 k > nXn={1w.p. (1−2−n)/2−1w.p. (1−2−n)/22kw.p. 2−k for k>nX_n = \begin{cases} 1 & \text{w.p. } (1 - 2^{-n})/2\\ -1 & \text{w.p. } (1 - 2^{-n})/2\\ 2^k & \text{w.p. } 2^{-k} \text{ for } k > n\\ \end{cases} 我需要证明,即使有无限的瞬间,ñ--√(X¯ñ)→dñ(0 …


1
库克距离极限值
我一直在阅读库克的距离,以找出对我的回归影响较大的离群值。在库克的原始研究中,他说,将临界值设为1应该可以确定影响者。但是,其他各种研究也使用或作为截止值。4n4n\frac{4}{n}4n−k−14n−k−1\frac{4}{n-k-1} 在我的研究中,我的残差都不是D大于1。但是,如果我使用作为截止,那么会有各种数据被认为是影响者的点。我决定测试删除这些数据点是否会对我的一般线性回归有所不同。我所有的静脉注射都保留了其重要性,并且没有明显的变化。4n4n\frac{4}{n}(4149=.026)(4149=.026)(\frac{4}{149}= .026) 我应该保留所有数据点并使用1的截止率吗?或删除它们?

2
乐观偏差-预测误差的估计
《统计学习的元素》(在线提供PDF版本)讨论了最佳偏差(7.21,第229页)。它指出,乐观偏差是训练误差与样本误差(如果我们在每个原始训练点采样新的结果值时观察到的误差)之间的差(见下)。 接下来,它声明这种乐观偏差()等于我们的估计y值与实际y值的协方差(公式如下)。我很难理解为什么这个公式表示乐观偏见。天真的,我会认为实际与预测之间的强协方差仅描述准确性,而不是乐观。让我知道是否有人可以帮助您推导公式或分享直觉。 ωω\omegayyyyyy

2
您将如何可视化细分渠道?(您可以使用Python做到吗?)
我在Moz上看到了这篇帖子,其中介绍了细分的营销渠道: 这种事情在我的工作中将具有很大的价值。我不知道如何可视化原始数据以显示像这样的分段漏斗。这个想法是销售线索来自不同的来源(我们将其用于细分数据),并在转化为交易时经历了多个阶段。从每个阶段到另一个阶段都有下降。每个切片的宽度由每个切片中引线的绝对数量确定。[ 编辑:注意,当涉及每个切片右侧指定的数字时,此处用作参考的图像会产生误导。切片的宽度和数量之间似乎没有任何关系。该图像仅应作为分段漏斗设计的参考]。 无论如何,任何想法如何形象化?如果可能的话,我很想用Python做到这一点。 如果有人需要一些虚拟数据,这是一个Google文档。 期待您的见解。谢谢!


2
R检测时间序列的增加/减少趋势
我有很多时间周期,包括时期:日,周或月。通过stl()功能或通过loess(x ~ y)我可以看到特定时间序列的趋势。我需要检测时间序列的趋势是增加还是减少。我该如何处理? 我尝试使用来计算线性回归系数lm(x ~ y)并使用斜率系数。(If |slope|>2 and slope>0 then上升趋势,else if |slope|>2 and slope<0–下降)。也许还有另一种更有效的趋势检测方法?谢谢! 例如:我有timeserie1,timeserie2。我需要一个简单的算法,告诉我这timeserie2是一个递增的算法,在中timeserie1,趋势没有增加或减少。我应该使用什么标准? timeserie1: 1774 1706 1288 1276 2350 1821 1712 1654 1680 1451 1275 2140 1747 1749 1770 1797 1485 1299 2330 1822 1627 1847 1797 1452 1328 2363 1998 1864 2088 2084 594 884 1968 1858 …
9 r  time-series  trend 

1
拟合时变系数DLM
我想使DLM具有随时间变化的系数,即通常线性回归的扩展, yt=θ1+θ2x2yt=θ1+θ2x2y_t = \theta_1 + \theta_2x_2。 我有一个预测变量()和一个响应变量(y_t),分别是1950年至2011年的海洋和内陆年度鱼获量。我希望遵循DLM回归模型,x2x2x_2ytyty_t yt=θt,1+θt,2xtyt=θt,1+θt,2xty_t = \theta_{t,1} + \theta_{t,2}x_t 系统演化方程在哪里 θt=Gtθt−1θt=Gtθt−1\theta_t = G_t \theta_{t-1} 摘自Petris等人的“带R的动态线性模型”的第43页。 一些编码, fishdata <- read.csv("http://dl.dropbox.com/s/4w0utkqdhqribl4/fishdata.csv", header=T) x <- fishdata$marinefao y <- fishdata$inlandfao lmodel <- lm(y ~ x) summary(lmodel) plot(x, y) abline(lmodel) 显然,回归模型的时变系数在这里更为合适。我从第121页至第125页沿用他的示例,并将其应用于我自己的数据。这是示例中的代码 ############ PAGE 123 require(dlm) capm <- read.table("http://shazam.econ.ubc.ca/intro/P.txt", header=T) capm.ts <- ts(capm, …

3
关于联合熵的直觉
我在建立关于联合熵的直觉上遇到困难。 =联合分布不确定性; =不确定性; =不确定性。H(X,Y)H(X,ÿ)H(X,Y)p(x,y)p(X,ÿ)p(x,y)H(X)H(X)H(X)px(x)px(x)p_x(x)H(Y)H(Y)H(Y)py(y)py(y)p_y(y) 如果H(X)高,则分布更加不确定,如果您知道这种分布的结果,则您可以获得更多信息!因此,H(X)也可以量化信息。 现在我们可以显示H(X,Y)≤H(X)+H(Y)H(X,Y)≤H(X)+H(Y)H(X,Y) \leq H(X) + H(Y) 但是,如果您知道可以得到和那么从某种意义上说比和拥有更多的信息,所以不应该与p(x,y)有关的不确定性是否大于各个不确定性的总和?p(x,y)p(x,y)p(x,y)px(x)px(x)p_x(x)py(y)py(y)p_y(y)p(x,y)p(x,y)p(x,y)px(x)px(x)p_x(x)py(y)py(y)p_y(y)


2
随着时间的推移纳入更详细的解释变量
我试图了解如何最好地建模一个变量,随着时间的推移,我已经获得了越来越详细的预测变量。例如,考虑对拖欠贷款的回收率建模。假设我们有一个包含20年数据的数据集,并且在那15年中,我们仅知道贷款是否已抵押,而对于抵押的特征一无所知。但是,在过去的五年中,我们可以将抵押品划分为一系列类别,这些类别可以很好地预测回收率。 给定此设置后,我要使模型适合数据,确定度量标准,例如预测变量的统计显着性,然后使用模型进行预测。 这适合什么缺失的数据框架?是否有与以下事实相关的特殊考虑:更详细的解释变量仅在给定的时间点之后才可用,而不是分散在整个历史样本中?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.