统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
决策树在哪些实现中需要变量(特征)缩放和变量(特征)归一化(调整)?
在很多机器学习算法,特征缩放(又名可变缩放,标准化)是一种常见的prepocessing一步维基百科-特征缩放 -这个问题是接近问题#41704 -如何以及为什么做归一化和特征缩放工作? 关于决策树,我有两个问题: 是否有任何需要特征缩放的决策树实现?我的印象是,大多数算法的分割标准对规模无动于衷。 请考虑以下变量:(1)单位,(2)小时,(3)每小时-最好是将这三个变量按原样保留在决策树中,否则我们会遇到某种类型的冲突因为“标准化”变量(3)与(1)和(2)有关?也就是说,您是通过将所有三个变量都放入混合中来攻击这种情况,还是通常选择这三个变量的某种组合,或者只是使用“标准化/标准化”功能(3)?

1
用比例和二项式分布确定样本大小
我正在尝试使用Sokal和Rohlf(3e)写的《生物统计学》一书来学习一些统计数据。这是第5章的练习,其中涵盖了概率,二项式分布和泊松分布。 我意识到有一个公式可以回答这个问题: 但是,该公式不在本文中。我想知道如何仅知道概率,所需的置信度和二项式分布来计算样本量。有没有涉及这一主题的资源?我已经尝试过Google,但是到目前为止,我所看到的都需要我无法访问的信息。n=4(p–√−q√)2n=4(p−q)2 n = \frac 4 {( \sqrt{p} - \sqrt{q} )^2}

1
从简单的R lm模型重新计算对数似然
我只是想用dnorm()重新计算lm模型(在R中)的logLik函数提供的对数似然率。 对于大量数据(例如n = 1000),它可以(几乎完美)工作: > n <- 1000 > x <- 1:n > set.seed(1) > y <- 10 + 2*x + rnorm(n, 0, 2) > mod <- glm(y ~ x, family = gaussian) > logLik(mod) 'log Lik.' -2145.562 (df=3) > sigma <- sqrt(summary(mod)$dispersion) > sum(log(dnorm(x = y, mean = predict(mod), …

1
我应该使用Welch(1947)的近似自由度还是Satterthwaite(1946)的近似度?
对于用于Welch t检验的近似自由度的正确公式,我感到困惑。Satterthwaite(1946)的公式是最常引用的公式,但是Welch在1947年提出了另一种公式。我不确定哪个更可取(或被大多数统计软件使用)。 Satterthwaite的公式: (s2X/ nX+ 秒2ÿ/ nÿ)2(s2X/ nX)2/( nX− 1 )+ (秒2ÿ/ nÿ)2/( nÿ− 1 )(sx2/nx+sy2/ny)2(sx2/nx)2/(nx−1)+(sy2/ny)2/(ny−1)\frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x )^2/(n_x-1)+(s_y^2/n_y )^2/(n_y-1)} 韦尔奇公式: − 2 + (秒2X/ nX+ 秒2ÿ/ nÿ)2(s2X/ nX)2/( nX+ 1 )+ (小号2ÿ/ nÿ)2/( nÿ+ 1 )−2+(sx2/nx+sy2/ny)2(sx2/nx)2/(nx+1)+(sy2/ny)2/(ny+1)-2+ \frac{\left(s_x^2/n_x +s_y^2/n_y\right)^2}{(s_x^2/n_x )^2/(n_x+1)+(s_y^2/n_y )^2/(n_y+1)} 参考文献: 宾夕法尼亚州萨特斯韦特(1946)。“方差成分估计的近似分布”。生物识别公告,第2卷,第6页,第110-114页。 韦尔奇,BL(1947)。“当涉及几个不同的总体方差时,“学生”问题的推广”。Biometrika,34,1 / 2,第28-35页。

3
如何从连续变量(差异单位)解释危险比?
我正在阅读一篇文章,该文章显示了连续变量的危险比,但是我不确定如何解释给定的值。 我对危险比的当前理解是,该数字表示在某些条件下[事件]的相对可能性。例如:如果吸烟(二元事件)导致的肺癌死亡风险比是2,那么在监测的时间内吸烟者死亡的可能性是非吸烟者的两倍。 从维基百科上看,连续变量的解释是危险比适用于差异单位。对于序数变量(例如,每天吸烟的数量),这对我来说很有意义,但是我不知道如何将此概念应用于连续变量(例如,每天吸烟的尼古丁含量?)

2
双向方差分析是否合适?
这是我的研究的描述。我正在试验三种植物:A,B和C。这些植物被认为可以降低糖尿病患者的血糖。我想确定这三种植物中的哪一种对小鼠单次给药后对降低血糖的影响更长。这是通过在7个时间点(第1、2、3、5、7、10和14天)测量小鼠的血糖来完成的。因此,有4组(未处理,A处理,B处理和C处理)。对于每组,使用3只小鼠(n = 3)。我的目标是: 为了确定每种植物处理的效果与未处理相比是否显着。 比较各组之间每天的效果。 为了确定哪个治疗组在14天后效果最长。 我的解决方案是使用双向ANOVA,因为有两个以上的组,并且我想每天比较各组,最后比较总体效果。 这是正确的方法吗?我能否排名第二和第三最好的工厂?还是应该使用时间序列分析?

1
在状态空间模型中解释卡尔曼滤波器
在状态空间模型中使用卡尔曼滤波器的步骤涉及什么? 我看到了几种不同的表述,但是我不确定细节。例如,Cowpertwait从以下等式开始: θ吨=g ^吨θ吨-1+瓦特吨yt=F′tθt+vtyt=Ft′θt+vty_{t} = F^{'}_{t}\theta_{t}+v_{t} θt=Gtθt−1+wtθt=Gtθt−1+wt\theta_{t} = G_{t}\theta_{t-1}+w_{t} 其中和 ,是我们未知的估计,而是观测值。瓦特吨〜Ñ (0 ,w ^ 吨)θ 吨 ÿ 吨θ0〜ñ(米0,C0),vŤ〜ñ(0 ,VŤ)θ0∼N(m0,C0),vt∼N(0,Vt)\theta_{0} \sim N(m_{0}, C_{0}), v_{t} \sim N(0,V_{t})wŤ〜ñ(0 ,w ^Ť)wt∼N(0,Wt)w_{t} \sim N(0, W_{t})θŤθt\theta_{t}ÿŤyty_{t} Cowpertwait定义了所涉及的分布(分别为先验,似然和后验分布): ÿ 吨 | θ 吨〜Ñ (˚FθŤ| dt − 1〜ñ(一个Ť,RŤ)θt|Dt−1∼N(at,Rt)\theta_{t}|D_{t-1} \sim N(a_{t}, R_{t}) θ吨| d吨〜Ñ(米吨,Ç吨)ÿŤ| θŤ〜ñ(F′ŤθŤ,VŤ)yt|θt∼N(Ft′θt,Vt)y_{t}|\theta_{t} \sim N(F^{'}_{t}\theta_{t}, V_{t}) θŤ| …

2
误差传播SD与SE
在两个不同的条件下(A和B),我对每个人的性状有3到5个度量。 我绘制平均每个个体在每个条件和我使用标准的误差(即,,其中N=测量次数)作为误差线。小号D / N--√SD/NSD/\sqrt{N}ñNN 现在,我要绘制条件A和条件B中每个人的平均度量之间的差异。我知道我可以确定传播的误差: 但是如何传播标准误差(因为我正在处理测量的平均值)而不是标准偏差?这有道理吗?小号D = Sd2一个+ Sd2乙----------√SD=SDA2+SDB2SD=\sqrt{SD_A^2+SD_B^2}

2
用于非参数聚类的PyMC:估计高斯混合参数的Dirichlet过程无法聚类
问题设定 我想将PyMC应用到的第一个玩具问题之一是非参数聚类:给定一些数据,将其建模为高斯混合,并学习聚类的数目以及每个聚类的均值和协方差。我对这种方法的大部分了解来自迈克尔·乔丹(Michael Jordan)和Yee Whye Teh(大约在2007年之前)的视频讲座(在稀疏成为流行之前),以及最近两天阅读Fonnesbeck博士和E. Chen的教程[fn1],[ fn2]。但是问题已得到充分研究,并且具有一些可靠的实现方式[fn3]。 在这个玩具问题中,我从一维高斯生成十次抽奖,并从。正如您在下面看到的那样,我没有对抽奖进行混洗,以便于分辨哪个样品来自哪个混合成分。N(μ = 4 ,σ = 2 )N(μ=0,σ=1)N(μ=0,σ=1)\mathcal{N}(\mu=0, \sigma=1)N(μ=4,σ=2)N(μ=4,σ=2)\mathcal{N}(\mu=4, \sigma=2) 我对每个数据样本进行,,其中表示该第个数据点的聚类:。是使用的截短Dirichlet进程的长度:对我来说,。我= 1 ,。。。,50 ž 我我ž 我 ∈ [ 1 ,。。。,N D P ] N D P N D P = 50yi∼N(μzi,σzi)yi∼N(μzi,σzi)y_i \sim \mathcal{N}(\mu_{z_i}, \sigma_{z_i})i=1,...,50i=1,...,50i=1,...,50ziziz_iiiizi∈[1,...,NDP]zi∈[1,...,NDP]z_i \in [1,...,N_{DP}]NDPNDPN_{DP}NDP=50NDP=50N_{DP}=50 扩展Dirichlet流程基础结构,每个集群ID都是来自分类随机变量的图形,其随机变量的质量函数由结构给出:带有的a浓度参数。折断构造通过首先获得依赖于 Beta分布的 iid Beta分布绘制,构造必须为1 的长向量,请参见[fn1]。并且由于我想通过数据告知我对了解,因此我遵循[fn1]并假定 0.3,100。ž 我〜Ç 一吨ë …


6
机器学习中的灵活和不灵活的模型
在比较不同情况下的弹性模型(即样条曲线)与非弹性模型(例如线性回归)时,我遇到了一个简单的问题。问题是: 通常,在以下情况下,我们是否希望灵活的统计学习方法的性能比不灵活的方法好或坏? 预测变量的数量非常大,而观测值的数量小? ñpppnñn 误差项的方差,即σ2=Var(e)σ2=Var(e)σ^2 = \text{Var}(e)极高吗? 我认为对于(1),当nñn较小时,不灵活的模型会更好(不确定)。对于(2),我不知道哪个模型(相对)更好。

2
拟合优度检验:关于安德森–达林检验和克拉梅尔–冯·米塞斯准则的问题
当我参加安德森–达林(Anderson-Darling)测试和克拉姆-冯·米塞斯(Cramér-vonMises)准则时,我正在阅读网页上的拟合优度测试。 到目前为止,我明白了。似乎仅基于不同的加权函数,安德森-达林检验和克拉姆-冯·米塞斯准则相似。此外,还有一种名为Watson检验的Cramér–von Mises准则的变体。www 基本上我有两个问题 关于这两种方法的Google结果并不多。他们仍然是最先进的吗?或已经被一些更好的方法所取代? 令人惊讶的是,根据有关Shapiro-Wilk,Kolmogorov-Smirnov,Lilliefors和Anderson-Darling检验的功率比较的这篇论文,AD的表现相当不错。总是比Lilliefors和KS更好,并且非常接近SW测试,后者是专为正态分布而设计的。 这种测试的置信区间是多少? 对于AD,CM和Watson测试,我看到了在Wiki页面上定义的测试统计信息变量,但没有找到置信区间。 对于KS测试而言,事情变得更加简单:在Wiki页面上,置信区间由定义,该值由的累积分布函数定义。KαKαK_\alphaKKK

1
关于最大似然的一致性和渐近正态性的一般性定理
我对有关最大似然估计器的渐近性质的结果有很好的参考价值感兴趣。考虑模型其中是维密度,并且是基于样本来自的MLE其中是的“真”值。我感兴趣的是两个违规行为。˚F Ñ(X | θ )ñ θ Ñ X 1,... ,X Ñ ˚F Ñ(·&| θ 0)θ 0 θ{ ˚Fñ(·&| θ ):θ ∈ Θ ,Ñ ∈ Ñ }{fn(⋅∣θ):θ∈Θ,n∈N}\{f_n(\cdot \mid \theta): \theta \in \Theta, n \in \mathbb N\}Fñ(X | θ )fn(x∣θ)f_n(\mathbf x \mid \theta)ñnnθ^ñθ^n\hat \theta_nX1个,… ,XñX1,…,XnX_1, \ldots, X_nFñ(·&| θ0)fn(⋅∣θ0)f_n(\cdot \mid \theta_0)θ0θ0\theta_0θθ\theta 数据不是iid,因此,关于的Fisher信息的累积速率比慢。 θ …

4
在这种情况下,对y的x回归明显好于对y的y吗?
在一个10人的随机样本上监测用于测量人血液中葡萄糖水平的仪器。还可以使用非常准确的实验室程序来测量水平。仪器度量用x表示。实验室程序度量用y表示。 我个人认为x上的y更正确,因为其目的是使用仪器读数来预测实验室读数。x上的y最小化了此类预测的误差。 但是提供的答案是y上的x。

1
统计人员为什么不使用相互信息来衡量关联?
我看过一些非统计学家的谈话,他们似乎在使用互信息而不是回归(或等效/密切相关的统计检验)来重新发明相关度量。 我认为统计学家不采用这种方法是有充分理由的。我的外行人的理解是,熵/互信息的估计量往往有问题且不稳定。因此,我认为功能也是有问题的:他们声称自己没有使用参数测试框架来尝试解决此问题。通常,这种工作不会影响功效计算,甚至不会影响置信度/可信度区间。 但是,采取恶魔的拥护者立场,当数据集非常大时,慢速收敛是否有那么大的意义呢?同样,有时这些方法似乎在某种意义上是“有效的”,即关联性已通过后续研究验证。反对使用互信息来衡量关联的最佳批评是什么?为什么不将其广泛用于统计实践中? 编辑:此外,是否有涵盖这些问题的好论文?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.