统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
为什么在伯努利参数上使用beta分布进行分层逻辑回归?
我目前正在阅读Kruschke出色的“做贝叶斯数据分析”书。但是,有关分层逻辑回归的章节(第20章)有些令人困惑。 图20.2描述了分层逻辑回归,其中伯努利参数被定义为通过S型函数转换的系数的线性函数。我在其他在线资源中也看到了大多数示例,这似乎是构成分层逻辑回归的方式。例如-http: //polisci2.ucsd.edu/cfariss/code/SIMlogit02.bug 但是,当预测变量是名义变量时,他在层次结构中添加了一层-Bernoulli参数现在从beta分布中绘制(图20.5),其参数由mu和kappa确定,其中mu是系数线性函数的S形变换。 ,而kappa使用伽玛优先级。 这似乎是合理的,类似于第9章中的掷硬币示例,但是我不认为名义上的预测变量与添加beta分布有什么关系。在度量标准预测变量的情况下,为什么不这样做?为什么为名义预测变量增加了beta分布? 编辑:澄清我所指的模型。首先,具有指标预测变量的逻辑回归模型(之前没有beta)。这类似于分层逻辑回归的其他示例,例如上面的错误示例: ÿ一世〜伯努利(μ一世)μ一世= 信号(β0+ ∑ĴβĴXĴ 我)β0〜ñ(M0,Ť0)βĴ〜ñ(Mβ,Ťβ)yi∼Bernoulli⁡(μi)μi=sig⁡(β0+∑jβjxji)β0∼N(M0,T0)βj∼N(Mβ,Tβ) y_i \sim \operatorname{Bernoulli}(\mu_i) \\ \mu_i = \operatorname{sig}(\beta_0 + \sum_j \beta_j x_{ji} ) \\ \beta_0 \sim N(M_0, T_0) \\ \beta_j \sim N(M_\beta, T_\beta) \\ 然后是带有名义预测变量的示例。在这里,我不太了解层次结构的“较低”级别的作用(将逻辑结果纳入二项式分析的beta中),以及为什么它应与度量示例有所不同。 ž一世〜斌(θ一世,N)θ一世〜Beta版(一个Ĵ,bĴ)一个Ĵ= μĴκbĴ= (1 - μĴ)κκ 〜Γ (小号κ,Rκ)μĴ= 信号(β0+ ∑ĴβĴXĴ 我)β0〜ñ(M0,Ť0)βĴ〜ñ(0 ,τβ)τβ= 1 / σ2βσ2β〜折t(TŤ,d ˚F)zi∼Bin⁡(θi,N)θi∼Beta⁡(aj,bj)aj=μjκbj=(1−μj)κκ∼Γ(Sκ,Rκ)μj=sig⁡(β0+∑jβjxji)β0∼N(M0,T0)βj∼N(0,τβ)τβ=1/σβ2σβ2∼folded …

2
e1071 libsvm有问题吗?
我有一个包含两个重叠类的数据集,每个类中有七个点,点在二维空间中。在R中,我正在svm从e1071软件包中运行,以为这些类构建单独的超平面。我正在使用以下命令: svm(x, y, scale = FALSE, type = 'C-classification', kernel = 'linear', cost = 50000) 其中x包含我的数据点并y包含其标签。该命令返回一个svm-object,我用它来计算分离超平面的参数(法向矢量)和(截距)。wwwbbb 下图(a)显示了我的点和svm命令返回的超平面(让我们将此超平面称为最佳平面)。带符号O的蓝点表示空间原点,虚线表示边距,带圆圈的是非零ξξ\xi(松弛变量)的点。 图(b)显示了另一个超平面,它是最佳5的平行平移(b_new = b_optimal-5)。不难看出,对于该超平面,目标函数 0.5||w||2+cost∑ξi0.5||w||2+cost∑ξi 0.5||w||^2 + cost \sum \xi_i (通过C分类svm最小化)将具有比图所示的最佳超平面更低的值(一个)。看来此svm功能有问题吗?还是我在某个地方犯了错误? 以下是本实验中使用的R代码。 library(e1071) get_obj_func_info <- function(w, b, c_par, x, y) { xi <- rep(0, nrow(x)) for (i in 1:nrow(x)) { xi[i] <- 1 - …

1
霍尔顿序列与Sobol序列?
从在回答前一个问题,我是指向哈尔顿序列,用于创建一组涵盖了统一的样本空间相当均匀的载体。但是维基百科页面提到,特别是较高的素数在系列的早期通常是高度相关的。样本量相对较短的任何一对高质数似乎都是这种情况-即使变量没有相关性,样本空间也不是均匀采样的,而是整个空间中存在高样本密度的对角带。 因为我使用的是长度为6或更大的向量,所以不可避免地将不得不使用一些素数来解决这个问题(尽管不如上面的示例那样糟糕),并且某些变量对将在他们的样本飞机。在我看来,使用Sobol'序列生成相似的集合(仅通过查看图表)似乎可以在变量对之间生成样本,这些变量对的分布更加均匀,即使是相对少量的样本也是如此。这似乎有用得多,所以我想知道Halton序列何时会更有益?还是仅仅是Halton序列更容易计算? 注意:也欢迎讨论其他多维低差异序列。

2
为什么在神经网络中使用派生特征?
例如,一个人想要预测房屋价格,并具有房屋的长度和宽度两个输入特征。有时,还包括“派生”多项式输入特征,例如面积,即长*宽。 1)包含派生要素的意义是什么?在训练过程中,神经网络是否应该学习长度,宽度和价格之间的联系?为什么第三个要素(区域)不是多余的? 另外,有时我还看到人们在输入要素上运行遗传选择算法以减少数量。 2)如果所有输入功能都包含有用的信息,减少它们的意义是什么?神经网络是否应该根据其重要性为每个输入特征分配适当的权重?运行遗传选择算法的重点是什么?


2
分位数回归预测
我对某些模型使用分位数回归很感兴趣,但想对使用此方法可以实现的目标进行一些说明。我知道我可以对IV / DV 关系进行更可靠的分析,尤其是在遇到离群值和异方差的情况下,但在我的情况下,重点是预测。 特别是,我有兴趣提高模型的拟合度,而不求助于更复杂的非线性模型甚至分段线性回归。在预测时,是否可以根据预测变量的值选择最高概率的结果分位数?换句话说,是否可以根据预测变量的值确定每个预测结果的分位数概率?



4
Sidak还是Bonferroni?
我在SPSS中使用广义线性模型来研究16种不同植物上毛虫的平均数量差异(非正态,使用Tweedie分布)。 我想进行多个比较,但是不确定是否应该使用Sidak或Bonferroni校正测试。两种测试有什么区别?这个比那个好吗?

1
如何计算Spearman等级相关性的置信区间?
维基百科具有Spearman等级相关性的Fisher变换到近似的z分数。也许z得分与零假设(等级相关性0)不同? 此页面具有以下示例: 4, 10, 3, 1, 9, 2, 6, 7, 8, 5 5, 8, 6, 2, 10, 3, 9, 4, 7, 1 rank correlation 0.684848 "95% CI for rho (Fisher's z transformed)= 0.097085 to 0.918443" 他们如何使用Fisher变换获得95%的置信区间?

5
lme4或等效于asreml-R的其他开源R软件包代码
我想使用lme4,nlme,贝叶斯回归包或任何可用的模型拟合混合模型。 Asreml-R编码约定中的混合模型 在进行具体说明之前,对于不熟悉ASREML代码的用户,我们可能希望了解有关asreml-R约定的详细信息。 y = Xτ + Zu + e ........................(1) ; 通常的混合模型,其中y表示观测值的n×1向量,其中τ是固定效应的p×1向量,X是全列秩的n×p设计矩阵,将观测值与固定效应的适当组合相关联,u是随机效应的q×1向量,Z是将观察结果与适当的随机效应组合相关的n×q设计矩阵,e是残差的n×1向量,模型(1)被称为线性混合模型或线性混合效应模型。假设 其中矩阵G和R分别是参数γ和φ的函数。 参数θ是方差参数,我们将其称为比例参数。 在具有多个残差方差的混合效应模型中,例如在分析具有多个截面或变量的数据时,参数θ固定为1。在具有单个残差方差的混合效应模型中,θ等于残差方差(σ2)。在这种情况下,R必须是相关矩阵。有关模型的更多详细信息,请参见Asreml手册(链接)。 误差的方差结构:R结构和随机效应的方差结构:可以指定G结构。 asreml()中的方差建模重要的是要了解通过直接乘积形成方差结构的过程。通常的最小二乘假设(以及asreml()中的默认值)是这些都是独立且均匀分布的(IID)。但是,如果数据来自以r行×c列的矩形阵列布置的现场实验,例如,我们可以将残差e安排为矩阵,并可能认为它们在行和列内是自相关的。向量以场顺序排列,也就是说,通过对列内的残差行(块内的曲线)进行排序,则残差的方差可能为 分别是行模型(阶r,自相关参数½r)和列模型(阶c,自相关参数½c)的相关矩阵。更具体地,在田间试验分析中,有时会针对常见误差假定二维可分离的自回归空间结构(AR1 x AR1)。 示例数据: nin89来自asreml-R库,该库在矩形字段的复制/块中生长了不同的变量。为了控制行或列方向上的其他可变性,每个图都被称为行和列变量(行列设计)。因此此行列的设计具有阻塞性。产量是测量变量。 示例模型 我需要等同于asreml-R代码的内容: 简单的模型语法如下所示: rcb.asr <- asreml(yield ∼ Variety, random = ∼ Replicate, data = nin89) .....model 0 线性模型在固定(必需),随机(可选)和rcov(误差分量)参数中指定为公式对象。默认值是简单误差项,不需要像模型0中那样正式为误差项指定。 这里的变化是固定的,随机是重复的(块)。除了随机和固定项,我们还可以指定误差项。在该模型0中为默认值。通过rcov参数在公式对象中指定模型的残差或误差分量,请参见以下模型1:4。 以下模型1更复杂,其中同时指定了G(随机)和R(错误)结构。 模型1: data(nin89) # Model 1: RCB analysis …
13 r 


1
来自正态分布组合的分位数
我了解不同年龄儿童的人体测量尺寸分布(例如肩跨度)。对于每个年龄和维度,我都有均值,标准差。(我也有八个分位数,但我认为我无法从中得到想要的东西。) 对于每个维度,我想估算长度分布的特定分位数。如果我假设每个维度都是正态分布的,则可以使用均值和标准偏差来实现。我是否可以使用一个漂亮的公式来获取与特定分位数的分布相关的值? 反向操作非常简单:对于特定值,对于每个正态分布(年龄),将面积都设置在该值的右侧。对结果求和,然后除以分布数。 更新:这是图形形式的相同问题。假设每个彩色分布都是正态分布。 而且,很明显,我可以尝试一堆不同的长度,并不断更改它们,直到获得与我的精度足够接近所需分位数的长度为止。我想知道是否有比这更好的方法。如果这是正确的方法,那么它有名字吗?

2
处理多重共线性
我了解到,使用封装vif()方法car,我们可以计算模型中输入的多重共线性度。从维基百科来看,如果该vif值大于,5那么我们可以认为输入存在多重共线性问题。例如,我使用lm()方法开发了线性回归模型,并vif()给出了以下内容。正如我们所看到的,输入ub,lb以及tb由多重痛苦。 vif(lrmodel) tb ub lb ma ua mb sa sb 7.929757 50.406318 30.826721 1.178124 1.891218 1.364020 2.113797 2.357946 为了避免多重共线性问题,并使模型更健壮,我ub和之间进行了交互lb,现在新模型的vif表如下: tb ub:lb ma mb sa sb ua 1.763331 1.407963 1.178124 1.327287 2.113797 1.860894 1.891218 有中没有太大区别R^2价值和以及有在上述两种情况都在误差没有太大的差别,从一留出CV测试。 我的问题是: 如上所示,通过交互来避免多重共线性问题是否还好? 与上述vif方法结果相比,有没有更好的方法来表示多重共线性问题。 请给我您的建议。 谢谢。

6
用于识别变量之间关系的R包
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4年前关闭。 是否可以使用R包来探索变量之间是否存在关系? 通常,当我寻找模式时,我会先看相关性,然后看一个方面图。然后,我将一些转换手动应用于数据中的变量。我想知道是否可以通过R包来加快此过程。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.