统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答



1
线性回归中作为独立变量求和的解释比例
我熟悉分类变量的概念以及相应的伪变量编码,这些编码使我们能够将一个级别作为基线来避免共线性。我还熟悉如何从此类模型解释参数估计值:相对于基线类别,对于给定拟合类别的预测变量,结果的预测变化。 我不确定的是如何解释一组独立的变量,这些变量之和等于一个。如果我们将所有比例都拟合到模型中,我们将再次具有共线性,因此,我们大概必须将一类作为基线。我还假设我将使用III型SS对该变量的重要性进行整体测试。但是,我们如何解释模型中相对于基线的那些水平的参数估计呢? 一个示例:在邮政编码级别,自变量是变质岩,火成岩和沉积岩的比例。如您所知,这是三种主要的岩石类型,所有岩石都被分类为其中一种。这样,所有这三个部分的比例之和为1。结果是各个邮政编码中的平均ra水平。 例如,如果要拟合变质和火成岩比例作为模型中的预测因子,而以沉积物为基线,则通过对两个拟合水平的整体III型SS F-测试可以表明岩石类型总体上是否重要结果的预测因子(平均ra水平)。然后,我可以查看各个p值(基于t分布)以确定一种或两种岩石类型是否与基线显着不同。 但是,当涉及到参数估计时,我的大脑一直想将它们纯粹解释为组(摇滚类型)之间结果的预期变化,而且我不知道如何将它们按比例拟合这一事实纳入其中。 如果的变质估计值为例如0.43,则说明的不是简单的解释,即当岩石变质而沉积时,预测的平均the水平增加了0.43个单位。但是,这种解释也不只是简单地解释了变质岩类型比例的某种单位增加(例如0.1),因为这并没有反映出它也相对于基线(沉积物)以及变化的事实。变质的比例从本质上改变了火成岩模型中其他岩石水平拟合的比例。ββ\beta 有没有人提供提供这种模型的解释的资源,或者如果没有,您可以在这里提供一个简短的示例吗?



2
高斯过程的好处
我对高斯过程的好处感到困惑。我的意思是将其与简单的线性回归进行比较,在线性回归中我们定义了线性函数对数据进行建模。 但是,在高斯过程中,我们定义函数的分布意味着我们没有明确定义函数应该是线性的。我们可以定义先于函数的先验,即先验高斯先验,先验先验定义一些特征,例如函数应具有的平滑程度以及全部。 因此,我们不必明确定义模型应该是什么。但是,我有疑问。我们确实有边际可能性,使用它可以调整高斯先验的协方差函数参数。因此,这类似于定义不是应该的功能类型。 归结为定义参数的同一件事,即使在GP中它们是超参数。例如在本文中。他们定义GP的均值函数类似于 m (x )= a x2+ b x + c即二阶多项式。m(x)=ax2+bx+ci.e. a second order polynomial.m(x) = ax ^2 + bx + c \quad \text{i.e. a second order polynomial.} 因此,肯定是定义了模型/功能,不是吗。那么像LR中那样将函数定义为线性有什么区别。 我只是没有获得使用GP的好处

2
计算RNA序列和ChIP芯片数据集之间的基因列表重叠的可能性
希望这些论坛上的人可以帮助我解决基因表达研究中的这一基本问题。 我对实验和对照组织进行了深度测序。然后,我获得了超出对照的实验样品中基因的倍数富集值。参考基因组有〜15,000个基因。与对照相比,我感兴趣的样本中的15,000个基因中有3,000个富集到某个临界值以上。 因此:A =总基因种群= 15,000 B = RNA-Seq富集的亚群= 3,000。 在先前的ChIP芯片实验中,我发现了400个被ChIP芯片丰富的基因。在400个ChIP芯片基因中,有3,000个富集RNA-Seq转录本的组中有100个基因。 因此:C =芯片上富含芯片的基因总数= 400。 仅凭偶然机会,我的100个ChIP芯片基因就会被RNA-Seq富集的可能性是多少?换句话说,最谨慎的方法是计算我观察到的B和C(100个基因)之间的重叠是否比仅凭偶然获得的重叠更好?到目前为止,根据我的读物,测试这一点的最佳方法是使用超几何分布。 我使用了一个在线计算器(stattrek.com),使用以下参数设置了超几何分布测试:-流行数量= 15,000-总体成功次数= 3,000-样本数量= 400,-成功数量= 100。对于超几何概率P(x = 100)= 0.00224050636447747我得到以下信息 B和C之间重叠的实际基因数量=100。这是否比偶然碰碰更好?如果任何一个基因被富集的机会是1:5(15,000个中的3,000个),看起来就不是这样。这就是为什么我不知道我上面计算的P(x = 100)是0.0022的原因。这等于偶然发生重叠的机会为0.2%。这不应该更高吗? 如果我从15,000个大列表中抽取了400个随机基因,那么这些基因中的任何80个都将被偶然地丰富(1:5)。实际上重叠的基因数量是100,所以这比偶然的情况好一点。 我还尝试提出一种使用R中的hyper或phyper函数的解决方案(使用我在另一篇文章中看到的):A =基因组中的所有基因(15,000)B =富含RNA-Seq的基因(3,000)C = ChIP芯片富集基因(400)这是R输入/输出(改编自先前的stackexchange帖子): > totalpop <- 15000 > sample1 <- 3000 > sample2 <- 400 > dhyper(0:2, sample1, totalpop-sample1, sample2) [1] 4.431784e-40 …

1
批处理规范为何具有可学习的规模和转移性?
据我了解,批处理规范将所有输入要素归一化为一层,呈单位正态分布。通过测量当前微型批次的平均值和方差来估计。N(μ=0,σ=1)N(μ=0,σ=1)\mathcal{N}(\mu=0,\sigma=1)μ,σ2μ,σ2\mu, \sigma^2 归一化后,将按比例缩放并按标量值移动输入: x^′i=γx^i+βx^i′=γx^i+β\hat{x}_i' = \gamma \hat{x}_i + \beta (如果我错了,请纠正我-这是我开始有点不确定的地方。) γγ\gamma和是标量值,每个成批处理的图层都有一对。使用backprop和SGD可以了解它们以及权重。ββ\beta 我的问题是,这些参数不是多余的吗,因为可以通过图层本身的权重以任何方式缩放和移动输入。换句话说,如果 y=Wx^′+by=Wx^′+by = W \hat{x}' + b 和 x^′=γx^+βx^′=γx^+β\hat{x}' = \gamma \hat{x} + \beta 然后 y=W′x^+b′y=W′x^+b′y = W' \hat{x} + b' 其中且。W′=WγW′=WγW' = W\gammab′=Wβ+bb′=Wβ+bb'=W\beta + b 那么将它们添加到已经能够学习规模和转移的网络的意义何在呢?还是我完全误会了事情?

5
是否有用于设计和应用神经网络/深度学习的可视工具?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 10个月前关闭。 我知道有很多用于机器学习和深度学习的库,例如caffe,Theano,TensorFlow,keras等。但是对我来说,我似乎必须了解我想使用的神经网络的体系结构。 是否有一个(可视的)工具可以试验不同的网络设计并将其应用于自己的数据? 我正在考虑使用TensorFlow Playground之类的东西,但是具有n维数据和不同的图层类型。 提前致谢!

2
为决策树分类功能编码的最佳做法?
在为线性回归编码分类特征时,有一条规则:假人的数量应比级别总数少一个(以避免共线性)。 决策树是否存在类似的规则(袋装,增强)?我之所以这样问是因为,Python的标准做法似乎是将n级别扩展到对我而言似乎不是最佳的n虚拟对象(sklearns OneHotEncoder或Pandas pd.get_dummies)。 作为编码决策树分类功能的最佳做法,您有何建议?

1
y轴在随机森林偏倚图中的意义
我正在使用RandomForestR包,并对如何在其偏相关图中解释Y轴的值感到困惑。帮助文档指出,该图是“变量对类概率的边际影响的图形描述”。但是,我仍然对y轴的确切含义感到困惑。 特别是,负值是什么意思? 对准确预测班级产生负面影响是什么意思? 这些图中最重要的特征是最大值,趋势形状等吗? 您可以将局部图与其他变量的局部图进行比较吗? 这些图如何与Maxent(一种分布建模软件)中创建的响应曲线进行比较?

1
具有Metropolis-Hastings算法的MCMC:选择方案
我需要进行仿真以评估3参数函数的积分,我们说,它的公式非常复杂。要求使用MCMC方法进行计算并实施Metropolis-Hastings算法以生成以分配的值,并建议使用3变量正态作为建议分布。阅读有关它的一些示例,我发现其中一些使用带有固定参数的法线一些使用具有可变均值,其中是最后接受的值根据分布。我对这两种方法都有疑问:ffffffN(μ,σ)N(μ,σ)N(\mu, \sigma)N(X,σ)N(X,σ)N(X, \sigma)XXXfff 1)选择最后接受的值作为提案分配的新均值是什么意思?我的直觉说,它应该保证我们的值将更接近于分布的值,并且接受的机会会更大。但这不是集中我们太多的样本吗?是否可以保证,如果我得到更多的样本,链条将变得平稳?fff 2)不会选择固定参数(因为确实很难分析)真的很困难,并且依赖于第一个样本,我们需要选择启动算法?在这种情况下,找到哪种更好的最佳方法是什么?fff 这些方法中的一种是否比另一种更好?或者这取决于具体情况? 我希望我的疑惑是明确的,如果能提供一些文献,我会很高兴(我读过一些有关该主题的论文,但是更好的是!) 提前致谢!

1
如何阅读R的nls的拟合优度?
我试图解释nls()的输出。我已经阅读了这篇文章,但我仍然不明白如何选择最合适的。根据我的拟合,我有两个输出: > summary(m) Formula: y ~ I(a * x^b) Parameters: Estimate Std. Error t value Pr(>|t|) a 479.92903 62.96371 7.622 0.000618 *** b 0.27553 0.04534 6.077 0.001744 ** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 Residual standard error: 120.1 on 5 degrees …


8
如果p值正好为1(1.0000000),那么置信区间限制应为多少才能支持原假设为真?[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加细节并通过编辑此帖子来澄清问题。 7个月前关闭。 这纯粹是一个假设的问题。一个非常普遍的说法是永远都不是真的,这只是样本量的问题。H0H0H_0 让我们假设,对于实数,从正态分布的总体中得出的两个均值()绝对没有可测量的差异(对于和估计为)。我们假设每组,我们使用检验。这意味着值为表明与绝对没有差异。这将表明测试统计量为。组之间的平均差为。在这种情况下,均值差的置信区间的极限是多少?他们会吗μ1=μ2μ1=μ2\mu_1=\mu_2μ=0μ=0\mu=0σσ\sigma=1=1=1N=16N=16N=16tttppp1.000001.000001.00000H0H0H_000000095%95%95\%[0.0,0.0][0.0,0.0][0.0, 0.0]? 我的问题的重点是,我们什么时候可以真正说出是真实的,即在这种情况下?还是在常客制框架中比较两种方法时可以真正说“没有区别”?H0H0H_0μ1=μ2μ1=μ2\mu_1=\mu_2

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.