统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
ICA是否需要首先运行PCA?
我审阅了一篇基于应用程序的论文,说在应用ICA之前先应用PCA(使用fastICA软件包)。我的问题是,ICA(fastICA)是否要求PCA首先运行? 本文提到 ...也有人认为,预先应用PCA可以通过(1)在白化之前丢弃小的尾随特征值,以及(2)通过使成对依存关系最小化来降低计算复杂度,从而提高ICA性能。PCA对输入数据进行解相关;其余的高阶依存关系由ICA分隔。 另外,其他论文也正在ICA之前应用PCA,例如该论文。 在ICA之前运行PCA还有其他利弊吗?请提供理论参考。

3
对蒙特卡洛Pi估计的误解
我相当确定我了解蒙特卡洛积分的工作原理,但不了解如何用它来估算Pi。我将按照此演示文稿第5张幻灯片中概述的步骤进行操作,网址为http://homepages.inf.ed.ac.uk/imurray2/teaching/09mlss/slides.pdf 我了解初步步骤。Pi等于单位圆四分之一面积的4倍。并且以(0,0)为中心的单位圆的右上四分之一的面积等于曲线的积分,即和单位圆的右上四分之一的曲线。。 0&lt;x&lt;10&lt;x&lt;10<x<10&lt;y&lt;10&lt;y&lt;10<y<1 我不明白的是这个积分是如何 ∬I((x2+y2)&lt;1)P(x,y)dxdy∬I((x2+y2)&lt;1)P(x,y)dxdy\iint I((x^2+y^2)<1)P(x,y)dxdy 其中P(x,y)P(x,y)P(x,y)在四分之一圆周围的单位正方形中均匀分布(即,如果0&lt;x&lt;10&lt;x&lt;10<x<1且0 &lt;y &lt;1则始终等于1,否则等于0&lt;y&lt;10&lt;y&lt;10<y<10)。因此,这意味着 I((x2+y2)&lt;1)P(x,y)I((x2+y2)&lt;1)P(x,y)I((x^2+y^2)<1)P(x,y) 是在0&lt;x&lt;10&lt;x&lt;10<x<1和0 &lt;y &lt;的情况下单位圆右上象限的函数1,0&lt;y&lt;10&lt;y&lt;10<y<1但我不明白这是怎么回事,因为指标函数只能是1或0。我理解它可能是通过这种方式编写的,以简化蒙特卡洛采样(即,这是一种期望,因此仅从P(x,y)P(x,ÿ)P(x,y)并获得应用于I((x ^ 2 + y ^ 2)&lt;1)的样本的平均值一世((X2+ÿ2)&lt; 1 )一世((X2+ÿ2)&lt;1个)I((x^2+y^2)<1)),但对我来说,这在直觉上没有意义,为什么该积分表示该曲线下方的面积。 有人可以对此提供直观的解释。也许说明该积分是如何逐步生成的? 编辑: 通过将期望与某个领域相关联,我能够获得更好的理解。如果有帮助,我将在这里进行解释。首先将Pi与单位圆的右上象限区域相关联 π= 4 ×一个Ť [Rπ=4×一个Ť[R\pi=4\times A_{tr} 然后,将右上象限放入单位正方形。在单位正方形上均匀分布的情况下,圆象限的面积与从中获取样本的概率成正比。因此,以下等式成立 P(X2+ÿ2&lt; 1 )=一个Ť [R一个小号qü 一个[R êP(X2+ÿ2&lt;1个)=一个Ť[R一个sqü一个[RËP(x^2+y^2<1)=\frac{A_{tr}}{A_{square}} 并且这样一个小号qü 一个[R ê= 1一个sqü一个[RË=1个A_{square}=1 P(X2+ÿ2&lt; 1 )=一个Ť [RP(X2+ÿ2&lt;1个)=一个Ť[RP(x^2+y^2<1)=A_{tr} 并代入原方程 π= 4 × P(X2+ÿ2&lt; 1 …

2
生存分析,其中协变量不可用于检查数据
我正在看法官作出决定所需的时间。每个法官都会评估许多申请人,可以批准或不批准该申请。法官在听证会后的某个时间提交报告,案子才定案。在研究期结束时,仍有许多案件尚未解决。 我想估计案例在系统中移动所需的平均时间。此外,我想看看被拒绝的案件是否比被批准的案件花费的时间更长。(法官们似乎花费更多的时间来编写他们最终未能批准的报告,或者寻求额外的文档)。 显然,我不知道研究结束时仍在审理中的案件是否会得到批准,因此协变量(批准/不批准)与数据一起被检查。 有什么我可以做的吗?
9 survival 

1
为什么在检验正态性时残差的相关性不重要?
当(即,来自线性回归模型)时, ,在这种情况下为残差是相关的而不是独立的。但是,当我们进行回归诊断并想测试假设 ,每本教科书都建议对残差使用Q–Q图和统计检验旨在测试某些。ÿ= A X+ εY=AX+εY = AX + \varepsilonÿYYε 〜Ñ(0,σ2I)⇒e^=(I−H)Y∼N(0,(I−H)σ2)ε∼N(0,σ2I)⇒e^=(I−H)Y∼N(0,(I−H)σ2)\varepsilon \sim \mathcal{N}(0, \sigma^2 I) \hspace{1em} \Rightarrow \hspace{1em} \hat{e} = (I - H) Y \sim \mathcal{N}(0, (I - H) \sigma^2_{})e^1,…,e^ne^1,…,e^n\hat{e}_1, \ldots, \hat{e}_nε∼N(0,σ2I)ε∼N(0,σ2I)\varepsilon \sim \mathcal{N}(0, \sigma^2 I)e^e^\hat{e}e^∼N(0,σ2I)e^∼N(0,σ2I)\hat{e} \sim \mathcal{N}(0, \sigma^2 I)σ2∈ [Rσ2∈R\sigma^2 \in \mathbb{R} 对于这些测试,残差是相关的而不是独立的无关紧要?通常建议使用标准化残差: 但这仅使它们同余,而不是独立的。e^′一世=Ë^一世1个−H我我−-----√,e^i′=e^i1−hii,\hat{e}_i' = \frac{\hat{e}_i}{\sqrt{1 - h_{ii}}}, 重新表述这个问题: …

2
EM算法练习题
这是期中考试的练习题。问题是一个EM算法示例。我在(f)部分遇到了麻烦。我列出了要完成的部分(a)-(e),以防万一我之前弄错了。 令是速率为独立指数随机变量。不幸的是,没有观察到实际的值,我们仅观察值是否落在特定间隔内。令,和 对于。观察到的数据由。X1,…,XnX1,…,XnX_1,\ldots,X_nθθ\thetaXXXXXXG1j=1{Xj&lt;1}G1j=1{Xj&lt;1}G_{1j} = \mathbb{1}\left\{X_j < 1\right\}G2j=1{1&lt;Xj&lt;2}G2j=1{1&lt;Xj&lt;2}G_{2j} = \mathbb{1}\left\{1< X_j<2\right\}G3j=1{Xj&gt;2}G3j=1{Xj&gt;2}G_{3j} = \mathbb{1}\left\{X_j > 2\right\}j = 1 ,… ,nĴ=1个,…,ñj=1,\ldots,n(G1 Ĵ,G2 Ĵ,G3 Ĵ)(G1个Ĵ,G2Ĵ,G3Ĵ)(G_{1j},G_{2j},G_{3j}) (a)给出观察到的数据可能性: L (θ | G )=∏j = 1ñ镨{XĴ&lt; 1 }G1 Ĵ镨{ 1 &lt;XĴ&lt; 2 }G2 Ĵ镨{XĴ&gt; 2 }G3 Ĵ=∏j = 1ñ(1−e−θ)G1j(e−θ−e−2θ)G2j(e−2θ)G3jL(θ|G)=∏j=1nPr{Xj&lt;1}G1jPr{1&lt;Xj&lt;2}G2jPr{Xj&gt;2}G3j=∏j=1n(1−e−θ)G1j(e−θ−e−2θ)G2j(e−2θ)G3Ĵ\begin{align*} L(\theta | G) &= \prod_{j=1}^n \text{Pr}\left\{X_j < 1\right\}^{G_{1j}}\text{Pr}\left\{12\right\}^{G_{3j}}\\ …

4
类似于PCA的非正交技术
假设我有一个二维点数据集,并且我想检测数据中所有局部极大值方差的方向,例如: PCA在这种情况下无济于事,因为它是正交分解,因此无法检测到我用蓝色表示的两条线,而是它的输出可能看起来像绿线所示。 请推荐任何适合此目的的技术。谢谢。

4
如何进行多元机器学习?(预测多个因变量)
我希望预测某人会购买的物品组...即,我有多个共线性因变量。 我不应该建立7个左右的独立模型来预测某人购买这7个项目中的每一个的概率,然后结合结果,而是应该采用什么方法来建立一个模型来说明7个相关的因变量之间的关系(他们可以购买的东西)。 我将R用作编程语言,因此请特别感谢R的任何建议。

3
如果,
假定设置如下: 令Zi=min{ki,Xi},i=1,...,nZi=min{ki,Xi},i=1,...,nZ_i = \min\{k_i, X_i\}, i=1,...,n。还有Xi∼U[ai,bi],ai,bi&gt;0Xi∼U[ai,bi],ai,bi&gt;0X_i \sim U[a_i, b_i], \; a_i, b_i >0。而且ki=cai+(1−c)bi,0&lt;c&lt;1ki=cai+(1−c)bi,0&lt;c&lt;1k_i = ca_i + (1-c)b_i,\;\; 0 k_i) = 1- \Pr(X_i \le k_i) =1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c=1−ki−aibi−ai=1−(1−c)(bi−ai)bi−ai=c= 1- \frac {k_i - a_i}{b_i-a_i} = 1-\frac {(1-c)(b_i-a_i)}{b_i-a_i} =c 因此,在所有 FZi(zi)=⎧⎩⎨⎪⎪⎪⎪⎪⎪⎪⎪⎪⎪0zi&lt;aizi−aibi−aiai≤zi&lt;ki1ki≤ziFZi(zi)={0zi&lt;aizi−aibi−aiai≤zi&lt;ki1ki≤ziF_{Z_i}(z_i) = \begin{cases} 0\qquad z_i0zi=kizi=kiz_i = k_i 总而言之,它等于现实的统一。 我想能够得出或表示随机变量S_n \ equiv \ sum_ {i = …


3
回归平滑样条曲线中等于k个分类变量的k个结的选择?
我正在研究一种预测成本模型,其中患者的年龄(以年为单位的整数)是预测变量之一。年龄与住院风险之间存在很强的非线性关系: 我正在考虑针对患者年龄的惩罚性回归平滑样条。根据《统计学习的要素》(Hastie等,2009,第151页),最佳结位置是每个会员年龄的唯一值一个结。 假设我将年龄保留为整数,那么惩罚平滑样条曲线是否等效于运行带有101个不同的年龄指标变量的岭回归或套索,每个年龄值在数据集中找到一个(减去一个作为参考)?然后避免过度参数化,因为每个年龄指标上的系数都缩小为零。

4
什么是“严格正分配”?
我正在阅读Judea Pearl的“因果关系”(2009年第二版),并在第1.1.5条“条件独立性和图形素”中指出: 以下是由条件独立关系(X_ || _Y | Z)满足的属性的(部分)列表。 对称性:(X_ || _ Y | Z)==&gt;(Y_ || _X | Z)。 分解:(X_ || _ YW | Z)==&gt;(X_ || _Y | Z)。 弱联合:(X_ || _ YW | Z)==&gt;(X_ || _Y | ZW)。 收缩:(X_ || _ Y | Z)&(X_ || _ W | ZY)==&gt;(X_ || _ …

2
通过概率编程(pymc)进行开关点检测
我目前正在阅读《概率编程和贝叶斯黑客方法》一书。我已经阅读了几章,并且在第一章中进行思考,其中pymc的第一个示例包括检测文本消息中的巫婆点。在该示例中,用于指示切换点何时发生的随机变量用ττ\tau。MCMC步骤后, ττ\tau 给出: 首先,从该图可以了解到,在第45天发生转换点的可能性接近50%。如果没有转换点,该怎么办?我想确定是否确实存在一个切换点,而不是假设有一个切换点然后尝试找到它。 作者通过“没有发生变化,或者随着时间的推移变化是逐渐变化的,……的后验分布”来回答“是否发生了切换点”问题。 ττ\tau 本来可以散布的。”但是您如何以可预测性来回答这个问题,例如,发生切换点的机率是90%,而在第45天发生机率的机率是50%。 是否需要更改型号?还是可以用当前模型来回答?

2
围绕非显着效应的狭窄置信区间能否为无效提供证据?
假设拒绝拒绝null表示null为真显然是错误的。但是,在一个情况下空未被拒绝和相应的置信区间(CI)是窄和围绕着0,这是否没有提供证据为空? 我有两种想法:是的,实际上,这将提供证据表明效应几乎为0。但是,在严格的假设检验框架中,似乎无效效应及其对应的CI根本无法推理。那么,当CI的点估计不重要时,它的含义是什么?它是否也不能用于推理,还是可以像前面的示例中那样用于量化无效的证据? 鼓励提供具有学术参考意义的答案。

1
什么时候合适的评分规则可以更好地估计分类设置中的泛化?
解决分类问题的一种典型方法是识别一类候选模型,然后使用诸如交叉验证之类的过程执行模型选择。通常,人们会选择精度最高的模型,或者选择一些编码特定问题信息的相关函数,例如。FβFβ\text{F}_\beta 假设最终目标是产生一个准确的分类器(准确度的定义再次取决于问题,则取决于问题),在哪种情况下,最好使用适当的评分规则来进行模型选择,而不是诸如准确性,准确性,召回率之类的不正确内容等等?此外,让我们忽略模型复杂性的问题,并假设我们认为所有模型具有同等可能性。 以前我不会说。从形式上讲,我们知道分类比回归[1],[2]更容易解决,并且我们可以得出前者比后者()更严格的界限。此外,在某些情况下,尝试准确匹配概率可能会导致错误的决策边界或过度拟合。但是,基于此处的对话和社区对此类问题的投票方式,我一直对此观点提出质疑。∗∗* 露芙·德沃罗伊。模式识别的概率论。卷 31. springer,1996年,第6.7节 Kearns,Michael J.和Robert E. Schapire。高效无分布学习概率概念。计算机科学基础,1990年。会议论文集,第31届年度研讨会。IEEE,1990年。 (∗)(∗)(*)这句话可能有点草率。我具体是指给定形式为带标签数据,其中和,它似乎更容易估计比准确估计的条件概率判定边界。S={(x1,y1),…,(xn,yn)}S={(x1,y1),…,(xn,yn)}S = \{(x_1, y_1), \ldots, (x_n, y_n)\}xi∈Xxi∈Xx_i \in \mathcal{X}yi∈{1,…,K}yi∈{1,…,K}y_i \in \{1, \ldots, K\}


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.