统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
了解因果贝叶斯网络中的d分离理论
我试图了解因果贝叶斯网络中的d-分离逻辑。我知道算法的工作原理,但我不完全理解为什么 “信息流”如算法中所述工作。 例如,在上图中,让我们以为我们只有X,没有观察到其他变量。然后根据d分离的规则,信息从X流向D: X影响A,这是P(A )≠ P(A | X)P(一种)≠P(一种|X)P(A)\neq P(A|X)。可以,因为A导致X,并且如果我们知道X的影响,那么这会影响我们对原因A的信念。信息流。 X影响B,即P(B )≠ P(B | X)P(乙)≠P(乙|X)P(B)\neq P(B|X)。这是可以的,因为由于我们对X的了解而改变了A,所以A处的更改也会影响我们对其原因B的信念。 X影响C,即。之所以可以,是因为我们知道B受其间接效应X的偏见,并且由于B受X的偏见,这将影响B的所有直接和间接影响。C是B的直接效应,它受我们对X的了解的影响。P(C)≠ P(C| X)P(C)≠P(C|X)P(C)\neq P(C|X) 好了,到目前为止,对我来说一切都很好,因为信息流是根据直观的因果关系发生的。但是在这种方案中,我没有得到所谓的“ V型结构”或“对撞机”的特殊行为。根据d-分离理论,B和D是上图中C的常见原因,它表示,如果我们未观察到C或其任何后代,则来自X的流量信息将在C处阻塞。 ,但是我的问题是为什么? 从上面的三个步骤开始,从X开始,我们看到C受关于X的知识的影响,并且信息流根据因果关系发生。d-分离理论说,由于没有观察到C,所以我们不能从C转到D。但是我认为,既然我们知道C是有偏见的,而D是C的原因,那么D也应该受到影响,而理论却相反。我显然在思维模式中缺少某些东西,但看不到它是什么。 因此,我需要一个解释,说明如果没有观察到C,为什么信息流会阻塞在C处。

1
如何理解相关系数公式?
谁能帮助我了解Pearson相关公式?样本 =变量和的标准分数的乘积平均值。rrrXXXYYY 我有点理解为什么他们需要对和进行标准化,但是如何理解z得分的乘积呢? XXXYYY 该公式也称为“产品-时刻相关系数”,但是产品作用的原理是什么?我不确定是否已经明确说明了我的问题,但是我只想直观地记住该公式。

2
毕达哥拉斯定理的总方差定律
假设XXX和YYY具有有限的第二矩。在具有第二个有限矩的随机变量的希尔伯特空间(具有内积T1,T2T1,T2T_1,T_2由E(T1T2)E(T1T2)E(T_1T_2),||T||2=E(T2)||T||2=E(T2)||T||^2=E(T^2)),我们可以解释E(Y|X)E(Y|X)E(Y|X)作为YYY在函数空间上的投影XXX。 我们也知道,总方差定律为 Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X))+Var(E(Y|X))Var(Y)=E(Var(Y|X)) + Var(E(Y|X)) 有没有一种方法可以根据上面的几何图形来解释该定律?有人告诉我定律与边为的直角三角形的勾股定理相同Y,E(Y|X),Y−E(Y|X)Y,E(Y|X),Y−E(Y|X)Y, E(Y|X), Y-E(Y|X)。我理解为什么三角形是直角的,但不了解勾股定理是如何捕捉总方差定律的。

1
解读LASSO变量迹线图
我是该glmnet软件包的新手,但仍不确定如何解释结果。谁能帮助我阅读以下跟踪图? 通过运行以下命令获得该图: library(glmnet) return <- matrix(ret.ff.zoo[which(index(ret.ff.zoo)==beta.df$date[2]), ]) data <- matrix(unlist(beta.df[which(beta.df$date==beta.df$date[2]), ][ ,-1]), ncol=num.factors) model <- cv.glmnet(data, return, standardize=TRUE) op <- par(mfrow=c(1, 2)) plot(model$glmnet.fit, "norm", label=TRUE) plot(model$glmnet.fit, "lambda", label=TRUE) par(op)


2
平坦,共轭和超先验。这些是什么?
我目前正在阅读Yang撰写的计算分子进化中的贝叶斯方法。在5.2节中,它讨论了先验,特别是非信息性/平坦/模糊/漫射,共轭和超先验。 这可能要求过分简化,但是,有人可以简单解释一下这些先验类型之间的区别,以及这如何影响我在贝叶斯分析过程中所做的分析/决策的结果? (我不是统计学家,我只是在学习贝叶斯分析的道路上开始,所以从外行角度讲,越多越好)
15 bayesian  prior 

2
影响点,高杠杆点和离群点的精确含义和比较?
来自维基百科 影响性观察是那些对回归模型的预测具有相对较大影响的观察。 来自维基百科 杠杆点是在独立变量的极值或偏值处进行的那些观察(如果有的话),因此缺少相邻观察意味着拟合的回归模型将通过该特定观察。 为什么以下来自维基百科的比较 尽管影响点通常具有较高的杠杆作用,但高杠杆点不一定是影响点。


1
引导程序可以用来代替非参数测试吗?
我是统计学的新手。自举的概念一直困扰着我。 我知道使用某些测试(例如t检验)需要抽样分布的正态性。如果数据不是正态分布的,则通过在SPSS的t测试中请求“引导”,是否可以解决非正态性问题?如果是这样,输出中报告的t统计量是否基于自举抽样分布? 而且,在我拥有非正态数据的情况下,与使用非参数测试(例如,Mann-Whitney或Kruskal-Wallis)相比,这会是更好的测试吗?在数据不正常且正在使用引导程序的情况下,我不会报告t统计量:对吗?


5
建立统计模型到底是什么?
建立统计模型到底是什么? 这些天,当我申请研究工作或咨询工作时,经常会出现“建立模型”或“建模”一词。这个词听起来很酷,但是它们到底指的是什么?您如何建立模型? 我查找了预测模型,其中包括k-nn和逻辑回归。
15 modeling 


1
每日数据的时间序列预测:带回归的ARIMA
我使用的是每日时间序列的销售数据,其中包含大约2年的每日数据点。根据一些在线教程/示例,我试图确定数据的季节性。似乎有一个每周一次,每月一次,可能还有每年一次的周期性/季节性。 例如,有发薪日,尤其是在该月中的第1个发薪日,该发炎日在一周中持续几天。还有一些特定的假日效应,通过观察观察可以清楚地识别出来。 配备了一些观察结果之后,我尝试了以下操作: ARIMA(带有R-forecast包Arima和auto.arima来自R-forecast包),使用回归器(以及函数中需要的其他默认值)。我创建的回归器基本上是一个0/1值的矩阵: 11个月(n-1)个变量 12个假期变量 无法计算发薪日部分...因为它的影响比我想象的要复杂得多。发薪日效应的工作方式有所不同,具体取决于每月1日的工作日。 我使用7(即每周频率)对时间序列进行建模。我尝试了该测试-一次预测7天。结果是合理的:预测11周的平均准确度平均每周RMSE为5%。 TBATS模型(来自R-forecast包)-使用多个季节性(7,30.4375,365.25),并且显然没有回归。在每周平均RMSE 3.5%的情况下,准确性出乎意料地优于ARIMA模型。 在这种情况下,没有ARMA错误的模型的性能会稍好一些。现在,如果我仅将#1中所述的ARIMA模型的假日效应系数应用于TBATS模型的结果,则每周平均RMSE改善为2.95% 现在,在对这些模型的基础理论没有足够的背景知识或知识的情况下,我感到困惑的是,这种TBATS方法是否有效。尽管它在11周的测试中显着提高了RMSE,但我想知道它将来是否可以保持这种准确性。甚至将ARIMA的假日效果应用于TBATS结果是合理的。任何/所有贡献者的任何想法都将受到高度赞赏。 测试数据链接 注意:执行“将链接另存为”以下载文件。

3
Neyman-Pearson引理能适用于简单的null和Alternative不属于同一分布族的情况吗?
当简单的null和简单的替代项不属于同一分布族时,是否可以适用Neyman-Pearson引理?从它的证明,我不明白为什么不能。 例如,当简单null为正态分布而简单替代为指数分布时。 当两者都属于不同的分布族时,似然比检验是否是对复合零值进行测试的好方法? 谢谢并恭祝安康!

1
两个独立随机变量的乘积
我有大约1000个值的样本。这些数据是从两个独立的随机变量的乘积获得的ξ∗ψξ∗ψ\xi \ast \psi 。所述第一随机变量具有均匀分布ξ∼U(0,1)ξ∼U(0,1)\xi \sim U(0,1)。第二随机变量的分布未知。如何估算第二个(ψψ \psi )随机变量的分布?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.