统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
参数可估计性问题
令和为四个随机变量,使得,其中是未知参数。还假设,那哪个是真的?Y1,Y2,Y3Y1,Y2,Y3Y_1,Y_2,Y_3Y4Y4Y_4E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y1)=θ1−θ3; E(Y2)=θ1+θ2−θ3; E(Y3)=θ1−θ3; E(Y4)=θ1−θ2−θ3E(Y_1)=\theta_1-\theta_3;\space\space E(Y_2)=\theta_1+\theta_2-\theta_3;\space\space E(Y_3)=\theta_1-\theta_3;\space\space E(Y_4)=\theta_1-\theta_2-\theta_3θ1,θ2,θ3θ1,θ2,θ3\theta_1,\theta_2,\theta_3Var(Yi)=σ2Var(Yi)=σ2Var(Y_i)=\sigma^2i=1,2,3,4.i=1,2,3,4.i=1,2,3,4. :是可估计的。θ1,θ2,θ3θ1,θ2,θ3\theta_1,\theta_2,\theta_3 B.是可估计的。θ1+θ3θ1+θ3\theta_1+\theta_3 C.是可估计的,是的最佳线性无偏估计。θ1−θ3θ1−θ3\theta_1-\theta_312(Y1+Y3)12(Y1+Y3)\dfrac{1}{2}(Y_1+Y_3)θ1−θ3θ1−θ3\theta_1-\theta_3 D.是可估计的。θ2θ2\theta_2 给出的答案是C,它对我来说看起来很奇怪(因为我得到了D)。 为什么我得到D?由于。E(Y2−Y4)=2θ2E(Y2−Y4)=2θ2E(Y_2-Y_4)=2\theta_2 为什么我不明白C可以作为答案?好的,我可以看到是的无偏估计量,并且其方差小于。 θ1-θ3ÿ1+ÿ3Y1+Y2+Y3+Y44Y1+Y2+Y3+Y44\dfrac{Y_1+Y_2+Y_3+Y_4}{4}θ1−θ3θ1−θ3\theta_1-\theta_3Y1+Y32Y1+Y32\dfrac{Y_1+Y_3}{2} 请告诉我我在哪里做错了。 也发布在这里:https : //math.stackexchange.com/questions/2568894/a-problem-on-estimability-of-parameters

2
什么是贝叶斯深度学习?
什么是贝叶斯深度学习,它与传统贝叶斯统计数据和传统深度学习有何关系? 涉及的主要概念和数学是什么?我可以说这只是非参数贝叶斯统计吗?它的开创性工作以及当前的主要发展和应用是什么? PS:贝叶斯深度学习受到了很多关注,请参阅NIPS研讨会。

1
ROC曲线相互交叉时两个模型的比较
用于比较两个或多个分类模型的一种常用方法是使用ROC曲线(AUC)下的面积作为间接评估其性能的一种方法。在这种情况下,通常将具有较大AUC的模型解释为比具有较小AUC的模型具有更好的性能。但是,根据Vihinen,2012年(https://www.ncbi.nlm.nih.gov/pmc/articles/PMC3303716/)所述,当两条曲线相互交叉时,这种比较不再有效。为什么会这样呢? 例如,根据ROC曲线和下面的AUC,可以确定模型A,模型B和模型C的方法是什么?

2
我可以使用CLR(中心对数比转换)为PCA准备数据吗?
我正在使用脚本。它用于核心记录。我有一个数据框,该数据框显示了给定深度(第一列)中各列的不同元素组成。我想用它来执行PCA,我对必须选择的标准化方法感到困惑。 你们中有没有人使用clr()来准备的数据prcomp()?还是将我的解决方案掺假了?除了在中使用属性scale之外,我还尝试clr()在使用prcomp()函数之前对数据使用on prcomp()。 data_f_clr<- clr(data_f) data_pca <- prcomp(data_f, center = TRUE, scale. = TRUE) https://stat.ethz.ch/R-manual/R-devel/library/stats/html/prcomp.html 描述scale是为了缩放数据,因此它们具有单位差异。我想我的数据规模与我想要的完全不同。问题是,当我使用上面的代码或跳过时clr()(这会产生更想要的结果),我收到了不同的解决方案。但是我想知道为什么clr()在这种情况下令人不安?

2
为什么经济学研究人员对二元响应变量使用线性回归?
最近,我不得不阅读几篇经济学方面的论文(我不太熟悉这一领域)。我注意到的一件事是,即使响应变量是二进制的,使用OLS拟合的线性回归模型也无处不在。因此,我的问题是: 为什么在经济学领域,线性回归优于逻辑回归?这是简单的普遍做法,还是(在论文,教师等中)积极倡导的程序? 请注意,我并不是在问为什么将线性回归与二元响应一起使用可能不是一个好主意,或者是什么替代方法。相反,我问为什么人们在这种情况下使用线性回归,因为我知道这两个问题的答案。

1
复合对称情况下(0 + factor | group)和(1 | group)+(1 | group:factor)随机效应规格的等价关系
道格拉斯·贝茨(Douglas Bates)指出,以下模型是等效的:“如果向量值随机效应的方差-协方差矩阵具有一种特殊形式,称为复合对称”(本演示文稿中的幻灯片91): m1 <- lmer(y ~ factor + (0 + factor|group), data) m2 <- lmer(y ~ factor + (1|group) + (1|group:factor), data) 具体而言,贝茨使用以下示例: library(lme4) data("Machines", package = "MEMSS") m1a <- lmer(score ~ Machine + (0 + Machine|Worker), Machines) m2a <- lmer(score ~ Machine + (1|Worker) + (1|Worker:Machine), Machines) 具有相应的输出: print(m1a, …


3
当数据量巨大时,回归的统计显着性发生了什么?
我正在阅读有关大规模回归(link)的问题,whuber指出了一个有趣的观点,如下所示: “几乎所有运行的统计测试都将非常强大,以至于几乎可以确定“显着”的影响。您必须更加关注统计的重要性,例如影响的大小,而不是重要性。” ---胡布 我想知道这是可以证明的东西还是在实践中只是一些常见现象? 任何指向证明/讨论/模拟的指针都将非常有用。


2
优化与机器学习
我想知道多少机器学习需要优化。据我所知,对于从事机器学习的人们来说,统计数据是一个重要的数学主题。同样,对于从事机器学习的人来说,了解凸优化或非凸优化有多重要?

1
使用iloc设置值
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 这条线在数据帧返回第4行combined对feature_a combined.iloc[0:4]["feature_a"] 如预期的那样,下一行将在数据帧中返回column的第2、4和16行feature_a: combined.iloc[[1,3,15]]["feature_a"] 这条线设置在数据帧的第一4行用于feature_a给77。 combined.iloc[0:4]["feature_a"] = 77 这条线有作用。正在发生某种计算,因为将其应用于更长的列表时会花费更长的时间。 combined.iloc[[1,3,15]]["feature_a"] = 88 使用此检查时,未将第二,第四和第十六行设置为88: combined.iloc[[1,3,15]]["feature_a"] 如何在不进行大量编码绕行的情况下将数据帧的列的行的任意列表设置为一个值? 这种情况似乎应该非常简单和普遍。
13 python  pandas 

8
调查:大型用户群中有25%是代表吗?
我的雇主目前正在对公司对办公室的态度(即情绪)进行全公司范围的调查。过去,他们对业务的各个领域(假设有10个非常不同的部门)和其中的所有员工(假设整个公司共有1000名员工)开放调查,每个部门的员工人数不相等,只有一个特定部门大概是组织总人口的50%。 今年,该调查仅对员工总数的25%开放,选择是“随机”的 因此,我有两个查询: 如果这是对整个员工基础的真正随机选择,那么假设所有这些员工都做出了回应,那么该统计上如何有效的样本呢? 如果在每个部门级别上是随机的,例如每个部门的25%,那么考虑一个部门的有效样本如何超过总人口的50%。 我本来以为要确定公司中的多数情绪,则每个部门至少需要50%的员工基础才能提供真实的阅读情绪。 更新:调查未执行。从所选择的25%中不能保证100%的响应率。如果没有填写调查表,则没有激励或惩罚手段。

2
我不明白二项式的方差
即使问这样一个基本问题,我也感到很愚蠢,但这里有: 如果我有一个随机变量可以取值和,且和,那么如果我从中抽取样本,我将得到二项式分布。XXX000111P(X=1)=pP(X=1)=pP(X=1) = pP(X=0)=1−pP(X=0)=1−pP(X=0) = 1-pnnn 分布的平均值是 μ=np=E(X)μ=np=E(X)\mu = np = E(X) 分布的方差为 σ2=np(1−p)σ2=np(1−p)\sigma^2 = np(1-p) 这是我的麻烦开始的地方: 方差由。因为两个可能的结果的平方不改变任何东西(和),所以意味着,这意味着 X 0 2 = 0 1 2 = 1 ë (X 2)= È (X )σ2=E(X2)−E(X)2σ2=E(X2)−E(X)2\sigma^2 = E(X^2) - E(X)^2XXX02=002=00^2 = 012=112=11^2 = 1E(X2)=E(X)E(X2)=E(X)E(X^2) = E(X) σ2=E(X2)−E(X)2=E(X)−E(X)2=np−n2p2=np(1−np)≠np(1−p)σ2=E(X2)−E(X)2=E(X)−E(X)2=np−n2p2=np(1−np)≠np(1−p)\sigma^2 = E(X^2) - E(X)^2 = E(X) …

3
beta分布从何而来?
我确定这里的每个人都已经知道,Beta分布的PDF 由X〜乙(一,b )X∼B(a,b)X \sim B(a,b) F(x )= 1B (a ,b )Xa − 1(1 − x )b − 1f(x)=1B(a,b)xa−1(1−x)b−1f(x) = \frac{1}{B(a,b)}x^{a-1}(1-x)^{b-1} 我一直在各地寻找有关该公式起源的解释,但我找不到它。我在Beta发行版上找到的每篇文章似乎都给出了这个公式,说明了它的一些形状,然后直接讨论其关键时刻。 我不喜欢使用无法推导和解释的数学公式。对于其他分布(例如伽马或二项式),有一个明确的推导可以学习和使用。但是我找不到类似的东西用于Beta发行版。 所以我的问题是:该公式的起源是什么?在最初开发的任何上下文中,如何从第一性原理中衍生出来? [为澄清起见,我不是在问如何在贝叶斯统计中使用Beta分布,或者在实践中直觉地意味着什么(我已经读过棒球示例)。我只想知道如何导出PDF。以前有一个问题提出了类似的问题,但是(我认为是错误的)它被标记为另一个未解决该问题的问题的重复,因此到目前为止,我在这里找不到任何帮助。] 编辑2017-05-06:谢谢大家的提问。我想对我想要的东西有一个很好的解释,当我向一些课程讲师问这个问题时,我得到了以下答案之一: “我想人们可以将正常密度推导为n个事物的总和除以sqrt(n)的极限,并且可以从事件以恒定速率发生的想法推导泊松密度。类似地,为了推导Beta密度,您将需要某种概念来确定什么使得Beta分布独立于密度,并且在逻辑上先于密度。” 因此,注释中的“从头开始”的想法可能最接近我要寻找的想法。我不是数学家,但是我使用能够推导的数学感到最自在。如果起源对我来说太先进了,那就去吧,但是如果不是,我想了解它们。

1
如果
我遇到了一个关于ARCH模型的属性的证明,该证明说,如果,则是固定的iff,其中ARCH模型是:{ X t } ∑ p i = 1 b i &lt; 1E(X2t)&lt;∞E(Xt2)&lt;∞\mathbb{E}(X_t^2) < \infty{Xt}{Xt}\{X_t\}∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1 Xt=σtϵtXt=σtϵtX_t = \sigma_t\epsilon_t σ2t=b0+b1X2t−1+...bpX2t−pσt2=b0+b1Xt−12+...bpXt−p2\sigma_t^2 = b_0 + b_1X_{t-1}^2 + ... b_pX_{t-p}^2 证明的主要思想是证明可以写为AR(p)进程,并且如果为真,则特征多项式的所有根都位于单位外部圈,因此是固定的。然后说是固定的。这是怎么回事? ∑ p i = 1 b i &lt; 1 { X 2 t } { X t }X2tXt2X_t^2∑pi=1bi&lt;1∑i=1pbi&lt;1\sum_{i=1}^pb_i < 1{X2t}{Xt2}\{X_t^2\}{Xt}{Xt}\{X_t\}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.