统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
关于偏差方差权衡的问题
我正在尝试了解偏差-方差折衷,估算器的偏差与模型的偏差之间的关系以及估算器的方差与模型的方差之间的关系。 我得出以下结论: 当我们忽略估计量的偏差时,即当我们仅旨在最小化模型偏差而不考虑模型的方差时,我们倾向于过度拟合数据(换句话说,我们仅旨在最小化估计量的方差而不考虑估计量的偏差) 反之亦然,当我们忽略估计量的方差时,即当我们仅旨在最小化模型方差而忽略模型的偏差时,我们倾向于使数据拟合不足(换句话说,我们仅旨在最小化模型的偏差)。估算器,也无需考虑估算器的方差)。 我的结论正确吗?

2
重复测量方差分析:正态性假设是什么?
我对重复测量方差分析中的正态性假设感到困惑。具体来说,我想知道究竟应该满足哪种常态。在阅读有关简历的文献和答案时,我遇到了这种假设的三种不同的措词。 每个(重复)条件中的因变量应正常分布。 人们常说rANOVA与ANOVA具有相同的假设,另外还有球形度。这就是Field的发现统计资料以及Wikipedia 关于该主题和Lowry的文章的主张。 残差(所有可能的对之间的差异?)应正态分布。 我发现在多个答案此声明CV(1,2)。通过将rANOVA 与配对t检验进行类比,这似乎也很直观。 应该满足多元正态性。 维基百科和此资源提到了这一点。另外,我知道,朗诺可以换用MANOVA,这可能值得这个要求。 这些等效吗?我知道多元正态性意味着DV的任何线性组合都是正态分布的,因此3.如果我正确理解后者,自然会包括2.。 如果这些都不相同,那么rANOVA的“真实”假设是什么?你能提供参考吗? 在我看来,对第一个主张的支持最大。但是,这与此处通常提供的答案不一致。 线性混合模型 由于@utobi的提示,我现在了解如何将rANOVA重新描述为线性混合模型。具体来说,为了建模血压随时间的变化,我将期望值建模为: 其中y i j是血压的测量值,a i是平均血压第i个对象的压力,而t i j为第i个对象被测量的第j次,b iE[yij]=ai+bitij,E[yij]=ai+bitij, \mathrm{E}\left[y_{ij}\right]=a_{i}+b_i t_{ij}, yijyijy_{ij}aiaia_{i}iiitijtijt_{ij}jjjiiibibib_i表示该变化的血压是跨学科的不同了。两种效果都被认为是随机的,因为受试者的样本只是人群的随机子集,这是最主要的兴趣所在。 最后,我尝试考虑这对正常性意味着什么,但收效甚微。释义McCulloch和Searle(2001,p。35. Eq。(2.14)): E[yij|ai]yij|aiai=ai∼indep. N(ai,σ2)∼i.i.d. N(a,σ2a)E[yij|ai]=aiyij|ai∼indep. N(ai,σ2)ai∼i.i.d. N(a,σa2)\begin{align} \mathrm{E}\left[y_{ij}|a_i\right] &= a_i \\[5pt] y_{ij}|a_i &\sim \mathrm{indep.}\ \mathcal{N}(a_i,\sigma^2) \\[5pt] a_i &\sim \mathrm{i.i.d.}\ \mathcal{N}(a,\sigma_a^2) \end{align} 我明白这意味着 4.每个人的数据都需要正态分布,但这在很少的时间点进行测试是不合理的。 我用第三种表达的意思是 5.各个主题的平均值呈正态分布。请注意,这是上述三种基础之上的另外两种不同的可能性。 McCulloch,CE和Searle,SR(2001)。广义模型,线性模型和混合模型。纽约:John …

1
Breiman的随机森林是否使用信息增益或Gini指数?
我想知道Breiman的随机森林(R randomForest包中的随机森林)是用作分割标准(属性选择标准)还是信息增益或基尼系数?我试图在http://www.stat.berkeley.edu/~breiman/RandomForests/cc_home.htm以及R中randomForest包的文档中找到它。但是我发现的唯一发现是,可以将Gini索引用于可变重要性计算。


1
关于感知器规则与梯度下降与随机梯度下降实现的说明
我对不同的Perceptron实现进行了一些实验,并希望确定我是否正确理解了“迭代”。 罗森布拉特的原始感知器规则 据我了解,在罗森布拉特的经典感知器算法中,权重在每个训练示例之后通过 Δw(t+1)=Δw(t)+η(target−actual)xiΔw(t+1)=Δw(t)+η(target−actual)xi\Delta{w}^{(t+1)} = \Delta{w}^{(t)} + \eta(target - actual)x_i 其中是这里的学习规则。目标和实际都被阈值化(-1或1)。我将其实现为1次迭代= 1次遍历训练样本,但是权重向量在每次训练样本后都会更新。Ë 吨一ËŤ一种eta 我将“实际”值计算为 sign(wwTxx)=sign(w0+w1x1+...+wdxd)sign(wwTxx)=sign(w0+w1x1+...+wdxd) sign ({\pmb{w}^T\pmb{x}}) = sign( w_0 + w_1 x_1 + ... + w_d x_d) 随机梯度下降 Δw(t+1)=Δw(t)+η(target−actual)xiΔw(t+1)=Δw(t)+η(target−actual)xi\Delta{w}^{(t+1)} = \Delta{w}^{(t)} + \eta(target - actual)x_i 相同感知规则,但是,target并actual没有阈值处理,但真正的价值。另外,我将“迭代”视为训练样本上的路径。 在这种线性可分离的情况下,SGD和经典感知器规则都收敛,但是,我在梯度下降实现方面遇到了麻烦。 梯度下降 在这里,我查看了训练样本并总结了训练样本1次传递后的权重变化,然后更新了权重,例如, 对于每个训练样本: Δwnew+=Δw(t)+η(target−actual)xiΔwnew+=Δw(t)+η(target−actual)xi\Delta{w_{new}} \mathrel{{+}{=}} \Delta{w}^{(t)} + \eta(target - actual)x_i ... 经过1次训练后: …

2
常客对电压表的看法是什么?
常客对电压表的故事及其变化有何看法?其背后的想法是,如果后来获悉那些假设事件不可能像假设的那样发生,那么必须对吸引假设事件的统计分析进行修订。 在维基百科上的故事的版本如下。 工程师抽取电子管的随机样本并测量其电压。测量范围为75至99伏。统计员计算样本均值和真实均值的置信区间。后来统计学家发现电压表的读数只能读到100,因此人口似乎被“审查了”。如果统计学家是正统的,这就需要进行新的分析。但是,工程师说,他还有另一个读到1000伏特的电表,如果电压超过100伏,他会使用该电表。这对统计学家来说是一件轻松的事,因为这意味着人口实际上是未经审查的。但是,第二天,工程师通知统计人员该第二个仪表在测量时没有工作。统计人员确定工程师在仪表固定好之前不会暂停测量,并告知他需要新的测量。工程师大为震惊。“接下来,您会问我的示波器”。 这个故事显然是愚蠢的,但我不清楚用它取笑的方法会带来什么自由。我敢肯定,在这种情况下,繁忙的应用统计学家不会为此担心,但是铁杆学术常客呢? 使用教条常识性方法,我们是否需要重复实验?我们能否从现有数据中得出任何结论? 为了解决故事中提出的更笼统的观点,如果我们想利用已经拥有的数据,是否可以对假设结果进行必要的修改以适应常人主义框架?

2
根据PCA / FA中保留的几个主要成分或因素创建一个索引
我正在使用主成分分析(PCA)创建研究所需的索引。我的问题是我应该如何使用通过PCA计算出的保留主成分来创建单个索引。 例如,在使用PCA之后,我决定保留3个主要成分,并计算了这3个主要成分的得分。为每位受访者从这三个分数中创建一个索引的合适方法是什么? 将3个计算所得的分数相加得到一个复合值是否有意义? 还是将这3个分数取平均值才能获得这样的价值? 还是只保留第一个主成分(最强)并将其分数用作索引? 或者,可以使用因子分析(FA),但仍然存在相同的问题:如何基于多个因子得分创建单个索引?

1
Box-Muller与逆CDF方法相比在模拟正态分布方面的优势?
为了从一组均匀变量中模拟正态分布,有几种技术: Box-Muller算法,其中一个对上的两个独立均匀变量进行采样,然后通过以下方法将它们转换为两个独立的标准正态分布: Ž 0 = √(0,1)(0,1)(0,1)Z0=−2lnU1−−−−−−√cos(2πU0)Z1=−2lnU1−−−−−−√sin(2πU0)Z0=−2lnU1cos(2πU0)Z1=−2lnU1sin(2πU0) Z_0 = \sqrt{-2\text{ln}U_1}\text{cos}(2\pi U_0)\\ Z_1 = \sqrt{-2\text{ln}U_1}\text{sin}(2\pi U_0) CDF方法,其中可以将普通cdf等同于一个统一变量: 并得出 F (Z )= U Z = F − 1(U )(F(Z))(F(ž))(F(Z))F(Z)= UF(ž)=ü F(Z) = U ž= F− 1(U)ž=F-1(ü)Z = F^{-1}(U) 我的问题是:哪个计算效率更高?我认为这是后者的方法-但是我阅读的大多数论文都使用Box-Muller-为什么? 附加信息: 正常CDF的逆是已知的,并给出: F− 1(Z)=2–√埃尔夫− 1(2Z−1),Z∈(0,1).F−1(Z)=2erf−1⁡(2Z−1),Z∈(0,1).F^{-1}(Z)\; =\; \sqrt2\;\operatorname{erf}^{-1}(2Z - 1), \quad Z\in(0,1). 因此: Z=F−1(U)=2–√erf−1(2U−1),U∈(0,1).Z=F−1(U)=2erf−1⁡(2U−1),U∈(0,1). Z …

2
不同分布的中值绝对偏差(MAD)和SD
对于正态分布的数据,标准偏差和中位数绝对偏差通过以下方式关联:σσ\sigmaMADMAD\text{MAD} σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,σ=Φ−1(3/4)⋅MAD≈1.4826⋅MAD,\sigma=\Phi^{-1}(3/4)\cdot \text{MAD}\approx1.4826\cdot\text{MAD}, 其中是标准正态分布的累积分布函数。Φ()Φ()\Phi() 其他分布有类似关系吗?

6
事后测试有什么问题?
我的统计教授这么说,我看过的所有书都说:事后测试是不科学的。您必须首先从理论中得出假设,然后再收集数据并进行分析。 但是我真的不明白问题是什么。 假设,我看到了不同颜色汽车的销售数据,并形成了这样的假设:从售出的不同颜色的汽车中,街上最大的汽车组应该是白色的。因此,有一天我坐在某个街道上,记下经过我的所有汽车的所有颜色。然后,我做一些测试,找到任何东西。 现在,假设我很无聊,有一天坐在某个街道上,记下经过我的所有汽车的所有颜色。由于我喜欢图表,因此我绘制了一个漂亮的直方图,发现白色汽车构成了最大的组。因此,我认为也许街上的大多数汽车都是白色的,并进行了一些测试。 事后检验的结果或结果解释与理论驱动的假设检验有何不同?为什么? *事后测试的反义词是什么? 我想补充一点,我们关于宇宙的大部分知识(地球绕太阳运动)是事后根据观测推论得出的。 在我看来,在物理学上完全可以假设过去一千年来太阳在东方升起并不是偶然的。
15 post-hoc 

1
2SLS,但第二级Probit
我正在尝试使用工具变量分析来推断观测数据的因果关系。 我遇到了两阶段最小二乘(2SLS)回归,这很可能可以解决我研究中的内生性问题。但是,我希望第一阶段成为OLS,第二阶段成为2SLS中的Probit。根据我的阅读和搜索,我已经看到研究人员使用2SLS或第一阶段的Probit和第二阶段的OLS,但并非相反,这正是我想要达到的目标。 我目前正在使用Stata,并且Stata中的ivreg命令用于直接2SLS。

2
名义/分类数据的“虚拟变量”与“指标变量”
“虚拟变量”和“指示变量”是标签常用术语,用于描述使用0/1编码的类别中的成员资格;通常为0:不属于类别成员; 1:属于类别成员。 2014年11月26日,对Scholar.google.com(带引号)进行了快速搜索,发现约有318,000篇文章使用了“虚拟变量”,而约112,000篇文章中使用了“指标变量”。术语“虚拟变量”在“ 绑定变量 ”的非统计数学中也具有含义,这很可能有助于在索引文章中更多地使用“虚拟变量”。 我的局部关联问题: 这些术语是否始终是同义词(在统计范围内)? 这些术语中的任何一个是否曾经被接受地应用于其他形式的分类编码(例如,效果编码,Helmert编码等)? 有什么统计学或学科原因比一个术语更喜欢一个术语?

3
贝叶斯假设检验在推理和决策理论的框架中意味着什么?
我的背景主要是机器学习,我试图学习贝叶斯假设检验的含义。我对概率的贝叶斯解释表示满意,并且在概率图形模型的背景下我对此很熟悉。但是,令我感到困惑的是在统计推断的背景下“假设”一词的含义。 我想我对机器学习所使用的词汇与统计和推理中通常使用的词汇感到困惑。 在监督学习的背景下,我通常认为该假设是将示例映射到其标签即的预测功能H:X→ Yh:X→ÿh:\mathcal{X} \rightarrow \mathcal{Y}。但是,在我看来,假设在我所做的阅读中并不具有相同的含义。让我粘贴我正在阅读的阅读摘要: 如果仔细阅读,它还会显示: 观察到的数据有不同的模型... 他们使用单词模型吗?对我而言,单词模型让我想到了一组功能,如果我们选择特定的预测功能。即功能的假设类别。例如,可以是二次函数的假设类(2级多项式)。但是,在我看来,他们在此摘录中使用单词模型和假设作为同义词(在我看来,它们是完全不同的单词)。Hd2Hd2\mathcal{H_{d2}} 然后继续提到我们可以对假设进行先验(在贝叶斯环境中要做的完全合理的事情): pH(高米),米= { 0 ,1 ,。。。,M− 1 }pH(H米), 米={0,1,。。。,中号-1}p_H(H_m), \ \ \ \ \ m=\{0, 1, ..., M-1 \} 我们也可以用当前的假设来表征数据: pÿ| H(⋅ | H米),米= { 0 ,1 ,。。。,M − 1 }pÿ|H(⋅|H米), 米={0,1,。。。,中号-1}p_{y|H}( \cdot |H_m), \ \ \ \ \ m=\{0, 1, …

1
无需更换即可绘制时预期的不同颜色数
考虑一个包含球的不同颜色的,其中 是球在个球中的比例()。我从骨灰盒中取出了球而没有替换,然后查看绘制的球中不同颜色的数字。根据分布合适属性,对作为函数的期望是什么?P p 我我Ñ Σ 我p 我 = 1 ñ ≤ ÑNNNPPPpipip_iiiiNNN∑ipi=1∑ipi=1\sum_i p_i = 1n≤Nn≤Nn \leq Nγ Ñ / Ñ pγγ\gammaγγ\gamman/Nn/Nn/Npp\mathbf{p} 给出更多的见解:如果对所有且,那么我将始终准确看到种颜色,即。否则,可以证明的期望是。对于固定的和,当均匀时,乘以的因子似乎最大。可能看到的不同颜色的预期数量受和熵的 函数限制?p 我 = 1 / P 我Ñ γ = P (Ñ / Ñ )γ > P (Ñ / Ñ )P ñ ñ / Ñ p Ñ / Ñ …

2
使用正态分布的图形模拟均匀分布的图形
我最近购买了一个数据科学面试资源,其中一个概率问题如下: 给定具有已知参数的正态分布的绘图,如何模拟均匀分布的绘图? 我最初的想法是,对于离散随机变量,我们可以将正态分布分解为K个唯一的子部分,其中每个子部分在正态曲线下的面积均相等。然后,我们可以通过识别变量最终落入法线曲线的哪个区域来确定该变量取K个值。 但这仅适用于离散随机变量。我研究了如何对连续随机变量执行相同的操作,但是不幸的是,我只能找到诸如逆变换采样之类的技术,这些技术将使用统一随机变量作为输入,并且可以从其他分布中输出随机变量。我在想,也许我们可以反向进行此过程以获得统一的随机变量? 我还考虑过可能使用Normal随机变量作为线性同余生成器的输入,但是我不确定这是否可行。 关于如何处理这个问题有任何想法吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.