统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
混合分布的CDF逆采样
上下文外的简短版本 令为CDF yyyF(⋅)≡{θθ+(1−θ)×CDFlog-normal(⋅;μ,σ) y = 0 y > 0F(⋅)≡{θ y = 0 θ+(1−θ)×CDFlog-normal(⋅;μ,σ) y > 0 F(\cdot) \equiv \cases{\theta & y = 0 \\ \theta + (1-\theta) \times \text{CDF}_{\text{log-normal}}(\cdot; \mu, \sigma) & y > 0} 假设我想使用反CDF方法模拟绘制。那可能吗?此函数不完全具有逆函数。然后再次有两个正态分布的混合分布的逆变换采样,这表明这里有一种已知的方法可以应用逆变换采样。yyy 我知道两步法,但是我不知道如何将其应用于我的情况(请参见下文)。 带背景的长版 我使用MCMC(特别是Stan)为向量值响应拟合了以下模型:yi=(y1,…,yK)iyi=(y1,…,yK)iy^i = \left( y_1 , \dots , y_K \right)^i θik≡logit−1(αkxi),μik≡βkxi−σ2k2F(⋅)≡{θθ+(1−θ)×CDFlog-normal(⋅;μ,σ) y = …

2
残差与潜在的干扰有何关系?
在最小二乘法中,我们要估计模型中的未知参数: Yj=α+βxj+εj(j=1...n)Yj=α+βxj+εj(j=1...n)Y_j = \alpha + \beta x_j + \varepsilon_j \enspace (j=1...n) 一旦完成(对于某些观测值),我们将获得拟合的回归线: Yj=α^+β^x+ej(j=1,...n)Yj=α^+β^x+ej(j=1,...n)Y_j = \hat{\alpha} + \hat{\beta}x +e_j \enspace (j =1,...n) 现在显然我们想检查一些图以确保满足假设。假设您要检查均方差,但是,实际上我们正在检查残差。假设您检查了残差与预测值的关系图,如果这表明我们看到了明显的异方差性,那么这与干扰项什么关系?残差中的异方差是否表示扰动方面的异方差? ejeje_jεjεj\varepsilon_j

2
使用波尔函数检查比例赔率假设是否在序数逻辑回归中成立
我已使用MASS软件包中的“ polr”函数对具有15个连续解释变量的序数分类响应变量运行序数逻辑回归。 按照UCLA指南中的建议,我已使用代码(如下所示)检查我的模型是否符合比例赔率假设。但是,我有点担心输出的含义,即不仅各个切点之间的系数都相似,而且也完全相同(请参见下图)。 FGV1b <- data.frame(FG1_val_cat=factor(FGV1b[,"FG1_val_cat"]), scale(FGV1[,c("X","Y","Slope","Ele","Aspect","Prox_to_for_FG", "Prox_to_for_mL", "Prox_to_nat_border", "Prox_to_village", "Prox_to_roads", "Prox_to_rivers", "Prox_to_waterFG", "Prox_to_watermL", "Prox_to_core", "Prox_to_NR", "PCA1", "PCA2", "PCA3")])) b <- polr(FG1_val_cat ~ X + Y + Slope + Ele + Aspect + Prox_to_for_FG + Prox_to_for_mL + Prox_to_nat_border + Prox_to_village + Prox_to_roads + Prox_to_rivers + Prox_to_waterFG + Prox_to_watermL + Prox_to_core …

1
简单线性回归中截距和斜率的估计值是否独立?
考虑线性模型 ÿ一世= α + βX一世+ϵ一世yi=α+βxi+ϵiy_i= \alpha + \beta x_i + \epsilon_i 并估计坡度和截距 α^α^\hat{\alpha} 和 β^β^\hat{\beta}使用普通的最小二乘法。此数学统计参考说明如下:α^α^\hat{\alpha} 和 β^β^\hat{\beta} 是独立的(以他们的定理证明)。 我不确定我为什么。以来 α^=ÿ¯-β^X¯α^=y¯−β^x¯\hat{\alpha}=\bar{y}-\hat{\beta} \bar{x} 这不是在说 α^α^\hat{\alpha} 和 β^β^\hat{\beta}有关系吗?我可能在这里错过了一些非常明显的东西。

1
PCA如何处理自相关数据?
仅仅因为一些通讯员提出了一个有关自相关计算方法的有趣问题,我才开始研究它,几乎不了解时间序列和自相关。 记者安排了他的数据(一个时间序列的数据点),每个数据点之间一个时滞,因此他拥有一个数据的矩阵(据我),其中第一行是原始数据,第二行是原始数据数据移动了时间单位,下一行又移动了一个,依此类推。我还通过将末端粘到尾巴上来实现了这一点,因此制作了“圆形”数据集。32323232 × 3232×3232\times321个1个1 然后,为了寻找可能产生的结果,我计算了相关矩阵,并由此得出了主要成分。出乎意料的是,我得到了一个频率分解的图像,并且(再次与其他数据)得到了一个频率,说在数据中有一个周期位于第一主成分中,而在四个数据中具有四个周期位于第二个PC中,依此类推。 (我有台特征值 “相关” PC323232666> 1>1个>1)。首先,我认为这取决于输入数据,但是现在,我假设通过具有循环移位的数据集的特殊构造(也称为“ Toeplitz”矩阵)来系统地采用这种方式。将PC解决方案旋转为varimax或其他旋转条件会产生稍微不同且可能有趣的结果,但总的来说似乎提供了这种频率分解。 这是我根据点数据集制作的图片的链接。这些曲线仅由因子矩阵的载荷绘制而成:一条曲线是一个因子的载荷。第一个PC1的曲线应显示最高振幅(大致是因为它具有最大的载荷平方和)323232 问题: Q1:这是设计使然吗?(具有这种类型的数据集的PCA) 问题2:这种方法确实确实可以用于严肃的频率/波长分析方法吗? [更新]这是数据集(希望它可以为您复制) -5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4 -3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5 -1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3 0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1 2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0 4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2 6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4 5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6 3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5 1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3 1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1 0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1 -2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0 -3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2 -1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3 0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1 3,5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0 5,7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3 7,6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5 6,7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7 7,5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6 5,4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7 4,3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5 3,2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4 2,3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3 3,5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2 5,4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3 4,3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5 3,2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4 2,3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3 3,4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2 4,-5,-3,-1,0,2,4,6,5,3,1,1,0,-2,-3,-1,0,3,5,7,6,7,5,4,3,2,3,5,4,3,2,3

1
在生态学中使用什么标准将变量分为解释变量和排序方法的响应?
我有在人群中相互作用的不同变量。基本上,我一直在盘点千足虫,并测量其他一些地形值,例如: 标本的种类和数量 动物所在的不同环境 pH值 有机物百分比 磷,钾,镁,钙,锰,铁,锌,铜的含量 Ca + Mg / K关系 基本上,我想使用PCA来确定哪些变量驱动样本的可变性并使森林(环境)有所不同。我应该为“变量”使用哪些变量,为“个人”使用哪些变量?

3
预测模型中的传递函数-解释
我忙于ARIMA建模,该模型添加了用于推广建模目的的外生变量,并且很难向业务用户进行解释。在某些情况下,软件包最终会带有简单的传递函数,即参数*外生变量。在这种情况下,解释很容易,即促销活动X(由外源二进制变量表示)通过Y量影响因变量(例如需求)。因此,从业务角度来讲,我们可以说促销活动X导致需求量增加了Y个单位。 有时,传递函数更加复杂,例如多项式除法*外生变量。我所能做的就是对多项式进行除法,以便找到所有的动态回归系数,并说例如促销活动不仅会影响需求发生期间的需求,而且还会影响未来的需求。但是由于软件包将输出传递函数作为多项式的除法,因此业务用户无法做出直观的解释。如果不进行除法运算,关于复杂的传递函数,我们有什么可以说的吗? 相关模型的参数和相关传递函数如下所示: 常数= 4200,AR(1),促销活动系数30,Num1 = -15,Num2 = 1.62,Den1 = 0.25 因此,我想如果这期间我们进行促销活动,需求量将增加30个单位。另外,由于存在传递函数(多项式除法),所以促销活动不仅会影响当前时间段,还会影响随后的时间段。问题是,我们如何才能发现促销会影响将来的几个时段,以及每个时段对需求量的影响如何?

1
有效卷积(以R为单位)
我想计算/评估卷积 G(x )=∫dF(x − t )ϕ (t )d牛逼,G(X)=∫dF(X-Ť)ϕ(Ť)dŤ,g(x)=\int_D f(x-t) \phi(t) dt, 哪里 FFf 是密度, ϕϕ\phi 平稳的功能,紧凑的支撑 ddD。卷积不是封闭形式的,我需要对其进行数值积分。我的问题是:是否有一种有效的方法来做到这一点?我想在R中实现它,所以,我想看看是否有比使用command更好的方法 integrate()。
9 r  convolution 


1
将神经网络与稀疏输入配合使用时应遵循哪些准则
我的输入极为稀疏,例如输入图像中某些特征的位置。此外,每个功能都可以进行多次检测(不确定是否会影响系统的设计)。我将其表示为k通道“二进制图像”,其中ON像素表示该特征的存在,反之亦然。我们可以看到这样的输入注定是非常稀疏的。 因此,在将稀疏数据与神经网络一起使用时,是否有任何建议,特别是代表检测/位置的数据?

1
从鉴定到估计
我目前正在阅读Pearl的文章(Pearl,2009年,第二版),探讨因果关系,并努力建立模型的非参数识别与实际估计之间的联系。不幸的是,珀尔本人对此话题非常沉默。 举个例子,我想到一个简单的因果关系模型, x→z→yx→z→yx \rightarrow z \rightarrow y,以及影响所有变量的混杂因素 w→xw→xw \rightarrow x, w→zw→zw \rightarrow z 和 w→yw→yw \rightarrow y。此外,xxx 和 yyy 受到不可观察的影响, x←→yx←→yx \leftarrow \rightarrow y。根据微积分规则,我现在知道干预后(离散)的概率分布由下式给出: P(y∣do(x))=∑w,z[P(z∣w,x)P(w)∑x[P(y∣w,x,z)P(x∣w)]].P(y∣do(x))=∑w,z[P(z∣w,x)P(w)∑x[P(y∣w,x,z)P(x∣w)]]. P(y \mid do(x)) = \sum_{w,z}\bigl[P(z\mid w,x)P(w)\sum_{x}\bigl[P(y\mid w,x,z)P(x\mid w)\bigr]\bigr]. 我知道不知道如何估算此数量(非参数或通过引入参数假设)?特别是当www是一组混杂变量,并且关注的数量是连续的。在这种情况下,估计联合干预前的数据分布似乎非常不切实际。有人知道处理这些问题的Pearl方法的应用吗?我很高兴获得一个指针。

4
当您不知道分布时如何采样
我是统计学的新手(一些初学者的Uni课程),并且想知道是否从未知分布中进行采样。具体来说,如果您不了解基本分布,是否有任何方法可以“保证”获得代表性样本? 举例说明:假设您试图弄清楚财富的全球分布。对于任何给定的个人,您都可以以某种方式找出他们的确切财富;但您无法“采样”地球上的每个人。因此,假设您随机抽样了n = 1000个人。 如果您的样本中不包括比尔·盖茨,您可能会认为不存在亿万富翁。 如果您的样本确实包括比尔·盖茨,您可能会认为亿万富翁比他们实际更为普遍。 无论哪种情况,您都无法真正分辨出亿万富翁的普通或罕见。您甚至可能根本无法判断是否存在任何内容。 对于这种情况,是否存在更好的采样机制? 您如何告诉先验使用哪种采样程序(以及需要多少个样本)? 在我看来,您可能必须“抽样”大量人口,以某种合理的确定性来了解地球上有多少普通或稀有的亿万富翁,这是由于基本的分布有点困难跟...共事。

2
为了获得统计学家的资格,我需要拥有“统计学”的硕士学位吗?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 5年前关闭。 我是我大学的应届毕业生,本科学历是统计学。我真的很喜欢统计学,并且可能会尝试以统计学家为生。我正在研究一个硕士课程,我无法阻止自己想知道是否需要为了成为统计学家而在“统计”课程中攻读硕士学位。例如,如果我在“教育测量/统计/评估”课程上修了硕士学位,那么我是否仍可以是具有该学术证书的统计学家(假设我已经拥有统计学专业的本科学位)? 我看了一下课程,课程内容包括实验设计,回归和多元分析。我不知道这些课程是否在数学上相当严格。
9 careers 

1
为什么这种多重插补质量低下?
考虑以下R代码: > data <- data.frame( a=c(NA,2,3,4,5,6),b=c(2.2,NA,6.1,8.3,10.2,12.13),c=c(4.2,7.9,NA,16.1,19.9,23)) > data a b c 1 NA 2.20 4.2 2 2 NA 7.9 3 3 6.10 NA 4 4 8.30 16.1 5 5 10.20 19.9 6 6 12.13 23.0 如您所见,我对数据进行了大致的设计c = 2*b = 4*a。因此,我希望缺少的值在左右a=1, b=2, c=12。所以我进行了分析: > imp <- mi(data) Beginning Multiple Imputation ( …

1
根据测量误差选择先验
如果您有仪器的测量误差,如何计算适当的先验值?本段摘自Cressie的书“时空数据统计”: 通常情况下,可以使用一些有关测量误差方差的先验信息,从而可以指定相当有用的参数模型。例如,如果我们假设条件独立的测量误差为iid ,那么我们应该为指定一个信息先验。假设我们对环境空气温度感兴趣,并且我们看到仪器制造商的技术指标表明“误差”为±0.1°C。假定此“错误”对应于2个标准差(应检查的假设!),然后我们可以指定\ sigma _ {\ epsilon} ^ {2}的先前平均值为(0.1 / 2)^ 2 = 0.0025Gau(0,σ2ϵ)Gau(0,σϵ2)Gau(0, \sigma_{\epsilon}^2)σ2ϵσϵ2\sigma_{\epsilon}^2±0.1°C±0.1°C±0.1°Cσ2ϵσϵ2\sigma_{\epsilon}^{2}(0.1/2)2=0.0025(0.1/2)2=0.0025(0.1/2)^2 = 0.0025。由于仪器制造商的规范,我们假设分布在0.0025处具有明确定义且相当窄的峰(例如,反伽马)。实际上,我们可以将其固定为0.0025;但是,数据模型错误也可能具有其他不确定性因素(第7.1节)。为避免过程模型错误可能引起的可识别性问题,建模人员应尽可能减少《科学》杂志的不确定性,包括进行旨在复制数据的辅助研究,这一点非常重要。 有谁知道如上所述获得先验值的一般程序是什么(尽管该段仅涉及获得先验均值)?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.