统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
我可以使用引导程序,为什么或为什么不呢?
我目前正在使用卫星图像进行生物量估算。我将快速定义问题的背景,然后解释我正在处理的统计问题。 背景 问题 我正在尝试估算法国某个地区的生物量。我的回答是the木体积密度(),它或多或少与生物量成正比(取决于木材密度...)。m3/ham3/ham^3/ha 我拥有的独立变量是从该地区测得的反射率得出的植被指数(本研究中使用的卫星对于那些了解卫星的人是MODIS)。这些索引例如是NDVI,EVI等。我有这些索引的地图,这些地图的分辨率为250m。 这些指数与同一森林类型(生物群落和气候)的体积之间有很强的相关性。因此,我尝试根据我知道体积的库存图上的这些指标(实际上是它们的时间序列)对体积密度进行回归。 森林清单 这些地块的体积通过以下抽样方法估算: 库存节点放置在覆盖该区域的常规网格上。 在每个节点上都有一个图,并且在该图上进行了清单处理(树类型,体积,树冠高度等)。当然,我只对库存图感兴趣,而我的植被指数的值就是包含该图的像素的值。 图中的库存过程如下: 在15m半径的圆中测量直径> 37.5cm的树木 在9m半径的圆中测量直径大于22.5cm的树木 在6m半径的圆中测量直径大于7.5cm的树木 然后使用膨胀系数计算体积密度。 对于每个图,我都可以访问所有测量树的数据。 而且,对于每棵单棵树,由于使用了异速方程,我对体积不确定(让我们说10%)。 统计数据很重要的地方... 为了使回归更加准确,我需要针对每个体积估计值使用该度量的方差/ CI。IMO,这取决于采样的树木数量和找到的体积密度。 所以我有两个问题: 如何解释我的植被指数在250m像素上测量的事实? 我可以假设体积密度在一个像素上是恒定的,并且可以通过一个库存图对该像素进行采样。 如何估算我的体积密度的变化性? 我想我可以在树上使用引导程序。但是我测量的树木总数可能很小(从7到20 ...)。此外,我如何考虑到我根据树木的大小在不同圆圈上测量树木的事实?如果查看整个像素,变异性应如何变化? 我还以为我可以使用蒙特卡洛模拟来模拟一个森林,然后用图解法对该森林进行随机采样,以查看发生了什么... 我没有很强的统计背景,所以我有点迷路!
10 bootstrap 

2
如何使用BUGS / JAGS / STAN为比例建模?
我正在尝试建立一个模型,其中回应是一个比例(实际上是政党在选区中获得的选票份额)。它的分布不正常,因此我决定使用beta分布对其进行建模。我也有几个预测指标。 但是,我不知道如何用BUGS / JAGS / STAN编写它(JAGS是我最好的选择,但这并不重要)。我的问题是我通过预测变量对参数求和,但是该怎么办呢? 代码将是这样的(使用JAGS语法),但是我不知道如何“链接” y_hat和y参数。 for (i in 1:n) { y[i] ~ dbeta(alpha, beta) y_hat[i] <- a + b * x[i] } (y_hat只是参数和预测变量的乘积,因此是确定性关系。a并且b是我试图估计的系数,x作为预测变量)。 感谢您的建议!

2
为什么分布很重要?
这可能和在该论坛上提出过的最愚​​蠢的问题一样,但是在收到上一个问题的合理答案后,我想我会再次运气。 一段时间以来,我一直对统计分布的重要性感到困惑,特别是因为它们与资产收益有关,更具体地说与资产分配有关。 我要具体说明的问题是:假设我有20年的标准普尔500指数月度回报数据,为什么在我可以简单地进行资产分配决策时,为什么我需要假设某种分配形式(即正态分布/约翰逊/征税飞行等)?只是根据我拥有的历史数据做出资产分配决策?

1
统计测试建议
我需要在以下方面找到适当的统计检验(似然比检验,t检验等):让是一个随机向量的IID样品(X ; Ý ),并假定(Ý X)〜Ñ [ (μ 1 μ 2),(1 0.5 0.5 1) ]。的假设是: H ^ 0 = μ 1 + μ{Xi;Y一世}ñ我= 1{X一世;ÿ一世}一世=1个ñ\{X_i;Y_i\}^n_{i=1}(X; ÿ)(X;ÿ)(X;Y)(是X)(ÿX)\bigl( \begin{smallmatrix} Y\\ X \end{smallmatrix} \bigr)ññN [ (μ1个μ2),(1.5.51个) ][(μ1个μ2),(1个.5.51个)]\left[\bigl( \begin{smallmatrix} \mu_1\\ \mu_2 \end{smallmatrix} \bigr), \bigl( \begin{smallmatrix} 1 & .5\\ .5 & 1 \end{smallmatrix} \bigr) \right] ; ħ …

1
在无病生存分析中如何处理死亡?
如果我有无病生存数据(定义为是否已诊断出特定疾病以及事件发生的时间或后续损失)以及总体生存数据,那么我该如何处理在没有疾病的情况下发生的死亡疾病事件?是否对这些患者进行了检查?还是应该从无病生存(dfs)分析中排除此类患者?我计划针对几种特定类型的疾病分别进行dfs分析。


3
当零假设为
我想对来自二项式数据的单个样本进行功效分析,H0:p=0H0:p=0H_0: p = 0,而H1:p=0.001H1:p=0.001H_1: p = 0.001,其中ppp是总体中成功的比例。如果0&lt;p&lt;10&lt;p&lt;10 < p <1,我可以使用任一的正态近似二项式,或χ2χ2\chi^2 -test,但与p=0p=0p =0,这些都失败。我很想知道是否可以进行这种分析。我非常感谢您的任何建议,评论或参考。非常感谢!

2
评估一阶马尔可夫链的聚类
我将数千个一阶马尔可夫链的数据集聚为大约10个聚类。 有什么推荐的方法可以评估这些集群,并找出集群中的项目共享以及它们与其他集群有何不同?因此,我可以这样说:“集群A中的进程一旦到达状态,往往会保持在状态Y,而其他集群中的进程则不是如此。” 这些马尔可夫链的过渡矩阵太大,以至于无法“看得见”。如果可以的话,它们相对稀疏。 我的想法是将所有过渡矩阵汇总为一个簇,对其求和并将其绘制为图片中的强度(从0到255的比例)。还有什么我应该尝试的“专业”吗?

1
为什么Anova()和drop1()为GLMM提供了不同的答案?
我有以下形式的GLMM: lmer(present? ~ factor1 + factor2 + continuous + factor1*continuous + (1 | factor3), family=binomial) 当我使用时drop1(model, test="Chi"),我得到的结果与Anova(model, type="III")从汽车包装或汽车上获得的结果不同summary(model)。后两个给出相同的答案。 通过使用大量虚构数据,我发现这两种方法通常没有区别。对于平衡线性模型,不平衡线性模型(不同组中的n不相等)和平衡广义线性模型,它们给出相同的答案,但对于平衡广义线性混合模型,它们给出相同的答案。因此看来,只有在包括随机因素的情况下,这种矛盾才会显现出来。 为什么这两种方法之间存在差异? 使用GLMM时应使用Anova()还是drop1()应使用? 至少就我的数据而言,两者之间的差异很小。哪一个使用都重要吗?
10 r  anova  glmm  r  mixed-model  bootstrap  sample-size  cross-validation  roc  auc  sampling  stratification  random-allocation  logistic  stata  interpretation  proportion  r  regression  multiple-regression  linear-model  lm  r  cross-validation  cart  rpart  logistic  generalized-linear-model  econometrics  experiment-design  causality  instrumental-variables  random-allocation  predictive-models  data-mining  estimation  contingency-tables  epidemiology  standard-deviation  mean  ancova  psychology  statistical-significance  cross-validation  synthetic-data  poisson-distribution  negative-binomial  bioinformatics  sequence-analysis  distributions  binomial  classification  k-means  distance  unsupervised-learning  euclidean  correlation  chi-squared  spearman-rho  forecasting  excel  exponential-smoothing  binomial  sample-size  r  change-point  wilcoxon-signed-rank  ranks  clustering  matlab  covariance  covariance-matrix  normal-distribution  simulation  random-generation  bivariate  standardization  confounding  z-statistic  forecasting  arima  minitab  poisson-distribution  negative-binomial  poisson-regression  overdispersion  probability  self-study  markov-process  estimation  maximum-likelihood  classification  pca  group-differences  chi-squared  survival  missing-data  contingency-tables  anova  proportion 

1
高阶矩的高斯似分布
对于均值和方差未知的高斯分布,标准指数族形式的充分统计量为。我的分布具有,其中N有点像设计参数。这种足够的统计向量是否有相应的已知分布?我需要此分布中的样本,因此从分布中获取准确的样本对我来说至关重要。非常感谢。ţ (X )= (X ,X 2,。。。,X 2 Ñ)Ť(x )= (x ,x2)T(x)=(x,x2)T(x)=(x,x^2)Ť(x )= (x ,x2,。。。,X2 N)T(x)=(x,x2,...,x2N)T(x)=(x,x^2,...,x^{2N})

3
“学习模型”一词从何而来
我经常听到这里的数据挖掘者使用这个术语。作为从事分类问题的统计学家,我熟悉术语“训练分类器”,并且我认为“学习模型”的意思是相同的。我不介意“训练分类器”。这似乎描绘了拟合模型的想法,因为训练数据用于获得模型参数的良好或“改进的”估计。但是,学习会获得知识。用简单的英语来说,“学习模型”就是要知道它是什么。但是实际上,我们从不“知道”模型。模型近似于现实,但没有模型是正确的。就像Box所说的:“没有正确的模型,但有些有用。” 我想听听数据挖掘者的回应。该术语是如何产生的?如果使用它,为什么喜欢它?

2
如何根据孤立子分布生成数字?
的孤子分布是在一组离散的概率分布与概率质量函数{1,…,N}{1,…,N}\{1,\dots, N\} p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N}p(1)=1N,p(k)=1k(k−1)for k∈{2,…,N} p(1)=\frac{1}{N},\qquad p(k)=\frac{1}{k(k-1)}\quad\text{for }k\in\{2,\dots, N\} 我想将其用作LT代码实现的一部分,理想情况下是在有统一随机数生成器的Python中使用。

1
先验条件不正确的贝叶斯因素
我有一个关于使用贝叶斯因子进行模型比较的问题。在许多情况下,统计学家对使用贝叶斯方法使用不适当的先验条件(例如某些Jeffreys先验条件和参考先验条件)感兴趣。 我的问题是,在模型参数的后验分布定义明确的情况下,在使用不正确的先验条件下使用贝叶斯因子比较模型是否有效? 作为一个简单的示例,请考虑将普通模型与Logistic模型与Jeffreys Priors进行比较。

2
对置信区间感到困惑
我对置信区间的概念感到困惑。具体地说,假设有一个高斯变量与σ已知的,并且我对所述下限μ 大号平均值的与95 %的置信水平。X〜ñ(μ ,σ)X∼N(μ,σ)X \sim N(\mu, \sigma)σσ\sigmaμ大号μL\mu_L95 %95%95\% 我将进行次实验,并观察X 1,X 2,X 3,X 4,X 5。555X1个X1X_1X2X2X_2X3X3X_3X4X4X_4X5X5X_5 选项1:我单独处理每个样品,我可以计算每个X 我。然后,我想有一些方法(我不知道如何)来计算实际低这些势必5 μ 大号的。μ大号= X一世- σžμL=Xi−σz\mu_L = X_i - \sigma zX一世XiX_iμ大号μL\mu_L 选项2:在另一方面,如果我采取,我可以计算μ 大号 = Ť - σ / √Ť= (X1个+ X2+ X3+ X4+ X5)/ 5T=(X1+X2+X3+X4+X5)/5T = (X_1+X_2+X_3+X_4+X_5)/5。(假设T正常,我们也可以使用t-stat。)μL=T−σ/5–√zμL=T−σ/5z\mu_L = T - \sigma/\sqrt{5}zTTT 除了选项2之外,是否还有其他方法可以基于样本计算下限?对于选项1,是否有一种方法可以基于计算出的5个下限来计算下限?555

1
校正正态分布的时钟精度
我有一个实验,该实验在分布于世界各地的数百台计算机上执行,以测量某些事件的发生。这些事件彼此依赖,因此我可以按升序对它们进行排序,然后计算时间差。 事件应该按指数分布,但是当绘制直方图时,这就是我得到的: 计算机上时钟的不精确性导致某些事件的时间戳早于它们所依赖的事件的时间戳。 我想知道是否可以将时钟同步归咎于PDF的峰值不为0(它们将整个对象向右移)吗? 如果时钟差异是正态分布的,我是否可以仅假设效果会相互补偿,从而仅使用计算出的时间差?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.