统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
您如何抽样人口有关系吗?
我有一个混合桶,里面装有无限量的大理石。大桶中有无数的大理石,但它们仅以一些未知但数量有限的品种出现: 是未知的,对于,绘制型大理石比绘制型大理石更有可能。V={v1,v2,v3,...,vk}V={v1,v2,v3,...,vk}\mathcal{V} = \{v_{1},v_{2},v_{3},...,v_{k}\} kkki≠ji≠ji\neq jviviv_ivjvjv_j 在一个实验中,一台机器使用某种未知程序对桶进行采样。该机器从其样本中报告一组描述了种大理石: XXXq≤kq≤kq\leq kX⊆V;|X|=qX⊆V;|X|=q X \subseteq \mathcal{V}; \quad |X|=q 重复该实验的试验(各个试验中的是固定的),我们得到,的子集序列。qqqVV\mathcal{V}(X1,X2,…)(X1,X2,…)(X_1,X_2,\dots) 我们知道的唯一其他事情是: 审判是独立且相同的 机器报告样品中前最常见的品种qqq 我们确切地不知道机器如何采样大理石。它可以选择大量弹珠,然后报告最频繁的。或者,它可以继续拾取大理石,直到有品种为止。它也可以做其他事情。qqqqqq 我们的试验会受到机器采样程序的影响?(X1个,X2,… )(X1个,X2,…)(X_1,X_2,\dots)

2
如何通过对R中使用optim最大化对数似然函数所估计的参数进行分析,从而估计出95%的置信区间?
如何通过对R中使用optim最大化对数似然函数所估计的参数进行分析,从而估计出95%的置信区间? 我知道我可以通过反转hessian渐近估计协方差矩阵,但我担心我的数据不符合该方法有效所需的假设。我希望使用其他方法来估计置信区间。 如Stryhn和Christensen以及Venables和Ripley的MASS书第8.4节,第220-221页中所述,轮廓似然方法是否合适? 如果是这样,是否有任何软件包可以帮助我在R中做到这一点?如果没有,这种方法的伪代码将是什么样?

1
如何从R零膨胀计数数据回归中获得标准误差?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 以下代码 PredictNew <- predict (glm.fit, newdata = Predict, X1 =X1, Y1= Y1, type = "response", se.fit = TRUE) 产生3列data.frame--PredictNew,拟合值,标准误差和残差标度项。 完美...但是使用的模型配备zeroinfl {pscl}: PredictNew <- predict (zeroinfl.fit, newdata = Predict, X1 =X1, Y1= Y1, type = "response", se.fit = TRUE) 要么 PredictNew <- predict (zeroinfl.fit, newdata = Predict, …

1
非中心指数分布的期望对数值
假设 XXX 与位置呈非中心指数分布 kkk 和率 λλ\lambda。那是什么E(log(X))E(log⁡(X))E(\log(X))。 我知道 k=0k=0k=0, 答案是 −log(λ)−γ−log⁡(λ)−γ-\log(\lambda) - \gamma 哪里 γγ\gamma是Euler-Mascheroni常数。那什么时候k>0k>0k > 0?

1
模拟分布
我正在进行能力规划任务,并且已经阅读了一些书籍。这特别是关于分布。我用R 建议使用什么方法来确定我的数据分布是什么?有统计方法可以识别它吗? 我有这张图。 使用R有哪些可用的模拟方法?在这里,我想为特定分布(例如指数)生成数据。如果我想将r-java与Java集成,它是正确的方法吗? 当我通过管道传输特定分布的数据时,是否可以预测效果(CPU使用率等)的分布?发送某些数据分布有什么不同的影响? 请考虑这些作为初学者的问题。是否有涉及此类模拟的书籍或材料? 笔记 该图摘自论文的结尾http://people.stern.nyu.edu/adamodar/pdfiles/papers/probabilistic.pdf。 我遇到过的健身技巧 拟合优度评估 卡方 柯尔莫哥洛夫-斯米尔诺夫, Anderson-Darling统计密度,CDF,PP和QQ图 如果我发现我的分布是正态分布或指数分布等,我不确定该怎么解释或下一步应该做些什么?它可以做什么?预测?希望这个问题清楚。 根据我的尼尔·冈瑟(Neil Gunther)的《能力规划》一书,指数延迟会导致队列波动。所以我知道这一点。

1
有没有一种方法可以只估计分位数来估计分布参数?
如果只给几个分位数,有没有一种方法可以拟合指定的分布? 例如,如果我告诉您我有一个伽玛分布数据集,则经验的 20%,30%,50%和90%分位数分别是: 20% 30% 50% 90% 0.3936833 0.4890963 0.6751703 1.3404074 我将如何估算参数?有多种方法可以做到这一点,还是已经有一个特定的程序? 更多编辑:我没有特别要求伽玛分布,这只是一个例子,因为我担心我无法适当地解释我的问题。我的任务是给定一些(2-4)个分位数,并希望估计一些分布的(1-3)参数尽可能“接近”。有时候有一个(或无限)精确的解决方案,有时却没有,对吧?

2
关于克里金的困惑
我正在阅读这篇有关克里金法的维基百科文章。我不明白那部分,当它说 克里格计算最佳线性无偏估计,,的使得克里格的与所述无偏性条件最小化方差。我没有得到推导,也没有得到方差如何最小化。有什么建议么?Z^(x0)ž^(X0)\hat Z (x_0)Z(x0)ž(X0)Z(x_0) 特别地,在没有偏见的情况下,我没有得到尽量减少应用的部分。 我认为应该 是E [Z'(x0)-Z(x0)]而不是E [Z'(x)-Z(x)]。'等同于Wiki文章中的hat。我也没有得到克里金法误差的推导方式


2
每个组中的相关性是否显着,但总体上无关紧要?
假设我们测试变量之间的Pearson相关性 XXx和在和。相关性在和每个中是否可能都是有效的,但当将两组数据组合在一起时却不重要吗?在这种情况下,请您提供一个解释。ÿÿy一个一个A乙乙B(x ,y)(X,ÿ)(x,y)一个一个A乙乙B

1
iid(均匀或正态)数据的特征值估计分布
假设我有一个数据集 ddd 尺寸(例如 d= 20d=20d=20),以便每个维度都是iid X一世〜ü[ 0 ; 1 ]Xi∼U[0;1]X_i \sim U[0;1] (或者,每个维度 Xi∼N[0;1]Xi∼N[0;1]X_i \sim \mathcal N[0;1]),并且彼此独立。 现在,我从该数据集中绘制一个随机对象,并采用 k=3⋅dk=3⋅dk=3\cdot d最近的邻居,并在此集合上计算PCA。与人们可能期望的相反,特征值并不完全相同。在20个尺寸统一的情况下,典型结果如下所示: 0.11952316626613427, 0.1151758808663646, 0.11170020254046743, 0.1019390988585198, 0.0924502502204256, 0.08716272453538032, 0.0782945015348525, 0.06965903935713605, 0.06346159593226684, 0.054527131148532824, 0.05346303562884964, 0.04348400728546128, 0.042304834600062985, 0.03229641081461124, 0.031532033468325706, 0.0266801529298156, 0.020332085835946957, 0.01825531821510237, 0.01483790669963606, 0.0068195084468626625 对于正态分布数据,结果似乎非常相似,至少在将它们重新缩放为总和为 111 ( N[0;1]dN[0;1]d\mathcal N[0;1]^d 分布显然首先具有较高的方差)。 我想知道是否有任何结果可以预测这种行为?我正在寻找测试该特征值序列是否一定规律,多少特征值符合预期以及哪些特征值与预期值明显不同的方法。 对于给定的(小)样本量 kkk,如果两个变量的相关系数显着,是否有结果?即使是iid变量,有时偶尔也会得到非0的结果kkk。


1
缺少预测变量的多元回归
假设我们得到了以下形式的一组数据 (y,X1个,X2,⋯ ,Xñ)(y,x1,x2,⋯,xn)(y,x_{1},x_{2},\cdots, x_{n}) 和 (y,X1个,X2,⋯ ,Xn − 1)(y,x1,x2,⋯,xn−1)(y,x_{1},x_{2},\cdots, x_{n-1})。我们被赋予了预测的任务ÿyy 根据的值 Xxx。我们估计两个回归,其中: ÿÿ=F1个(X1个,⋯ ,Xn − 1,Xñ)=F2(X1个,⋯ ,Xn − 1)(1)(2)(1)y=f1(x1,⋯,xn−1,xn)(2)y=f2(x1,⋯,xn−1) \begin{align} y &=f_{1}(x_{1},\cdots, x_{n-1}, x_{n}) \tag{1} \\ y &=f_{2}(x_{1},\cdots, x_{n-1}) \tag{2} \end{align} 我们还估计了一个回归,该回归预测了 Xñxnx_{n} 根据的值 (X1个,⋯ ,Xn − 1)(x1,⋯,xn−1)(x_{1},\cdots, x_{n-1}), 那是: Xñ=F3(X1个,⋯ ,Xn − 1)(3)(3)xn=f3(x1,⋯,xn−1) x_{n}=f_{3}(x_{1},\cdots, x_{n-1}) \tag{3} 假设现在给我们的值为 (X1个,⋯ ,Xn …

3
随机森林回归中依赖于响应分布的偏差
我正在使用R(2.1.3版,4.6-2版的ForestForest)中的randomForest软件包进行回归,并注意到我的结果存在明显偏差:预测误差取决于响应变量的值。高值被低估,而低值被高估。起初,我怀疑这是我的数据的结果,但是以下简单示例表明这是随机森林算法所固有的: n = 1000; x1 = rnorm(n, mean = 0, sd = 1) response = x1 predictors = data.frame(x1=x1) rf = randomForest(x=predictors, y=response) error = response-predict(rf, predictors) plot(x1, error) 我怀疑偏差取决于响应的分布,例如,如果x1是均匀分布的,则没有偏差;如果x1是指数分布,则偏差是单边的。本质上,正态分布尾部的响应值是异常值。模型很难预测离群值也就不足为奇了。在randomForest的情况下,来自分布尾部的极高幅度的响应值不太可能最终出现在末端叶片中,并且其效果将在集合平均中被淘汰。 请注意,我尝试在前面的示例“ R线性回归尾部mtry中的RandomForest”中捕获此效果。这是一个不好的例子。如果以上示例中的偏差确实是该算法固有的,则可以得出这样的偏差校正值:给定一个正试图预测的响应分布,从而可以进行更准确的预测。 基于树的方法(例如随机森林)是否受到响应分布偏差的影响?如果是这样,这是统计界先前所知的,通常如何进行校正(例如,使用偏倚模型的残差作为输入的第二个模型)? 校正依赖于响应的偏差很困难,因为从本质上来说,响应是未知的。不幸的是,估计/预测响应通常与偏见没有相同的关系。

2
混合模型的参数,半参数和非参数引导
接下来的嫁接摘自本文。我是新手,要引导并尝试为带有R boot包的线性混合模型实现参数,半参数和非参数自举。 R代码 这是我的R代码: library(SASmixed) library(lme4) library(boot) fm1Cult <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=Cultivation) fixef(fm1Cult) boot.fn <- function(data, indices){ data <- data[indices, ] mod <- lmer(drywt ~ Inoc + Cult + (1|Block) + (1|Cult), data=data) fixef(mod) } set.seed(12345) Out <- boot(data=Cultivation, statistic=boot.fn, R=99) Out 问题 …
9 r  mixed-model  bootstrap  central-limit-theorem  stable-distribution  time-series  hypothesis-testing  markov-process  r  correlation  categorical-data  association-measure  meta-analysis  r  anova  confidence-interval  lm  r  bayesian  multilevel-analysis  logit  regression  logistic  least-squares  eda  regression  notation  distributions  random-variable  expected-value  distributions  markov-process  hidden-markov-model  r  variance  group-differences  microarray  r  descriptive-statistics  machine-learning  references  r  regression  r  categorical-data  random-forest  data-transformation  data-visualization  interactive-visualization  binomial  beta-distribution  time-series  forecasting  logistic  arima  beta-regression  r  time-series  seasonality  large-data  unevenly-spaced-time-series  correlation  statistical-significance  normalization  population  group-differences  demography 


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.