统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

5
贝叶斯计量经济学教科书
我正在寻找一本关于贝叶斯计量经济学的理论上严格的教科书,假定对频密主义计量经济学有扎实的理解。 我想为每个答案建议一项工作,以便可以单独对建议进行投票或否决。


3
掷骰子的公式(非蛮力)
首先,我不确定该问题应该发布在哪里。我问一个统计问题是否是NP-Complete,如果不能以编程方式解决它。我将其发布在这里是因为统计问题是中心问题。 我正在尝试找到解决问题的更好公式。问题是:如果我有4d6(4个普通的6面骰子)并全部掷出,请移除一个具有最低编号的骰子(称为“掉落”),然后将剩余的3个相加,得出每个可能结果的概率是多少?我知道答案是这样的: Sum (Frequency): Probability 3 (1): 0.0007716049 4 (4): 0.0030864198 5 (10): 0.0077160494 6 (21): 0.0162037037 7 (38): 0.0293209877 8 (62): 0.0478395062 9 (91): 0.0702160494 10 (122): 0.0941358025 11 (148): 0.1141975309 12 (167): 0.1288580247 13 (172): 0.1327160494 14 (160): 0.1234567901 15 (131): 0.1010802469 16 (94): 0.0725308642 17 (54): 0.0416666667 …
14 dice  np 

2
如何解释泊松GLM结果中的参数估计值[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 5年前关闭。 Call: glm(formula = darters ~ river + pH + temp, family = poisson, data = darterData) Deviance Residuals: Min 1Q Median 3Q Max -3.7422 -1.0257 0.0027 0.7169 3.5347 Coefficients: Estimate Std.Error z value Pr(>|z|) (Intercept) 3.144257 0.218646 14.381 < 2e-16 *** riverWatauga -0.049016 0.051548 -0.951 0.34166 …



3
k-均值聚类分析后方差分析的适当性
经过K均值分析后,方差分析表后面的通知表明,不应将显着性水平视为相等均值的检验,因为已基于欧几里得距离得出了最大距离的聚类解。我应该使用哪种测试来显示聚类变量的均值在聚类之间是否不同?我已经在k均值输出提供的ANOVA表中看到了此警告,但是在某些参考资料中,我看到正在运行事后ANOVA测试。我是否应该忽略k均值ANOVA输出,并使用事后测试运行单向ANOVA并以传统方式解释它们?还是我只能暗示F值的大小,哪些变量对差异的贡献更大?另一个困惑是,聚类变量不是违反ANOVA的假设而呈正态分布,那么我可以使用Kruskal-Wallis非参数检验,但是它具有关于相同分布的假设。特定变量的集群间分布似乎并不相同,有些正偏,有些则负...我有1275个大样本,5个聚类,10个以PCA分数衡量的聚类变量。
14 anova  k-means 


2
推导二元泊松分布
我最近遇到了双变量Poisson分布,但是对于如何导出它有点困惑。 分布由下式给出: P(X=x,Y=y)=e−(θ1+θ2+θ0)θx1x!θy2y!∑i=0min(x,y)(xi)(yi)i!(θ0θ1θ2)iP(X=X,ÿ=ÿ)=Ë-(θ1个+θ2+θ0)θ1个XX!θ2ÿÿ!∑一世=0米一世ñ(X,ÿ)(X一世)(ÿ一世)一世!(θ0θ1个θ2)一世P(X = x, Y = y) = e^{-(\theta_{1}+\theta_{2}+\theta_{0})} \displaystyle\frac{\theta_{1}^{x}}{x!}\frac{\theta_{2}^{y}}{y!} \sum_{i=0}^{min(x,y)}\binom{x}{i}\binom{y}{i}i!\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)^{i} 据我所知,在θ0θ0\theta_{0}项之间的相关性的测量XXX和YÿY ; 因此,当XXX和YÿY是独立的,θ0=0θ0=0\theta_{0} = 0和分配简单地变成两个单变量泊松分布的产物。 考虑到这一点,我的困惑是基于求和项-我假设该项解释了XXX和之间的相关性YÿY。 在我看来,该加数构成某种其中“成功”的概率由下式给出二项式累积分布函数的产品(θ0θ1θ2)(θ0θ1个θ2)\left(\frac{\theta_{0}}{\theta_{1}\theta_{2}}\right)和“失败”的概率由下式给出i!1min(x,y)−i一世!1个米一世ñ(X,ÿ)-一世i!^{\frac{1}{min(x,y)-i}},因为(i!1min(x,y)−i!)(min(x,y)−i)=i!(一世!1个米一世ñ(X,ÿ)-一世!)(米一世ñ(X,ÿ)-一世)=一世!\left(i!^{\frac{1}{min(x,y)-i!}}\right)^{(min(x,y)-i)} = i!,但我可能与此相去甚远。 有人可以提供一些有关如何导出这种分布的帮助吗?同样,如果可以将其包含在任何答案中,那么如何将模型扩展到多变量场景(例如三个或更多随机变量),那就太好了! (最后,我已经注意到,之前有一个类似的问题(了解二元泊松分布),但实际上并未对此推导进行探讨。)

2
AIC,BIC和GCV:在惩罚回归方法中做出决策的最佳方法是什么?
我的一般理解是AIC处理模型的拟合优度和模型的复杂性之间的权衡。 一个我C= 2 k - 2 l n (L )AIC=2k−2ln(L)AIC =2k -2ln(L) ķkk =模型中的参数数量 大号LL =可能性 贝叶斯信息准则BIC与AIC密切相关.AIC对参数数量的惩罚程度不如BIC。我可以看到这两个在历史上到处都有使用。但是广义交叉验证(GCV)对我来说是新的。GCV如何与BIC或AIC相关?这些标准如何一起或单独用于在像ridge这样的面板回归中选择惩罚项? 编辑: 这是一个思考和讨论的示例: require(lasso2) data(Prostate) require(rms) ridgefits = ols(lpsa~lcavol+lweight+age+lbph+svi+lcp+gleason+pgg45, method="qr", data=Prostate,se.fit = TRUE, x=TRUE, y=TRUE) p <- pentrace(ridgefits, seq(0,1,by=.01)) effective.df(ridgefits,p) out <- p$results.all par(mfrow=c(3,2)) plot(out$df, out$aic, col = "blue", type = "l", ylab = …

2
嵌套交叉验证的使用
Scikit Learn的“模型选择”页面提到了嵌套交叉验证的使用: >>> clf = GridSearchCV(estimator=svc, param_grid=dict(gamma=gammas), ... n_jobs=-1) >>> cross_validation.cross_val_score(clf, X_digits, y_digits) 并行执行两个交叉验证循环:一个由GridSearchCV估计器设置gamma,另一个由cross_val_score来测量估计器的预测性能。所得分数是对新数据的预测分数的无偏估计。 据我了解,clf.fit将原生使用交叉验证来确定最佳伽玛值。在那种情况下,为什么我们需要使用上面给出的嵌套cv?该说明提到嵌套的cv会生成预测分数的“无偏估计”。难道不是clf.fit吗? 另外,我无法从该cross_validation.cross_val_score(clf, X_digits, y_digits)过程中获得clf最佳估计。您能告诉我该怎么做吗?

1
为什么要使用参数引导程序?
我目前正在设法弄清有关参数引导程序的一些事情。大多数事情可能都很琐碎,但我仍然认为我可能错过了一些东西。 假设我想使用参数引导程序获取数据的置信区间。 因此,我有此样本,并假设其为正态分布。那么我估计方差v和平均米,并得到我的分布估计P,这显然只是ñ (米,v)。v^v^\hat{v}m^m^\hat{m}P^P^\hat{P}N(m^,v^)N(m^,v^)N(\hat{m},\hat{v}) 除了从该分布中采样外,我还可以分析地计算分位数并完成。 a)我得出结论:在这种微不足道的情况下,参数引导程序是否与在正态分布假设中计算事物相同? 因此,从理论上讲,只要我能处理计算,所有参数自举模型都是如此。 b)我得出结论:使用一定分布的假设将使我在参数引导程序上获得比非参数引导程序更高的准确性(如果正确的话)。但是除此之外,我之所以这样做,是因为我无法处理分析计算而无法尝试模拟我的分析方法吗? c)如果计算通常是使用近似值完成的,我也将使用它,因为这可能会给我带来更高的准确性...? 对我来说,(非参数)引导程序的好处似乎在于我不需要假设任何分布。对于参数引导程序,该优势已经消失了-还是我错过了某些事情,而参数引导程序在哪些方面提供了上述优势?

2
为什么通过Bartlett检验诊断的球形度表示PCA不适当?
我了解Bartlett检验与确定您的样本是否来自方差相等的总体有关。 如果样本来自方差相等的总体,则我们无法拒绝检验的原假设,因此,主成分分析是不合适的。 我不确定这种情况(具有同方差数据集)的问题在哪里。拥有所有数据的基础分布都相同的数据集会出现什么问题?如果存在这种情况,我只是没什么大不了的。为什么这会使PCA不合适? 我似乎无法在网上找到任何好的信息。有人解释这一测试为何与PCA有关的经验吗?

3
R:我在gbm和RandomForest的部分依赖图中看到了什么?
实际上,我以为我已经理解了一个可以显示具有部分依赖图的图,但是使用一个非常简单的假设示例,我很困惑。在下面的代码块中,我生成了三个自变量(a,b,c)和一个因变量(y),其中c与y呈紧密线性关系,而a和b与y不相关。我使用R包使用增强的回归树进行回归分析gbm: a <- runif(100, 1, 100) b <- runif(100, 1, 100) c <- 1:100 + rnorm(100, mean = 0, sd = 5) y <- 1:100 + rnorm(100, mean = 0, sd = 5) par(mfrow = c(2,2)) plot(y ~ a); plot(y ~ b); plot(y ~ c) Data <- data.frame(matrix(c(y, a, b, …

1
内核带宽:Scott与Silverman的规则
谁能用简单的英语解释带宽选择的斯科特和西尔弗曼经验法则之间的区别是什么?具体来说,什么时候比另一种更好?它与基础分布有关吗?样品数量? PS:我指的是SciPy中的代码。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.