统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
拟最大似然估计(QMLE)背后的想法和直觉
问题:拟最大似然估计(QMLE;又称伪最大似然估计,PMLE)背后的思想和直觉是什么?当实际误差分布与假定误差分布不匹配时,使估算器工作的原因是什么? QMLE 的Wikipedia站点很好(简要,直观),但是我可以使用更多的直觉和细节,也许还可以作为例证。其他参考文献也很受欢迎。(我记得翻阅了很多计量经济学教科书,以寻找有关QMLE的资料,而令我惊讶的是,QMLE仅涵盖其中一到两个,例如Wooldridge “横截面和面板数据的计量经济学分析”(2010年),第13章第11节,第502-517页。)


5
两个独立的均匀随机变量之间的比率分布
Supppse XXX和YYY在标准均匀分布在[0,1][0,1][0, 1],它们是独立的,是什么的PDF Z=Y/XZ=Y/XZ = Y / X? 一些概率论教科书的答案是 fZ(z)=⎧⎩⎨1/2,1/(2z2),0,if 0≤z≤1if z>1otherwise.fZ(z)={1/2,if 0≤z≤11/(2z2),if z>10,otherwise. f_Z(z) = \begin{cases} 1/2, & \text{if } 0 \le z \le 1 \\ 1/(2z^2), & \text{if } z > 1 \\ 0, & \text{otherwise}. \end{cases} 我想知道,通过对称性,不应该fZ(1/2)=fZ(2)fZ(1/2)=fZ(2)f_Z(1/2) = f_Z(2)?根据上述PDF,情况并非如此。


2
为什么要精确使用观察到的Fisher信息?
在标准的最大似然设定(IID样品从一些分布密度˚F ý(Ý | θ 0)),并在正确指定模型的情况下,Fisher信息由下式给出ÿ1个,… ,YñY1,…,YnY_{1}, \ldots, Y_{n}Fÿ(y| θ0fy(y|θ0f_{y}(y|\theta_{0} 一世(θ )= − Eθ0[ ∂2θ2lnFÿ(θ )]I(θ)=−Eθ0[∂2θ2ln⁡fy(θ)]I(\theta) = -\mathbb{E}_{\theta_{0}}\left[\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) \right] 相对于生成数据的真实密度的期望值。我已经阅读了观察到的Fisher信息 Ĵ^(θ )= - ∂2θ2lnFÿ(θ )J^(θ)=−∂2θ2ln⁡fy(θ)\hat{J}(\theta) = -\frac{\partial^{2}}{\theta^{2}}\ln f_{y}(\theta) 之所以使用,主要是因为在某些情况下,计算(预期)Fisher信息所涉及的积分可能不可行。是什么让我困惑的是,即使积分是可行的,期望有相对于真实模型,即涉及到未知参数值取。如果是这样的情况下,它似乎不知道θ 0是不可能的计算予。这是真的?θ0θ0\theta_{0}θ0θ0\theta_{0}一世II

1
在原假设下模拟二项式检验时p值的非均匀分布
我听说在零假设下,p值分布应该是均匀的。但是,在MATLAB中进行二项式检验的仿真返回的均值分布与均值大于0.5(在这种情况下为0.518)的差异非常大: coin = [0 1]; success_vec = nan(20000,1); for i = 1:20000 success = 0; for j = 1:200 success = success + coin(randperm(2,1)); end success_vec(i) = success; end p_vec = binocdf(success_vec,200,0.5); hist(p_vec); 尝试更改生成随机数的方式无济于事。我真的很感谢在这里的任何解释。

1
Python中的Jenks自然断裂:如何找到最佳断裂数目?
我找到了Jenks Natural Breaks算法的这个Python实现,可以使其在Windows 7计算机上运行。考虑到我的地理数据的大小,它非常快并且可以在很短的时间内找到中断点。在将这种聚类算法用于数据之前,我使用的是(此处)算法。我使用KMeans遇到的问题是找到最佳K值参数,但是我“解决”了它,针对不同的K值启动了算法,并使用(此处)找到了最佳K。sklearn.clustering.KMeans sklearn.metrics.silhouette_score 我的问题是:如果我告诉Natural Breaks算法找到5个类(即K),那么如何确定这是最匹配我的数据的类数?如何验证我选择了最佳的休息时间? 谢谢!

1
重复k折交叉验证的报告差异
我一直在使用重复的k倍交叉验证,并一直报告(交叉评估的不同运行折叠倍数的平均值作为评估指标的平均值)。 但是,我不确定如何报告差异。我在这里发现了许多关于重复交叉验证的问题,但是,我所知没有一个问题明确回答了重复交叉验证测试中的方差问题。 我知道总方差是由于:1)模型的不稳定性和2)样本数量有限。 似乎有4种不同的方法可以计算出重复k倍交叉验证的方差: 1)交叉验证运行期间估计的平均性能指标(例如准确性)的方差是否是方差的有效估计? 2)通过汇总特定于运行的差异(在交叉验证测试的不同倍数中计算得出)来汇总差异。 3)将来自大型向量中交叉验证的不同折叠的分类结果串联起来。例如,如果每个折叠中的测试数据数量为10,而我的CV为10倍,则所产生的重复矢量将为100。现在,如果我将交叉验证测试重复10次,我将包含10个大小为100的向量,每个向量都包含10倍CV运行的分类结果。现在,我将像单次运行CV一样计算均值和方差。 4)我也读过(等式2和3合1),方差是外部方差和预期内部方差的总和。如果我理解正确,则外部方差是特定于重复的平均性能的方差,内部方差是交叉验证的不同倍数之间的方差。 非常感谢您的帮助和指导,以便为重复的交叉验证测试报告适当的差异。 谢谢,


2
如何解释马修斯相关系数(MCC)?
问题的答案phi,Matthews和Pearson相关系数之间的关系?表明三种系数方法都是等效的。 我不是来自统计数据,所以这应该是一个简单的问题。 Matthews的论文(www.sciencedirect.com/science/article/pii/0005279575901099)描述了以下内容: "A correlation of: C = 1 indicates perfect agreement, C = 0 is expected for a prediction no better than random, and C = -1 indicates total disagreement between prediction and observation"`. 根据Wikipedia(http://en.wikipedia.org/wiki/Pearson_product-moment_correlation_coefficient),皮尔森相关性描述为: giving a value between +1 and −1 inclusive, where: 1 is total positive correlation, …

1
变量与PCA分量(在双图/加载图上)的正确关联度量是什么?
我FactoMineR用来将我的测量数据集减少到潜在变量。 变量地图上面很清楚我解释,但是当它涉及到的变量和组件1.纵观可变地图之间的关联我很困惑,ddp并且cov非常接近在地图的组件,ddpAbs是一个远一点远。但是,这不是相关性显示的内容: $Dim.1 $Dim.1$quanti correlation p.value jittAbs 0.9388158 1.166116e-11 rpvi 0.9388158 1.166116e-11 sd 0.9359214 1.912641e-11 ddpAbs 0.9327135 3.224252e-11 rapAbs 0.9327135 3.224252e-11 ppq5 0.9319101 3.660014e-11 ppq5Abs 0.9247266 1.066303e-10 cov 0.9150209 3.865897e-10 npvi 0.8853941 9.005243e-09 ddp 0.8554260 1.002460e-07 rap 0.8554260 1.002460e-07 jitt 0.8181207 1.042053e-06 cov5_x 0.6596751 4.533596e-04 ps13_20 -0.4593369 2.394361e-02 ps5_12 -0.5237125 …

2
有关标准化岭回归的问题
大家好,我发现了一两篇使用山脊回归的论文(用于篮球数据)。如果运行ridge回归,总是被告知要标准化我的变量,但是却被告知要这样做,因为ridge是比例变量(ridge回归并不是我们课程的真正组成部分,因此我们的讲师会略过它)。 我读过的这些论文并未对它们的变量进行标准化,这让我感到有些惊讶。他们还通过交叉验证最终获得了很大的lambda值(大约在2000-4000水平),并且我被告知这是由于未对变量进行标准化。 不标准化变量到底会如何导致较高的lambda值,并且,一般而言,不标准化变量会有什么后果?真的有什么大不了的吗? 任何帮助深表感谢。


2
用于回归的多项式对比
我无法理解回归拟合中多项式对比的用法。特别是,我指的是,用于R表示此页面上描述的间隔变量(具有相等间距的正交变量)使用的编码。 在该页面的示例中,如果我理解正确的话,R适合间隔变量的模型,返回一些权重,以加权其线性,二次或三次趋势。因此,拟合模型应为: write=52.7870+14.2587X−0.9680X2−0.1554X3,write=52.7870+14.2587X−0.9680X2−0.1554X3,{\rm write} = 52.7870 + 14.2587X - 0.9680X^2 - 0.1554X^3, 其中应取的值,,,或根据不同的电平的间隔可变的。XXX111222333444 它是否正确?而且,如果是这样,多项式对比的目的是什么?

1
这种后验分布图怎么了?
我收到以下图片,该图片说明了后验概率分布是先验分布和似然分布的组合。 有人告诉我图像有问题,即后验分布不能具有似然函数形式的形式。但是我正在努力思考图像出了什么问题。 后验似乎是可能性,但是被先验分布拉到右边。这与我对应该发生的事情的理解相符,并且很有意义。有谁知道可能出什么问题了? 我唯一的想法是,后方的面积可能会比似然度下的面积略小。尽管考虑到后部的可能性似乎比可能性要大一些,但似乎提出了一个非常挑剔的方面。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.