统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
在Matlab中使用互信息进行特征选择
我正在尝试将互信息的思想应用于特征选择,如这些讲义(第5页)中所述。 我的平台是Matlab。我从经验数据计算互信息时发现的一个问题是,数字总是向上偏移。我在Matlab Central上找到了大约3〜4个不同的文件来计算MI,当我输入独立的随机变量时,它们都给出了很大的数字(例如> 0.4)。 我不是专家,但是问题似乎是,如果仅使用联合和边际密度来计算MI,则会在过程中引入偏差,因为MI从定义上说是积极的。是否有人对如何准确估计互信息有实用建议? 一个相关的问题是,在实践中,人们实际上如何使用MI选择功能?对我而言,如何得出一个阈值并不明显,因为理论上MI是无界的。还是人们只是按MI对要素进行排名并采用前k个要素?

2
多重共线性是否隐含在分类变量中?
我注意到,在修补多元回归模型时,在分类变量的类别内(当然,在排除参考类别之后),有一个很小但引人注目的多元共线性效应,以方差膨胀因子来衡量。 例如,假设我们有一个包含连续变量y和一个名义分类变量x的数据集,该变量具有k个可能的互斥值。我们将这可能的值编码为0/1虚拟变量。然后,我们运行回归模型。虚拟变量的VIF分数结果为非零。实际上,随着类别数量的增加,VIF也随之增加。使虚拟变量居中似乎不会更改VIF。x 1,x 2,… ,x k y = b 0 + b 1 x 1 + b 2 x 2 + ⋯ + b k - 1 x k - 1 k - 1ķkkX1个,X2,… ,xķx1,x2,…,xkx_1, x_2,\dots ,x_kÿ= b0+ b1个X1个+ b2X2+ ⋯ + bk − 1Xk − 1y=b0+b1x1+b2x2+⋯+bk−1xk−1y = b_0 + …

2
长尾中泊松累积分布的简单近似?
我想决定容量一个表中的,以便它具有的残留可能性小于2 - p溢出对于给定的p ∈ [ 40 ... 120 ],假设条目的数量服从泊松法与给定的预期ë ∈ [ 10 3 … 10 12 ]。CCC2- p2−p2^{-p}p ∈ [ 40 ... 120 ]p∈[40…120]p\in[40\dots 120]Ë∈ [ 103… 1012]E∈[103…1012]E\in[10^3\dots 10^{12}] 理想情况下,我想最低的整数C,使得1-CDF[PoissonDistribution[E],C] < 2^-p对于给定的p和E; 但我对其中的一些内容感到满意C。数学是人工计算罚款,但是我想计算C的p,并E在编译时,这限制了我的64位整数运算。 更新:在Mathematica(版本7)e = 1000; p = 40; c = Quantile[PoissonDistribution[e], 1 - 2^-p]中1231,似乎是正确的(感谢@Procrastinator);但是,p = 50和的结果p = 60都是1250,这在不安全的方面是错误的(而且很重要:我的实验重复次,每次25次或更多,并且我希望总的失败几率小于2 − …

1
randomForest和变量重要性错误?
我不明白的之间的差异rfobject$importance,并importance(rfobject)在MeanDecreaseAccuracy列。 例: > data("iris") > fit <- randomForest(Species~., data=iris, importance=TRUE) > fit$importance setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 0.027078501 0.019418330 0.040497602 0.02898837 9.173648 Sepal.Width 0.008553449 0.001962036 0.006951771 0.00575489 2.472105 Petal.Length 0.313303381 0.291818815 0.280981959 0.29216790 41.284869 Petal.Width 0.349686983 0.318527008 0.270975757 0.31054451 46.323415 > importance(fit) setosa versicolor virginica MeanDecreaseAccuracy MeanDecreaseGini Sepal.Length 1.277324 …

1
是否可以通过随机梯度下降从P(X)的非iid样本和P(Y | X)的iid样本中训练P(Y | X)的模型?
当在某些数据集上通过随机梯度下降训练参数化模型(例如,使似然性最大化)时,通常假设从训练数据分布中抽取训练样本。因此,如果目标是建模联合分布,则应从该分布中得出每个训练样本。P(X,Y)P(X,Y)P(X,Y)(xi,yi)(xi,yi)(x_i,y_i) 如果目标是为条件分布P(Y | X)建模P(Y|X)P(Y|X)P(Y|X),那么iid需求将如何变化(如果有的话)? 我们还必须从联合分布中抽取每个样本(xi,yi)(xi,yi)(x_i,y_i) iid吗? 我们应该从P(X)绘制xixix_i iid ,然后从P(Y | X)绘制y_i iid 吗?P(X)P(X)P(X)yiyiy_iP(Y|X)P(Y|X)P(Y|X) 我们可以从P(X)中得出xixix_i不是iid (例如随时间相关),然后从P(Y | X)中得出y_i iid 吗?P(X)P(X)P(X)yiyiy_iP(Y|X)P(Y|X)P(Y|X) 您能否评论这三种随机梯度下降方法的有效性?(或在必要时帮助我重新说明问题。) 如果可能的话,我想做#3。我的应用程序是强化学习,其中我使用参数化条件模型作为控制策略。状态序列xixix_i是高度相关的,但是从状态为条件的随机策略中,对操作yiyiy_i进行了iid采样。结果样本(xi,yi)(xi,yi)(x_i,y_i)(或它们的子集)用于训练策略。(换句话说,想象在某个环境中长时间运行控制策略,收集状态/动作样本的数据集。然后,即使状态随着时间而相互关联,动作也将根据状态独立地生成。)这是有点类似的情况提出。 我发现了一篇论文,Ryabko,2006年,“ 有条件独立数据的模式识别 ”,乍一看似乎很有意义。然而,那里的情况是从我需要什么,在这里逆转(标签/分类/动作)可以被延伸不IID,和(对象/模式/状态)从绘制IID。yiyiy_iP(Y)P(Y)P(Y)xixix_iP(X|Y)P(X|Y)P(X|Y) 更新: Ryabko论文中提到的两篇论文(此处和此处)似乎与此处相关。他们假设来自任意过程(例如,不是iid,可能是非平稳的)。他们表明,在这种情况下,最近邻估计和核估计是一致的。但是我更感兴趣的是在这种情况下基于随机梯度下降的估计是否有效。xixix_i

2
指数对数回归系数与比值比不同
据我了解,对数回归的指数贝塔值是该变量与相关因变量的比值比。但是,该值与手动计算的优势比不匹配。我的模型使用保险等其他指标预测发育迟缓(营养不良的一种衡量标准)。 // Odds ratio from LR, being done in stata logit stunting insurance age ... etc. or_insurance = exp(beta_value_insurance) // Odds ratio, manually calculated odds_stunted_insured = num_stunted_ins/num_not_stunted_ins odds_stunted_unins = num_stunted_unins/num_not_stunted_unins odds_ratio = odds_stunted_ins/odds_stunted_unins 这些值不同的概念原因是什么?控制回归中的其他因素?只是想能够解释差异。


2
IID随机法线的最大阶统计量的渐近分布
是否有一个很好的极限分布最大(X1个,X2,。。。,Xñ)最大值(X1个,X2,。。。,Xñ)\max( X_1,X_2,...,X_n) 的ññn去∞∞\infty,假定它们是独立同分布的方差正态分布σ2σ2\sigma^2。 几乎可以肯定,这是一个众所周知的问题,需要有精巧的证明和好的解决方案,但是我一直在研究并且没有发现任何东西。

1
相关随机变量加权和的“中心极限定理”
我正在读一篇声称 X^ķ= 1ñ--√∑j = 0ñ− 1XĴË- 我2 πk j / N,X^ķ=1个ñ∑Ĵ=0ñ-1个XĴË-一世2πķĴ/ñ,\hat{X}_k=\frac{1}{\sqrt{N}}\sum_{j=0}^{N-1}X_je^{-i2\pi kj/N}, (即离散傅立叶变换(DFT)表示CLT趋向于(复杂)高斯随机变量。但是,我知道通常情况并非如此。在阅读了这个(谬误的)论点之后,我在网上搜索并找到了Peligrad&Wu的2010年论文,他们证明对于某些平稳过程,人们可以找到“ CLT定理”。 我的问题是:您是否还有其他参考文献试图解决找到给定索引序列的DFT的极限分布(无论是通过模拟还是从理论上)的问题?给定在时间序列分析或非平稳序列的派生/应用中的某些协方差结构,我对收敛速度(即DFT收敛的速度)特别感兴趣。XĴXĴX_j

4
随机矩阵的稀疏诱导正则化
众所周知(例如在压缩感测领域),范数是“稀疏诱导的”,即如果我们最小化函数(对于固定矩阵A和向量→ b)f A ,→ b(→ X)= ‖ 甲→ X - → b ‖ 2 2 + λ ‖ → X ‖ 1为足够大的λ > 0,我们很可能为很多选择甲,→ bL1L1L_1AAAb⃗ b→\vec{b}fA,b⃗ (x⃗ )=∥Ax⃗ −b⃗ ∥22+λ∥x⃗ ∥1fA,b→(x→)=‖Ax→−b→‖22+λ‖x→‖1f_{A,\vec{b}}(\vec{x})=\|A\vec{x}-\vec{b}\|_2^2+\lambda\|\vec{x}\|_1λ>0λ>0\lambda>0AAAb⃗ b→\vec{b},和在结果→ x中具有许多完全为零的条目。λλ\lambdax⃗ x→\vec{x} 但是,如果我们最小化受该的条目的状态→ X为正,而总和到1,然后将大号1术语不具有任何影响(因为‖ → X ‖ 1 = 1通过法令)。在这种情况下,是否存在一个类似的L 1型正则化函数可以起作用,以鼓励生成的→ x稀疏?fA,b⃗ fA,b→f_{A,\vec{b}}x⃗ x→\vec{x}111L1L1L_1∥ X⃗ ∥1个= 1‖x→‖1=1\|\vec{x}\|_1=1大号1个L1L_1X⃗ x→\vec{x}

2
巨大峰度?
我正在对股指的每日收益进行描述性统计。也就是说,如果和分别是第1天和第2天的索引级别,则是我正在使用的收益(文献上完全标准)。P 2P1P1P_1P2P2P_2loge(P2P1)loge(P2P1)log_e (\frac{P_2}{P_1}) 因此,其中的峰度很大。我正在查看大约15年的每日数据(因此大约有时间序列观测值)260∗15260∗15260 * 15 means sds mins maxs skews kurts ARGENTINA -0.00031 0.00965 -0.33647 0.13976 -15.17454 499.20532 AUSTRIA 0.00003 0.00640 -0.03845 0.04621 0.19614 2.36104 CZECH.REPUBLIC 0.00008 0.00800 -0.08289 0.05236 -0.16920 5.73205 FINLAND 0.00005 0.00639 -0.03845 0.04622 0.19038 2.37008 HUNGARY -0.00019 0.00880 -0.06301 0.05208 -0.10580 4.20463 IRELAND 0.00003 0.00641 …

4
为什么要在差异中使用控制变量?
我对使用以下标准方程式的“差异中的差异”方法有疑问: 这里treat是治疗组和岗位的虚拟变量。 y=a+b1treat+b2post+b3treat⋅post+uy=a+b1treat+b2post+b3treat⋅post+u y= a + b_1\text{treat}+ b_2\text{post} + b_3\text{treat}\cdot\text{post} + u 现在,我的问题很简单:为什么大多数论文仍然使用其他控制变量?我认为,如果平行趋势假设是正确的,那么我们就不必担心额外的控制措施。我只能想到使用控制变量的2个可能原因: 没有它们,趋势将不会平行 因为DnD规范将治疗时治疗组和对照组之间趋势的任何差异归因于干预措施(即,交互作用术语*治疗后)-当我们不控制其他变量时,交互作用系数可能会超过-/低估了 有人可以阐明这个问题吗?我的理由1)或2)完全有意义吗?我对DnD中控制变量的使用不完全了解。



1
树状图聚类的词法相关
考虑树状图聚类的上下文。让我们称原始差异为个体之间的距离。构建完树状图后,我们将两个个体之间的同态差异定义为这些个体所属的簇之间的距离。 有人认为,原始差异和同类差异之间的相关性(称为“ 相关性相关性”)是分类的“适用性指标”。这听起来让我很困惑。我的反对意见不依赖于Pearson相关性的特定选择,而是基于这样的一般思想,即原始差异和同义差异之间的任何联系都可能与分类的适用性有关。 您是否同意我的观点,或者您是否可以提出一些论点来支持使用cophenetic相关性作为树状图分类的适用性指标?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.