统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

5
证明OLS估计量是尺度相等的吗?
我没有尺度等方差的正式定义,但是这是《统计学习入门》在p上对此的描述。217: 标准最小二乘系数...是等比例的:将乘以常数只会导致将最小二乘系数估计值按比例缩放。XĴXĴX_jCCc1 / c1个/C1/c 为简单起见,我们假设通用线性模型,其中,是矩阵(其中),其中,和是具有的实值随机变量的维向量。- [R β &Element; [R p + 1 ε Ñ ë [ ε ] = 0 Ñ × 1ÿ = X β+εÿ=Xβ+ϵ\mathbf{y} = \mathbf{X}\boldsymbol\beta + \boldsymbol\epsilonÿ ∈ řñÿ∈[Rñ\mathbf{y} \in \mathbb{R}^NXX\mathbf{X}ñ× (p + 1 )ñ×(p+1个)N \times (p+1)p + 1 &lt; Np+1个&lt;ñp+1 < N[R[R\mathbb{R}β &Element; [Rp + 1β∈[Rp+1个\boldsymbol\beta …

2
几何均值是哪个连续分布的均值的无偏估计量?
是否存在任何可以用封闭形式表示的连续分布,其均值使得样本的几何均值是该均值的无偏估计量? 更新:我只是意识到我的样本必须是正数(否则几何平均值可能不存在),因此连续不是正确的词。对于随机变量的负值零为正值连续的分布怎么样。类似于截断的分布。

1
当岭和套索分别表现良好但产生不同系数时如何解释结果
我正在使用Lasso和Ridge来运行回归模型(以预测介于0-5之间的离散结果变量)。在运行模型之前,我使用的SelectKBest方法scikit-learn将功能集从250减少到25。如果没有初始特征选择,套索和里奇均会降低准确性得分(这可能是由于样本量小600)所致。另外,请注意,某些功能是相关的。 运行模型后,我观察到Lasso和Ridge的预测精度几乎相同。但是,当我按系数的绝对值对它们进行排序后检查前10个特征时,我发现最多有%50重叠。 也就是说,鉴于每种方法分配的特征的重要性不同,基于所选模型,我可能会有完全不同的解释。 通常,这些功能代表网站中用户行为的某些方面。因此,我想通过突出具有较强预测能力而不是较弱特征(用户行为)的特征(用户行为)来解释发现。但是,我目前不知道如何前进。我应该如何解释模型?例如,应该结合两者并突出显示重叠部分,还是我应该选择Lasso,因为它提供了更多的可解释性?


2
阅读箱须图:是否可以收集组之间的显着差异?
假设我们正在查看这个箱须图: 在周四和周五之间,我认为大多数人都会同意,睡眠时间似乎有很大差异。但是,这是一个统计上有效的猜想吗?由于周四和周五之间两个四分位数的范围都没有重叠,我们能否辨别出显着差异?星期四和星期五的上下晶须重叠的事实又如何呢?这会影响我们的分析吗? 通常伴随这样的图表是某种方差分析,但我很好奇,仅通过查看箱线图我们能说出多少组之间的差异。

2
来自汉密尔顿的ARMA(p,q)的状态空间表示
r=max(p,q+1)r=max(p,q+1)r = \max(p,q+1)yt−μ=ϕ1(yt−1−μ)+ϕ2(yt−2−μ)+...+ϕ3(yt−3−μ)+ϵt+θ1ϵt−1+...+θr−1ϵt−r+1.yt−μ=ϕ1(yt−1−μ)+ϕ2(yt−2−μ)+...+ϕ3(yt−3−μ)+ϵt+θ1ϵt−1+...+θr−1ϵt−r+1. \begin{aligned} y_t -\mu &= \phi_1(y_{t-1} -\mu) + \phi_2(y_{t-2} -\mu) + ... + \phi_3(y_{t-3} -\mu) \\ &+ \epsilon_t + \theta_1\epsilon_{t-1} + ... + \theta_{r-1}\epsilon_{t-r+1}. \end{aligned} ξt+1=⎡⎣⎢⎢⎢⎢ϕ11⋮0ϕ20⋮0…………ϕr−1001ϕr000⎤⎦⎥⎥⎥⎥ξt+⎡⎣⎢⎢⎢⎢ϵt+10⋮0⎤⎦⎥⎥⎥⎥ξt+1=[ϕ1ϕ2…ϕr−1ϕr10…00⋮⋮…0000…10]ξt+[ϵt+10⋮0] \xi_{t+1} = \begin{bmatrix} \phi_1 & \phi_2 & \dots & \phi_{r-1} & \phi_r \\ 1 & 0 & \dots & 0 & 0 …

2
如果您不能正交处理,请原始处理(多项式回归)
当执行多项式回归在,人们有时会使用原始多项式,有时正交多项式。但是当他们使用似乎完全武断的东西时。XYYYXXX 在这里和这里使用原始多项式。但是在这里和这里,正交多项式似乎给出了正确的结果。什么,怎么,为什么?! 与此相反,当从教科书(例如ISLR)中学习多项式回归时,甚至没有提到原始多项式或正交多项式-只是给出了要拟合的模型。 那么我们什么时候必须使用什么呢? 为什么,等的各个 p值在这两个值之间相差很多?X 2XXXX2X2X^2

1
SVM的一般化界限
我对支持向量机的泛化能力的理论结果感兴趣,例如,这些机器的分类错误概率和Vapnik-Chervonenkis(VC)维度的界限。但是,通读文献后,我的印象是,某些相似的重复结果往往因作者而略有不同,尤其是在一定的持有范围内需要的技术条件方面。 在下面我会记得的SVM问题和主要成果概括状态3,我已经在这种或那种形式反复发现的结构我给整个博览会3个主引用。−−- 问题设置: 假设我们有一个独立且均布的(iid)对的数据样本,其中所有,和。我们构造了一个支持向量机(SVM),该向量使,和定义的分离超平面之间的最小余量最大化。,以及之间最接近的点以便将和定义的两个类分开。我们通过引入松弛变量让SVM通过软裕度来承认一些错误(xi,yi)1≤i≤n(xi,yi)1≤i≤n(x_i,y_i)_{1\leq i\leq n}iiixi∈Rpxi∈Rpx_i \in \mathbb{R}^pyi∈{−1,1}yi∈{−1,1}y_i \in \{-1,1\}m∗m∗m^*{x:w⋅x+b=0}{x:w⋅x+b=0}\{x : w \cdot x + b = 0\}w∈Rpw∈Rpw \in \mathbb{R}^pb∈Rb∈Rb \in \mathbb{R}x1,⋯,xnx1,⋯,xnx_1,\cdots,x_ny=−1y=−1y = -1y=1y=1y = 1 -ξ1,⋯,ξnξ1,⋯,ξn\xi_1,\cdots,\xi_n −−-但为了表示简单起见,我们忽略了内核的可能性。解参数和是通过求解以下凸二次优化程序获得的:b ∗w∗w∗w^*b∗b∗b^* minw,b,ξ1,⋯,ξns.t.:12∥w∥2+C∑i=1nξiyi(w⋅xi+b)≥1−ξiξi≥0,∀i∈{1,⋯,n},∀i∈{1,⋯,n}minw,b,ξ1,⋯,ξn12‖w‖2+C∑i=1nξis.t.:yi(w⋅xi+b)≥1−ξi,∀i∈{1,⋯,n}ξi≥0,∀i∈{1,⋯,n}\begin{align} \min_{w, \, b, \, \xi_1, \, \cdots, \, \xi_n} \; & \; \frac{1}{2}\|w\|^2 + C\sum_{i=1}^n\xi_i \\ \text{s.t.} \; : \; …

2
有不确定数据的监督学习?
是否存在将监督学习模型应用于不确定数据集的现有方法?例如,假设我们有一个类别为A和B的数据集: +----------+----------+-------+-----------+ | FeatureA | FeatureB | Label | Certainty | +----------+----------+-------+-----------+ | 2 | 3 | A | 50% | | 3 | 1 | B | 80% | | 1 | 1 | A | 100% | +----------+----------+-------+-----------+ 我们如何在此基础上训练机器学习模型?谢谢。

6
贝叶斯统计MCMC的基本参考
我正在寻找一些有关贝叶斯统计基本 MCMC(带有R)的实用和理论示例的论文或书籍。我从来没有研究过模拟,这就是为什么我要寻找“基本”信息。你能给我一些建议吗?


2
如果以巧妙的方式应用收缩率,对于效率更高的估算器来说,收缩率是否始终会更好?
假设我有两个估算器和是相同参数一致估算器,并且 ,在psd的意义上为。因此,渐近比更有效。这两个估计器基于不同的损失函数。 β 2β0√βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2β0β0\beta_0n−−√(βˆ1−β0)→dN(0,V1),n−−√(βˆ2−β0)→dN(0,V2)n(β^1−β0)→dN(0,V1),n(β^2−β0)→dN(0,V2)\sqrt{n}(\widehat{\beta}_1 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_1), \quad \sqrt{n}(\widehat{\beta}_2 -\beta_0) \stackrel{d}\rightarrow \mathcal{N}(0, V_2) β 1 β 2V1≤V2V1≤V2V_1 \leq V_2βˆ1β^1\widehat{\beta}_1βˆ2β^2\widehat{\beta}_2 现在,我想寻找一些收缩技术来改善估计量的有限样本属性。 假设我发现了一种收缩技术,可以改善有限样本中的估算器,并为我提供等于的MSE值。这是否意味着我可以找到一种适用于收缩方法 ,使我的MSE 不大于? γ 2 β 1βˆ2β^2\widehat{\beta}_2γˆ2γ^2\widehat{\gamma}_2βˆ1β^1\widehat{\beta}_1 γˆ2γ^2\widehat{\gamma}_2 换句话说,如果巧妙地应用了收缩率,那么对于更高效的估算器来说,收缩率是否总是更好地工作?


1
泊松分布数据的逻辑回归
从一些机器学习笔记中讨论了一些区分性分类方法,特别是逻辑回归,其中y是类标签(0或1),而x是数据,据说: 如果x|y=0∼Poisson(λ0)x|y=0∼Poisson(λ0)x|y = 0 \sim \mathrm{Poisson}(λ_0),并且x|y=1∼Poisson(λ1)x|y=1∼Poisson(λ1)x|y = 1 \sim \mathrm{Poisson}(λ_1),则p(y|x)p(y|x)p(y|x)将是逻辑对数。 为什么会这样呢?

3
中位数在[Mode-Mean]之外的反例
此文章是我上面的联赛,但它谈论,我很感兴趣,之间的平均,模式和中位数的关系的话题。它说 : 普遍认为,单峰分布的中值“通常”在均值和众数之间。但是,并非总是如此... 我的问题:有人可以提供中位数在[众数,均值]区间之外的连续单峰(理想情况下简单)分布的示例吗?例如的分布mode &lt; mean &lt; median。 ===编辑======= Glen_b和Francis已经有了很好的答案,但是我意识到我真正感兴趣的是一个示例,其中众数&lt;均值&lt;中位数或中位数&lt;均值&lt;模式(这两个中位数都在[众数,均值]之外,而中位数是与模式均值“在同一侧”(即高于或低于模式)。我可以接受这里的答案是一个新问题,或者有人可以在这里直接提出解决方案?
11 mean  median  mode 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.