统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
Facebook的先知与线性回归有什么不同吗?
因此,我对Facebook先知的了解是,它基本上将时间序列分解为趋势和季节性。例如,加性模型应写为: ÿ(t )= g(t )+ s (t )+ h (t )+ eŤÿ(Ť)=G(Ť)+s(Ť)+H(Ť)+ËŤ y(t) = g(t) + s(t) + h(t) + e_t 与 ŤŤt时间 G(吨)G(Ť)g(t)趋势(可以是线性或逻辑) s (吨)s(Ť)s(t)季节性(每天,每周,每年...) ħ (吨)H(Ť)h(t)假期 ËŤËŤe_t错误 我的问题是:不能通过简单的线性回归来完成吗?如果我们比较一下结果,结果会有什么不同?为什么?

3
居中意味着减少协方差吗?
假设我有两个非独立的随机变量,并且想在不损失过多“信号”的情况下尽可能减小它们之间的协方差,这是否意味着居中?我在某处读到,意思是居中将相关性降低了一个重要因素,所以我认为对协方差也应如此。

4
相关矩阵特征值为零的充要条件
给定随机变量,其概率分布为,相关矩阵为正半定值,即其特征值是正数还是零。nnnXiXiX_iP(X1,…,Xn)P(X1,…,Xn)P(X_1,\ldots,X_n)Cij=E[XiXj]−E[Xi]E[Xj]Cij=E[XiXj]−E[Xi]E[Xj]C_{ij}=E[X_i X_j]-E[X_i]E[X_j] 我对上具有 零特征值所必需和/或足够的条件感兴趣。例如,一个充分的条件是随机变量不是独立的:对于某些实数。例如,如果,则为特征值为零的的特征向量。如果我们对此类型的具有独立的线性约束,则意味着零特征值。PPPCCCmmm∑iuiXi=0∑iuiXi=0\sum_i u_i X_i=0uiuiu_iP(X1,…,Xn)=δ(X1−X2)p(X2,…,Xn)P(X1,…,Xn)=δ(X1−X2)p(X2,…,Xn)P(X_1,\ldots,X_n)=\delta(X_1-X_2)p(X_2,\ldots,X_n)u⃗ =(1,−1,0,…,0)u→=(1,−1,0,…,0)\vec u=(1,-1,0,\ldots,0)CCCmmmXiXiX_immm 当对于某个(即)时,至少存在另外一种(但琐碎的)可能性,因为情况有一列和零行:。因为这并不是很有趣,所以我假设概率分布不是那种形式。一P (X 1,... ,X Ñ)α δ (X 一 - ë [ X 一 ] )ç 我Ĵ Ç 我一个 = C ^ 一个我 = 0 ,Xa=E[Xa]Xa=E[Xa]X_a=E[X_a]aaaP(X1,…,Xn)∝δ(Xa−E[Xa])P(X1,…,Xn)∝δ(Xa−E[Xa])P(X_1,\ldots,X_n)\propto\delta(X_a-E[X_a])CijCijC_{ij}Cia=Cai=0,∀iCia=Cai=0,∀iC_{ia}=C_{ai}=0,\,\forall i 我的问题是:线性约束是诱导零特征值的唯一方法(如果我们禁止上面给出的琐碎例外),还是对随机变量的非线性约束也可以生成零特征值?CCC



2
从p范数球()产生均匀噪声
我正在尝试编写一个函数,该函数会产生均匀分布的噪声,该噪声来自维的p范数球:nnn ||x||p≤r||x||p≤r\begin{equation} ||x||_p \leq r \end{equation} 我找到了可能的圆的解决方案()(http://mathworld.wolfram.com/DiskPointPicking.html),但是我很难将其扩展为不同值。p=2p=2p = 2ppp 我尝试通过仅从均匀分布中抽取随机样本并在不满足给定约束的情况下重绘来进行尝试。但是,除了它是一个丑陋的解决方案之外,它在高尺寸方面在计算上也不可行。
11 simulation  noise 

2
为什么对MCMC采样器有反对使用Jeffreys或基于熵的先验的建议?
Stan的开发人员在其Wiki页面上指出: 我们不喜欢的一些原理:不变性,杰弗里斯,熵 相反,我看到了很多正态分布建议。到目前为止,我使用了不依赖于采样贝叶斯方法,并且是那种高兴地明白了为什么是二项式可能性的不错选择。θ 〜贝塔( α = 12,β= 12)θ〜贝塔(α=1个2,β=1个2)\theta \sim \text{Beta}\left(\alpha=\frac{1}{2},\beta=\frac{1}{2}\right)
11 bayesian  mcmc  prior  pymc  stan 

3
初始化K均值聚类的方法
我对当前为K均值选择初始种子(集群中心)的最新技术感兴趣。 谷歌搜索有两种流行的选择: 随机选择初始种子,以及 使用KMeans ++选择技术:Arthur&Vassilvitskii 2006 k-means ++:精心播种的优势 还有其他任何人都知道的有前途的方法,这些方法可能不那么受欢迎?

1
为什么将SVM解释为分类概率是错误的?
我对SVM的理解是,它与逻辑回归(LR)非常相似,即将特征的加权总和传递给S形函数以获取属于一类的概率,而不是交叉熵(逻辑)损失功能,使用铰链损失进行训练。使用铰链损失的好处是可以执行各种数值技巧来使内核化更加有效。但是,缺点是所得模型的信息少于相应的LR模型可能具有的信息。因此,例如,如果没有内核化(使用线性内核),SVM决策边界仍将位于LR输出0.5的概率所在的相同位置,但无法判断属于一类的概率从SVM 衰减的速度有多快。决策边界。 我的两个问题是: 我上面的解释正确吗? 使用铰链损失如何使将SVM结果解释为概率无效?

2
为什么袋装树/随机森林树比单个决策树具有更高的偏差?
如果我们考虑一个完整的决策树(即未修剪的决策树),则它具有高方差和低偏差。 套袋和随机森林使用这些高方差模型并对其进行汇总,以减少方差,从而提高预测准确性。套袋和随机森林都使用Bootstrap采样,并且如“统计学习的要素”中所述,这会增加单个树中的偏差。 此外,由于随机森林方法限制了允许在每个节点上拆分的变量,因此单个随机森林树的偏差会进一步增加。 因此,如果套袋和随机森林中单棵树的偏差增加不会“过度”使变化减少,则只能提高预测精度。 这使我想到以下两个问题:1)我知道使用引导程序抽样时,(几乎总是)我们在引导程序样本中会有一些相同的观察结果。但是,为什么这会导致套袋/随机森林中单个树木的偏见增加?2)此外,为什么对每个拆分中要拆分的可用变量的限制会导致随机森林中各个树的偏倚更高?

3
Nelder Mead的停止标准
我正在尝试实现用于优化功能的Nelder-Mead算法。关于Nelder-Mead的维基百科页面,除其停止标准外,对整个算法都非常清楚。可悲的是: 检查收敛性[需要澄清]。 我自己尝试并测试了一些标准: 如果则停止f(xN+1)−f(x1)&lt;ϵf(xN+1)−f(x1)&lt;ϵf(x_{N+1}) - f(x_1) < \epsilon,其中小,并且是单纯形的第个顶点,从低()到高()函数值。换句话说,当单纯形的最大值几乎等于最小值时。我发现这不能正常工作,因为这不能保证函数在单纯形内部的功能。例如,考虑函数:ϵϵ\epsilonxixix_iiiif(x1)f(x1)f(x_1)f(xñ+ 1)f(Xñ+1个)f(x_{N+1})F(x )= x2F(X)=X2f(x) = x^2当然,这对于优化来说是微不足道的,但是假设我们使用NM来做到这一点,并且让我们的两个单纯形点分别为和。该算法将在此处收敛,而找不到最佳值。X1个= - 1X1个=-1个x_1 = -1X2= 1X2=1个x_2=1 第二种选择涉及评估单纯形的质心:如果。假设如果单纯形和质心的最低点具有类似的值,则单纯形足够小以调用收敛。| F(x1个)− f(xC)| &lt; ϵ|F(X1个)-F(XC)|&lt;ϵ|f(x_1) - f(x_c)| < \epsilon 这是检查收敛的正确方法吗?还是有一种确定的方法来检查这一点?我找不到任何相关资料,因为大多数搜索结果都集中在算法的复杂性上。

5
什么时候使用混合效果模型?
线性混合效应模型是线性回归模型的扩展,用于分组收集和汇总的数据。关键优势在于系数可以相对于一个或多个组变量而变化。 但是,我在何时使用混合效果模型方面感到困惑?我将通过在极端情况下使用玩具示例来阐述我的问题。 假设我们要为动物的身高和体重建模,并使用物种作为分组变量。 如果不同的群体/物种真的不同。说一只狗和大象。我认为没有必要使用混合效果模型,我们应该为每个小组建立一个模型。 如果不同的群体/物种真的很相似。说一只母狗和一只公狗。我认为我们可能希望将性别用作模型中的分类变量。 因此,我假设我们应该在中间情况下使用混合效果模型?可以说,该组是猫,狗,兔子,它们是大小相似的动物,但不同。 是否有任何正式的论据来建议何时使用混合效果模型,即如何在 为每个小组建立模型 混合效应模型 将组用作回归中的分类变量 我的尝试:方法1是最“复杂的模型” /更少的自由度,方法3是最“简单的模型” /更大的自由度。混合效果模型位于中间。我们可能会考虑根据Bais Variance Trade Off选择正确模型所需的数据量和复杂度。


3
确定性模型和随机模型有什么区别?
简单线性模型: ε 吨 Ñ (0 ,σ 2)x=αt+ϵtx=αt+ϵtx=\alpha t + \epsilon_t其中 〜IIDϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) 与和V 一- [R (X )= σ 2E(x)=αtE(x)=αtE(x) = \alpha tVar(x)=σ2Var(x)=σ2Var(x)=\sigma^2 AR(1): ε 吨 Ñ (0 ,σ 2)Xt=αXt−1+ϵtXt=αXt−1+ϵtX_t =\alpha X_{t-1} + \epsilon_t其中 〜IIDϵtϵt\epsilon_tN(0,σ2)N(0,σ2)N(0,\sigma^2) 与和V 一- [R (X )= 吨σ 2E(x)=αtE(x)=αtE(x) = \alpha tVar(x)=tσ2Var(x)=tσ2Var(x)=t\sigma^2 因此,简单的线性模型被视为确定性模型,而AR(1)模型被视为随机模型。 根据本·兰伯特(Ben Lambert)-确定性与随机性的Youtube视频,将AR(1)称为随机模型的原因是因为它的方差随时间增加。那么,非恒定方差的特征是否是确定随机或确定性的标准? 我也认为简单线性模型不是完全确定性的,因为我们有一个项与模型相关联。因此,我们总是在具有随机性。那么我们可以说模型是确定性的还是随机的呢? Xϵtϵt\epsilon_txxx

1
R中PCA双图中基础变量的箭头
冒着使问题成为特定于软件的风险,并以其普遍存在和特质为借口,我想问一下biplot()R中的函数,更具体地说,是有关其默认的叠加红色箭头的计算和绘图的问题。到基础变量。 [为了理解某些评论,最初发布的地块存在稀缺性问题,现在已删除。]
11 r  pca  biplot 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.