统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
查找统计模型的拟合值和预测值
假设我有以下数据并且正在运行回归模型: df=data.frame(income=c(5,3,47,8,6,5), won=c(0,0,1,1,1,0), age=c(18,18,23,50,19,39), home=c(0,0,1,0,0,1)) 一方面,我运行一个线性模型来预测收入: md1 = lm(income ~ age + home + home, data=df) 其次,我运行一个logit模型来预测won变量: md2 = glm(factor(won) ~ age + home, data=df, family=binomial(link="logit")) 对于这两个模型,我想知道如何生成具有预测器响应类别,拟合值和模型预测值的表或数据框。 因此对于线性模型,类似于: age fitted_income predicted_income 18 3 5 23 3 3 50 4 2 19 5 5 39 6 4 home fitted_income predicted_income 0 …
12 r 

4
有人可以说明依赖和零协方差如何发生吗?
像格雷格一样,有人可以举例说明,但更详细地讲,随机变量如何依存但协方差为零?格雷格,这里的海报,给出了使用一个圆形的例子在这里。 有人可以使用一系列分阶段说明该过程的步骤来更详细地解释此过程吗? 另外,如果您从心理学中学到了一个例子,请通过相关例子说明这个概念。请在解释时非常准确和有序,并说明可能会有哪些后果。

6
解释R的ur.df(Dickey-Fuller单位根测试)结果
我正在使用软件包中的ur.df()功能在时间序列上运行以下单位根测试(Dickey-Fuller)urca。 该命令是: summary(ur.df(d.Aus, type = "drift", 6)) 输出为: ############################################### # Augmented Dickey-Fuller Test Unit Root Test # ############################################### Test regression drift Call: lm(formula = z.diff ~ z.lag.1 + 1 + z.diff.lag) Residuals: Min 1Q Median 3Q Max -0.266372 -0.036882 -0.002716 0.036644 0.230738 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) …

1
GLM中规范链接函数的计算
我认为规范链接函数来自指数族的自然参数。说,考虑族 则是规范的链接函数。以伯努利分布为例,我们有 因此,规范链接函数g(⋅)g(⋅)g(\cdot)f(y,θ,ψ)=exp{yθ−b(θ)a(ψ)−c(y,ψ)}f(y,θ,ψ)=exp⁡{yθ−b(θ)a(ψ)−c(y,ψ)} f(y,\theta,\psi)=\exp\left\{\frac{y\theta-b(\theta)}{a(\psi)}-c(y,\psi)\right\} θ=θ(μ)θ=θ(μ)\theta=\theta(\mu)P(Y=y)=μy(1−μ)1−y=exp{ylogμ1−μ+log(1−μ)}P(Y=y)=μy(1−μ)1−y=exp⁡{ylog⁡μ1−μ+log⁡(1−μ)} P(Y=y)=\mu^{y}(1-\mu)^{1-y}=\exp\left\{y\log\frac{\mu}{1-\mu}+\log{(1-\mu)}\right\} g(μ)=logμ1−μg(μ)=log⁡μ1−μg(\mu)=\log\frac{\mu}{1-\mu} 但是,当我看到这张幻灯片时,它声称 尽管可以很容易地针对此特定分布(以及其他一些分布,例如泊松分布)进行验证,我看不到一般情况的等效性。谁能给出提示?谢谢〜g′(μ)=1V(μ)g′(μ)=1V(μ) g'(\mu)=\frac{1}{V(\mu)}

1
多元时间序列的块引导程序的替代方法
我目前使用以下过程来引导R中的多元时间序列: 确定块大小-运行包中的函数b.star,该函数np将为每个系列生成块大小 选择最大块大小 tsboot使用选定的块大小在任何系列上运行 使用引导输出中的索引来重构多元时间序列 有人建议使用meboot软件包作为块引导程序的替代方法,但是由于我没有使用整个数据集来选择块大小,因此,我不确定如果要使用通过在运行meboot时创建的索引来保持序列之间的相关性。一个系列。如果有人在多变量环境下使用过meboot,我将不胜感激有关此过程的建议。


5
如何衡量SE贡献者的“全面性”?
众所周知,Stack Exchange是具有不同主题的问答站点的集合。假设每个站点彼此独立,给定用户拥有的统计信息,与下一个家伙相比,如何计算他的“全面性”?我应该使用什么统计工具? 老实说,我不太了解如何数学上定义“全面性”,但是它必须具有以下特征: 在所有条件都相同的情况下,用户代表越多,他的能力就越全面 在所有条件平等的情况下,用户参与的站点越多,他的能力就越全面。 答案或问题不会影响全面性




2
何时使用蒙特卡洛方法优于时差方法?
最近,我一直在进行大量有关强化学习的研究。我遵循了Sutton&Barto的《强化学习:简介》。 我知道什么是马尔可夫决策过程,以及如何使用动态规划(DP),蒙特卡洛和时间差(DP)学习来解决它们。我遇到的问题是,我不知道蒙特卡洛何时会比TD学习更好的选择。 它们之间的主要区别是TD学习使用自举法来近似动作值函数,而Monte Carlo使用平均值来实现这一点。当这是更好的方法时,我只是真的无法想到一个方案。 我的猜测是,它可能与性能有关,但我找不到任何可以证明这一点的资料。 我是否缺少某些东西?或者一般来说,TD学习是更好的选择吗?

1
PLS回归与PLS路径建模之间的差异。对PLS的批评
在这里提出了这个问题,但是没有人给出很好的答案。因此,我认为再次提出该建议是一个好主意,并且我想补充一些意见/问题。 第一个问题是“ PLS路径建模”和“ PLS回归”之间的区别是什么?更概括地说,什么是结构方程建模(SEM),路径建模和回归?据我了解,回归更多地关注预测,而SEM则关注于响应和预测变量之间的关系,而路径建模是SEM的特例? 我的第二个问题是PLS有多可靠?最近,如Rönkkö等人所述,它受到了许多批评。2016年以及Rönkkö等人。2015年这导致了拒绝的论文基础上高一级期刊,如PLS 经营管理杂志(这里是期刊编辑的说明): 我们几乎拒绝所有基于PLS的手稿,因为我们得出结论,在OM研究人员使用的各种模型中,PLS毫无例外都是错误的建模方法。 我应该注意我的领域是光谱学,既不是管理/心理学也不是统计学。在上面链接的论文中,作者更多地谈论了PLS作为SEM方法,但对我来说,他们的批评似乎也适用于PLS回归。


2
Kolmogorov–Smirnov检验:随着样本量的增加,p值和ks检验的统计量减少
为什么p值和ks检验统计量会随着样本数量的增加而减少?以以下Python代码为例: import numpy as np from scipy.stats import norm, ks_2samp np.random.seed(0) for n in [10, 100, 1000, 10000, 100000, 1000000]: x = norm(0, 4).rvs(n) y = norm(0, 4.1).rvs(n) print ks_2samp(x, y) 结果是: Ks_2sampResult(statistic=0.30000000000000004, pvalue=0.67507815371659508) Ks_2sampResult(statistic=0.080000000000000071, pvalue=0.89375155241057247) Ks_2sampResult(statistic=0.03499999999999992, pvalue=0.5654378910227662) Ks_2sampResult(statistic=0.026599999999999957, pvalue=0.0016502962880920896) Ks_2sampResult(statistic=0.0081200000000000161, pvalue=0.0027192461984023855) Ks_2sampResult(statistic=0.0065240000000000853, pvalue=6.4573678008760032e-19) 凭直觉,我理解随着n的增长,测试“更加确定”了两种分布是不同的。但是,如果样本量很大,那么在诸如此类的相似性测试(如安德森·达林检验)或t检验中有什么意义,因为在这种情况下,当n很大时,总会发现分布是“明显”不同!?现在我想知道p值的意义到底是什么。它在很大程度上取决于样本量...如果p> 0.05而您希望降低样本量,则只需获取更多数据即可。如果p <0.05且您希望它更高,则删除一些数据。 同样,如果两个分布相同,则ks检验统计量将为0,p值为1。但是在我的示例中,随着n的增加,ks检验统计量表明分布随时间变得越来越相似(减小)。 ,但根据p值,它们会随着时间变得越来越多(也有所减少)。

1
黑森矩阵和协方差矩阵之间的关系
在研究最大似然估计时,要进行最大似然估计的推论,我们需要知道方差。要找出方差,我需要知道Cramer的Rao下界,它看起来像是在曲率上具有二阶导数的Hessian矩阵。我有点混在一起来定义协方差矩阵和粗麻布矩阵之间的关系。希望听到有关该问题的一些解释。一个简单的例子将不胜感激。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.