统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
相互作用项和高阶多项式
如果我有兴趣拟合线性解释变量和与因变量具有二次关系的另一个解释变量之间的双向相互作用,我是否必须同时包括与二次分量的相互作用和与线性变量的相互作用模型中的组件?例如: 反过来在我之前的线程上构建: 曲率项和模型选择,如果这是在R中使用的模型选择分析,其中包含许多解释变量,则输出的模型包含交互项,其中包括二次项aaabbbyyyy∼a+b+b2+ab+ab2y∼a+b+b2+ab+ab2 y\sim a+b+b^2+ab+ab^2 MuMIna:b2a:b2a:b^2仅当在同一模型中还存在与线性成分的相互作用项以及,和作为直接效应时才有效吗?a:ba:ba:baaabbbb2b2b^2

3
集合时间序列模型
我需要自动进行时间序列预测,而且我事先不知道这些序列的功能(季节性,趋势,噪音等)。 我的目标不是为每个系列获得最佳模型,而是避免出现非常糟糕的模型。换句话说,每次都会出现小错误不是问题,但是偶尔会出现大错误是一个问题。 我认为我可以通过组合使用不同技术计算的模型来实现。 也就是说,尽管ARIMA对于特定系列来说是最好的方法,但对于其他系列来说可能不是最好的方法。指数平滑也一样。 但是,如果我将每种技术中的一个模型组合在一起,即使一个模型不太好,另一个模型也会使估算值更接近真实值。 众所周知,ARIMA在长期行为良好的序列中效果更好,而指数平滑在短期噪声序列中表现突出。 我的想法是结合使用两种技术生成的模型以获得更可靠的预测,这有意义吗? 可能有很多方法可以合并这些模型。 如果这是一个好方法,我应该如何将它们结合起来? 一个简单的预测平均值方法是一个选择,但是如果我根据模型的某种优度度量对平均值进行加权,也许可以得到更好的预测。 合并模型时对方差的处理方式是什么?


3
贝叶斯分析的可能性与条件分布
我们可以将贝叶斯定理写成 p(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(θ|x)=f(X|θ)p(θ)∫θf(X|θ)p(θ)dθp(\theta|x) = \frac{f(X|\theta)p(\theta)}{\int_{\theta} f(X|\theta)p(\theta)d\theta} 其中是后验的,是条件分布的,而是先验的。p(θ|x)p(θ|x)p(\theta|x)f(X|θ)f(X|θ)f(X|\theta)p(θ)p(θ)p(\theta) 要么 p(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(θ|x)=L(θ|x)p(θ)∫θL(θ|x)p(θ)dθp(\theta|x) = \frac{L(\theta|x)p(\theta)}{\int_{\theta} L(\theta|x)p(\theta)d\theta} 其中是后验的,是似然函数,而是先验的。p(θ|x)p(θ|x)p(\theta|x)L(θ|x)L(θ|x)L(\theta|x)p(θ)p(θ)p(\theta) 我的问题是 为什么要使用似然函数而不是条件分布来进行贝叶斯分析? 您能否用语言说出可能性与条件分布之间的区别是什么?我知道可能性不是概率分布和。L(θ|x)∝f(X|θ)L(θ|x)∝f(X|θ)L(\theta|x) \propto f(X|\theta)

3
具有交互作用项的联合模型与用于组比较的单独回归
在收集了先前问题和讨论的宝贵反馈后,我提出了以下问题:假设目标是检测两组之间的效果差异,例如男性与女性之间的差异。有两种方法可以做到这一点: 对两组进行两个单独的回归,并使用Wald检验拒绝(或不拒绝)原假设:,其中是男性回归中一个IV的系数,是相同回归中的系数四,女性退步。H0H0H_0b1−b2=0b1−b2=0b_1-b_2=0b1b1b_1b2b2b_2 将这两个组合并在一起,并通过包含性别虚拟对象和交互项(IV * genderdummy)来运行联合模型。然后,将基于交互作用的符号和显着性的t检验来检测组效应。 如果在情况(1)中拒绝Ho,即组差异很大,但是在情况(2)中交互项项的系数在统计上不重要,即组差异不重要,该怎么办。反之亦然,在情况(1)中不拒绝Ho,并且在情况(2)中交互项很重要。我几次都以这种结果告终,我想知道哪种结果会更可靠,以及这种矛盾背后的原因是什么。 非常感谢!

1
如何使用R计算临界t值?
抱歉,这是一个新问题。我正在尝试第一次自学统计学。我想我的基本过程已经停滞了,但是我很难用R执行它。 因此,我正在尝试评估形式的多元线性回归中回归系数的重要性 y^=Xβ^y^=Xβ^ \hat y = X \hat \beta 我认为用于测试的t统计量由H0:β^j=0,Ha:β^j≠0H0:β^j=0,Ha:β^j≠0H_0: \hat \beta_j = 0, H_a: \hat \beta_j \neq 0 t0=β^j−0se(β^j)=β^jσ^2Cjj−−−−−√=β^jCjjSSRes/(n−p)−−−−−−−−−−−−−−√t0=β^j−0se(β^j)=β^jσ^2Cjj=β^jCjjSSRes/(n−p)t_0 = \frac{\hat \beta_j - 0}{\text{se}(\hat \beta_j)} = \frac{\hat \beta_j}{\sqrt{\hat \sigma^2 C_{jj}}} = \frac{\hat \beta_j}{\sqrt{C_{jj} SS_{Res}/(n-p)}} 其中是对角线在条目。CjjCjjC_{jj}jthjthj^{th}(X′X)−1(X′X)−1(X'X)^{-1} 到目前为止,一切都很好。我知道如何使用R中的矩阵运算来计算所有这些值。但是为了拒绝null,这本书说我需要 |t0|>tα/2,n−p|t0|>tα/2,n−p|t_0| > t_{\alpha/2,n-p} 如何使用R 计算此临界值?tα/2,n−ptα/2,n−pt_{\alpha/2,n-p} 现在,我知道如何找到这些值的唯一方法是查看书后的表格。肯定有更好的办法。

4
对相关矩阵特征值分布的直觉/解释?
您对相关矩阵特征值分布的直觉/解释是什么?我倾向于听到通常3个最大特征值最重要,而接近零的特征值则是噪声。另外,我已经看过几篇研究论文,研究自然发生的特征值分布与从随机相关矩阵计算得出的特征值分布有何不同(再次,区分信号中的噪声)。 请随时详细说明您的见解。

3
时间序列预测的数据增强策略
我正在考虑两种策略来对时间序列进行“数据增强”。 首先,有一点背景知识。预测时间序列下一步的预测变量PPP通常取决于以下两个函数:时间序列的过去状态,以及预测变量的过去状态:{ 一一世}{一个一世}\lbrace A_i\rbrace P({ 甲我≤ Ť - 1} ,P小号t − 1)P({一个一世≤Ť-1个},P小号Ť-1个)P(\lbrace A_{i\leq t-1}\rbrace,P_{S_{t-1}}) 如果我们想调整/训练我们的系统以获得一个好的,那么我们将需要足够的数据。有时可用数据还不够,因此我们考虑进行数据扩充。PPP 第一种方法 假设我们有时间序列,具有。并且还假设我们有满足以下条件:。{ 一一世}{一个一世}\lbrace A_i \rbrace1个≤ 我≤ Ñ1个≤一世≤ñ1 \leq i \leq nϵϵ\epsilon0 &lt; ϵ &lt; | 一个我+ 1− A一世| ∀我∈{1,...,Ñ}0&lt;ϵ&lt;|一个一世+1个-一个一世|∀一世∈{1个,…,ñ}0<\epsilon < |A_{i+1} - A_i| \forall i \in \lbrace 1, \ldots,n\rbrace 我们可以构造一个新的时间序列,其中是分布。{ B一世= A一世+ r一世}{乙一世=一个一世+[R一世}\lbrace B_i = …


1
“绝对连续随机变量”与“连续随机变量”?
在Valentin V. Petrov的《概率论的有限定理》一书中,我看到了分布的定义是“连续的”和“绝对连续的”之间的区别,其定义如下: X P (X ∈ 乙) = 0 乙P (X ∈ 乙) = 0 乙(* )(∗)(*) “ ... 如果实线的任何有限点或可数点的,则随机变量的分布被认为是连续的。如果Lebesgue的所有Borel集的,则绝对是连续的...”XXXP(X∈ 乙) = 0P(X∈乙)=0P\left(X \in B\right)=0乙乙BP(X∈ 乙) = 0P(X∈乙)=0P\left(X \in B\right)=0乙乙B 我熟悉的概念是: (#)(#)(\#) “如果随机变量具有连续的累积分布函数,则它绝对是连续的。” (∗ )(#)我的问题是:我的问题是:\textbf{My questions are:}和关于“绝对连续性”的两个描述是在谈论同一件事吗?如果是,我如何将一种解释翻译成另一种解释?(* )(∗)(*)(#)(#)(\#) 谢谢!



3
什么是矩量法,它与MLE有何不同?
通常,矩量方法似乎只是将观测到的样本均值或方差与理论矩量相匹配以获得参数估计。我了解到,这通常与指数家庭的MLE相同。 但是,即使找到似然函数的模式可能比较棘手,也很难找到一个清晰的矩量方法定义和一个清晰的讨论来解释为什么MLE通常受到青睐。 这个问题MLE比Moment方法更有效吗?哈佛大学的唐纳德·鲁宾教授引述唐纳德·鲁宾的话说,自40年代以来,每个人都知道MLE胜过MoM,但我有兴趣了解其历史或原因。

2
带有嘈杂标签的分类?
我正在尝试训练神经网络进行分类,但是我拥有的标签比较吵(大约30%的标签是错误的)。 交叉熵损失确实有效,但是我想知道在这种情况下是否有其他方法更有效?还是交叉熵损失最优? 我不确定,但是我正在考虑某种程度地“减少”交叉熵损失,这样一个数据点的损失将不大于某个上限,这行得通吗? 谢谢! 更新 根据卢卡斯的答案,我得到了预测输出和softmax函数z的输入的导数。所以我想基本上是在增加一个平滑项3ÿyyžzz为导数。p我=0.3/Ñ+0.7Ŷ我升=-Σ吨我登录(p我)∂升37 N37N\frac{3}{7N} p一世= 0.3 /牛+ 0.7 ÿ一世pi=0.3/N+0.7yip_i=0.3/N+0.7y_i l = − ∑ t一世日志(p一世)l=−∑tilog⁡(pi)l=-\sum t_i\log(p_i) ∂升∂升∂ÿ一世= - 吨一世∂日志(p一世)∂p一世∂p一世∂ÿ一世= - 0.7 吨一世p一世= - 吨一世37 N+ y一世∂l∂yi=−ti∂log⁡(pi)∂pi∂pi∂yi=−0.7tipi=−ti37N+yi\frac{\partial l}{\partial y_i}=-t_i\frac{\partial\log(p_i)}{\partial p_i}\frac{\partial p_i}{\partial y_i}=-0.7\frac{t_i}{p_i}=-\frac{t_i}{\frac{3}{7N}+y_i} 衍生物为原交叉熵损失: ∂升∂升∂ž一世= 0.7 ∑ĴŤĴpĴ∂ÿĴ∂ž一世= y一世∑ĴŤĴÿĴ37 N+ yĴ- Ť一世ÿ一世37 N+ y一世∂l∂zi=0.7∑jtjpj∂yj∂zi=yi∑jtjyj37N+yj−tiyi37N+yi\frac{\partial l}{\partial z_i}=0.7\sum_j\frac{t_j}{p_j}\frac{\partial y_j}{\partial z_i}=y_i\sum_jt_j\frac{y_j}{\frac{3}{7N}+y_j}-t_i\frac{y_i}{\frac{3}{7N}+y_i} ∂升∂升∂ÿ一世= - 吨一世ÿ一世∂l∂yi=−tiyi\frac{\partial …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.