统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
汇总时间序列以使其看起来更有意义是否有效?
我还有另一个关于时间序列的问题。 我有一个数据集,可以提供三年内精神病医院的暴力事件的每日记录。在上一个问题的帮助下,我一直在摆弄它,现在对此感到高兴。 我现在要知道的是,每日系列非常嘈杂。它从0时到20时上下波动剧烈。使用黄土图和预测软件包(我可以为像我这样的新手强烈推荐),我得到一条完全平坦的线,且预测的置信区间很大。 但是,每周或每月汇总数据更有意义。它们从系列开始时就开始下降,然后在中间再次上升。黄土图和预测包都产生了看起来更有意义的东西。 确实感觉有点像作弊。我是不是更喜欢聚合版本,因为它们看起来不错,没有任何实际有效性? 还是计算移动平均值并以此为基础会更好?恐怕我对所有这些背后的理论还不够了解,无法对可以接受的东西充满信心

6
可疑地使用信号处理原理来识别趋势
我建议尝试在一些非常嘈杂的长期数据中找到趋势。数据基本上是在大约8个月的时间内每周对大约5mm的物体进行测量。数据精确到1毫米,并且非常嘈杂,每周定期更改+/- 1或2毫米。我们只有到最接近毫米的数据。 我们计划使用一些具有快速傅立叶变换的基本信号处理来从原始数据中分离出噪声。基本的假设是,如果我们镜像数据集并将其添加到现有数据集的末尾,则可以创建数据的完整波长,因此我们的数据将以快速傅立叶变换显示,我们希望可以将其分离出来。 考虑到这对我来说有点怀疑,这是值得推荐的方法,还是镜像和附加我们的数据集的方法在某种程度上有根本性的缺陷?我们正在寻找其他方法,例如也使用低通滤波器。

2
检验三位一体的可能性最大:面对矛盾的结论该怎么办?
在最大似然估计的上下文中,Wald,似然比和拉格朗日乘数检验在渐近上是等价的。但是,对于小样本,它们往往会有很大差异,在某些情况下,它们会得出不同的结论。 如何根据拒绝空值的可能性对它们进行排名?如果测试的答案不一致,该怎么办?您能选择一个给出所需答案的方法吗?或者是否有关于如何进行的“规则”或“指南”?


1
非自由午餐定理和K-NN一致性
在计算学习中,NFL定理指出没有通用学习器。对于每种学习算法,都有一个分布使学习者输出具有大误差的假设,而且概率很高(尽管误差假设很低)。结论是,为了学习,必须限制假设的类别或分布。Devroye等人在他们的《模式识别的概率论》一书中证明了K近邻学习者的以下定理: 其中假设 μ 具有密度。如果 k → ∞ 和 k / n → 0 那么对于每一个 ϵ > 0 , 都有 N, 对于所有 n > N , st:P(Rñ− R∗> ϵ )< 2 e x p (− Cdñ ε2)假设 μ 具有密度。如果 ķ→∞ 和 ķ/ñ→0 然后每个 ϵ>0, 有 ñ, 圣 对所有人 ñ>ñ:P([Rñ-[R∗>ϵ)<2ËXp(-Cdñϵ2)\text{Assume } \mu …

1
此过程的可能性如何?
病人被送进医院。他们的住院时间取决于两件事:他们受伤的严重程度,以及他们愿意为住院而支付多少保险。如果某些患者的保险决定停止支付住宿费用,则某些患者会过早离开。 假设以下内容: 1)停留时间是泊松分布的(参数为λλ\lambda,现在假设是暂时的,可能是现实的假设,也可能不是)。 2)各种保险计划涵盖7、14和21天的住宿时间。许多患者将在停留7,14或21天后离开(因为他们的保险用完了,必须离开)。 如果要从此过程中获取数据,它可能如下所示: 如您所见,在7、14和21天都有峰值。这些是在保险结束后离开的患者。 显然,可以将数据建模为混合模型。我很难记下这种分布的可能性。这就像零膨胀的泊松,但通货膨胀率分别为7、14和21。 此数据的可能性是多少?可能性背后的思考过程是什么?

1
混合连续变量和二进制变量的t-SNE
我目前正在研究使用t-SNE进行高维数据的可视化。我有一些包含二进制和连续变量混合的数据,并且数据似乎很容易将二进制数据聚类。当然,这是按比例缩放(介于0和1之间)数据的预期:二进制变量之间的Euclidian距离将始终最大/最小。如何使用t-SNE处理混合的二进制/连续数据集?我们应该删除二进制列吗?它有一个不同的metric,我们可以使用? 作为示例,请考虑以下python代码: x1 = np.random.rand(200) x2 = np.random.rand(200) x3 = np.r_[np.ones(100), np.zeros(100)] X = np.c_[x1, x2, x3] # plot of the original data plt.scatter(x1, x2, c=x3) # … format graph 所以我的原始数据是: 其中颜色是第三个特征(x3)的值-在3D中,数据点位于两个平面(x3 = 0平面和x3 = 1平面)中。 然后,我执行t-SNE: tsne = TSNE() # sci-kit learn implementation X_transformed = StandardScaler().fit_transform(X) tsne = TSNE(n_components=2, …

1
为什么贝叶斯统计成为越来越流行的研究主题?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 去年关闭。 浏览美国新闻统计前100名计划的研究领域,在贝叶斯统计中几乎所有人都很沉重。但是,如果我去低年级学校,他们中的大多数人仍在进行古典/频率统计研究。例如,我目前的学校(在QS世界统计排名中介于150到200之间,因此不被认为是一流学校),只有一位教授关注贝叶斯统计,而对贝叶斯统计几乎感到不满。我采访过的一些研究生甚至说,贝叶斯统计学家正在做贝叶斯统计,因此我当然强烈反对。 但是,我想知道为什么会这样。我有一些有根据的猜测: (a)古典/常用统计的方法学上没有足够的进步空间,古典/常用统计的唯一可行的研究是应用,这将是低年级学校的主要重点,因为顶级学校应该更多倾向于理论和方法研究。 (b)它在很大程度上取决于领域。统计的某些分支仅更适合于贝叶斯统计,例如许多统计方法的科学应用,而其他分支更适合于经典统计(例如金融领域)。(如果我错了,请纠正我)鉴于此,在我看来,顶级学校有很多统计系在科学领域进行申请,而较低级的学校统计系则主要将重点放在财务领域,因为这可以帮助他们创收。和资金。 (c)频繁使用方法存在巨大的问题无法解决,例如容易发生MLE的过度拟合等问题。贝叶斯方法似乎提供了一个出色的解决方案。 (d)计算能力在这里,因此贝叶斯计算不再像30年前那样成为瓶颈。 (e)这可能是我最自以为是的猜测。古典/频率主义统计学家有一个抵制之处,就是他们不喜欢可能会取代古典统计角色的新方法论。但是就像拉里·瓦瑟曼(Larry Wasserman)所说的那样,这取决于我们正在尝试做的事情,每个人都应该保持开放的态度,尤其是作为研究人员。

1
高斯过程/狄利克雷过程等随机过程是否具有密度?如果没有,如何对他们应用贝叶斯规则?
Dirichlet Pocess和高斯过程通常被称为“函数分布”或“分布分布”。在那种情况下,我可以有意义地谈谈GP下函数的密度吗?也就是说,高斯过程或Dirichlet过程是否具有概率密度的概念? 如果不是,那么,如果对函数的先验概率的概念没有很好地定义,我们如何使用贝叶斯定律从后验先到?贝叶斯非参数世界中是否存在诸如MAP或EAP估计之类的东西?非常感谢。

2
随机效应模型中每个群集的最小样本量
随机效应模型中每个聚类的观察数量是否合理?我有1,500个样本,其中700个聚类被建模为可交换随机效应。我可以选择合并群集,以构建较少但较大的群集。我想知道如何选择每个聚类的最小样本量,以便在预测每个聚类的随机效应时获得有意义的结果?有一篇很好的论文可以解释这一点吗?

2
在线性回归中,当我们仅对交互作用项感兴趣时,为什么还要包含二次项?
假设我对线性回归模型,用于ÿ一世= β0+ β1个X1个+ β2X2+ β3X1个X2Yi=β0+β1x1+β2x2+β3x1x2Y_i = \beta_0 + \beta_1x_1 + \beta_2x_2 + \beta_3x_1x_2,因为我想看看如果两个协变量之间的相互作用产生作用在Y。 在教授的课程笔记中(我没有与之联系),其中指出:当包括互动术语时,您应该包括他们的第二学位术语。即ÿ一世= β0+ β1个X1个+ β2X2+ β3X1个X2+ β4X21个+ β5X22Yi=β0+β1x1+β2x2+β3x1x2+β4x12+β5x22Y_i = \beta_0 + \beta_1x_1 + \beta_2x_2 + \beta_3x_1x_2 +\beta_4x_1^2 + \beta_5x_2^2应包含在回归。 当我们仅对互动感兴趣时,为什么要包含第二学位?

1
混合效应逻辑回归的固定效应解释
我对UCLA网页上有关混合效应逻辑回归的陈述感到困惑。他们显示了一个通过拟合这样的模型得到的固定效应系数表,下面的第一段似乎完全像正常的逻辑回归那样解释系数。但是,当他们谈论比值比时,他们说您必须根据随机效应来解释它们。是什么使对数奇数的解释与其指数值不同? 要么不需要“保持其他所有内容不变”? 从该模型解释固定效应系数的正确方法是什么?我总是给人的印象是“正常”逻辑回归没有任何变化,因为随机效应的期望值为零。因此,无论有无随机效应,您都可以解释完全相同的对数奇数和优势比-仅更改了SE。 估计可以基本上一如既往地解释。例如,对于IL6,IL6的单位增加与预期的缓解对数几率中的0.053单位降低相关。同样,已婚或已婚的人有望获得的缓解几率比未婚者高0.26。 许多人喜欢解释赔率。但是,当存在混合效果时,这些将具有更细微的含义。在常规logistic回归中,优势比与所有其他预测变量固定的预期优势比成正比。这是有道理的,因为我们经常对统计数据进行调整以适应其他影响(例如年龄),以获得结婚的“纯”影响或任何主要的主要预测指标。混合效应逻辑模型也是如此,此外,保持所有其他特征不变包括保持随机效应不变。也就是说,赔率是指保持年龄和IL6恒定的人以及具有相同医生或具有相同随机效应的医生的人的条件赔率

1
找到
设X1,X2,...,XnX1,X2,...,XnX_1, X_2, . . . , X_n是具有pdf的iid随机变量 fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)fX(x∣θ)=θ(1+x)−(1+θ)I(0,∞)(x)f_X(x\mid\theta) =\theta(1 +x)^{−(1+\theta)}I_{(0,\infty)}(x) 其中θ>0θ>0\theta >0。给出1的UMVUE1θ1θ\frac{1}{\theta}并计算其方差 我了解了两种用于获得UMVUE的方法: 克莱默罗下界(CRLB) 莱曼-舍夫·特莱姆 我将尝试使用两者中的前者。我必须承认,我不完全了解这里发生的事情,而我的尝试解决方案是基于一个示例问题。我有一个fX(x∣θ)fX(x∣θ)f_X(x\mid\theta)是一个完整的单参数指数族与 h(x)=I(0,∞)h(x)=I(0,∞)h(x)=I_{(0,\infty)},c(θ)=θc(θ)=θc(\theta)=\theta,w(θ)=−(1+θ)w(θ)=−(1+θ)w(\theta)=-(1+\theta),t(x)=log(1+x)t(x)=log(1+x)t(x)=\text{log}(1+x) 由于w′(θ)=1w′(θ)=1w'(\theta)=1在ΘΘ\Theta上不为零,因此适用CRLB结果。我们有 log fX(x∣θ)=log(θ)−(1+θ)⋅log(1+x)log fX(x∣θ)=log(θ)−(1+θ)⋅log(1+x)\text{log }f_X(x\mid\theta)=\text{log}(\theta)-(1+\theta)\cdot\text{log}(1+x) ∂∂θlog fX(x∣θ)=1θ−log(1+x)∂∂θlog fX(x∣θ)=1θ−log(1+x)\frac{\partial}{\partial \theta}\text{log }f_X(x\mid\theta)=\frac{1}{\theta}-\text{log}(1+x) ∂2∂θ2log fX(x∣θ)=−1θ2∂2∂θ2log fX(x∣θ)=−1θ2\frac{\partial^2}{\partial \theta^2}\text{log }f_X(x\mid\theta)=-\frac{1}{\theta^2} 所以I1(θ)=−E(−1θ2)=1θ2I1(θ)=−E(−1θ2)=1θ2I_1(\theta)=-\mathsf E\left(-\frac{1}{\theta^2}\right)=\frac{1}{\theta^2} 和CRLB为的无偏估计τ(θ)τ(θ)\tau(\theta)是 [τ′(θ)]2n⋅I1(θ)=θ2n[τ′(θ)]2[τ′(θ)]2n⋅I1(θ)=θ2n[τ′(θ)]2\frac{[\tau'(\theta)]^2}{n\cdot I _1(\theta)} = \frac{\theta^2}{n}[\tau'(\theta)]^2 由于∑i=1nt(Xi)=∑i=1nlog(1+Xi)∑i=1nt(Xi)=∑i=1nlog(1+Xi)\sum_{i=1}^n t(X_i)=\sum_{i=1}^n \text{log}(1+X_i) 那么∑ni=1log(1+Xi)∑i=1nlog(1+Xi)\sum_{i=1}^n \text{log}(1+X_i)任何线性函数,或者等效地,1的任何线性函数1n∑ni=1log(1+Xi)1n∑i=1nlog(1+Xi)\frac{1}{n}\sum_{i=1}^n \text{log}(1+X_i),将达到其期望的CRLB,因此将成为其期望的UMVUE。由于E(log(1+X))=1θE(log(1+X))=1θ\mathsf E(\text{log}(1+X))=\frac{1}{\theta}我们的UMVUE为1θ1θ\frac{1}{\theta}是1n∑ni=1log(1+Xi)1n∑i=1nlog(1+Xi)\frac{1}{n}\sum_{i=1}^n \text{log}(1+X_i) 对于天然的参数,我们可以让η=−(1+θ)⇒θ=−(η+1)η=−(1+θ)⇒θ=−(η+1)\eta=-(1+\theta)\Rightarrow \theta=-(\eta+1) …

2
不能改善样本外预测的“显着变量”-如何解释?
我有一个问题,我认为这对很多用户来说都是非常基本的。 我使用线性回归模型来(i)研究几个解释变量与我的反应变量之间的关系,以及(ii)使用解释变量预测我的反应变量。 一个特定的解释变量X似乎对我的响应变量有显着影响。为了测试此解释变量X的增加值,以便对我的响应变量进行样本外预测,我使用了两个模型:模型(a)使用所有解释变量,模型(b)使用所有变量除了变量X。对于这两个模型,我仅报告样本外性能。看起来两个模型的性能几乎一样好。换句话说,添加解释变量X不会改善样本外预测。请注意,我还使用模型(a)(即具有所有解释变量的模型)来发现,解释变量X确实会严重影响我的响应变量。 我现在的问题是:如何解释这一发现?直截了当的结论是,即使变量X似乎使用推论模型显着影响了我的响应变量,但它并不能改善样本外预测。但是,我很难进一步解释这一发现。这怎么可能?对此发现有何解释? 提前致谢! 额外信息:具有“显着影响”是指参数估计的最高95%后验密度间隔中不包含0(即使用贝叶斯方法)。用常客的话来说,这大致对应于p值小于0.05。我仅对所有模型参数使用扩散(无信息)先验。我的数据具有纵向结构,总共包含大约7000个观测值。对于样本外预测,我使用90%的数据来拟合模型,并使用10%的数据使用多次复制来评估模型。也就是说,我多次进行了火车测试拆分,并最终报告了平均性能指标。

2
均值平方的无偏正估计
假设我们有真正的(不明)从分布获得独立同分布的样本均值和方差,我们要估计μ 2。μ,σ2μ,σ2\mu, \sigma^2μ2μ2\mu^2 我们如何构造一个无偏的,始终为正的估计量? 以样本均值的平方被偏置,并且将高估的数量,电除尘器。如果μ接近于0和σ 2是大的。μ~2μ~2\tilde{\mu}^2μμ\muσ2σ2\sigma^2 这可能是一个琐碎的问题,但我的Google技术让我失望,因为estimator of mean-squared只有回报mean-squarred-error estimators 如果使事情变得容易,则可以将基础分布假定为高斯分布。 解: 有可能构造的无偏估计 ; 参见克努姆西的答案μ2μ2\mu^2 这是不可能构建的无偏,总是正的估计,因为这些要求是冲突的,当真正的平均值是0; 见眨眼的答案μ2μ2\mu^2

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.