统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答



2
贝叶斯定理中的归一化常数
Pr(data)Pr(data)\Pr(\textrm{data}) Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)Pr(parameters∣data)=Pr(data∣parameters)Pr(parameters)Pr(data)\Pr(\text{parameters} \mid \text{data}) = \frac{\Pr(\textrm{data} \mid \textrm{parameters}) \Pr(\text{parameters})}{\Pr(\text{data})} 被称为归一化常数。到底是什么 目的是什么?为什么看起来像Pr(data)Pr(data)\Pr(data)?为什么不取决于参数?

4
如何在假设检验中指定原假设
如何为原假设选择问题的最佳经验法则是什么。例如,如果我要检查假设B是否为真,我应该使用B作为零值,使用B作为替代假设,还是将NOT B用作零值?我希望问题清楚。我知道这与我要最小化的错误(类型I?)有关,但我一直忘了它的发展,因为我没有为它建立清晰的直觉。谢谢。

4
在R中添加观测值和/或预测变量时,有效地更新线性回归
我想在R中找到一种方法,以便在添加观察值或预测变量时有效地更新线性模型。在添加观察值时,biglm具有更新功能,但是我的数据足够小以驻留在内存中(尽管我确实有大量实例需要更新)。有一些方法可以赤手空拳,例如,更新QR因式分解(请参阅Hammarling和Lucas的“更新QR因式分解和最小二乘问题”),但我希望有一个现有的实现。

5
比贝叶斯主义有更多的可能性吗?
作为一个物理专业的学生,​​我大概经历了六次“为什么我是贝叶斯”的演讲。总是一样的-主持人自鸣得意地解释了贝叶斯解释如何优于大众所称的常客主义解释。他们提到了贝叶斯规则,边缘化,先验和后验。 真实的故事是什么? 是否有适用于常客统计数据的合法适用范围?(肯定要多次采样或滚动模具吗?) 除了“贝叶斯”和“频率论者”之外,还有没有其他有用的概率论?

4
套索的最佳罚分选择
是否有关于任何分析结果或实验论文最优的系数的选择罚项。通过优化,我的意思是最大化选择最佳模式,或最大限度地减少预期损失的概率相关的参数。我之所以问是因为,由于问题的实例很多,或者由于手头的问题的大小,通过交叉验证或引导程序选择参数通常是不切实际的。唯一积极的结果,我所知道的是Candes和计划,通过近理想模型选择ℓ 1的最小化。ℓ1ℓ1\ell_1ℓ1ℓ1\ell_1

2
应用低事件发生率的逻辑回归
我有一个数据集,其中事件率非常低(40,000总分)。我正在对此进行逻辑回归。我曾与某人讨论过,结果表明逻辑回归不会在如此低的事件发生率数据上提供良好的混淆矩阵。但是由于业务问题及其定义方式,尽管我同意可以删除一些非事件人口,但我无法将事件数从40,000增加到任何更大的数目。12 ⋅ 10512⋅10512\cdot10^5 请告诉我您对此的看法,特别是: Logistic回归的准确性是否取决于事件发生率,或者是否建议任何最低事件发生率? 是否有用于低事件发生率数据的特殊技术? 删除非事件总体是否对模型的准确性有利? 我是统计建模的新手,请原谅我的无知,请解决我可能想到的任何相关问题。 谢谢,
15 logistic 

2
如何计算变量分区的方差
我正在运行一个实验,在该实验中我将并行收集(独立)样本,我计算了每组样本的方差,现在我想将所有样本合并起来以找到所有样本的总方差。 由于不确定术语,我很难找到这个的派生词。我认为它是一个RV的分区。 所以,我想找到V一个- [R (X)V一种[R(X)Var(X)从V一个[R (X1)Var(X1个)Var(X_1),V一个- [R (X2)V一种[R(X2)Var(X_2),...,和V一个- [R (Xñ)V一种[R(Xñ)Var(X_n),其中XXX = [ X1个,X2,… ,Xñ][X1个,X2,…,Xñ][X_1, X_2, \dots, X_n]。 编辑:分区不是相同的大小/基数,但是分区大小的总和等于整个样本集中的样本数。 编辑2:这里有一个用于并行计算的公式,但是它仅涉及将分区分为两组而不是ññn组的情况。
15 variance 

3
CDF举足轻重?
如果FZFZF_Z是CDF,则看起来FZ(z)αFZ(z)αF_Z(z)^\alpha()也是CDF。α>0α>0\alpha \gt 0 问:这是标准结果吗? Q:有一个很好的方法找到一个函数与 ST,其中gggX≡g(Z)X≡g(Z)X \equiv g(Z)FX(x)=FZ(z)αFX(x)=FZ(z)αF_X(x) = F_Z(z)^\alphax≡g(z)x≡g(z) x \equiv g(z) 基本上,我手头还有另一个CDF。从某种程度上讲,我想描述产生该CDF的随机变量的特征。FZ(z)αFZ(z)αF_Z(z)^\alpha 编辑:如果能得到特殊情况的分析结果,我会很高兴。或者至少知道这样的结果很棘手。Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)

3
如何绘制聚类的数据输出?
我尝试对一组数据(一组标记)进行聚类,并得到2个聚类。我想用图形表示它。由于我没有(x,y)坐标,因此对表示有点困惑。 还要寻找这样做的MATLAB / Python函数。 编辑 我认为发布数据使问题更清晰。我有两个使用Python中的kmeans集群(不使用scipy)创建的集群。他们是 class 1: a=[3222403552.0, 3222493472.0, 3222491808.0, 3222489152.0, 3222413632.0, 3222394528.0, 3222414976.0, 3222522768.0, 3222403552.0, 3222498896.0, 3222541408.0, 3222403552.0, 3222402816.0, 3222588192.0, 3222403552.0, 3222410272.0, 3222394560.0, 3222402704.0, 3222298192.0, 3222409264.0, 3222414688.0, 3222522512.0, 3222404096.0, 3222486720.0, 3222403968.0, 3222486368.0, 3222376320.0, 3222522896.0, 3222403552.0, 3222374480.0, 3222491648.0, 3222543024.0, 3222376848.0, 3222403552.0, 3222591616.0, 3222376944.0, 3222325568.0, 3222488864.0, 3222548416.0, 3222424176.0, 3222415024.0, 3222403552.0, …


2
了解R的增强Dickey Fuller测试中的k滞后
我在R中进行了一些单位根测试,但我不完全确定k lag参数的含义。我使用了tseries软件包中的增强Dickey Fuller测试和Philipps Perron测试。显然,默认的参数(用于)仅取决于序列的长度。如果选择不同的我得到的结果将完全不同。拒绝null:ķķkadf.testķķk Dickey-Fuller = -3.9828, Lag order = 4, p-value = 0.01272 alternative hypothesis: stationary # 103^(1/3)=k=4 Dickey-Fuller = -2.7776, Lag order = 0, p-value = 0.2543 alternative hypothesis: stationary # k=0 Dickey-Fuller = -2.5365, Lag order = 6, p-value = 0.3542 alternative hypothesis: stationary # k=6 加上PP测试结果: …
15 r  time-series  trend 

1
“ Heywood Case”的确切定义是什么?
我一直在非正式地使用术语“ Heywood Case”来指代由于数值精度问题在线,有限响应迭代更新的方差估计变为负数的情况。(我使用的是Welford方法的一种变体来添加数据并删除较旧的数据。)我的印象是,它适用于因数值误差或建模误差而使方差估计值变为负数的任何情况,但同事我对这个术语的用法感到困惑。除了在因子分析中使用的Google搜索之外,它的搜索量很少,并且似乎是指负方差估计的结果。确切的定义是什么?最初的海伍德是谁?

3
为什么总是使用均值0和标准差1分布?
我的统计数据是自学的,但是我阅读的许多资料都指向平均值为0,标准差为1的数据集。 如果是这样,那么: 为什么平均值0和SD 1是一个不错的属性? 为什么从该样本中得出的随机变量等于0.5?抽取0.001的机会与0.5相同,因此这应该是平坦分布... 当人们谈论Z分数​​时,这实际上是什么意思?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.