统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
他们为什么会在这里选择伽玛分布?
在本课程的其中一项练习中,我们使用的是Kaggle医学数据集。 练习说: 我们希望对单个费用的分布进行建模,我们也确实希望能够捕获有关该分布的不确定性,以便更好地捕获可能看到的值的范围。加载数据并执行初始视图: 从上面我们可能会怀疑这里存在某种指数状分布。...保险索赔费用可能是多式联运的。伽马分布可能是适用的,我们可以测试一下并非首先是保险索赔的费用的分布。 我查看了 “伽玛分布”,发现“一个连续的,仅正的单峰分布,该分布编码了在Poisson过程中发生“ alpha”事件所需的时间,平均到达时间为“ beta”。 这里没有时间,只有无关的费用,无论是否有保险。 他们为什么要选择伽玛分布?

3
如何测量两个频率分布之间的统计“距离”?
我正在执行一个数据分析项目,其中涉及调查一年中网站的使用时间。我想做的是比较使用模式的“一致性”,例如,与每周使用1小时一次或每次使用10分钟一次的模式有多接近6每周次数。我知道可以计算的几件事: 香农熵:衡量结果中的“确定性”相差多少,即概率分布与均匀分布的相差多少? Kullback-Liebler散度:测量一个概率分布与另一个概率分布有多少不同 Jensen-Shannon散度:与KL 散度相似,但在返回有限值时更有用 Smirnov-Kolmogorov检验:一种用于确定连续随机变量的两个累积分布函数是否来自同一样本的检验。 卡方检验:一种拟合优度检验,用于确定频率分布与预期频率分布的差异程度。 我想做的是比较分布中实际使用时间(蓝色)与理想使用时间(橙色)的差异。这些分布是离散的,下面的版本被归一化为概率分布。横轴表示用户在网站上花费的时间(以分钟为单位);这已记录在一年中的每一天;如果用户根本没有上过网站,则该时间为零,但已从频率分布中删除。右边是累积分布函数。 我唯一的问题是,即使我可以使JS-divergence返回一个有限值,但当我查看不同的用户并将其使用分布与理想用户进行比较时,我得到的值几乎是相同的(因此这不是一个好方法。表示两者之间的差异)。同样,当归一化为概率分布而不是频率分布时,会丢失大量信息(例如,学生使用该平台50次,则应垂直缩放蓝色分布,以使长条的总长度等于50,并且橙色栏的高度应为50,而不是1)。我们所说的“一致性”的部分原因是用户访问网站的频率是否会影响他们从网站中获得多少收益;如果他们失去访问该网站的次数,那么比较概率分布就有点不确定了;即使用户持续时间的概率分布接近“理想”使用情况,该用户在一年中可能只使用了1周的平台,这可能不是很一致。 是否有比较完善的技术来比较两个频率分布并计算某种度量,以表征它们的相似度(或相异度)?


2
Wolfram Mathworld是否会错误地描述具有概率密度函数的离散概率分布?
通常,使用概率质量函数(PMF)描述离散变量的概率分布: 当使用连续随机变量时,我们使用概率密度函数(PDF)而不是概率质量函数来描述概率分布。 - 深度学习的古德费洛,Bengio和库维尔 但是,Wolfram Mathworld使用PDF来描述离散变量的概率分布: 这是一个错误吗?还是没关系?

2
从连续数据到分类总是错误的吗?
当我读到有关如何设置数据的知识时,经常遇到的一件事是将一些连续数据转换为分类数据并不是一个好主意,因为如果阈值确定不当,您很可能会得出错误的结论。 但是,我目前有一些数据(前列腺癌患者的PSA值),我认为普遍的共识是,如果您低于4岁,您可能没有,如果您高于4岁,则您处于危险之中,然后高于10和20,您可能已经拥有了。这样的东西。在那种情况下,将我的连续PSA值分类为0-4、4-10和> 10的组是否仍然不正确?还是可以说阈值是“确定的”,实际上可以吗?

2
不独立于样本分布的统计示例?
这是维基百科上统计的定义 更正式地说,统计理论将统计量定义为样本的函数,其中函数本身与样本的分布无关。也就是说,可以在实现数据之前说明功能。统计信息一词既用于函数,也用于给定样本上的函数值。 我想我对这个定义大体上了解,但是我不能弄清函数独立于样本分布的那部分。 我到目前为止对统计的理解 一个样本是一组的一些数目的独立的实现中的,同分布与分布F(iid)的随机变量(10层的实现一个20面公平骰子,一个六面公平骰子的5个辊100米的实现的一个辊,从人口中随机抽取100个人)。 一个函数,其域就是该集合,其范围是实数(或者它可以产生其他事物,例如矢量或其他数学对象……)将被视为统计信息。 当我想到示例时,均值,中位数,方差在这种情况下都是有意义的。它们是一组实现的函数(来自随机样本的血压测量)。我还可以看到如何将线性回归模型视为统计yi=α+β⋅xiyi=α+β⋅xiy_{i} = \alpha + \beta \cdot x_{i} -这不仅是一组实现上的函数吗? 我感到困惑的地方 假设我从上面的理解是正确的,那么我将无法理解某个函数可能与样本分布无关的地方。我一直在想一个例子来理解它,但是没有运气。任何见解将不胜感激!

3
置信区间何时“有意义”,而相应的可信区间却没有?
通常情况下,具有95%覆盖率的置信区间与包含95%后验密度的可信区间非常相似。当先验是均匀的或在后者情况下接近均匀时,会发生这种情况。因此,置信区间通常可以用来近似可信区间,反之亦然。重要的是,我们可以由此得出结论,对于许多简单的用例而言,将置信区间作为可信区间的误解很多,几乎没有实际意义。 有许多没有发生这种情况的例子,但是它们似乎都被贝叶斯统计的拥护者挑剔,试图证明这种惯常方法是有问题的。在这些示例中,我们看到置信区间包含不可能的值等,这应该表明它们是无稽之谈。 我不想回顾那些例子,也不想对贝叶斯与频频主义者进行哲学讨论。 我只是在寻找相反的例子。在任何情况下,置信度和可信度间隔都大不相同,并且置信度过程提供的间隔明显更好吗? 需要说明的是:这是通常期望可信区间与相应的置信区间重合的情况,即使用先验,统一等先验时的情况。我对有人选择事先任意决定的情况不感兴趣。 编辑: 为响应@JaeHyeok Shin的以下回答,我必须不同意他的示例使用正确的可能性。我使用近似贝叶斯计算来估计下面R中theta的正确后验分布: ### Methods ### # Packages require(HDInterval) # Define the likelihood like <- function(k = 1.2, theta = 0, n_print = 1e5){ x = NULL rule = FALSE while(!rule){ x = c(x, rnorm(1, theta, 1)) n = length(x) x_bar = mean(x) rule = …

2
柯西分布是某种“不可预测的”分布吗?
柯西分布是某种“不可预测的”分布吗? 我试着做 cs <- function(n) { return(rcauchy(n,0,1)) } 在R中获得了多个n值,并注意到它们有时会生成非常不可预测的值。 比较一下例如 as <- function(n) { return(rnorm(n,0,1)) } 这似乎总是给点“紧凑”的云。 通过这张图片,它应该看起来像正态分布吗?然而,它可能仅适用于一部分价值。还是诀窍在于,柯西标准偏差(如下图所示)收敛得更慢(左右方向),因此尽管概率较低,但允许更严重的离群值? 这里是正常rv,cs是柯西rv。 但是,由于异常值的极端,Cauchy pdf的尾部可能永远不会收敛吗?

5
如何计算线性回归与已知理论线之间是否具有统计学上的显着差异?
我有一些数据大致沿着直线拟合: 当我对这些值进行线性回归时,我得到一个线性方程: y=0.997x−0.0136y=0.997x−0.0136y = 0.997x-0.0136 在理想世界中,该等式应为。y=xy=xy = x 显然,我的线性值接近理想值,但不完全相同。我的问题是,如何确定此结果是否具有统计意义? 0.997的值是否明显不同于 1?-0.01 与0 显着不同吗?还是它们在统计上是相同的,我可以得出具有一定合理置信度的结论?y=xy=xy=x 我可以使用什么好的统计检验? 谢谢

2
为什么《辛普森一家》(电视连续剧)在预测未来方面如此成功?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 在黄色而非黄色媒体中,它得到了广泛的评论,以至于《辛普森一家》(电视连续剧)反复预测了未来。关于它的综合在线文章在这里和这里。如果您用谷歌 “辛普森一家预测未来”,那么您将获得数百万的点击量和视频。 也许最引人注目的“预测”(至少对我而言)是特朗普担任美国总统(2000年作出!)。最新的似乎是加拿大大麻的合法化。 问题是,为什么这种明显的成功? 我的猜测是,(i)辛普森一家做出了很多 “预测”(而是建立了情景),(ii)从统计学上来说,点击率实际上很低(不是我计算过)。明显的“成功”只是一种认知偏见。

2
我可以使用分布的矩采样分布吗?
我注意到在统计/机器学习方法中,分布通常由高斯近似,然后将高斯用于采样。它们通过计算分配的所述第一两个时刻开始,并使用这些估计μμ\mu和σ2σ2\sigma^2。然后他们可以从那个高斯样本中取样。 在我看来,我计算出的力矩越多,我越应该能够估计出我想要采样的分布。 如果我计算3个矩该怎么办...如何使用这些矩从分布中采样?这可以扩展到N个时刻吗?

3
如果
题 如果X1,⋯,Xn∼N(μ,1)X1,⋯,Xn∼N(μ,1)X_1,\cdots,X_n \sim \mathcal{N}(\mu, 1)是IID,则计算E(X1∣T)E(X1∣T)\mathbb{E}\left( X_1 \mid T \right),其中T=∑iXiT=∑iXiT = \sum_i X_i。 尝试:请检查以下是否正确。 让我们说,我们采取的这些条件期望使得总和 ∑iE(Xi∣T)=E(∑iXi∣T)=T.∑iE(Xi∣T)=E(∑iXi∣T)=T.\begin{align} \sum_i \mathbb{E}\left( X_i \mid T \right) = \mathbb{E}\left( \sum_i X_i \mid T \right) = T . \end{align} 这意味着每个E(Xi∣T)=TnE(Xi∣T)=Tn\mathbb{E}\left( X_i \mid T \right) = \frac{T}{n}因为X1,…,XnX1,…,XnX_1,\ldots,X_n是IID。 因此,E(X1∣T)=TnE(X1∣T)=Tn\mathbb{E}\left( X_1 \mid T \right) = \frac{T}{n}。这是对的吗?

1
决策树的深度
由于决策树算法在每个步骤都对属性进行分割,因此决策树的最大深度等于数据的属性数。它是否正确?

6
更重要的统计数据是:“所有妇女中90%幸存”或“所有妇女中90%是妇女”?
考虑以下有关泰坦尼克号的陈述: 假设1:只有男人和女人在船上 假设2:有很多男人和女人 陈述1:90%的妇女幸存 陈述2:在所有幸存者中,有90%是女性 第一个表明,挽救妇女可能是重中之重(无论是否挽救男性) 第二种统计数据什么时候有用? 我们可以说其中一个几乎总是比另一个有用吗?

1
哪些套袋算法值得随机森林公司接班?
对于增强算法,我想说它们发展得很好。1995年初引入了AdaBoost,然后过了一段时间,它是Gradient Boosting Machine(GBM)。最近,在2015年左右推出了XGBoost,它非常准确,可以处理过度拟合,并且已成为多次Kaggle竞赛的获胜者。LightGBM在2017年由Microsoft引入,与XGBoost相比,它提供的培训时间大大减少。此外,Yandex推出了CatBoost,用于处理分类功能。 随机森林(Random Forest)于2000年代初推出,但是有没有值得的继任者?我认为,如果存在一种比Random Forest更好的装袋算法(可以在实践中轻松应用),它将在像Kaggle这样的地方引起关注。另外,为什么增强成为更流行的集成技术,是因为您可以构建更少的树以获得最佳预测?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.