统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
非常偏斜的群集,计数数据:有什么建议(转换等)?
基本问题 这是我的基本问题:我正在尝试将包含一些非常偏斜的变量与计数的数据集聚类。变量包含许多零,因此对于我的聚类过程不是很有帮助-这很可能是k-means算法。 很好,您说的是,只需使用平方根,Box Cox或对数转换变量即可。但是由于我的变量是基于分类变量的,所以我担心我可能会通过处理一个变量(基于分类变量的一个值)而使其他变量(基于分类变量的其他值)而产生偏差。 。 让我们更详细些。 数据集 我的数据集代表物品的购买。这些项目具有不同的类别,例如颜色:蓝色,红色和绿色。然后,例如由顾客将购买分组在一起。这些客户中的每一个都由我的数据集的一行代表,因此我必须以某种方式汇总客户的购买量。 我这样做的方式是通过计算购买次数,其中该商品是某种颜色。因此,而不是一个变量color,我结束了三个变量count_red,count_blue和count_green。 这是一个示例说明: ----------------------------------------------------------- customer | count_red | count_blue | count_green | ----------------------------------------------------------- c0 | 12 | 5 | 0 | ----------------------------------------------------------- c1 | 3 | 4 | 0 | ----------------------------------------------------------- c2 | 2 | 21 | 0 | ----------------------------------------------------------- c3 | 4 …

1
哪个表可用于交叉表分析:Boschloo或Barnard?
我正在分析来自30位患者的小型数据集的2x2表。我们正在回顾性地尝试寻找一些变量,这些变量可以提示选择哪种治疗方法。变量(obs正常/奇怪)和治疗决策(A / B)具有特殊意义,因此数据如下所示: Obs / Tr。十二月正常奇怪一个12012乙13518岁25530Obs / Tr。十二月一个乙正常121325奇怪0551218岁30\begin{array} {|r|r|r|r|} \hline \text{Obs/Tr. Dec.} &\text{A} &\text{B}\\ \hline \text{normal} &12 &13 &25\\ \hline \text{strange} &0 &5 &5\\ \hline &12 &18 &30\\ \hline \hline \end{array} 显然,一个单元格缺少条目,这不包括卡方检验,而Fisher的精确检验没有给出饱和的p值(但仍小于10%)。因此,我的第一个想法是找到一种功能更强大的测试,并且在博客和本文中有关Barnard和Boschloos测试的文章中进行了阅读 ,总的来说,有以下三种情况可以产生强大的测试: 固定列和行和 Fisher的精确检验→→\rightarrow 固定的列或(xclusive)行和 Barnard的精确检验→→\rightarrow 没有固定的 Boschloos的精确测试→→\rightarrow 上面的文章指出,处理A和处理B的总和以前几乎是未知的,因此我们可以排除Fisher的精确检验。但是其他选择呢?如果我们有健康的对照,我们可以控制安慰剂和verum组,我们可以控制这些数字,因此可以选择2:Barnard。就我而言,我不确定,因为一方面我们有一个类似的数学问题(观察水平的总和等于安慰剂/ verum的总和),这导致了Barnard,但设计有所不同,因为我们无法控制nr。采样前正常/奇怪的观察结果,导致3:Boschloo。 那么应该使用哪个测试,为什么呢?我当然要大功率。 (我想知道的另一个问题是,如果在chisq.testr的情况下使用不是更好prop.test(x, alternative = "greater")?在这里对理论方面进行了说明。)

1
负二项分布的最大似然估计
问题如下: 从参数k = 3的负二项式分布中收集n个值的随机样本。 找到参数π的最大似然估计。 为该估计量的标准误差找到一个渐近公式。 说明如果参数k足够大,为什么负二项式分布将近似正态。此正态近似的参数是什么? 我的工作如下: 1.我觉得这是需要的,但是我不确定在这里我是否准确,或者鉴于提供的信息,我是否可以做得更好? p(x)=(x−1k−1)πk(1−π)x−kL(π)=Πnip(xn|π)ℓ(π)=Σniln(p(xn|π))ℓ‘(π)=Σnikπ−(x−k)(1−π)p(x)=(x−1k−1)πk(1−π)x−kL(π)=Πinp(xn|π)ℓ(π)=Σinln⁡(p(xn|π))ℓ‘(π)=Σinkπ−(x−k)(1−π)p(x) = {x-1 \choose k-1}\pi^k(1-\pi)^{x-k}\\ L(\pi) = \Pi_i^n p(x_n|\pi)\\ \ell(\pi) = \Sigma_i^n\ln(p(x_n|\pi))\\ \ell`(\pi) = \Sigma_i^n\dfrac{k}{\pi}-\dfrac{(x-k)}{(1-\pi)} 我认为以下是要求的。对于最后部分我感觉需要更换π^π^\hat{\pi}与kxkx\dfrac{k}{x} ℓ‘‘(π^)=−kπ^2+x(1−π^)2se(π^)=−1ℓ‘‘(π^)−−−−−−−√se(π^)=π^2k−(1−π^)2x−−−−−−−−−−−−√ℓ‘‘(π^)=−kπ^2+x(1−π^)2se(π^)=−1ℓ‘‘(π^)se(π^)=π^2k−(1−π^)2x\ell``(\hat{\pi}) = -\dfrac{k}{\hat{\pi}^2} + \dfrac{x}{(1-\hat{\pi})^2}\\ se(\hat{\pi}) = \sqrt{-\dfrac{1}{\ell``(\hat{\pi})}}\\ se(\hat{\pi}) = \sqrt{\dfrac{\hat{\pi}^2}{k} - \dfrac{(1-\hat{\pi})^2}{x}}\\ 我不确定如何证明这一点,并且仍在研究中。任何提示或有用的链接将不胜感激。我觉得这可能与负二项式分布可以看作是几何分布的集合有关,或者与二项式分布的倒数有关,但不确定如何处理。 任何帮助将不胜感激


2
差异法中的差异:如何检验治疗组和对照组之间共同趋势的假设?
继从评论以前的线程,我想知道,如何能够测试的在差异方法的不同治疗组和对照组之间的共同趋势的假设? 我是否可以使用两个时间点的数据(例如2002年的基线调查,2002年至2006年的治疗以及2006年的随访调查)来检验该假设? 非常感谢你! 编辑:发布此问题后,“相关”面板将我引到这个未回答的问题,在该问题中,问问者希望了解某种方法背后的直觉,以解释DID方法中的时间趋势。我想在这里链接它,因为这个问题对我也很有趣。谢谢!

4
维度诅咒:kNN分类器
我正在阅读凯文·墨菲(Kevin Murphy)的书:《机器学习-概率论》。在第一章中,作者正在解释维数的诅咒,其中有一部分我不理解。例如,作者指出: 考虑输入沿D维单位立方体均匀分布。假设我们通过在x周围生长一个超立方体直到它包含所需的数据点分数来估计类标签的密度。该立方体的预期边缘长度为。e D(f )= f 1FFfËd(f)= f1个dËd(F)=F1个de_D(f) = f^{\frac{1}{D}} 这是我无法理解的最后一个公式。似乎如果要覆盖10%的点,则沿每个尺寸的边长应为0.1?我知道我的推理是错误的,但我不明白为什么。


2
增量高斯过程回归
我想使用在数据点上通过数据流一个一到达的滑动窗口来实现增量式高斯过程回归。 让表示输入空间的维数。因此,每个数据点x i具有d个元素。dddX一世xix_iddd 令为滑动窗口的大小。ñnn 为了做出预测,我需要计算语法矩阵的逆,其中K i j = k (x i,x j),k是平方指数核。ķKKķ我Ĵ= k (x一世,XĴ)Kij=k(xi,xj)K_{ij} = k(x_i, x_j) 为了避免K随着每个新数据点变大,我认为可以在添加新点之前删除最旧的数据点,这样可以防止gram增长。例如,让其中,Σ是权重的协方差和φ是由平方指数内核隐含的隐式映射函数。ķ= ϕ (X)ŤΣ φ (X)K=ϕ(X)TΣϕ(X)K = \phi(X)^{T}\Sigma\phi(X)ΣΣ\Sigmaϕϕ\phi 现在让 ]和X n e w = [ x t − n + 2 | 。。。| X Ť | X 吨+ 1 ],其中X “s的ð由1列的矩阵。X= [ xt − …

2
均值差异与均值差异
在研究两个独立样本均值时,我们被告知我们正在研究“两种均值的差异”。这意味着我们从人口1(平均y¯1y¯1\bar y_1),并从它减去人口2(平均)。所以,我们的“两种方式的区别”是( -)。y¯2y¯2\bar y_2y¯1y¯1\bar y_1y¯2y¯2\bar y_2 在研究配对样本均值时,我们被告知正在查看“均值差”。通过计算每对之间的差异,然后取所有这些差异的平均值来计算。d¯d¯\bar d 我的问题是:我们是否得到相同的( -)与它的,如果我们从两列数据计算出它们,并在第一时间认为这是两个独立的样本,而第二时间考虑它配对数据?我玩了两列数据,看起来值是一样的!在那种情况下,可以说只是出于非量化的原因使用了不同的名称吗? ˉ ý 2 ˉ dy¯1y¯1\bar y_1y¯2y¯2\bar y_2d¯d¯\bar d

1
了解分数微分公式
我有一个时间序列,我想它建模为一个分整(又名FARIMA)过程。如果y t是(分数)阶d的积分,我想对其进行分数差分以使其固定。ÿŤÿŤy_tÿŤÿŤy_tddd 问题:以下定义分数微分的公式正确吗? ΔdÿŤ:= yŤ- dÿt − 1+ d(d− 1 )2 !ÿt − 2- d(d− 1 )(d− 2 )3 !ÿt − 3+ 。。。+ (− 1 )k + 1d(d− 1 )⋅ 。。。⋅ (d− k )ķ !ÿ吨- ķ+ 。。。ΔdÿŤ:=ÿŤ-dÿŤ-1个+d(d-1个)2!ÿŤ-2-d(d-1个)(d-2)3!ÿŤ-3+。。。+(-1个)ķ+1个d(d-1个)⋅。。。⋅(d-ķ)ķ!ÿŤ-ķ+。。。\Delta^d y_t := y_t - d y_{t-1} + \frac{d(d-1)}{2!} y_{t-2} - \frac{d(d-1)(d-2)}{3!} y_{t-3} + …




2
为什么PCA最大化投影的总方差?
克里斯托弗·毕晓普(Christopher Bishop)在他的《模式识别和机器学习》一书中写道,在将数据投影到与先前选定的组件正交的空间之后,每个连续的主分量将投影在一个维度上的方差最大化。其他人显示类似的证明。 但是,这仅证明了就最大方差而言,每个连续分量都是对一个维度的最佳投影。为什么这意味着,首先选择这样的组件,投影到5个维度的方差最大化?

2
f-measure是准确性的代名词吗?
我了解f量度(基于精度和召回率)是对分类器的准确性的估计。同样,当我们有不平衡的数据集时,f度量优于准确性。我有一个简单的问题(更多是关于使用正确的术语,而不是技术)。我的数据集不平衡,并且在实验中使用了f-measure。我准备写一篇不适合机器学习/数据挖掘会议的论文。因此,在这种情况下,我可以准确地同义地指代f度量。例如,我的f值为0.82,那么我可以说我的分类器达到了82%的准确预测吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.