统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
Fisher的精确检验给出了非均匀的p值
我正在尝试在模拟的遗传问题中应用费舍尔的精确检验,但是p值似乎偏向右侧。作为一名生物学家,我想我只是在漏掉每个统计学家显而易见的东西,因此,我将非常感谢您的帮助。 我的设置是这样的:(设置1,边际不固定) 在R中随机生成两个0和1的样本。每个样本n = 500,采样0和1的概率相等。然后,我将每个样本中0/1的比例与Fisher的精确测试进行比较(只是fisher.test;还尝试了具有类似结果的其他软件)。重复采样和测试3万次。产生的p值的分布如下: 所有p值的平均值约为0.55,在0.0577处为第5个百分点。即使分布在右侧看起来也不连续。 我一直在阅读所有内容,但我没有发现任何迹象表明这种行为是正常的-另一方面,这只是模拟数据,因此我看不到任何偏见的来源。我错过了任何调整吗?样本量太小?或者也许它不应该是均匀分布的,并且p值的解释不同? 还是我应该重复一百万次,找到0.05分位数,并在将其应用于实际数据时将其用作显着性临界值? 谢谢! 更新: Michael M建议固定边际值0和1。现在,p值给出了更好的分布-不幸的是,它不是统一的,也不是我认识的任何其他形状: 添加实际的R代码:(设置2,固定的边距) samples=c(rep(1,500),rep(2,500)) alleles=c(rep(0,500),rep(1,500)) p=NULL for(i in 1:30000){ alleles=sample(alleles) p[i]=fisher.test(samples,alleles)$p.value } hist(p,breaks=50,col="grey",xlab="p-values",main="") 最终编辑: 正如胡布在评论中指出的那样,由于分箱,这些区域看上去只是扭曲了。我将附加设置1(免费边距)和设置2(固定边距)的QQ图。在下面的Glen模拟中可以看到类似的图,并且所有这些结果实际上似乎相当统一。谢谢您的帮助!


3
Jeffreys Prior用于均值和方差未知的正态分布
我正在阅读先验分布,并为均值和方差未知的正态分布随机变量的样本计算了Jeffreys Prior。根据我的计算,以下适用于现有杰弗里: p (μ ,σ2)= dË Ť (我)-----√= de t (1 / σ2001 /(2 σ4))------------------√= 12个σ6----√∝ 1σ3。p(μ,σ2)=dËŤ(一世)=dËŤ(1个/σ2001个/(2σ4))=1个2σ6∝1个σ3。 p(\mu,\sigma^2)=\sqrt{det(I)}=\sqrt{det\begin{pmatrix}1/\sigma^2 & 0 \\ 0 & 1/(2\sigma^4)\end{pmatrix}}=\sqrt{\frac{1}{2\sigma^6}}\propto\frac{1}{\sigma^3}. 在这里,一世一世I是费舍尔的信息矩阵。 但是,我还阅读了以下出版物和文件: p (μ ,σ2)∝ 1 / σ2p(μ,σ2)∝1个/σ2p(\mu,\sigma^2)\propto 1/\sigma^2见第2.2节中卡斯和瓦塞尔曼(1996)。 参见第25页中羊和Berger(1998)p (μ ,σ2)∝ 1 / σ4p(μ,σ2)∝1个/σ4p(\mu,\sigma^2)\propto 1/\sigma^4 如Jeffreys Prior那样,均值和方差未知的正态分布。杰弗里斯先验的“实际”是什么?

1
为什么不每次都进行强大的回归?
此页面的示例表明,简单回归明显受到异常值的影响,可以通过鲁棒回归技术来克服:http : //www.alastairsanderson.com/R/tutorials/robust-regression-in-R/ 。我相信lmrob和ltsReg是其他强大的回归技术。 为什么不应该每次都不进行鲁棒回归(例如rlm或rq),而不是执行简单回归(lm)?这些强大的回归技术有什么缺点吗?感谢您的见解。

1
如何减少误报的数量?
我正在尝试解决名为“ 行人检测”的任务,并且在两个类别的积极因素(人,负面因素)的背景上训练二进制clasifer。 我有数据集: 正数= 3752 负数= 3800 我使用 带有参数的train \ test split 80 \ 20%和RandomForestClassifier形式scikit-learn: RandomForestClassifier(n_estimators=100, max_depth=50, n_jobs= -1) 我得到分数:95.896757% 测试训练数据(完美运行): true positive: 3005 false positive: 0 false negative: 0 true negative: 3036 对测试数据进行测试: true positive: 742 false positive: 57 false negative: 5 true negative: 707 我的问题是如何减少误报(背景分类为人)的数量?另外,为什么我的误报错误多于误报错误? 我尝试使用class_weight参数,但有时性能会下降(如class_weight = {0:1,1:4}所示)。 …


2
回归模型的VC维
在讲座系列“ 从数据中学习”中,这位教授提到VC维度量了给定模型可以破碎多少点的模型复杂性。因此,这对于分类模型非常有效,在分类模型中,如果分类器能够有效地粉碎k个点,我们可以说出N个点,那么VC维度量将为K。但是我不清楚如何为回归模型测量VC维?


1
高矩形矩阵对随机变量的线性变换
假设我们有一个随机向量,它是从概率密度函数为的分布中得出的。如果我们用一个完整的矩阵对其进行线性变换,得到,则的密度由X⃗ ∈RnX→∈Rn\vec{X} \in \mathbb{R}^nfX⃗ (x⃗ )fX→(x→)f_\vec{X}(\vec{x})n×nn×nn \times nAAAY⃗ =AX⃗ Y→=AX→\vec{Y} = A\vec{X}Y⃗ Y→\vec{Y}fY⃗ (y⃗ )=1|detA|fX⃗ (A−1y⃗ ).fY→(y→)=1|detA|fX→(A−1y→). f_{\vec{Y}}(\vec{y}) = \frac{1}{\left|\det A\right|}f_{\vec{X}}(A^{-1}\vec{y}). 现在说我们变换X⃗ X→\vec{X}代替由m×nm×nm \times n矩阵BBB,与m>nm>nm > n,给人Z⃗ =BX⃗ Z→=BX→\vec{Z} = B\vec{X}。显然,Z∈RmZ∈RmZ \in \mathbb{R}^m,但是它“存在于” nnn维子空间G⊂RmG⊂RmG \subset \mathbb{R}^m。已知Z⃗ Z→\vec{Z}位于G中,它的条件密度是GGG多少? 我的第一个本能是使用B的伪逆BBB。如果B=USVTB=USVTB = U S V^T是奇异值分解BBB,然后B+=VS+UTB+=VS+UTB^+ = V S^+ U^T是伪逆,其中S+S+S^+通过反转对角矩阵的非零项形成SSS。我猜想这会给fZ⃗ (z⃗ )=1∣∣det+S∣∣fX⃗ (B+z⃗ ),fZ→(z→)=1|det+S|fX→(B+z→), …

2
如何通过正确的检查创建玩具生存(事件发生时间)数据
我希望创建一个正确检查的玩具生存(事件发生时间)数据,并按照比例风险和恒定基线风险进行某种分布。 我创建数据的方法如下,但是在将Cox比例风险模型拟合到模拟数据后,我无法获得接近真实值的估计风险比。 我做错什么了? R代码: library(survival) #set parameters set.seed(1234) n = 40000 #sample size #functional relationship lambda=0.000020 #constant baseline hazard 2 per 100000 per 1 unit time b_haz <-function(t) #baseline hazard { lambda #constant hazard wrt time } x = cbind(hba1c=rnorm(n,2,.5)-2,age=rnorm(n,40,5)-40,duration=rnorm(n,10,2)-10) B = c(1.1,1.2,1.3) # hazard ratios (model coefficients) hist(x %*% …

3
如何有效地生成间隔中的排序均匀分布值?
假设我要从interval生成一组随机数(a, b)。生成的序列还应该具有对其进行排序的属性。我可以想到两种方法来实现这一目标。 让n是要生成的序列的长度。 第一种算法: Let `offset = floor((b - a) / n)` for i = 1 up to n: generate a random number r_i from (a, a+offset) a = a + offset add r_i to the sequence r 第二算法: for i = 1 up to n: generate a random number …

2
两个独立统一随机变量乘积的pdf
让〜和〜与给定的分布两个独立随机变量。的分布是什么?XXXU(0,2)U(0,2)U(0,2)YYYU(−10,10)U(−10,10)U(-10,10)V=XYV=XÿV=XY 我已经尝试过卷积,知道 h(v)=∫y=+∞y=−∞1yfY(y)fX(vy)dyH(v)=∫ÿ=-∞ÿ=+∞1个ÿFÿ(ÿ)FX(vÿ)dÿh(v) = \int_{y=-\infty}^{y=+\infty}\frac{1}{y}f_Y(y) f_X\left (\frac{v}{y} \right ) dy 我们还知道, fY(y)=120Fÿ(ÿ)=1个20f_Y(y) = \frac{1}{20} ħ(v)=1h(v)=120∫y=10y=−101y⋅12dyH(v)=1个20∫ÿ=-10ÿ=101个ÿ⋅1个2dÿh(v)= \frac{1}{20} \int_{y=-10}^{y=10} \frac{1}{y}\cdot \frac{1}{2}dy h(v)=140∫y=10y=−101ydyH(v)=1个40∫ÿ=-10ÿ=101个ÿdÿh(v)=\frac{1}{40}\int_{y=-10}^{y=10} \frac{1}{y}dy 告诉我,这里有些奇怪,因为它在0处是不连续的。请帮助。

2
为排名数据绘制回归线(Spearman相关性)是否“可行”?
我有一些我计算出Spearman相关性的数据,并希望将其可视化以用于出版物。因变量是排名的,独立变量不是。我想可视化的是总体趋势,而不是实际的斜率,因此我对独立变量进行了排名,并应用了Spearman相关/回归。但是,当我绘制数据并将其插入到手稿中时,我偶然发现了这个声明(在此网站上): 当您进行Spearman秩相关时,几乎不会将回归线用于描述或预测,因此不要计算回归线的等价物。 然后 您可以按照与线性回归或相关性相同的方式来绘制Spearman等级相关性数据。但是,不要在图表上放置回归线。使用等级相关性对其进行分析后,将线性回归线放在图形上会产生误导。 问题是,回归线与我未对独立变量进行排名并计算皮尔逊相关性时没有太大不同。趋势是相同的,但是由于期刊中彩色图形的费用过高,所以我使用单色表示,并且实际数据点重叠得太多,以致无法识别。 当然,我可以通过制作两个不同的图来解决此问题:一个用于数据点(排名),另一个用于回归线(未排名),但是如果事实证明我引用的来源有误或存在问题,就我而言,这不是问题,它将使我的生活更轻松。(我也看到了这个问题,但这并没有帮助我。) 编辑其他信息: 如果将分类算法的性能进行比较,则x轴上的自变量表示特征的数量,y轴上的因变量表示等级。现在,我有一些算法可以平均比较,但是我想对我的情节说的是:“虽然分类器A越好,存在的特征越多,分类器B越好,存在的特征越多” 编辑2以包括我的地块: 绘制的算法等级与特征数量的关系 绘制的算法等级与特征等级的对比 因此,重复标题中的问题: 可以为Spearman相关/回归的排名数据绘制回归线吗?



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.