统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
独立性测试与同质性测试
我正在教授基础统计学课程,今天我将介绍两类独立性的卡方检验和同质性检验。这两种方案在概念上是不同的,但是可以使用相同的测试统计量和分布。在同质性测试中,其中一个类别的边际总数被认为是设计本身的一部分-它们代表为每个实验组选择的主题数。但是,由于卡方检验围绕所有边际总数的条件进行,因此,对同质性检验和具有分类数据的独立性检验进行区分不会有任何数学上的影响-使用该检验时至少没有。 我的问题如下:是否有任何流派的统计思想或统计方法会得出不同的分析结果,这取决于我们是在测试独立性(所有边际都是随机变量)还是在检验同质性(其中一组边际是由设计设置)? 在连续的情况下,假设我们在同一主题上观察并进行独立性检验,或者观察不同人群中的并检验它们是否来自同一分布,则方法是不同的(相关性分析与t检验)。如果分类数据来自离散连续变量怎么办?独立性和同质性的检验是否应该区分开?(X,Y)(X,Y)(X,Y)(X1个,X2)(X1,X2)(X_1, X_2)

2
仅一类的分类器
在简单的分类中,我们有两个类:class-0和class-1。在某些数据中,我只有Class-1的值,所以没有Class-0的值。现在,我正在考虑建立一个模型来对第1类的数据进行建模。因此,当有新数据出现时,该模型将应用于新数据,并找到一个概率,说明新数据与该模型相适应的可能性。然后,与阈值进行比较,我可以过滤不适当的数据。 我的问题是: 这是解决此类问题的好方法吗? 可以在这种情况下使用RandomForest分类器吗?我是否需要为第0类添加人工数据,希望分类器将其视为噪声? 还有其他想法可以解决这个问题吗?

2
最高和经常关闭-包括答案
中号ÿ d一个吨一个小号ë 吨:中号ÿ d一个Ť一个sËŤ:My \ \ dataset: 1 :A ,B ,C,E1个:一个,乙,C,Ë1: A,B,C,E 2 :A ,C,D ,E2:一个,C,d,Ë2:A,C,D,E 3 :B ,C ,E3: 乙,C,Ë3:\ \ \ \ \ B,C,E 4 :A ,C,D ,E4:一个,C,d,Ë4:A,C,D,E 5 :C ,D ,E5: C,d,Ë5:\ \ \ \ C, D, E 6 :A ,D ,E 6: 一个,d,Ë6: \ \ \ …

3
广义线性混合模型:模型选择
这个问题/主题是在与一位同事的讨论中提出的,我正在就此寻求一些意见: 我正在使用随机效应逻辑回归建模一些数据,更确切地说是随机截距逻辑回归。对于固定效果,我有9个有趣且值得考虑的变量。我想进行某种模型选择,以找到重要的变量并给出“最佳”模型(仅主要效果)。 我的第一个想法是使用AIC比较不同的模型,但是使用9个变量,我比较比较2 ^ 9 = 512个不同的模型(关键字:数据挖掘)并不太令人兴奋。 我与一位同事讨论了这个问题,他告诉我,他记得曾经读过关于对GLMM使用逐步(或向前)模型选择的文章。但是应该使用AIC作为进入/退出标准,而不是使用p值(例如,基于GLMM的似然比检验)。 我发现这个想法非常有趣,但是我没有找到进一步讨论此问题的参考资料,而我的同事不记得他在哪里读过。许多书籍建议使用AIC来比较模型,但是我没有找到关于将其与逐步或向前模型选择过程一起使用的任何讨论。 所以我基本上有两个问题: 在逐步模型选择过程中将AIC用作进入/退出标准有什么问题吗?如果是,那有什么选择? 您是否有参考资料讨论上述过程(也作为最终报告的参考资料? 最好, 艾米利亚

1
内核方法的局限性是什么?何时使用内核方法?
内核方法在许多监督分类任务中非常有效。那么内核方法的局限性是什么?何时使用内核方法?特别是在大规模数据时代,内核方法有哪些进步?内核方法和多实例学习之间有什么区别?如果数据为500x10000,500则为样本数,并且10000为每个特征的维数,那么在这种情况下,我们可以使用核方法吗?


1
应该使用哪种统计检验来检验基因清单的丰富性?
我进行了一项实验,以测试细胞对某种DNA损伤剂的敏感性。我们发现了270个对药物特别敏感的基因,分析的基因总数为3668。在270个敏感基因中,有38个被归类为“ DNA修复基因”。如果基因组中包含“ DNA修复基因”的数目为112,而基因组中的基因总数为3668,那么敏感基因是否富含DNA修复基因?应该使用哪种统计检验?如果您还可以告诉我一些在线计算p值的工具,我们将不胜感激。

1
概率和模糊逻辑有什么区别?
我从事模糊逻辑(FL)已有多年,我知道FL与概率之间存在差异,特别是在FL处理不确定性方面。但是,我想问问FL和概率之间还有什么区别? 换句话说,如果我处理概率(融合信息,汇总知识),我可以对FL做同样的事情吗?
10 bayes  fuzzy 

1
GLM的日志可能性
在下面的代码中,我使用glm对分组数据执行逻辑回归,并使用mle2对“手工”进行逻辑回归。为什么R中的logLik函数会给我一个对数可能性logLik(fit.glm)=-2.336,而不是我手工得到的一个logLik(fit.ml)=-5.514? library(bbmle) #successes in first column, failures in second Y <- matrix(c(1,2,4,3,2,0),3,2) #predictor X <- c(0,1,2) #use glm fit.glm <- glm(Y ~ X,family=binomial (link=logit)) summary(fit.glm) #use mle2 invlogit <- function(x) { exp(x) / (1+exp(x))} nloglike <- function(a,b) { L <- 0 for (i in 1:n){ L <- L + sum(y[i,1]*log(invlogit(a+b*x[i])) …


3
引导残差:我做对了吗?
首先:据 我了解,引导残差的工作方式如下: 使模型适合数据 计算残差 重新采样残差并将其添加到1。 使模型适合3中的新数据集。 重复n次数,但始终将重新采样的残差添加到从1开始的拟合中。 到目前为止,对吗? 我想做的是稍微不同的事情: 我想为估计一些环境变量的算法估计参数和预测不确定性。 我所拥有的是该变量的无错误时间序列(来自模拟)x_true,在其中添加了一些噪声,x_noise以生成综合数据集x。然后,我尝试通过将平方和sum((x_estimate - x_true)^2)(!not x_estimate - x!)作为目标函数拟合我的算法来找到最佳参数。为了查看我的算法如何执行并创建参数分布的样本,我想重新采样x_noise,将其添加到x_true,再次拟合我的模型,冲洗并重复。这是评估参数不确定性的有效方法吗?我可以将自举数据集的拟合解释为预测不确定性,还是必须遵循上面发布的过程? / edit:我认为我还没有真正弄清楚模型的作用。可以认为它本质上类似于降噪方法。它不是预测模型,而是一种试图提取嘈杂的环境数据时间序列的基础信号的算法。 / edit ^ 2:对于在那里的MATLAB用户,我写下了一些我所要表达的快速且肮脏的线性回归示例。 我认为这是残差的“常规”自举(如果我错了,请纠正我):http : //pastebin.com/C0CJp3d1 这就是我想做的:http : //pastebin.com/mbapsz4c

3
估计均匀分布的参数:不正确的先验?
我们有N个样本 X一世XiX_i,从均匀分布 [0,θ][0,θ][0,\theta] 哪里 θθ\theta未知。估计θθ\theta 从数据。 因此,贝叶斯法则... F(θ|X一世)=F(X一世|θ)F(θ)F(X一世)f(θ|Xi)=f(Xi|θ)f(θ)f(Xi)f(\theta | {X_i}) = \frac{f({X_i}|\theta)f(\theta)}{f({X_i})} 可能是: F(X一世|θ)=∏ñ一世=1个1个θf(Xi|θ)=∏Ni=11θf({X_i}|\theta) = \prod_{i=1}^N \frac{1}{\theta} (编辑:何时 0≤X一世≤θ0≤Xi≤θ0 \le X_i \le \theta 对所有人 一世ii,否则为0-感谢whuber) 但是没有其他信息 θθ\theta,似乎事前应该与 1个11 (即制服)或 1个大号1L\frac{1}{L} (杰弗里斯事前?) [0,∞][0,∞][0,\infty]但是然后我的积分不收敛,我不确定如何进行。有任何想法吗?

1
SMOTE针对多类不平衡问题引发错误
我正在尝试使用SMOTE纠正我的多类分类问题中的不平衡。尽管根据SMOTE帮助文档,SMOTE在虹膜数据集上可以很好地工作,但是在类似的数据集上却不能工作。这是我的数据的样子。请注意,它具有三个类别,值分别为1、2、3。 > data looking risk every status 1 0 1 0 1 2 0 0 0 1 3 0 0 0 2 4 0 0 0 1 5 0 0 0 1 6 3 0 0 1 7 0 0 0 1 8 0 0 0 1 9 0 1 …

1
排列检验将单个样本与平均值进行比较
当人们实施置换测试以将单个样本与平均值进行比较时(例如,您可能会使用置换t检验),均值将如何处理?我已经看到了需要进行均值检验和样本才能进行置换测试的实现,但是目前尚不清楚它们实际上是在做什么。有没有一种有意义的方法可以对一个样本与假设的均值进行置换检验(例如t检验)?或者,它们只是在引擎盖下默认不进行置换测试?(例如,尽管调用了排列函数或设置了排列测试标志,但默认为标准t检验或类似函数) 在标准的两样本置换测试中,一个样本将具有两组并将标签的分配随机化。但是,当一个“组”是假设平均值时,该如何处理?显然,假设均值本身没有样本量。那么,将均值转换为排列格式的典型方法是什么?“平均”样本是否假定为单点?与样本组大小相等的样本?无限大小的样本? 假设一个假设均值是假设的,我会说它在技术上要么具有无限支持,要么具有您想要为其提供的任何支持。但是,这些都不对实际计算非常有用。值均等于平均值​​的大小相等的样本有时似乎是通过某些测试完成的(例如,只需用假定的位置填充对的另一半)。这很有道理,因为这是等长样本,您将看到假设均值正确无偏差。 所以我的问题是这样的:在实践中,当第二组是平均值(或相似的抽象假定值)时,人们是否真的会模拟置换测试样式标签的随机化?如果是这样,人们在这样做时如何处理标签随机化?

4
如何计算2D标准偏差(平均值为0,以界限为边界)
我的问题如下:我从某个点一次在地面上几米处投下40个球。球滚动,停下来。使用计算机视觉,我计算了XY平面中的质心。我只对从质心到每个球的距离感兴趣,这是使用简单几何图形计算的。现在,我想知道与中心的单侧标准偏差。因此,我将能够知道一定数量的球在一个std半径内,更多球在2 * std半径内,依此类推。如何计算单面标准偏差?正常方法将声明一半球位于0均值的“负侧”。在这个实验中,这当然是没有意义的。我是否必须确保滚珠符合标准分布?感谢您的任何帮助。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.