统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

6
如何检测极化的用户意见(高和低星级)
如果我有一个星级评分系统,用户可以在其中表达对某产品或某项商品的偏爱,那么我该如何统计选票是否被“高分”。意思是,即使对于给定的产品,平均值是5分之3,我如何仅使用数据(没有图形方法)如何检测到1-5拆分与共识3

1
子节点的Gini减少和Gini杂质
我正在研究随机森林的基尼特征重要性度量。因此,我需要计算节点杂质的基尼系数降低。这是我这样做的方式,它导致与定义的冲突,表明我在某处一定是错误的... :) 对于一个二叉树,给定左右子节点的概率,我可以计算出节点的基尼杂质:nnn i(n)=1−p2l−p2ri(n)=1−pl2−pr2 i(n) = 1 - p_l^2 - p_r^2 基尼值下降: Δi(n)=i(n)−pli(nl)−pri(nr)Δi(n)=i(n)−pli(nl)−pri(nr) \Delta i(n) = i(n) - p_li(n_l) - p_ri(n_r) 因此,对于在一个节点上有110个观察值的示例: - node (110) - left (100) - left_left (60) - left_right (40) - right (10) - right_left (5) - right_right (5) 我会像这样计算节点的Gini减少量: i(left)i(right)i(node)=1−(60/100)2−(40/100)2=1−(5/10)2−(5/10)2=1−(100/110)2−(10/110)2=0.48=0.50=0.16i(left)=1−(60/100)²−(40/100)²=0.48i(right)=1−(5/10)²−(5/10)²=0.50i(node)=1−(100/110)²−(10/110)²=0.16\begin{align} i({\rm left}) &= 1 - …

2
岭回归-贝叶斯解释
我听说,如果适当选择先验,则可以将岭回归作为后验分布的平均值。直觉是先验对回归系数设置的约束(例如,标准正态分布在0附近)是否相同/替换对系数平方大小设置的惩罚?要保持等价,先验是否必须是高斯?

3
支持不平衡数据的SVM
我想尝试在数据集中使用支持向量机(SVM)。但是在尝试问题之前,我曾警告过SVM在极端不平衡的数据上不能很好地执行。就我而言,我最多可以有95-98%的0和2-5%的1。 我试图找到有关在稀疏/不平衡数据上使用SVM的资源,但我能找到的只是“ sparseSVM”(使用少量支持向量)。 我希望有人可以简要解释一下: SVM对这种数据集的预期效果如何 如果有的话,必须对SVM算法进行修改 哪些资源/论文对此进行了讨论

1
解释方差是什么意思?
特别是,我想知道为什么会有这个概念多元R(我可以理解为多元回归中观察到的分数与预测分数之间的相关性),然后有一个单独的概念R平方,即平方或R。 我被告知R平方是解释的百分比变化而R不是,但是我不理解相关性和解释的变化之间的区别。

4
转换数据时要避免的陷阱?
双重转换响应后,在XXX和YÿY变量之间实现了很强的线性关系。该模型是 Y∼Xÿ〜XY\sim X ,但我把它转化为 YX−−√∼X−−√ÿX〜X\sqrt{\frac{Y}{X}}\sim \sqrt{X} 将R2[R2R^2从.19提高到.76。 显然,我对这种关系做了一些体面的手术。谁能讨论这样做的陷阱,例如过度转换的危险或可能违反统计原则的危险?

2
在R中“手工”计算AIC
我试过在R中计算线性回归的AIC,但未使用AIC函数,如下所示: lm_mtcars <- lm(mpg ~ drat, mtcars) nrow(mtcars)*(log((sum(lm_mtcars$residuals^2)/nrow(mtcars))))+(length(lm_mtcars$coefficients)*2) [1] 97.98786 但是,AIC给出了不同的值: AIC(lm_mtcars) [1] 190.7999 有人可以告诉我我在做什么错吗?

3
为什么没人使用贝叶斯多项式朴素贝叶斯分类器?
因此,在(无监督的)文本建模中,潜在狄利克雷分配(LDA)是概率潜在语义分析(PLSA)的贝叶斯版本。本质上,LDA = PLSA + Dirichlet优先于其参数。我的理解是,LDA现在是参考算法,并以各种程序包实现,而PLSA不再使用。 但是在(监督)文本分类中,我们可以对多项式朴素贝叶斯分类器执行完全相同的操作,并将Dirichlet放在参数之前。但是我认为我从未见过有人这样做,并且多项朴素贝叶斯的“点估计”版本似乎是大多数软件包中实现的版本。有什么理由吗?

2
抽样分布是否可以推理?
一些贝叶斯主义者抨击常识性推断,指出“没有唯一的采样分布”,因为这取决于研究者的意图(Kruschke,Aguinis和Joo,2012,第733页)。 例如,某位研究人员开始收集数据,但在40名参与者参加之后,他的资金却被意外削减。此处如何定义采样分布(以及后续的CI和p值)?我们是否仅假设每个组成样本的N = 40?还是由不同N的样本组成,每个样本的大小由他的资金可能被削减的其他随机次数决定? 教科书中的t,F,卡方(等)零分布均假设N对于所有组成样本都是固定且恒定的,但实际上可能并非如此。对于每个不同的停止过程(例如,在一定时间间隔后或直到我的助手厌倦为止),似乎存在不同的采样分布,并且使用这些“尝试且真实的”固定N分布是不合适的。 这种批评对频繁出现的CI和p值的合法性有多大损害?有理论上的反驳吗?似乎通过攻击采样分布的概念,频繁推断的整个体系是微不足道的。 任何学术参考都将不胜感激。

1
如何实现严格的积极预测?
我正在研究一个值严格为正的时间序列。使用包括AR,MA,ARMA等在内的各种模型,我找不到简单的方法来获得严格的积极预测。 我正在使用R进行预测,我所能找到的是带有以下描述的正参数的Forecast.hts {hts} : 预测分级或分组时间序列,包hts ## S3 method for class 'gts': forecast((object, h, method = c("comb", "bu", "mo", "tdgsf", "tdgsa", "tdfp", "all"), fmethod = c("ets", "rw", "arima"), level, positive = FALSE, xreg = NULL, newxreg = NULL, ...)) positive If TRUE, forecasts are forced to be strictly positive http://www.inside-r.org/packages/cran/hts/docs/forecast.gts 对于非分层时间序列有什么建议吗?关于使用其他约束(例如最小值,最大值等)的概括又如何呢? …

2
手工进行ARIMA估算
我试图了解如何在ARIMA建模/ Box Jenkins(BJ)中估算参数。不幸的是,我所遇到的书都没有详细描述估计程序,例如对数似然估计程序。我发现该网站/教学材料非常有帮助。以下是来自上面引用的来源的公式。 L L (θ )= − n2日志(2 π)− n2日志(σ2)- Σt = 1ñË2Ť2个σ2大号大号(θ)=-ñ2日志⁡(2π)-ñ2日志⁡(σ2)-∑Ť=1个ñËŤ22σ2 LL(\theta)=-\frac{n}{2}\log(2\pi) - \frac{n}{2}\log(\sigma^2) - \sum\limits_{t=1}^n\frac{e_t^2}{2\sigma^2} 我想自己学习ARIMA / BJ估计。因此,我使用编写了用于手工估算ARMA的代码。下面是我在做,[R[R[RR[R[RR 我模拟了ARMA(1,1) 将上面的方程写成函数 使用模拟数据和优化函数来估计AR和MA参数。 我还在stats软件包中运行ARIMA,并通过手工比较了ARMA参数。 比较如下: **以下是我的问题: 为什么估计变量和计算变量之间存在细微差异? ARIMA是否在R反向广播中起作用,或者估算程序与我的代码中以下概述的有所不同? 我已将观测值1的e1或错误指定为0,这是正确的吗? 还有没有一种方法可以使用优化的粗略估计来估计预测的置信范围? 一如既往的感谢您的帮助。 下面是代码: ## Load Packages library(stats) library(forecast) set.seed(456) ## Simulate Arima y <- arima.sim(n = 250, list(ar = …


1
在原假设下,可交换样本背后的直觉是什么?
排列检验(也称为随机检验,重新随机检验或精确检验)非常有用,并且在t-test未满足例如要求的正态分布的假设以及通过按等级对值进行转换时派上用场非参数测试之类的测试Mann-Whitney-U-test会导致丢失更多信息。但是,在使用这种检验时,一个假设且唯一一个假设应该是原假设下样本的可交换性假设。还值得注意的是,当有两个以上的示例(如在coinR包中实现的示例)时,也可以应用这种方法。 您能用简单的英语用一些比喻语言或概念直觉来说明这一假设吗?这对于在像我这样的非统计学家中阐明这个被忽视的问题非常有用。 注意: 提及在相同假设下应用置换测试不成立或无效的情况将非常有帮助。 更新: 假设我随机从我所在地区的当地诊所收集了50个受试者。他们被随机分配为接受药物或安慰剂的比例为1:1。分别Par1在V1(基准),V2(3个月后)和V3(1年后)时测量了参数1 。根据特征A,所有50个主题都可以分为2组;正值= 20,负值=30。它们也可以基于特征B细分为另外2组;B阳性= 15,B阴性=35。 现在,我具有Par1所有访问中所有受试者的值。在可交换性的假设下,如果可以,我是否可以在Par1使用置换测试的水平之间进行比较: -将接受药物治疗的受试者与接受V2安慰剂治疗的受试者进行比较? -将具有特征A的对象与具有V2的特征B的对象进行比较? -比较在V2具有特征A的对象与在V3具有特征A的对象? -在哪种情况下,这种比较是无效的,并且违反了可交换性的假设?
15 hypothesis-testing  permutation-test  exchangeability  r  statistical-significance  loess  data-visualization  normal-distribution  pdf  ggplot2  kernel-smoothing  probability  self-study  expected-value  normal-distribution  prior  correlation  time-series  regression  heteroscedasticity  estimation  estimators  fisher-information  data-visualization  repeated-measures  binary-data  panel-data  mathematical-statistics  coefficient-of-variation  normal-distribution  order-statistics  regression  machine-learning  one-class  probability  estimators  forecasting  prediction  validation  finance  measurement-error  variance  mean  spatial  monte-carlo  data-visualization  boxplot  sampling  uniform  chi-squared  goodness-of-fit  probability  mixture  theory  gaussian-mixture  regression  statistical-significance  p-value  bootstrap  regression  multicollinearity  correlation  r  poisson-distribution  survival  regression  categorical-data  ordinal-data  ordered-logit  regression  interaction  time-series  machine-learning  forecasting  cross-validation  binomial  multiple-comparisons  simulation  false-discovery-rate  r  clustering  frequency  wilcoxon-mann-whitney  wilcoxon-signed-rank  r  svm  t-test  missing-data  excel  r  numerical-integration  r  random-variable  lme4-nlme  mixed-model  weighted-regression  power-law  errors-in-variables  machine-learning  classification  entropy  information-theory  mutual-information 

4
如何对在转换后仍然不正常的非正常数据执行回归?
我有一些数据(158例)来自于李克特量表对21个调查表项目的回答。我真的希望/需要进行回归分析,以查看问卷中的哪些项目可以预测对整体项目的满意度(满意度)。响应不是正态分布的(根据KS测试),我已经以我能想到的各种方式(逆,对数,log10,sqrt,平方)对其进行了转换,并且顽固地拒绝了正态分布。残留图看起来到处都是,所以我认为进行线性回归并假装其表现正常(这也不是泊松分布)确实是不合法的。我认为这是因为答案非常接近(平均值为3.91,95%CI为3.88至3.95)。 所以,我在想我是否需要一种转换数据的新方法,或者需要某种非参数回归,但是我不知道我在SPSS中可以做的任何事情。

1
为方差创建置信区间时为什么使用卡方?
这是一个非常基本的问题。为什么我们使用卡方分布?这种分布是什么意思?为什么将这种分布用于创建方差的置信区间? 我用Google搜索的每个地方都只是说明了一个事实,说明了何时使用chi,但没有说明为什么要使用chi,以及为什么会使用它。 非常感谢任何可以将我引向正确方向的人,也就是-真正理解我为方差创建置信区间时为什么使用chi的原因。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.