统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如果某些时间点的响应严重偏斜,而某些时间点没有进行重复测量研究,该怎么办?
通常,当在纵向设计中遇到连续但偏斜的结果度量时(例如,具有一个对象间效应),通常的方法是将结果转换为正态。如果情况极端,例如观察结果被截断,则可能会花哨并使用Tobit生长曲线模型或类似的模型。 但是,当我看到结果通常在某些时间点分布然后在其他时间严重偏斜时,我会感到茫然。转换可能会堵塞一个泄漏,但会引发另一个泄漏。在这种情况下,您有什么建议?我是否不知道混合效果模型的“非参数”版本? 注意:一个应用示例是一系列教育干预措施前后的知识测验分数。分数开始正常,但随后聚集在量表的高端。


1
Hosmer-Lemeshow与AIC进行逻辑回归
如果Hosmer-Lemeshow表示不合身,但AIC在所有模型中最低,请问您是否仍在使用该模型? 如果删除变量,则Hosmer-Lemeshow统计数据并不重要(这意味着完全不存在拟合度不足)。但是AIC增加了。 编辑:我认为通常,如果不同模型的AIC彼此接近(即),则它们基本上是相同的。但是AIC却大不相同。这似乎表明AIC最低的那个是我应该使用的那个,即使Hosmer-Lemeshow测试表明不是这样。&lt; 2&lt;2<2 也许HL测试仅适用于大样本?对于小样本量(我的样本量约为300),它具有较低的功耗。但是,如果我得到了显着的结果……这意味着即使功率很低,我也会遭到拒绝。 如果我使用AICc与AIC会有所不同吗?您如何在SAS中获得AICc?我知道多样性可能存在问题。但是我先验地假设这些变量对结果有影响。 任何意见? Edit2:我认为我应该使用变量少一个而模型AIC较高且HL不显着的模型。原因是因为其中两个变量相互关联。因此,摆脱一个很有意义。

2
套索修改为LARS
我试图了解如何修改Lars算法以生成套索。虽然我确实了解LARS,但无法从Tibshirani等人的论文中看到套索的修改。特别是我不明白为什么非零坐标的符号必须与当前相关的符号一致的符号条件。有人可以帮我吗 我想我正在寻找对原始L-1规范问题(即套索)使用KKT条件的数学证明。非常感谢!
12 lasso 

9
如何自动创建漂亮的图形?
例如。例如此页面上的http://store.steampowered.com/hwsurvey 有没有现成的软件可以做到这一点?或者,对其他具有类似功能的软件有何建议?我知道这并不是一个真正的统计问题,但我非常强烈地认为,为了使数据有效,应该以一种简洁而富有吸引力的方式呈现数据,因此我认为这个问题对某些人来说是明智的。 更新(11/12/29): 感谢您对这个问题的所有答复,非常感谢您的所有建议。所谓自动,是指我键入数据,然后图形会自动更新。 我项目的目的是在不确定的时间内每天收集6-10套数据(或者每天2x),我想找到一种方法来表示网站中的数据(类似于我的Steam链接上面提供的内容),而用户后端对于非技术用户来说足够简单。如果您还有其他建议,请添加到答案中!再次感谢!

1
决策树中二进制拆分的实现差异
我对决策树中二进制拆分的实际实现感到好奇-因为它与分类预测变量级别有关。XjXjX{j} 具体来说,在使用决策树构建预测模型时,我经常会使用某种采样方案(例如装袋,过采样等),以提高其预测准确性和稳定性。在这些采样例程中,可以将类别变量以小于完整级别集的形式显示给树拟合算法。 假设变量X具有水平{A,B,C,D,E}。在样本中,可能仅{A,B,C,D}存在水平。然后,当将结果树用于预测时,可以存在全套。 继续此示例,假设一棵树在X上分裂并{A,B}向左和{C,D}向右发送。当面对新数据时,我希望二进制拆分的逻辑会这样说:“如果X具有值A或B,则向左发送,否则,将这种情况向右发送”。在某些实现中似乎发生了“如果X的值为A或B,则发送到左侧,如果X的值为C或D,则发送到右侧”。当这种情况采用值E时,算法将崩溃。 处理二进制拆分的“正确”方法是什么?似乎经常但不是总是实施更健壮的方法(请参阅下面的Rpart)。 这是几个例子: Rpart失败,其他都还可以。 #test trees and missing values summary(solder) table(solder$PadType) # create train and validation set.seed(12345) t_rows&lt;-sample(1:nrow(solder),size=360, replace=FALSE) train_solder&lt;-solder[t_rows,] val_solder&lt;-solder[-t_rows,] #look at PadType table(train_solder$PadType) table(val_solder$PadType) #set a bunch to missing levels(train_solder$PadType)[train_solder$PadType %in% c('L8','L9','W4','W9')] &lt;- 'MISSING' #Fit several trees, may have to play with the parameters to …

3
公开数据的托管选项
因此,您已经决定支持可重复研究的想法,并希望在线提供数据供人们查看和使用。问题是,您在哪里托管它? 我的第一个倾向当然是我在大学服务器上拥有的私有Web空间,但是这些事情实际上并没有那么持久-如果我离开,目录在消失之前会保持打开状态很短的时间。保持数据可供人们将来使用和使用的正确设置几乎是不正确的。 您是否使用GitHub或SourceForge之类的东西?还是其他服务? 有问题的数据是一些非常狭narrow的模拟结果的输出-因此,我不一定认为像InfoChimps或其他公共数据存储库之类的地方就是它的正确选择。更少的是“您可以使用此代码学习东西!” 以及更多“您可以复制本文中的图3”。

2
训练数据中具有不相等组大小的SVM
我正在尝试从训练数据构建一个SVM,其中一组代表的数量更多。但是,组将在最终的测试数据中均等地代表。因此,我想使用R包接口的class.weights参数来平衡两组在训练数据中的影响。e1071libsvm 由于我不确定应该如何指定这些权重,因此我进行了一些测试: 生成一些空数据(随机特征;组标签之间的比例为2:1) 使用class.weights参数集安装一个svm 。 预测一堆新的空数据集并查看类比例。 针对不同的空训练集重复整个过程很多次。 这是我正在使用的R代码: nullSVM &lt;- function(n.var, n.obs) { # Simulate null training data vars = matrix(rnorm(n.var*n.obs), nrow=n.obs) labels = rep(c('a', 'a', 'b'), length.out=n.obs) data = data.frame(group=labels, vars) # Fit SVM fit = svm(group ~ ., data=data, class.weights=c(a=0.5, b=1)) # Calculate the average fraction of 'a' …

2
在R中使用Monte Carlo模拟逼近积分
我如何使用MC模拟近似以下积分? ∫1−1∫1−1|x−y|dxdy∫−11∫−11|x−y|dxdy \int_{-1}^{1} \int_{-1}^{1} |x-y| \,\mathrm{d}x \,\mathrm{d}y 谢谢! 编辑(在某些情况下):我试图学习如何使用仿真来逼近积分,并且遇到一些困难时可以做一些练习。 编辑2 + 3:我不知何故感到困惑,以为我需要将积分拆分为单独的部分。因此,我实际上发现了: n &lt;- 15000 x &lt;- runif(n, min=-1, max=1) y &lt;- runif(n, min=-1, max=1) mean(4*abs(x-y))

2
计数数据方差的参数化建模
我正在为某些数据建模,但是我不确定我可以使用哪种类型的模型。我有计数数据,我想要一个模型,该模型将给出数据均值和方差的参数估计。也就是说,我有各种预测因素,我想确定是否有任何因素会影响方差(而不仅仅是组均值)。 我知道泊松回归将不起作用,因为方差等于均值。这个假设对我而言无效,因此我知道存在过度分散的情况。但是,负二项式模型只会生成一个过分散参数,而不会作为模型中预测变量的函数。什么模型可以做到这一点? 另外,将赞赏对讨论模型的书或论文的参考和/或实现模型的R包。

4
咨询统计学家以向其客户提供参考
这个问题说明了面对像维基百科这样的资源匮乏的人,自己独自掌握统计数据和概率的困难。 在我看来,咨询统计学家(这里有些人会)通常会面临向客户解释某些概念和方法的挑战。这是教学硬币的另一面。掌握了这一概念后,进行某种特定的分析可能很有意义,但是一个人的参考文献可能不合适或难以与客户共享。那么,咨询统计学家是否喜欢向客户建议的共同资源?(有关更高级或专门的主题,请参阅更新#1。) 我可以想到一些有用的书籍,但是我怀疑很多客户会像Developer一样去搜索网络,并且会在Wikipedia上看到相当荒唐的资料。在我对开发人员的答复中,我建议使用《NIST手册》作为此类参考。还有什么? 更新1:正如Peter Flom所指出的那样,对于更高级的材料或更狭窄的研究,提供单个参考点可能并不容易。这是正确的,对于那些情况,我应该用不同的措词表达问题。在这种情况下,顾问如何找到并共享可访问的参考资料?我相信许多顾问会花时间写一些新的东西来向客户解释事情,但是这些并不是找到和共享的参考。 一些想法: 顾问或其他人编写的教程 案例研究或分析表明相同的概念 书籍摘录(正如我在对开发者的回答中所建议的那样),描述了概念 还有什么可能是来源,或者您实际上将如何寻找这些参考?我意识到这是一个开放式问题,但是我对Developer的回答显示了我解决该问题的一些方法。我并不是要问所有可以解决此问题的方法,而是以自己的经验,您通常如何提供这种解释性资源?

4
错误使用统计工具造成的高成本后果的例子
我怀疑统计工具的大多数用户是辅助用户(没有或没有经过正规统计学培训的人们)。对于研究人员和其他专业人员来说,将统计方法应用于他们的数据非常诱人,因为他们在同行评审的论文,灰色文献,网络或会议上已经“先于”看过它们。但是,如果没有对所需的假设和统计工具的局限性有清楚的了解,则会导致错误的结果-错误通常是无法识别的! 我发现,本科生(尤其是社会科学和自然科学专业的学生)要么没有意识到统计学上的陷阱,要么发现这些陷阱没有什么意义(后者通常是这种情况)。尽管可以在许多入门级教科书,网络或StackExchange中找到不当使用统计工具的示例,但我很难找到具有不利结果的现实示例(例如,以美元计的成本,受影响的生命和失去的职业) 。为此,我正在寻找真实的例子,这些例子突出了对统计方法的滥用: 统计入门课程通常涵盖所使用的统计方法(即推断统计,回归等)。 最终结果带来了高昂的后果(美元损失,生活受到影响,职业崩溃等等)。 这些数据随时可以用作课程中的工作示例(目的是让学生通过对现实世界产生影响的现实示例进行研究)。 在讨论在研究项目中正确定义单位的重要性时,我想举一个非统计的例子,这是“度量事故”,导致损失了1.25亿美元的卫星!这通常会引起学生的:-o因素,并且似乎具有持久的印象(至少在他们短暂的学习生涯中如此)。

3
使用read.csv只读取三列中的两列
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我有一个由三列组成的ascii数据集,但是只有最后两列是实际数据。现在,我想使用创建一个数据点图read.csv(file = "result1", sep= " ")。R读取所有三列。如何避免这种情况?
12 r 

5
我可以使用PCA进行变量选择以进行聚类分析吗?
我必须减少变量数量以进行聚类分析。我的变量之间有很强的相关性,因此我考虑进行因素分析 PCA(主要成分分析)。但是,如果使用所得分数,则我的聚类不是很正确(与文献中以前的分类相比)。 题: 我可以使用旋转矩阵为每个组件/因子选择负荷最大的变量,而仅将这些变量用于聚类吗? 任何参考书目也将有所帮助。 更新: 一些澄清: 我的目标: 我必须通过SPSS使用两步算法进行聚类分析,但是我的变量不是独立变量,因此我考虑丢弃其中的一些变量。 我的数据集: 我正在研究100,000个案例的15个标量参数(我的变量)。一些变量具有高度相关性( Pearson)&gt;0.9&gt;0.9>0.9 我的疑问: 由于只需要独立变量,因此我想进行主成分分析(对不起:我在最初的问题中错误地谈到了因子分析,这是我的错误),并且只为每个组件选择负荷最大的变量。我知道PCA过程存在一些任意步骤,但是我发现此选择实际上类似于IT Jolliffe(1972&2002)提出的“ 方法B4 ”来选择变量,JR King和DA Jackson也在1999年提出了这种选择。 。 因此,我正在考虑以这种方式选择一些自变量子组。然后,我将使用这些组来运行不同的聚类分析,并将比较结果。

2
线性回归中t检验和方差分析之间的差异
我想知道线性回归中t检验和ANOVA之间有什么区别? 是t检验来检验任何一个斜率和截距是否均值为零,而方差分析是用来检验所有斜率是否均均值为零吗?这是它们之间的唯一区别吗? 在简单的线性回归中,即只有一个预测变量的情况下,只有一个斜率可以估计。那么,t检验和ANOVA是否等效?如果是的话,假设它们使用不同的统计量(t检验使用t统计量,而ANOVA则使用F统计量),怎么做?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.