统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
在R中的一张图上绘制多个图?
使用以下代码,我尝试在中的图形上绘制四个图R。我对图不满意,因为图之间有很多空间,因此图的宽度不足以分析图。 有人可以帮我制作一个有四个图的漂亮图吗? 如何保持X轴标签的范围从1到10,而不是默认的5个标签? 数据: a1:11.013 13.814 13.831 13.714 13.787 13.734 13.778 13.771 13.823 13.659 a2:5.181 7.747 8.314 8.061 7.920 8.153 8.540 8.845 7.881 8.301 我已经将a1数据用于b1,c1和d1;仅用于此处的b2,c2和d2的a2数据。 数字: 码: op=par(mfrow=c(4,1), mar=c(5.5,5.1,4.1,2.1)) plot(a1, type="b", ylim=c(0,14.5), xlab="Time (secs)", ylab="", cex.axis=1.4, cex.lab=1.3,cex=1.2,lwd=2.5,col="red1",lty=2,pch=1, main="A") lines(a2,type="b",pch=3,lty=3,col="darkblue",lwd=2.5,cex=1.2) par(xpd=T) legend(1,26.5,c("X","Y"),bty="n",horiz=T,cex=1.5,col=c("red1","darkblue"),text.col=c("red1","darkblue"),pch=c(1,3),lty=c(2,3),x.intersp=0.4,adj=0.2) plot(b1, type="b", ylim=c(0,14.5), xlab="Time (secs)", ylab="", cex.axis=1.4, cex.lab=1.3,cex=1.2,lwd=2.5,col="red1",lty=2,pch=1, main="B") …

2
学习机器学习算法所需的概率基础的最佳方法是什么?
几年前,我在大学里修过一门概率论课程,但现在我正在学习一些机器学习算法,其中一些数学令人迷惑。 尤其是现在,我正在学习EM算法(期望最大化),似乎在我所需要的和所拥有的之间有很大的脱节。 我不是要书或网站,而是要学习足够多的这些主题以对使用它们的算法有透彻了解的方法是什么?是否需要阅读一本书并进行数百次练习?还是从这个意义上讲,这种杀伤力过大? 编辑:如果这是此问题的错误位置,请投票迁移:)

1
复制“统计学习要素”中的表18.1
统计学习元素中的表18.1 总结了14个类别数据集上几个分类器的性能。我正在将套索和弹性网的新算法与此类多类分类问题进行比较。 使用glmnet版本1.5.3(R 2.13.0),我无法复制表中的点7(惩罚的多项式),其中报告使用的基因数量为269,测试错误为13 54。使用的数据是此14癌症微阵列数据集。无论我如何尝试,我都会在170-180个基因附近使用性能最佳的模型,其54个测试错误中的16个。大号1个大号1个L_1 注意,在654页的18.3节的开头,描述了数据的一些预处理。 我已经联系了作者-到目前为止没有任何回复-请问是否有人可以确认复制表格是否存在问题或提供有关如何复制表格的解决方案。

1
从嘈杂的观察中确定真实均值
我有一大套形式的数据点(平均值,标准偏差)。我希望将其减少为单一(更好)的平均值,以及(希望)较小的标准偏差。 显然,我可以简单地计算,但是这没有考虑到某些数据点比其他数据点准确得多的事实。Σ d一个牛逼一米Ë 一个Ññ∑datameanN\frac{\sum data_{mean}}{N} 简而言之,我希望对这些数据点进行加权平均,但不知道在标准偏差方面加权函数应该是什么。

5
BUGS的R替代品[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 去年关闭。 我正在学习使用BUGS和R进行的贝叶斯统计课程。 我已经读到R中有许多新的贝叶斯软件包。是否有列表或参考说明了哪些贝叶斯统计软件包以及这些软件包的作用?并且,是否有R包替代品可以提高BUGS的灵活性?
13 r  bayesian  bugs 

4
均方误差用于评估一个估算器相对于另一个估算器的相对优势吗?
假设我们有两个参数估计量和。为了确定哪个估算器“更好”,我们看一下MSE(均方误差)吗?换句话说,我们看,其中是估计量的偏差,而是估计量的方差?哪个拥有更高的MSE才是更差的估算器?α 2 X 中号小号ë = β 2 + σ 2 β σ 2α1个α1\alpha_1α2α2\alpha_2Xxx中号小号Ë= β2+ σ2MSE=β2+σ2MSE = \beta^2+ \sigma^2ββ\betaσ2σ2\sigma^2
13 estimation  mse 

2
关于R中使用ggplot2的两个因素的箱线图
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我对R和R中的任何软件包都是新手。我查看了ggplot2文档,但找不到此文件。我想要boxthis关于两个因子f1和的变量的箱形图f2。那是假设f1和f2都是因子变量,并且每个变量都有两个值,并且boxthis是连续变量。我想要得到的曲线图4个箱图,每个对应于一个组合从所述可能的组合f1和f2可以采取。我认为使用R中的基本功能,可以通过 > boxplot(boxthis ~ f1 * f2 , data = datasetname) 在此先感谢您的帮助。
13 r  boxplot  ggplot2 

4
在百分比上使用ANOVA?
我有一个包含四个组(4个BMI组)的表作为自变量(因子)。我有一个因变量,即“孕期母亲吸烟的百分比”。 为此可以使用ANOVA还是必须使用卡方检验或其他测试?
13 anova 


6
内生性与未观察到的异质性
内生性和未观察到的异质性有什么区别?我知道内生性来自例如省略的变量吗?但是据我了解,未观察到的异质性会导致相同的问题。但是,这两个概念之间的区别到底在哪里?

2
在结构方程模型中拥有非常小的样本的复杂性
我正在Amos 18中运行结构方程模型(SEM)。我正在为我的实验寻找100名参与者(宽松使用),这可能不足以进行成功的SEM。反复告诉我,SEM(以及EFA,CFA)是一种“大样本”统计程序。长话短说,我没有参加100名参与者(这真是令人惊讶!),并且在排除两个有问题的数据点之后只有42个参与者。出于兴趣,我还是尝试了该模型,令我惊讶的是,它看起来非常合适!CFI> .95,RMSEA <.09,SRMR <.08。 该模型并不简单,实际上我会说它相对复杂。我有两个潜在变量,一个有两个观测变量,另一个有5个观测变量。我在模型中还有四个观察到的变量。间接变量和直接变量之间存在许多关系,例如,某些变量是其他四个变量内生的。 我对SEM有点陌生;但是,我认识的两个非常熟悉SEM的人告诉我,只要拟合指标良好,效果是可以解释的(只要它们很重要),并且该模型没有任何明显的“错误”。我知道某些适合度指标在暗示良好适合度方面偏向或反对小样本,但我前面提到的三个指标似乎不错,而且我相信也没有类似偏见。为了测试间接影响,我使用引导程序(2000个样本左右),90%的偏差校正了信心,蒙特卡洛。另外需要注意的是,我针对三种不同的条件运行三种不同的SEM。 我有两个问题,我希望一些人可以考虑,如果您有贡献,请回答: 我的模型是否存在没有通过拟合指数证明的重大弱点?小样本将突出显示该研究的弱点,但我想知道是否存在一些我完全没有注意到的巨大统计问题。我计划将来再增加10至20名参与者,但这仍将为我提供相对较小的样本进行此类分析。 给我很小的样本,或者在使用它的上下文中,我使用引导程序是否有任何问题? 我希望这些问题对本论坛来说不是太“基本”。我已经阅读了许多关于SEM和相关问题的章节,但是我发现人们在这方面的观点非常分散! 干杯

4
方差的实际应用是什么?
我正在自学概率论,但我不确定我是否理解方差相对于标准差的任何用法。在我正在查看的实际情况下,方差大于范围,因此在直观上似乎没有用。
13 variance 

4
比较不同预测变量集的重要性
我曾为有特定问题的研究学生提供建议,并且我很想在此站点上得到其他人的意见。 内容: 研究人员具有三种类型的预测变量。每种类型包含不同数量的预测变量。每个预测变量都是一个连续变量: 社交:S1,S2,S3,S4(即四个预测变量) 认知:C1,C2(即两个预测变量) 行为:B1,B2,B3(即三个预测变量) 结果变量也是连续的。样本包括大约60名参与者。 研究人员想评论哪种类型的预测变量在解释结果变量方面更重要。这与对这些类型的预测变量的相对重要性的更广泛的理论关注有关。 问题 有什么好方法可以评估一组预测变量相对于另一组预测变量的相对重要性? 对于每个集合中预测变量数量不同的事实,有什么好的策略? 您可能建议解释什么注意事项? 任何引用示例或技术讨论的内容也将受到欢迎。


4
如何计算变量组之间/组之间的相关性?
我有一个包含1000个观察值和50个变量的矩阵,每个变量以5分制为单位。这些变量被组织成组,但是每个组中变量的数量并不相等。 我想计算两种类型的相关性: 变量组内的相关性(在特征之间):某种程度的变量,用于确定变量组内的变量是否在测量同一事物。 变量组之间的相关性:某种度量(假设每个组反映一个整体特征)是每个特征(组)如何与其他特征相关联。 这些特征先前已被分为几类。我对找到组之间的相关性很感兴趣-即假设组中的特征正在测量相同的基本特征(已在上面完成#1-Cronbach的alpha值),这些特征本身是否相关? 有人对从哪里开始有建议吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.