统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
这种对稀疏性的解释准确吗?
根据软件包removeSparseTerms功能的文档,tm稀疏性是这样的: A term-document matrix where those terms from x are removed which have at least a sparse percentage of empty (i.e., terms occurring 0 times in a document) elements. I.e., the resulting matrix contains only terms with a sparse factor of less than sparse. 那么,是否正确解释是说如果sparse等于.99,那么我们要删除仅出现在最多1%数据中的术语?

6
如何在符号
的表示法如何读取?是否服从正态分布?还是是正态分布?也许大约是正常的。X X XX∼N(μ,σ2)X∼N(μ,σ2)X\sim N(\mu,\sigma^2)XXX XXX XXX 如果有几个变量遵循(或不管用什么词)同一分布,该怎么办?怎么写的?

3
使用scikit Learn选择功能后识别过滤的功能
这是我的Python 功能选择方法代码: from sklearn.svm import LinearSVC from sklearn.datasets import load_iris iris = load_iris() X, y = iris.data, iris.target X.shape (150, 4) X_new = LinearSVC(C=0.01, penalty="l1", dual=False).fit_transform(X, y) X_new.shape (150, 3) 但是在获得新的X(因变量-X_new)之后,我如何知道在此新的更新变量中删除了哪些变量以及考虑了哪些变量?(已删除的一个或数据中存在的三个。) 获得此标识的原因是对新的测试数据应用相同的过滤。

1
R中的交叉验证套索回归
R函数cv.glm(库:引导)为广义线性模型计算估计的K折交叉验证预测误差,并返回增量。使用此函数进行套索回归(库:glmnet)是否有意义?如果是,如何进行?glmnet库使用交叉验证来获得最佳的车削参数,但是我没有找到任何交叉验证最终glmnet方程的示例。


1
测试夏普比率的重要性
测试夏普比率或信息比率的重要性的正确方法是什么?夏普比率将基于各种股指,并且可能具有可变的回溯期。 我看到的一种解决方案只是应用了学生t检验,而df设置为回溯期的长度。 由于以下原因,我不愿采用上述方法: 我认为t检验对偏斜敏感,但是股本收益通常会产生负偏斜。 使用对数收益计算的平均收益小于使用简单收益计算的平均收益。我认为,与基于对数收益的夏普比率相比,基于收益的简单夏普比率更有可能被注册为重要资产,但是底层资产收益在技术上是相同的。 如果回溯期很小(即样本量很小),则t检验可能是适当的,但是使用其他检验在什么阈值下有意义? 我的第一个倾向是避免使用学生t分布,而是创建一个基于非对称配电,我已经测试读取已被证明是股市回报的一个非常接近的近似,允许在峰度和偏度控制。 我的第二个倾向是看非参数测试,但是由于使用经验有限,我不确定从哪里开始以及应该避免的陷阱。 我是否在考虑这个问题,是否与我的担忧无关?

2
什么是桶装?
我一直在四处寻找没有运气的机器学习中“桶化”的清晰解释。到目前为止,我了解到的是,存储桶化类似于数字信号处理中的量化,其中一系列连续值被一个离散值代替。它是否正确? 应用存储桶化有什么利弊(除了丢失信息的明显影响)?关于如何应用存储分区是否有任何经验法则?在应用机器学习之前,是否有任何准则/算法可用于应用桶化?

1
为什么主成分分数不相关?
假设是均值数据矩阵。矩阵为,具有m个不同的特征值,特征向量\ mathbf s_1,\ mathbf s_2 ... \ mathbf s_m正交。S = cov (A)m × m m s 1 s 2 s m一个一个\mathbf AS =cov( A)小号=冠状病毒(一个)\mathbf S=\text{cov}(\mathbf A)米× 米米×米m\times m米米ms1个s1个\mathbf s_1s2s2\mathbf s_2smsm\mathbf s_m 第iii个主要成分(有人称其为“分数”)是向量 zi=Asizi=Asi\mathbf z_i = \mathbf A\mathbf s_i。换句话说,它是\ mathbf A的列的线性组合AA\mathbf A,其中系数是\ mathbf S的第iii个特征向量的分量。SS\mathbf S 我不明白为什么zizi\mathbf z_i和zjzj\mathbf z_j对于所有i \ neq j都不相关i≠ji≠ji\neq …

2
一小部分布尔特征样本的PCA和频谱聚类之间的差异
我有50个样本的数据集。每个样本均由11个(可能相关的)布尔特征组成。我想介绍一下如何在2D图上可视化这些样本,并检查50个样本中是否存在聚类/分组。 我尝试了以下两种方法: (a)在50x11矩阵上运行PCA,并选择前两个主要成分。将数据投影到2D图上并运行简单的K均值以识别聚类。 (b)构造一个50x50(余弦)相似度矩阵。运行频谱聚类以降低维数,然后再次进行K均值。 直接进行PCA与使用相似性矩阵的特征值之间在概念上有什么区别?这个比那个好吗? 此外,还有更好的方法以2D形式显示此类数据吗?由于我的样本大小始终限制为50,并且功能集始终在10-15范围内,因此我愿意即时尝试多种方法并选择最佳方法。 相关问题: 通过聚类或PCA对样本进行分组

2
嵌套交叉验证-与通过训练集上的kfold CV选择模型有何不同?
我经常看到人们谈论5x2交叉验证是嵌套交叉验证的特例。 我假设第一个数字(在这里:5)是指内环的折叠数,第二个数字(在这里:2)是指外环的折叠数?那么,这与“传统”模型选择和评估方法有何不同?我所说的“传统” 将数据集拆分为单独的训练(例如80%)和测试集 在训练集上使用k倍交叉验证(例如k = 10)进行超参数调整和模型选择 使用测试集评估所选模型的泛化性能 如果k = 2,则测试集和训练集的大小相等,那么5x2是否不完全相同?

3
将法线除以可得出t分布-证明
让和。w ^ 〜χ 2(小号)Z∼N(0,1)Z∼N(0,1)Z \sim N(0,1)W∼χ2(s)W∼χ2(s)W \sim \chi^2(s) 如果和独立分布,则变量遵循自由度的分布。W Y = ZZZZWWW吨小号Y=ZW/s√Y=ZW/sY = \frac{Z}{\sqrt{W/s}}tttsss 我正在寻找这一事实的证明,如果您不想写下完整的参数,那么引用就足够了。

1
标准化变量的协方差是否具有相关性?
我有一个基本问题。说我有两个随机变量,和。我可以通过减去平均值并除以标准偏差来对它们进行标准化,即。XXXYYYXstandardized=(X−E(X))(SD(X))Xstandardized=(X−E(X))(SD(X))X_{standardized} = \frac{(X - E(X))}{(SD(X))} 是的相关和,,一样的标准版本的协方差和?也就是说,吗?ÿ Ç ø - [R (X ,ÿ )X ý Ç ø - [R (X ,ÿ )= c ^ Ö v (X 小号吨一个Ñ ð 一个[R d 我Ž ë d,ÿ 小号吨一个Ñ d 一- [R d 我ž e d)XXXYYYCor(X,Y)Cor(X,Y)Cor(X, Y)XXXÿÿYCØr(X,Y)=Co v (X小号Ťand一个rdizË d,Y小号Ť 一nd一个rd一世zË d)Co[R(X,ÿ)=CØv(XsŤ一个ñd一个[Rd一世žËd,ÿsŤ一个ñd一个[Rd一世žËd)Cor(X, Y) = Cov(X_{standardized}, …

1
对于广义线性模型(例如,泊松混合模型(与glmer拟合)),lsmeans报告什么?
我正在分析设计实验中的眼动数据。我的数据的简化版本如下所示(您可以在此处获取dput()数据), head(lookDATA) participant fixationImage fixationCount 1 9 Automobile 81 2 9 Bird 63 3 9 Chair 82 4 9 Dog 64 5 9 Face 90 6 9 Plant 75 其中参与者是每个主题的唯一标识符,fixationImage是他们固定在哪个图片类别上,而fixationCount是他们固定在该图片类别上的次数。 我使用lme4包中的 glmer()将泊松模型拟合到数据中。 model<-glmer(fixationCount ~ fixationImage + (1|participant), family = poisson, data = lookDATA) 我使用lsmeans 包中的 lsmeans()来检查因子水平之间的差异, cld(lsmeans(model,"fixationImage")) 提供以下输出: fixationImage lsmean …

2
应用学术期刊文章中统计部分的好例子
我是一名在应用领域工作的生物统计学家,我负责为我合作的论文撰写统计学方法部分。在阅读许多学术论文时,我遇到了许多统计数据写得不好的例子(大多数是无聊的,缺乏信息性的,缺乏精确性,细节和对所用方法的理解)。 无论使用何种主题和复杂的统计方法,在应用研究文章中有哪些写得好的统计章节的好例子? 如何定义“写得好”是主观的,但是如果描述得很清楚,我将描述写得很好的统计部分,给出(或似乎给出)分析方式的全貌,解决分析过程中所做的假设,并将统计过程纳入论文流程。 以下是一些我认为统计数据不错的论文示例: BCG疫苗接种可降低接种疫苗的and和未接种疫苗的C幼崽中结核感染的风险 原发性经皮冠状动脉介入治疗急性ST段抬高型心肌梗死的死亡率预测模型:急性心肌梗死试验中派瑞单抗的评估结果 其他?也欢迎对“良好”统计部分应包括的内容进行思考。

2
在贝叶斯线性回归中评估后验预测分布
我很困惑,如何评价贝叶斯线性回归后的预测分布,过去的基本情况进行了说明这里第3页,以下复制。 p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y)p(y~∣y)=∫p(y~∣β,σ2)p(β,σ2∣y) p(\tilde y \mid y) = \int p(\tilde y \mid \beta, \sigma^2) p(\beta, \sigma^2 \mid y) 基本情况是此线性回归模型: ÿ= Xβ+ ϵ ,ÿ∼N(Xβ,σ2)y=Xβ+ϵ,y∼N(Xβ,σ2) y = X \beta + \epsilon, \hspace{10mm} y \sim N(X \beta, \sigma^2) 如果我们使用一个统一的现有上,带刻度-INV χ 2上之前σ 2,OR正常-逆伽马之前(见此处)的后验预测分布解析和是学生吨。 ββ\betaχ2χ2\chi^2σ2σ2\sigma^2 这个模型呢? ÿ= Xβ+ ϵ ,ÿ〜ñ(Xβ,Σ )ÿ=Xβ+ϵ,ÿ〜ñ(Xβ,Σ) y = X \beta + …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.