统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
ROC和multiROC分析:如何计算最佳切割点?
我试图了解如何计算ROC曲线的最佳切点(灵敏度和特异性最大化的值)。我正在使用aSAH包中的数据集pROC。 该outcome变量可以由两个独立变量解释:s100b和ndka。使用该Epi包的语法,我创建了两个模型: library(pROC) library(Epi) ROC(form=outcome~s100b, data=aSAH) ROC(form=outcome~ndka, data=aSAH) 以下两个图形说明了输出: 在第一个图表(s100b)中,该函数表示最佳切点位于对应于的值lr.eta=0.304。在第二张图(ndka)中,最佳切点位于的对应值上lr.eta=0.335(的含义lr.eta)。我的第一个问题是: 什么是相应s100b和ndka的值lr.eta值表示(是什么方面的最佳临界点s100b和ndka)? 第二个问题: 现在,假设我创建一个同时考虑了两个变量的模型: ROC(form=outcome~ndka+s100b, data=aSAH) 获得的图形为: 我想知道ndkaAND 的值是什么,s100b通过该函数可以最大程度地提高敏感性和特异性。换句话说:是什么样的价值观ndka和s100b我们已SE = 68.3%和SP = 76.4%(从图表中获取的值)? 我想第二个问题与multiROC分析有关,但是该Epi软件包的文档并未解释如何为模型中使用的两个变量计算最佳切点。 我的问题与reasearchGate的问题非常相似,简而言之: 确定代表灵敏度和特异性之间更好权衡的临界值很简单。但是,对于多变量ROC曲线分析,我注意到大多数研究人员都将注意力集中在确定AUC上几个指标(变量)线性组合的整体准确性的算法上。[...] 但是,这些方法并未提及如何确定与多个指标相关联的临界值组合,以提供最佳的诊断准确性。 Shultz在他的论文中提出了一种可能的解决方案,但是从本文中,我无法理解如何为多元ROC曲线计算最佳切点。 也许Epi包装中的解决方案不是理想的,所以任何其他有用的链接将不胜感激。

3
运行kmeans之前是否需要删除相关/共线性的变量?
我正在运行kmeans以识别客户群。我大约有100个变量来识别集群。这些变量中的每一个都代表客户在类别上花费的百分比。因此,如果我有100个类别,则我拥有这100个变量,这样每个客户的这些变量之和为100%。现在,这些变量彼此之间具有很强的相关性。在运行kmeans之前,是否需要删除其中一些以消除共线性? 这是示例数据。实际上,我有100个变量和1000万个客户。 Customer CatA CatB CatC 1 10% 70% 20% 2 15% 60% 25%

2
多元线性回归模拟
我是R语言的新手。我想知道如何从满足回归的所有四个假设的多重线性回归模型进行模拟。 好的谢谢。 假设我要基于此数据集模拟数据: y<-c(18.73,14.52,17.43,14.54,13.44,24.39,13.34,22.71,12.68,19.32,30.16,27.09,25.40,26.05,33.49,35.62,26.07,36.78,34.95,43.67) x1<-c(610,950,720,840,980,530,680,540,890,730,670,770,880,1000,760,590,910,650,810,500) x2<-c(1,1,3,2,1,1,3,3,2,2,1,3,3,2,2,2,3,3,1,2) fit<-lm(y~x1+x2) summary(fit) 然后我得到输出: Call: lm(formula = y ~ x1 + x2) Residuals: Min 1Q Median 3Q Max -13.2805 -7.5169 -0.9231 7.2556 12.8209 Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 42.85352 11.33229 3.782 0.00149 ** x1 -0.02534 0.01293 -1.960 0.06662 . x2 0.33188 2.41657 …

2
在具有Gamma分布的GLM中使用R
我目前在理解R语法以使用Gamma分布拟合GLM时遇到问题。 我有一组数据,其中每行包含3个协变量(),响应变量()和形状参数()。我想将Gamma分布的比例建模为3个协变量的线性函数,但是我不了解如何为每行数据将分布的形状设置为 ÿ ķ ķX1,X2,X3X1,X2,X3X_1, X_2, X_3YYYKKKKKK 我认为类似的情况是,对于二项式分布,GLM要求知道每个数据条目的试验次数()。NNN

3
执行线性回归,但强制求解通过一些特定数据点
我知道如何对一组点执行线性回归。也就是说,我知道如何将自己选择的多项式拟合到给定的数据集(从LSE的角度来看)。但是,我不知道的是如何迫使我的解决方案经过我选择的某些特定要点。我之前已经看过这件事,但是我不记得该过程叫什么,更不用说它是如何完成的了。 作为一个非常简单而具体的示例,让我们说我在xy平面上散布了100个点,我选择通过它们拟合任意阶多项式。我知道如何很好地执行此线性回归。但是,让我们说我想“强制”解决方案,例如,通过x坐标,和x = 89的三个数据点(及其对应的y坐标)当然)。x = 19 x = 89x = 3x=3x=3x = 19x=19x=19x = 89x=89x=89 这个通用程序叫什么,它是如何完成的,还有什么我需要注意的陷阱吗? 编辑: 我想补充一点,我正在寻找一种具体的方法来做到这一点。我编写了一个程序,该程序实际上以两种方式之一进行线性回归,即直接或通过梯度下降来反转协方差矩阵。我要问的是,究竟是如何逐步地修改我所做的事情,以使多项式解经过特定点? 谢谢!

2
两个相关多元正态随机变量的线性组合
假设我们有两个随机变量向量,它们都是正常的,即和。我们对它们的线性组合的分布感兴趣,其中和是矩阵,是向量。如果和独立,则。问题是在从属情况下,假设我们知道任何一对的相关性。谢谢。X∼N(μX,ΣX)X∼N(μX,ΣX)X \sim N(\mu_X, \Sigma_X)Y∼N(μY,ΣY)Y∼N(μY,ΣY)Y \sim N(\mu_Y, \Sigma_Y)Z=AX+BY+CZ=AX+BY+CZ = A X + B Y + CAAABBBCCCXXXYYYZ∼N(AμX+BμY+C,AΣXAT+BΣYBT)Z∼N(AμX+BμY+C,AΣXAT+BΣYBT)Z \sim N(A \mu_X + B \mu_Y + C, A \Sigma_X A^T + B \Sigma_Y B^T)(Xi,Yi)(Xi,Yi)(X_i, Y_i) 最好的祝福,伊万

2
解释发生率比
因此,我想拟合一个随机效应负二项式模型。对于这种模型,STATA可以产生指数系数。根据帮助文件,这些系数可以解释为发生率。不幸的是,我不是英语为母语的人,我也不是很了解什么是发病率比率或如何翻译它们。 所以我的问题是,我该如何解释发生率。例如: 如果模型给我一个变量的发生率比为0.7。这将意味着依赖变数的预期观察数(计数)。如果独立var改变一个单位,则改变.7吗? 有人可以帮忙吗?




3
OLS是蓝色的。但是,如果我不在乎无偏和线性怎么办?
高斯-马尔可夫定理告诉我们,OLS估计量是线性回归模型的最佳线性无偏估计量。 但是,假设我不在乎线性和无偏性。那么,对于线性回归模型,是否还有其他(可能是非线性/有偏的)估计量,在高斯-马尔可夫假设或其他一些一般假设下效率最高? 当然,有一个标准的结果:如果除高斯-马尔可夫假设之外,我们还假设误差是正态分布的,则OLS本身就是最佳的无偏估计量。对于其他一些特定的误差分布,我可以计算相应的最大似然估计量。 但是我想知道在某些相对通用的情况下是否存在某种比OLS更好的估计器?

5
为什么我们需要替代假设?
当我们进行测试时,我们最终会得到两个结果。 1)我们拒绝零假设 2)我们不能拒绝零假设。 我们不会谈论接受替代假设。如果我们不谈论接受替代假设,为什么我们根本需要替代假设? 这是更新: 有人可以给我两个例子: 1)拒绝原假设等于接受替代假设 2)拒绝原假设不等于接受替代假设



3
为什么神经网络需要特征选择/工程设计?
尤其是在kaggle竞赛中,我注意到模型的性能完全取决于特征选择/工程。虽然我可以完全理解为什么在处理更传统/较旧的ML算法时会出现这种情况,但我不明白为什么在使用深度神经网络时会出现这种情况。 引用深度学习书: 深度学习通过引入以其他更简单的表示形式表示的表示形式,解决了表示学习中的这一核心问题。深度学习使计算机可以从更简单的概念中构建复杂的概念。 因此,我一直认为,如果“信息包含在数据中”,则在足够的训练时间下,足够深,参数齐全的神经网络将获得正确的特征。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.