统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


2
一类SVM与示例SVM
我知道,一类支持向量机(OSVM)是在考虑否定数据的情况下提出的,它们试图找到将正集与某个负锚点(例如起源)分开的决策边界。 2011年的工作提出了示例性SVM(ESVM),该模型训练了一个声称与OSVM有所不同的“单个每个类别分类器”,因为ESVM不需要“将示例映射到可以使用相似性内核的公共特征空间中”计算”。我不太了解这意味着什么以及ESVM与OSVM有何不同。因此,它们有何不同?在ESVM中如何避免这种相似性内核计算?

4
是否有法律规定如果您进行足够的试验,就会发生罕见的事情?
我正在尝试制作有关已加载的骰子的视频,在视频中的某一点上,我们掷出约200个骰子,将所有的六个骰子再次掷出,然后将所有的六个骰子掷出并第三次掷出。我们有一个骰子连续3次出现6次,这显然并不稀奇,因为应该有1/216的机会发生,我们有大约200个骰子。那么我该如何解释这并不稀奇呢?似乎不太像大数定律。我想说的是“如果您进行足够的测试,甚至不可能发生的事情”,但是我的伴侣说人们可能会对“绑定到”术语持怀疑态度。 有没有表达这种概念的标准方法?

3
如何在多元回归中的预测变量之间划分r平方?
我刚刚读过一篇论文,其中的作者对两个预测变量进行了多元回归。总体r平方值为0.65。他们提供了一个表格,用于在两个预测变量之间划分r平方。该表如下所示: rsquared beta df pvalue whole model 0.65 NA 2, 9 0.008 predictor 1 0.38 1.01 1, 10 0.002 predictor 2 0.27 0.65 1, 10 0.030 在该模型中,R使用mtcars数据集运行时,总体r平方值为0.76。 summary(lm(mpg ~ drat + wt, mtcars)) Call: lm(formula = mpg ~ drat + wt, data = mtcars) Residuals: Min 1Q Median 3Q Max …

3
从多元正态分布中提取样本的Cholesky与本征分解
我想绘制样品X〜Ñ(0,Σ)X〜ñ(0,Σ)\mathbf{x} \sim N\left(\mathbf{0}, \mathbf{\Sigma} \right)。维基百科建议任一使用的Cholesky或特征分解,即 Σ = D1个dŤ1个Σ=d1个d1个Ť \mathbf{\Sigma} = \mathbf{D}_1\mathbf{D}_1^T 或 Σ = Q Λ QŤΣ=问Λ问Ť \mathbf{\Sigma} = \mathbf{Q}\mathbf{\Lambda}\mathbf{Q}^T 因此,样品可通过得出: x = D1个vX=d1个v \mathbf{x} = \mathbf{D}_1 \mathbf{v} 或 X = Q Λ--√vX=问Λv \mathbf{x} = \mathbf{Q}\sqrt{\mathbf{\Lambda}} \mathbf{v} 其中 v〜Ñ(0,I)v∼N(0,I) \mathbf{v} \sim N\left(\mathbf{0}, \mathbf{I} \right) 维基百科建议它们在生成样本方面都同样出色,但是Cholesky方法具有更快的计算时间。这是真的?尤其是在使用蒙特卡洛方法时,在数值上,沿对角线的方差可能相差几个数量级?是否有对此问题的正式分析?

1
为什么控制FDR不如控制FWER严格?
我已经读到,控制FDR比控制FWER宽松,例如在Wikipedia中: 与家庭错误率(FWER)过程(例如Bonferroni校正)相比,FDR控制过程对错误发现的控制不太严格。这以增加I型错误率的代价为代价来增加功率,即拒绝应该接受的无效无效假设。 但是我想知道它在数学上如何被证明是正确的? FDR和FWER之间是否存在某些关系?

2
与增强Dickey Fuller测试混淆
我正在研究electricityR包中可用的数据集TSA。我的目的是找出arima模型是否适合此数据并最终拟合。因此,我进行如下操作: 第一个:绘制下图所示的时间序列: 第二个:我想获取对数electricity以稳定方差,然后适当地对序列进行差分,但是在这样做之前,我测试了序列的平稳性使用adf(Dickey Fuller)测试的原始数据集,令人惊讶的是,结果如下: 代码和结果: adf.test(electricity) Augmented Dickey-Fuller Test data: electricity Dickey-Fuller = -9.6336, Lag order = 7, p-value = 0.01 alternative hypothesis: stationary Warning message: In adf.test(electricity) : p-value smaller than printed p-value 好吧,按照我的初学者的时间序列概念,我认为这意味着数据是固定的(p值小,拒绝非平稳性的零假设)。但是,从ts曲线来看,我发现这不可能是固定的。有人对此有有效的解释吗?

3
测试变量是否遵循相同的分布
如果要测试两个变量是否遵循相同的分布,将两个变量简单排序然后检查它们的相关性是否是一个很好的测试?如果它很高(至少为0.9?),则变量很可能来自相同的分布。 这里的分布是指“正态”,“卡方”,“伽玛”等。

2
R语言rnorm和runif有什么区别[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 函数rnorm和runifR 之间有什么区别?
16 r 

2
皮尔逊残差
在卡方检验拟合优度的背景下,有关皮尔逊残差的初学者问题: 除测试统计量外,R chisq.test函数还报告皮尔逊残差: (obs - exp) / sqrt(exp) 我理解为什么查看观察值与期望值之间的原始差异并不能提供足够的信息,因为较小的样本将导致较小的差异。但是,我想更多地了解分母的作用:为什么要除以期望值的根?这是“标准化”残差吗?

1
有关如何归一化回归系数的问题
不确定normalize是否在此处使用正确的词,但是我会尽力说明我要问的问题。这里使用的估计量是最小二乘。 假设有Ŷ = β 0 + β 1 X 1y=β0+β1x1y=\beta_0+\beta_1x_1,则可以通过居中围绕平均值Ŷ = β ' 0 + β 1 X ' 1y=β′0+β1x′1y=\beta_0'+\beta_1x_1',其中β ' 0 = β 0 + β 1 ˉ X 1β′0=β0+β1x¯1\beta_0'=\beta_0+\beta_1\bar x_1和X ' 1 = X - ˉ Xx′1=x−x¯x_1'=x-\bar x,使β ' 0β′0\beta_0'不再对估计任何影响β 1β1\beta_1。 我的意思是β 1在Ŷ = β 1 X ' …

1
copula密度的上限?
的Fréchet可-Hoeffding上限适用于连接函数分布函数,它是由下式给出 C(u1,...,ud)≤min{u1,..,ud}.C(u1,...,ud)≤min{u1,..,ud}.C(u_1,...,u_d)\leq \min\{u_1,..,u_d\}. 系密度而不是CDF 是否有相似的上限(在某种程度上取决于边际密度)?c(u1,...,ud)c(u1,...,ud)c(u_1,...,u_d) 任何参考将不胜感激。

1
设置STL窗口宽度的标准
使用R进行STL分解,s.window控制如何快速的季节性成分可以改变。较小的值允许更快速的更改。将季节性窗口设置为无穷大等效于将季节性分量强制为周期性(即跨年相同)。 我的问题: 如果我有一个每月的时间序列(即频率等于),应该使用什么标准设置?121212s.window 那和时间序列频率之间有联系吗?

1
集群数据的正确引导技术?
我有一个关于在存在强集群的数据上使用适当的引导技术的问题。 我的任务是评估保险索赔数据的多元混合效应预测模型,方法是对最新的索赔数据评分当前的基线模型,以便确定该模型对哪些医疗事件包含最高诊治频率的预测效果如何(较高95%)。敏感性,特异性和阳性预测值(PPV)将用于评估模型的有效性。 自举似乎是建立敏感性,特异性和PPV百分比置信区间的正确方法。不幸的是,鉴于索赔数据是1)由护理提供者关联的,2)分组为护理事件的,并且在护理事件的前几个月中进行了更频繁的拜访(因此存在一些自相关性),因此不宜采用单纯的引导程序。在这里,对移动块自举技术的一种变化是否合适? 或三步引导程序可能会起作用:1)从数据中的不同提供者处进行替换的样本,然后2)从所选提供者的不同护理阶段中进行替换的样本,然后3)每个内的不同主张所进行的替换样本选择的情节。 非常感谢您的任何建议!

2
高度不平衡数据集的培训方法
我有一个高度不平衡的测试数据集。正集包含100个案例,而负集包含1500个案例。在训练方面,我有一个更大的候选库:正面训练集有1200个案例,负面训练集有12000个案例。对于这种情况,我有几种选择: 1)在整个训练集中使用加权SVM(P:1200,N:12000) 2)使用基于采样训练集(P:1200,N:1200)的SVM,从12000个案例中抽取1200个否定案例。 在确定哪种方法更好方面是否有任何理论指导?由于测试数据集高度不平衡,我是否也应该使用不平衡训练集?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.