统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
Matérn协方差函数的原理是什么?
Matérn协方差函数通常在高斯过程中用作核函数。像这样定义 Cν(d)=σ221−νΓ(ν)(2ν−−√dρ)νKν(2ν−−√dρ)Cν(d)=σ221−νΓ(ν)(2νdρ)νKν(2νdρ) {\displaystyle C_{\nu }(d)=\sigma ^{2}{\frac {2^{1-\nu }}{\Gamma (\nu )}}{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}^{\nu }K_{\nu }{\Bigg (}{\sqrt {2\nu }}{\frac {d}{\rho }}{\Bigg )}} 其中是距离函数(例如欧几里得距离),是伽马函数,是第二种修改的Bessel函数,和是正参数。实际上,有很多时间被选择为或。Γ ķ ν ρ ν ν 3dddΓΓ\GammaKνKνK_\nuρρ\rhoνν\nuνν\nu 53232\frac{3}{2}5252\frac{5}{2} 很多时候,该内核比“标准高斯”内核更好,因为它“不那么平滑”,但是除此之外,还有其他原因为什么人们更喜欢这种内核?对其表达方式的某些几何直觉,或对看似神秘的公式的某种解释,将受到高度赞赏。

1
为什么将James-Stein估计量称为“收缩”估计量?
我一直在阅读有关James-Stein估计器的信息。在本注释中,其定义为 θ^=(1−p−2∥X∥2)Xθ^=(1−p−2‖X‖2)X \hat{\theta}=\left(1 - \frac{p-2}{\|X\|^2}\right)X 我已经阅读了证明,但不理解以下说法: 在几何上,James–Stein估计器将每个分量向原点方向收缩。XXX “将每个分量缩小到原点”到底是什么意思?我在想类似 在这种情况下,只要,因为 XXX∥θ^−0∥2&lt;∥X−0∥2,‖θ^−0‖2&lt;‖X−0‖2,\|\hat{\theta} - 0\|^2 < \|X - 0\|^2,(p+2)&lt;∥X∥2(p+2)&lt;‖X‖2(p+2) < \|X\|^2∥θ^∥=∥X∥2−(p+2)∥X∥2∥X∥.‖θ^‖=‖X‖2−(p+2)‖X‖2‖X‖.\|\hat{\theta}\| = \frac{\|X\|^2 - (p+2)}{\|X\|^2} \|X\|. 人们说“缩小为零”是什么意思,因为从范式来看,JS估计量比X更接近零?L2L2L^2XXX 截至2017年9月22日的更新:今天我意识到也许我使事情变得过于复杂。似乎人们真的是说,一旦将乘以小于,即,X的每个分量都将比以前小。1 ‖ X ‖ 2 - (p + 2 )XXX111 X∥X∥2−(p+2)∥X∥2‖X‖2−(p+2)‖X‖2\frac{\|X\|^2 - (p + 2)}{\|X\|^2}XXX

6
对数据集样本进行超参数调整不是一个好主意吗?
我有一个包含140000个示例和30个功能的数据集,我正在为其训练几个分类器以进行二进制分类(SVM,逻辑回归,随机森林等) 在许多情况下,使用网格搜索或随机搜索对整个数据集进行超参数调整在时间上过于昂贵。 我开始使用以下技术 子样本我的数据集 使用获得的分数来调整超参数 使用获得的参数来使用整个数据集训练模型 为了评估在第二步骤I使用每组参数sklearn的GridSearchCV与CV = 10。为了评估在第三步中创建的最终模型,我使用sklearn的cross_val_predict。从这种意义上来说,我评估模型时会遗漏10%的数据,然后对其余模型进行训练,然后对10%的预测准确性进行迭代10次,然后取平均分数。 让我担心的是,我在整个数据集上进行训练所获得的预测准确性确实接近我为最佳参数集调整参数时所获得的评估(每组经过测试的参数均输出通过平均10-交叉验证结果)。 在大多数情况下,cross_val_predict使用所有训练示例(整个数据集)测得的准确性略高于返回的最佳参数评估值。 为了说明这一点,这里是对一组参数的评估(在比我上面描述的更小的数据集上,但是效果是相同的) Best parameters set found on development set: {'kernel': 'rbf', 'C': 9, 'gamma': 0.1} Scores for all sets of parameters 0.851 (+/-0.006) for {'kernel': 'rbf', 'C': 3, 'gamma': 0.5} 0.852 (+/-0.006) for {'kernel': 'rbf', 'C': 3, 'gamma': 0.1} 0.829 …


2
VAR预测方法
我正在建立一个VAR模型来预测资产价格,并想知道我的方法在统计上是否合理,我所包括的测试是否相关,以及是否需要更多测试以确保基于输入变量的可靠预测。 下面是我当前的检查Granger因果关系并预测所选VAR模型的过程。 require("forecast") require("vars") #Read Data da=read.table("VARdata.txt", header=T) dac &lt;- c(2,3) # Select variables x=da[,dac] plot.ts(x) summary(x) #Run Augmented Dickey-Fuller tests to determine stationarity and differences to achieve stationarity. ndiffs(x[, "VAR1"], alpha = 0.05, test = c("adf")) ndiffs(x[, "VAR2"], alpha = 0.05, test = c("adf")) #Difference to achieve stationarity d.x1 …
19 r  forecasting  modeling  var 


11
为什么逻辑回归称为机器学习算法?
如果我正确理解,则在机器学习算法中,该模型必须从其经验中学习,即,当模型对新情况给出错误的预测时,它必须适应新的观察结果,并且随着时间的推移,模​​型会变得越来越好。我看不到逻辑回归具有这种特征。那么为什么它仍被视为机器学习算法?在“学习”方面,逻辑回归与普通回归之间有何区别? 对于随机森林,我也有同样的问题! “机器学习”的定义是什么?


4
处理异方差的最佳方法?
我有一个线性模型的残差值随拟合值的函数关系图,其中异方差非常清楚。但是,我不确定现在应该如何进行,因为据我了解,这种异方差会使我的线性模型无效。(那正确吗?) 使用封装的rlm()功能使用健壮的线性拟合,MASS因为它显然对异方差具有健壮性。 由于我的系数的标准误差由于异方差性而错了,因此我可以调整标准误差以使其对异方差性很强吗?使用此处发布在堆栈溢出上的方法:具有异方差的回归校正的标准错误 哪种方法是解决我的问题的最佳方法?如果我使用解决方案2,那么我对模型的预测能力完全没有用吗? Breusch-Pagan检验确认方差不是恒定的。 我的残差在拟合值的函数中看起来像这样: (较大版本)


1
拟合优度以及选择线性回归或泊松的模型
我需要针对我的研究中的两个主要难题提出一些建议,这是对三大制药和创新案例的研究。每年的专利数量是因变量。 我的问题是 好的模型最重要的标准是什么?什么更重要或更重要?是大多数还是所有变量都是有意义的?是“ F统计”的概率吗?它是“调整后的R平方”的值吗? 第二,如何确定最合适的研究模型?除了专利是​​计数变量(可能是泊松计数)之外,我还有一些解释性变量,例如资产回报率,研发预算,重复合伙人(不是二进制变量的百分比),公司规模(员工)等等。我应该做线性回归还是泊松?

5
使用SVM或神经网络时如何将分类变量重新编码为数值变量
要使用SVM或神经网络,需要将分类变量转换(编码)为数字变量,在这种情况下,通常的方法是使用0-1二进制值,将第k个分类值转换为(0,0,.. 。,1,0,... 0)(1在第k个位置)。还有其他方法可以做到这一点,尤其是当存在大量分类值(例如10000),使得0-1表示将在神经网络中引入大量额外的维度(输入单位)时,这似乎不是很理想或期望的? 我在问一般策略。

3
为什么随着样本数量的增加,t分布变得更正常?
根据Wikipedia,我了解到,当样本是来自正态分布总体的iid观测值时,t分布就是t值的样本分布。但是,我不直观地理解为什么这会导致t分布的形状从肥尾变为几乎完全正常。 我得到的是,如果您从正态分布中进行采样,那么如果您进行大样本采样,它将类似于该分布,但是我不知道为什么它从它的胖尾形状开始。

2
结构方程模型(SEM)与贝叶斯网络(BN)
这里的术语是一团糟。“结构方程”与“建筑桥梁”一样模糊,而“贝叶斯网络” 本质上并不是贝叶斯。因果关系之神朱迪亚·珀尔(Judea Pearl)说得更好,这两个模型流派几乎相同。 那么,重要的区别是什么? (令我惊讶的是,截至本文撰写时,SEM的Wikipedia页面甚至还没有包含“网络”一词。)

3
非正态样本的样本方差的渐近分布
这是造成问题的更一般的处理 这个问题。在得出样本方差的渐近分布之后,我们可以应用Delta方法得出标准差的相应分布。 设一个大小为的iid 非正态随机变量,均值和方差。将样本均值和样本方差设置为 { X i } ,nnn{Xi},i=1,...,n{Xi},i=1,...,n\{X_i\},\;\; i=1,...,nμμ\muσ2σ2\sigma^2x¯=1n∑i=1nXi,s2=1n−1∑i=1n(Xi−x¯)2x¯=1n∑i=1nXi,s2=1n−1∑i=1n(Xi−x¯)2\bar x = \frac 1n \sum_{i=1}^nX_i,\;\;\; s^2 = \frac 1{n-1} \sum_{i=1}^n(X_i-\bar x)^2 我们知道 E(s2)=σ2,Var(s2)=1n(μ4−n−3n−1σ4)E(s2)=σ2,Var⁡(s2)=1n(μ4−n−3n−1σ4)E(s^2) = \sigma^2, \;\;\; \operatorname {Var}(s^2) = \frac{1}{n} \left(\mu_4 - \frac{n-3}{n-1}\sigma^4\right) 其中μ4=E(Xi−μ)4μ4=E(Xi−μ)4\mu_4 = E(X_i -\mu)^4,我们将注意力集中在需要存在且有限的矩,确实存在且为有限矩的分布上。 它持有吗 n−−√(s2−σ2)→dN(0,μ4−σ4)?n(s2−σ2)→dN(0,μ4−σ4)?\sqrt n(s^2 - \sigma^2) \rightarrow_d N\left(0,\mu_4 - \sigma^4\right)\;\; ?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.