统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
如何选择最佳指标来测量校准?
我编程并进行测试驱动的开发。在更改代码后,我将运行测试。有时他们成功,有时他们失败。在我运行测试之前,我写下一个从0.01到0.99的数字,以表示我相信测试会成功。 我想知道我在预测测试成功还是失败方面是否有所进步。如果我可以跟踪我是否更擅长预测测试在星期一还是星期五成功,那也将是很好的。我想知道,如果我预测测试成功的能力与我跟踪的其他指标相关。 剩下的工作就是选择正确的指标。在超级预测中,Philip Tetlock建议使用Brier分数来衡量专家的校准水平。文献中提出的另一种度量是对数评分规则。还有其他可能的候选人。 如何确定要使用的指标?是否有理由赞成一种计分规则而不是其他计分规则?

1
是什么证明了矩阵函数导数的这种计算是合理的?
在吴安德(Andrew Ng)的机器学习课程中,他使用以下公式: ∇一个吨- [R (甲乙甲ŤC)= C甲乙+ C ^Ť一乙Ť∇Atr(ABATC)=CAB+CTABT\nabla_A tr(ABA^TC) = CAB + C^TAB^T 他做了一个快速证明,如下所示: ∇一个吨- [R (甲乙甲ŤC)= ∇一个吨- [R (˚F(A )AŤC)= ∇∘吨- [R (˚F(∘ )AŤC)+ ∇∘吨- [R (˚F(一)∘ŤC)= (AŤC)ŤF′(∘ )+ (∇∘Ť吨- [R (˚F(一)∘ŤC)Ť= CŤ一乙Ť+ (∇∘Ť吨- [R (∘Ť)CF(A ))Ť= CŤ一乙Ť+ ((CF(A ))Ť)Ť= CŤ一乙Ť+ C一乙∇Atr(ABATC)=∇Atr(f(A)ATC)=∇∘tr(f(∘)ATC)+∇∘tr(f(A)∘TC)=(ATC)Tf′(∘)+(∇∘Ttr(f(A)∘TC)T=CTABT+(∇∘Ttr(∘T)Cf(A))T=CTABT+((Cf(A))T)T=CTABT+CAB\nabla_A tr(ABA^TC) \\ = \nabla_A tr(f(A)A^TC) \\ = …

1
在什么情况下,Wilcoxon的符号秩检验优于t检验或符号检验?
经过一些讨论(在下面),我现在对焦点问题有了更清晰的了解,因此这是一个修订后的问题,尽管某些评论现在似乎与原始问题无关。 似乎t检验针对对称分布迅速收敛,有符号秩检验假设对称,并且对于对称分布,均值/伪随机数/中位数之间没有差异。如果是这样,在什么情况下,当他/她同时拥有t检验和sign检验时,相对没有经验的统计学家会认为有序检验有用吗?如果我的一位(例如社会科学专业)学生正在尝试测试一种治疗方法是否比另一种治疗方法更好(通过某种相对容易解释的衡量标准,例如某种“平均”差异的概念),那么我将努力寻找一个有签名的地方,即使在我的大学中,虽然通常会进行等级考试,但忽略了符号测试。

2
卷积神经网络可以将不同大小的图像作为输入图像吗?
我正在开发用于图像识别的卷积网络,我想知道是否可以输入不同大小的图像(尽管差别不大)。 关于此项目:https : //github.com/harvardnlp/im2markup 他们说: and group images of similar sizes to facilitate batching 因此,即使经过预处理,图像仍然具有不同的大小,这是有道理的,因为它们不会切掉公式的某些部分。 使用不同尺寸会有任何问题吗?如果有,我应该如何解决此问题(因为公式无法完全适合相同的图像大小)? 任何输入将不胜感激


2
排序列表上的分布
说我们有一个有序的物品清单 [a, b, c, ... x, y, z, ...] 我正在寻找一个上面的列表中受某些参数alpha控制的发行版系列,以便: 对于alpha = 0,它将第一项的概率分配为1,将其分配给上方,将其余的分配为0。也就是说,如果我们从此列表中进行采样并进行替换,则总会得到a。 随着alpha的增加,我们会按照指数衰减的方式,为列表的其余部分分配越来越高的概率,并遵守列表的顺序。 当alpha = 1时,我们为列表中的所有项目分配相等的概率,因此从列表中进行采样类似于忽略其顺序。 这与几何分布非常相似,但是有一些明显的区别: 在所有自然数上定义了几何分布分布。在上面的例子中,列表的大小是固定的。 没有为alpha = 0定义几何分布。

3
二进制数据的指示符变量:{-1,1}与{0,1}
我感兴趣的治疗协变量相互作用的实验背景/随机对照试验,用二进制治疗分配指标。ŤTT 根据具体的方法/来源,我分别看到已治疗和未治疗受试者的和。Ť = { 1 ,- 1 }Ť= { 1 ,0 }T={1,0}T=\{1,0\}Ť= { 1 ,− 1 }T={1,−1}T=\{1, -1\} 使用或有什么经验法则吗?{ 1 ,- 1 }{ 1 ,0 }{1,0}\{1,0\}{ 1 ,− 1 }{1,−1}\{1, -1\} 解释有何不同?

1
手动计算线性混合模型的随机效应预测
我试图手工从线性混合模型中计算随机效应预测,并使用伍德在广义加性模型中提供的表示法:R的简介(pdf的pg 294 / pg 307),我对每个参数的含义感到困惑代表。 以下是伍德的摘要。 定义线性混合模型 ÿ= Xβ+ Zb + ϵY=Xβ+Zb+ϵ Y = X\beta + Zb + \epsilon 其中b N(0,ψ),和ε 〜 N(0,σ 2)〜∼\simψψ\psiε 〜ϵ∼\epsilon \simσ2σ2\sigma^{2} 如果b和y是具有正态分布的随机变量 [by]∼N[[0Xβ],[ψΣybΣbyΣθσ2]][by]∼N[[0Xβ],[ψΣbyΣybΣθσ2]]\begin{align*} \begin{bmatrix} b\\ y \end{bmatrix} &\sim N \begin{bmatrix} \begin{bmatrix} 0\\ X\beta \end{bmatrix}\!\!,& \begin{bmatrix} \psi & \Sigma_{by} \\ \Sigma_{yb}& \Sigma_{\theta}\sigma^{2} \end{bmatrix} \end{bmatrix}\\ \end{align*} 可再生能源的预测是通过 …

2
测试套索逻辑回归中的系数显着性
[ 这里提出了类似的问题,但没有答案] 我已经使用L1正则化拟合了逻辑回归模型(套索逻辑回归),我想测试拟合系数的显着性并获得其p值。我知道Wald的检验(例如)是在不进行正则化的情况下测试单个系数在完全回归中的显着性的一种选择,但是对于Lasso,我认为会出现更多的问题,这些问题不允许使用常规的Wald公式。例如,检验所需的方差估计不遵循通常的表达式。套索纸原件 http://statweb.stanford.edu/~tibs/lasso/lasso.pdf 建议使用基于引导程序的程序来估计系数方差,(再次,我认为)测试可能需要此方差(第2.5节,第272页的最后一段和273的开头): 一种方法是通过引导程序:要么可以固定要么可以针对每个引导程序样本对进行优化。固定类似于选择(特征的)最佳子集,然后对该子集使用最小二乘标准误差ttttttttt 我的理解是:反复将Lasso回归拟合到整个数据集,直到找到正则化参数的最佳值(这不是引导程序的一部分),然后仅使用由Lasso选择的特征将OLS回归拟合到子样本数据并应用通常的公式来计算每个回归的方差。(然后,我该如何处理每个系数的所有这些方差以获得每个系数的最终方差估计?) 此外,将常用的显着性检验(例如Wald检验利用估计的beta和方差)与系数的Lasso估计和自举估计方差一起使用是否正确?我可以肯定它不是,但是任何帮助(使用其他测试,使用更直接的方法,无论如何...)都非常受欢迎。 根据这里的答案,我怀疑无法得出推论和p值。就我而言,p值是一个外部要求(尽管我选择使用L1正则化)。 非常感谢 编辑 如果我仅使用上一次套索逻辑回归所选择的变量来拟合OLS逻辑回归怎么办?显然(请参阅此处), 进行交叉验证后,无需再次运行模型(您只需从cv.glmnet的输出中获取系数),实际上,如果您在不惩罚的情况下拟合新的逻辑回归模型,那么您将无法使用套索 但是,如果我这样做的唯一目的是能够在不使变量数量减少的情况下计算p值呢?这是一个很肮脏的方法吗?:-)

2
什么是随机变量的样本?
随机变量被定义为从具有基础度量一个代数到另一个代数的可测量函数。XXXσσ\sigma(Ω1,F1)(Ω1,F1)(\Omega_1, \mathcal F_1)PPPσσ\sigma(Ω2,F2)(Ω2,F2)(\Omega_2, \mathcal F_2) 我们如何谈论这个随机变量的样本?我们是否将其视为的元素?还是与具有相同的可测量功能?XnXnX^nΩ2Ω2\Omega_2XXX 我在哪里可以了解更多信息? 例: 在蒙特卡洛估计中,我们通过将样本作为函数来证明估计量的无偏性。如果将随机变量的期望定义为(Xn)Nn=1(Xn)n=1N(X^n)_{n = 1}^NXXX E[X]=∫Ω1X(ω1)dP(ω1)E[X]=∫Ω1X(ω1)dP(ω1)\begin{align} \mathbb E[X] = \int_{\Omega_1} X(\omega_1) \,\mathrm dP(\omega_1) \end{align} 并假设是函数并且,我们可以进行如下操作:XnXnX^nXn=XXn=XX^n = X E[1N∑n=1Nf(Xn)]=1N∑n=1NE[f(Xn)]=1N∑n=1NE[f(X)]=E[f(X)].E[1N∑n=1Nf(Xn)]=1N∑n=1NE[f(Xn)]=1N∑n=1NE[f(X)]=E[f(X)].\begin{align} \mathbb E\left[\frac{1}{N} \sum_{n = 1}^N f(X^n)\right] &= \frac{1}{N} \sum_{n = 1}^N \mathbb E[f(X^n)] \\ &= \frac{1}{N} \sum_{n = 1}^N \mathbb E[f(X)] \\ &= \mathbb E[f(X)]. \end{align} …

2
条件均值独立性意味着OLS估计量的无偏性和一致性
考虑以下多元回归模型:Y=Xβ+Zδ+U.(1)(1)Y=Xβ+Zδ+U.Y=X\beta+Z\delta+U.\tag{1} 这里是列向量; a矩阵; a列向量; Z a n \ times l矩阵;\增量一升\次1个的列向量; 和U,误差项,n \ times1列向量。YYYn×1n×1n\times 1XXXn×(k+1)n×(k+1)n\times (k+1)ββ\beta(k+1)×1(k+1)×1(k+1)\times 1ZZZn×ln×ln\times lδδ\deltal×1l×1l\times 1UUUn×1n×1n\times1 题 我的讲师是《计量经济学概论》教科书,第三版。 詹姆斯·H·斯托克(James H. Stock)和马克·沃森(Mark W.Watson)281,和《计量经济学:荣誉考试复习会》(PDF),第2页。7,向我表达了以下内容。 如果我们假设所谓的条件平均独立性,根据定义,这意味着E(U|X,Z)=E(U|Z),(2)(2)E(U|X,Z)=E(U|Z),E(U|X,Z)=E(U|Z),\tag{2} 并且如果满足最小二乘假设,但条件均值零假设(因此,我们假设)(请参阅1 -3以下),E(U|X,Z)=0E(U|X,Z)=0E(U|X,Z)=0E(U|X,Z)=E(U|Z)≠0E(U|X,Z)=E(U|Z)≠0E(U|X,Z)=E(U|Z) \neq 0 然后,在这个较弱的假设集合下,中的OLS估计量保持无偏且一致。β^β^\hat{\beta}ββ\beta(1)(1)(1) 我如何证明这一主张?即,1和2以上意味着OLS估计给了我们一个公正的和一致的估计?是否有任何研究文章证明这一主张?ββ\betaββ\beta 评论 最简单的情况是通过考虑线性回归模型给出并证明了OLS估计的如果每个,则是无偏的。Yi=β0+β1Xi+β2Zi+ui,i=1,2,…,n,Yi=β0+β1Xi+β2Zi+ui,i=1,2,…,n,Y_i=\beta_0+\beta_1X_i+\beta_2Z_i+u_i,\quad i=1,2,\ldots,n,β 1 β 1 È (û 我| X 我,Ž 我)= È (û 我| Ž 我)我β^1β^1\hat{\beta}_1β1β1\beta_1E(ui|Xi,Zi)=E(ui|Zi)E(ui|Xi,Zi)=E(ui|Zi)E(u_i|X_i,Z_i)=E(u_i|Z_i)iii 证明无偏的假设和共同正态分布UiUiU_iZiZiZ_i 定义,然后和因此,可以重写为通过,得出现在,由于和共同为正态分布,因此正态分布的理论请参见。推导多元正态分布的条件分布,表示(实际上,我们不需要假设联合正态性,而只需假设此同一性)对于某乘矢量V=U−E(U|X,Z)V=U−E(U|X,Z)V=U-E(U|X,Z)U=V+E(U|X,Z)U=V+E(U|X,Z)U=V+E(U|X,Z)E(V|X,Z)=0.(*)(*)E(V|X,Z)=0.E(V|X,Z)=0\tag{*}.(1)(1)(1)Y=Xβ+Zδ+E(U|X,Z)+V.(3)(3)Y=Xβ+Zδ+E(U|X,Z)+V.Y=X\beta+Z\delta+E(U|X,Z)+V.\tag{3}(2)(2)(2)Y=Xβ+Zδ+E(U|Z)+V.(4)(4)Y=Xβ+Zδ+E(U|Z)+V.Y=X\beta+Z\delta+E(U|Z)+V.\tag{4}UiUiU_iZiZiZ_i …

1
如何使用cv.glmnet(R中的LASSO回归)进行交叉验证?
我想知道如何使用R中的glmnet正确地训练和测试LASSO模型? 具体来说,我想知道如果缺少外部测试数据集该如何使用交叉验证(或其他类似方法)来测试我的LASSO模型,该怎么做。 让我分解一下情况: 我只有一个数据集来通知和训练我的glmnet模型。结果,我将不得不使用交叉验证来拆分数据,以生成一种测试模型的方法。 我已经在使用cv.glmnet,根据软件包的详细信息: 对glmnet进行k折交叉验证,生成图并返回lambda的值。 进行交叉验证cv.glmnet只是为了选择最佳的λ,还是作为更通用的交叉验证程序? 换句话说,我还需要执行另一个交叉验证步骤来“测试”我的模型吗? 我正在假设“是的”。 既然如此,我该如何交叉验证我的cv.glmnet模型? 我是否必须手动执行此caret功能,或者该功能对glmnet模型有用吗? 我是否使用交叉验证的两个同心“循环”?...我是否使用CV的“内循环” cv.glmnet来确定k倍交叉验证处理的“外部循环”的每k倍内的最佳lambda值? 如果我对已经进行交叉验证的cv.glmnet模型进行交叉验证,那么如何cv.glmnet在交叉验证的“外部循环”的每一折中将“最佳”模型(与“最佳” lambda值隔离)与每个模型隔离? 注:我定义“最好”的模式,与产生最小的1 SE内的MSE拉姆达关联的模型......这是$lambda.1se在cv.glmnet模型。 内容: 我正在尝试根据树木直径(“ D”),D ^ 2和种类(“ factor(SPEC)”)来预测树木年龄(“年龄”)。[结果方程式:Age ~ D + factor(SPEC) + D^2]。我有约5万行数据,但数据是纵向的(通过时间跟踪个体),由约65种组成。

1
是否有实现的Monte Carlo / MCMC采样器可以处理后验分布的局部局部最大值?
我目前正在使用贝叶斯方法来估计由多个ODE组成的模型的参数。由于我有15个参数可以估计,因此我的采样空间是15维的,而我寻找的后验分布似乎有很多局部最大值,这些最大值被非常低概率的大区域非常孤立。 这导致了我的蒙特卡洛链的混合问题,因为一个链不太可能“跳出”一个局部最大值并偶然碰到另一个最大值。 在该领域似乎有很多研究,因为它很容易找到解决这个问题的论文(见下文),但是很难找到一个实际的实现。我只发现了与分子动力学有关的软件包,而没有贝叶斯推断。是否有(MC)MC采样器的实现能够处理孤立的局部最大值? 我被迫与Matlab一起工作,因为那是我编写的ODE模型所编写的,所以最欢迎有关Matlab的建议;-)。但是,如果有其他语言的“杀手级应用”,也许我可以说服我的PI切换;-)。 我目前正在使用由Haario,L​​aine等人撰写的“延迟拒绝/自适应蒙特卡洛”采样器。,这也是迄今为止我所能找到的唯一一个比标准Metropolis-Hastings算法更复杂的采样器 值得注意的方法似乎是: 编辑于2017年3月7日更新了我在此期间学到的知识 具有不同起点的多个相似链 链间适应。使用多个独立链生成的合并样本的经验协方差矩阵来更新链提案分布的协方差矩阵。(1) 不同回火的多条链 回火: 某种“温度”似乎改变了后部景观,使链条更可能混合。(我还没有深入探讨这一问题)(1)调节的目的是使由后验概率分布形成的(高维)概率态势平坦。通常通过将后验概率乘以的幂来实现,其中后方景观在变平(3,p.298)。这意味着,代替计算状态的后验概率,给定数据可以计算出回火后验概率1/T1/T1/TT>1T>1T>1p(θ∣D)p(θ∣D)p(\theta\mid D)θθ\thetaDDD p(θ∣D)1/T∝(p(D∣θ)⋅p(θ))1/Tp(θ∣D)1/T∝(p(D∣θ)⋅p(θ))1/Tp(\theta\mid D)^{1/T} \propto \left( p(D\mid\theta)\cdot p(\theta)\right)^{1/T} 选择的越高,概率图中的峰越平坦越宽。因此,较高的值导致采样器从一个局部最大值切换到另一个局部最大值的可能性更高。但是,不是搜索的后验分布 。因此,必须使用该分布的样本链来启用之后的采样。TTTTTTp(θ∣D)1/Tp(θ∣D)1/Tp(\theta\mid D)^{1/T}T≠1T≠1T\neq1p(θ∣D)p(θ∣D)p(\theta\mid D) 原始的,未回火的后验分布的样本,可以通过几种方法从该分布的回火版本得到样本: 大都会耦合的MCMC同时运行多个链,每个链具有不同但恒定的值。概率性地切换两个链的状态。仅将的链中的样本用于下游估计;其他链只需确保对所有峰进行了采样。参考 (4)具有并行算法,并为此主题引用了会议文章和教科书(5,6)TTTT=1T=1T=1 小世界MCMC。采样器在两个建议之间切换。大多数情况下,使用差异较小的提案分布,很少使用差异较大的提案。这两个建议之间的选择是随机的。差异较大的建议也可以从另一个链中得出,该链只会产生很大的跳跃,以粗糙的方式尽可能多地采样(2,7) 哈密​​尔顿蒙特卡洛(HMC) 我对此了解不多,但是JAGS的No-U-Turn采样器(NUTS) 似乎在使用它。参见参考。(8)。Alex Rogozhnikov创建了关于该主题的可视教程。 参考文献: (1)Craiu等,2009:向邻居学习:并行链和区域自适应MCMC。 J Am Stat Assoc 104:488,第1454-1466页。http://www.jstor.org/stable/40592353 (2)关岛等,2012:带回火的小世界MCMC:人为性和光谱缺口。https://arxiv.org/abs/1211.4675(仅在arXiv上) (3):Brooks等。(2011)。马尔可夫链手册蒙特卡洛。CRC出版社。 (4):Altekar等。(2004):平行大都会耦合马尔可夫链蒙特卡洛用于贝叶斯系统发生推断。Bioinformatics 20(3)2004,第407–415页,http: //dx.doi.org/10.1093/bioinformatics/btg427 (5):盖耶(Geyer CJ)(1991)马尔可夫链蒙特卡罗最大似然。在:Keramidas(ed。),《计算科学与统计:接口》第23届会议论文集。接口基金会,费尔法克斯站,第156–163页。 (6):Gilks​​ WR和Roberts GO(1996)。改善MCMC的策略。在:实践中的Gilks​​ WR,Richardson S和Spiegelhalter(eds) …

4
如何向外行人解释什么是无偏估计?
假设是一个无偏估计。然后,当然是。 θë[ θ |θ]=θθ^θ^\hat{\theta}θθ\thetaE[θ^∣θ]=θE[θ^∣θ]=θ\mathbb{E}[\hat{\theta} \mid \theta] = \theta 一个人如何向外行人解释呢?过去,我所说的是,如果对一堆求平均值,则随着样本数量的增加,您会更好地逼近。 θθ^θ^\hat{\theta}θθ\theta 对我来说,这是有问题的。我认为我在这里实际描述的是这种渐近无偏的现象,而不是单纯地无偏的现象,即 其中\ hat {\ theta}可能取决于n。limn→∞E[θ^∣θ]=θ,limn→∞E[θ^∣θ]=θ,\lim_{n \to \infty}\mathbb{E}[\hat{\theta} \mid \theta] = \theta\text{,} Ñθ^θ^\hat{\theta}nnn 那么,如何向外行人解释什么是无偏估计呢?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.