统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
雅可比因子导致的不同概率密度变换
在Bishop的模式识别和机器学习中,在引入概率密度之后,我读了以下内容:p(x∈(a,b))=∫bap(x)dxp(x∈(a,b))=∫abp(x)dxp(x\in(a,b))=\int_a^bp(x)\textrm{d}x 在变量的非线性变化下,由于雅可比因子,概率密度与简单函数的变换不同。例如,如果我们考虑变量,则函数变为 。现在考虑 相对于新变量对应于密度的概率密度,其中满足表示和是不同密度的事实。观测落在范围将用于的小值 ,被变换成的范围内x=g(y)x=g(y)x = g(y)f(x)f(x)f(x)f~(y)=f(g(y))f~(y)=f(g(y))\tilde{f}(y) = f(g(y))px(x)px(x)p_x(x)py(y)py(y)p_y(y)yyypx(x)px(x)p_x(x)py(y)py(y)p_y(y)(x,x+δx)(x,x+δx)(x, x + \delta x)δxδx\delta x(y,y+δy(y,y+δy(y, y + \delta y),其中 px(x)δx≃py(y)δypx(x)δx≃py(y)δyp_x(x)\delta x \simeq p_y(y)δy,因此py(y)=px(x)|dxdy|=px(g(y))|g′(y)|py(y)=px(x)|dxdy|=px(g(y))|g′(y)|p_y(y) = p_x(x) |\frac{dx}{dy}| = p_x(g(y)) | g\prime (y) |。 雅可比因子是什么?所有事物的确切含义(可能是定性)是什么?Bishop说,此属性的结果是,概率密度最大值的概念取决于变量的选择。这是什么意思? 对我来说,这有点出乎意料(考虑在介绍章节中)。我会感谢一些提示,谢谢!


3
随机森林回归预测不高于训练数据
我注意到,在建立随机森林回归模型时,至少在中R,预测值永远不会超过训练数据中看到的目标变量的最大值。例如,请参见下面的代码。我正在建立一个回归模型以mpg根据mtcars数据进行预测。我建立了OLS和随机森林模型,并使用它们来预测mpg假设的汽车应该具有非常好的燃油经济性。OLS预计会mpg达到预期的高,但随机森林则不会。我在更复杂的模型中也注意到了这一点。为什么是这样? > library(datasets) > library(randomForest) > > data(mtcars) > max(mtcars$mpg) [1] 33.9 > > set.seed(2) > fit1 <- lm(mpg~., data=mtcars) #OLS fit > fit2 <- randomForest(mpg~., data=mtcars) #random forest fit > > #Hypothetical car that should have very high mpg > hypCar <- data.frame(cyl=4, disp=50, hp=40, drat=5.5, wt=1, qsec=24, vs=1, …
12 r  random-forest 

4
Bootstrap vs蒙特卡洛,误差估计
我正在阅读《地球化学计算中的蒙特卡洛方法的误差传播》一书,安德森(Anderson,1976年),有些事情我不太了解。 考虑一些测量数据和程序,其处理它,并返回一个给定值。在本文中,此程序用于首先使用数据手段(即)获得最佳值。{A±σA,B±σB,C±σC}{A±σA,B±σB,C±σC}\{A\pm\sigma_A, B\pm\sigma_B, C\pm\sigma_C\}{A,B,C}{A,B,C}\{A, B, C\} 然后,作者使用蒙特卡洛方法,通过在不确定性范围内改变输入参数(由均值和标准偏差给出的高斯分布来确定),将不确定性分配给该最佳值。),然后再将其提供给程序。如下图所示:{A,B,C}{A,B,C}\{A, B, C\}{σA,σB,σC}{σA,σB,σC}\{\sigma_A, \sigma_B, \sigma_C\} (版权:ScienceDirect) 可以从最终的分布中获得不确定性。ZZZ 如果我应用了bootstrap方法而不是Monte Carlo方法,将会发生什么情况?像这样: 这是:我不是在不确定性范围内更改数据,而是先将它们替换为样本,然后再将其提供给程序。 在这种情况下,这两种方法有什么区别?应用任何警告之前,我应该注意哪些注意事项? 我知道这个问题,蒙特卡洛(Bootstrap)引导程序,但是它并不能完全解决我的疑问,因为在这种情况下,数据包含分配的不确定性。

2
R中的单样本Kolmgorov-Smirnov测试中的“不应出现束缚”
我将使用Kolmogorov-Smirnov测试来测试R中MYDATA的正常性。这是我所做的一个示例 ks.test(MYDATA,"pnorm",mean(MYDATA),sd(MYDATA)) 这是R给我的结果: data: MYDATA D = 0.13527, p-value = 0.1721 alternative hypothesis: two-sided Warning message: In ks.test(MYDATA, "pnorm", mean(MYDATA), sd(MYDATA)) : ties should not be present for the Kolmogorov-Smirnov test 我认为有一个问题,此警告中的“联系”是什么意思?

3
套索vs.自适应套索
LASSO和自适应LASSO是两个不同的东西,对吗?(对我来说,处罚看起来有所不同,但我只是在检查我是否错过了某件事。) 当您通常谈到弹性网时,是LASSO还是自适应LASSO? 如果您选择alpha = 1,glmnet包将执行哪一个操作? 自适应LASSO可在较温和的条件下工作,对吗?两者都在适当的数据中具有oracle属性,对吗?

2
对数差异时间序列模型是否优于增长率?
我经常看到作者估计“对数差异”模型,例如 log(yt)−log(yt−1)=log(yt/yt−1)=α+βxtlog⁡(yt)−log⁡(yt−1)=log⁡(yt/yt−1)=α+βxt\log (y_t)-\log(y_{t-1}) = \log(y_t/y_{t-1}) = \alpha + \beta x_t 我同意这是恰当的关联在变化的百分比而为。xtxtx_tytyty_tlog(yt)log⁡(yt)\log (y_t)I(1)I(1)I(1) 但是对数差异是一个近似值,似乎无需对数转换也可以估算一个模型,例如 yt/yt−1−1=(yt−yt−1)/yt−1=α+βxtyt/yt−1−1=(yt−yt−1)/yt−1=α+βxty_t/y_{t-1} -1 = (y_t - y_{t-1}) / y_{t-1}=\alpha+\beta x_t 此外,增长率将精确地描述百分比变化,而对数差异将仅近似于百分比变化。 但是,我发现对数差异法的使用频率更高。实际上,使用增长率似乎与解决第一个差异一样适合解决平稳性问题。实际上,我发现将对数变量转换回级别数据时,预测会变得有偏差(在文献中有时称为重新转换问题)。yt/yt−1yt/yt−1y_t/y_{t-1} 与增长率相比,使用对数差异有什么好处?增长率转换是否存在任何固有问题?我猜想我遗漏了一些东西,否则更频繁地使用该方法似乎很明显。

1
使用条件分布从边际分布采样?
我想从单变量密度采样,但我只知道这种关系:FXfXf_X FX(x )= ∫FX| ÿ(x | y)fÿ(y)dÿ。fX(x)=∫fX|Y(x|y)fY(y)dy.f_X(x) = \int f_{X\vert Y}(x\vert y)f_Y(y) dy. 我想避免使用MCMC(直接在整数表示上),并且由于和易于采样,因此我在考虑使用以下采样器:f Y(y )FX| ÿ(x | y)fX|Y(x|y)f_{X\vert Y}(x\vert y)Fÿ(y)Fÿ(ÿ)f_Y(y) 对于。j = 1 ,… ,NĴ=1个,…,ñj=1,\dots, N 样本。ÿĴ〜˚FÿÿĴ〜Fÿy_j \sim f_Y 样本。XĴ〜˚FX| ÿ(⋅ | yĴ)XĴ〜FX|ÿ(⋅|ÿĴ)x_j \sim f_{X\vert Y}(\cdot\vert y_j) 然后,我将得到对,仅获取边际样本。 它是否正确?(x 1,… ,x N)(x1个,ÿ1个),。。。,(xñ,ÿñ)(X1个,ÿ1个),。。。,(Xñ,ÿñ)(x_1,y_1),...,(x_N,y_N)(x1个,… ,xñ)(X1个,…,Xñ)(x_1,\dots,x_N)

3
区别在于摘要统计:基尼系数和标准偏差
有几个摘要统计信息。当您要描述分布的分布时,可以使用例如标准差或基尼系数。 我知道标准偏差是基于中心趋势,即与均值的偏差,基尼系数是色散的一般度量。我也知道,基尼系数具有上限和下限[0 1],而标准偏差则没有。这些属性是很好知道的,但是标准偏差可以提供哪些见解,使基尼无法做到,反之亦然?如果我不得不选择使用两者之一,那么在提供信息和洞察力方面,与另一种相比使用一种优势是什么?


1
火车等待时间的贝叶斯建模:模型定义
这是我从常驻人员那里进行贝叶斯数据分析的第一次尝试。我阅读了A. Gelman撰写的Bayesian Data Analysis中的许多教程和一些章节。 作为第一个或多或少独立数据分析示例,我选择了火车等待时间。我问自己:等待时间的分布是什么? 该数据集在博客上提供,并且在PyMC之外进行了稍有不同的分析。 我的目标是给定这19个数据条目,估计预期的火车等待时间。 我建立的模型如下: μ∼N(μ^,σ^)μ∼N(μ^,σ^)\mu \sim N(\hat\mu,\hat\sigma) σ∼|N(0,σ^)|σ∼|N(0,σ^)|\sigma \sim |N(0,\hat\sigma)| λ∼Γ(μ,σ)λ∼Γ(μ,σ)\lambda \sim \Gamma(\mu,\sigma) ρ∼Poisson(λ)ρ∼Poisson(λ)\rho \sim Poisson(\lambda) 其中μ^μ^\hat\mu是数据平均值,σ^σ^\hat\sigma是数据标准偏差乘以1000。 我使用泊松分布将预期的等待时间建模为ρρ\rho。此分布的速率参数是使用Gamma分布建模的,因为它是与Poisson分布的共轭分布。超先验μμ\mu和σσ\sigma分别使用正态分布和半正态分布建模。使标准偏差σσ\sigma尽可能宽,以使其尽可能不被置信。 我有很多问题 这个模型对任务是否合理(几种可能的建模方法?)? 我有没有犯任何新手错误? 是否可以简化模型(我倾向于使简单的事情复杂化)? 如何验证rate参数()的后验是否确实适合数据?ρρ\rho 如何从拟合的泊松分布中抽取一些样本以查看样本? 在经过5000个Metropolis步骤后,后继者看起来像这样: 我也可以发布源代码。在模型拟合阶段,我使用NUTS 执行参数和的步骤。然后在第二步中对速率参数进行Metropolis操作。最后,我使用内置工具绘制轨迹。μμ\muσσ\sigmaρρ\rho 对于任何能够使我掌握更多概率编程的言论和评论,我将不胜感激。可能还有更多值得尝试的经典示例吗? 这是我使用PyMC3在Python中编写的代码。数据文件可以在这里找到。 import matplotlib.pyplot as plt import pandas as pd import numpy as np import pymc3 from scipy import …
12 bayesian  pymc 

1
置换检验的置信区间和P值不确定性
我正在学习随机测试。我想到两个问题: 是的,通过随机化测试(我认为与置换测试相同)来计算p值很容易而且很直观。但是,如何像普通参数测试一样生成95%的置信区间? 当我阅读华盛顿大学有关置换测试的文档时,第13页上有一句话说: 对于1000个排列....,p = 0.05附近的不确定度约为 。±1%±1%\pm 1\% 我不知道我们如何得到这种不确定性。

1
如何使用线性函数逼近将权重拟合到Q值
在强化学习中,当存在较大的状态空间时,通常使用线性函数逼近。(当查找表变得不可行时。) 线性函数近似的值的形式为问-Q−Q- Q (s ,a )= w1个F1个(s ,a )+ w2F2(s ,a )+ ⋯ ,Q(s,a)=w1f1(s,a)+w2f2(s,a)+⋯,Q(s,a) = w_1 f_1(s,a) + w_2 f_2(s,a) + \cdots, 其中是权重,f i是特征。w一世wiw_iF一世fif_i 这些功能由用户预定义。我的问题是,权重如何分配? 我已经阅读/下载了一些有关学习函数逼近的讲座幻灯片。他们中的大多数人都跟随着线性回归的幻灯片。由于它们只是幻灯片,因此往往不完整。我想知道这两个主题之间的联系/关系是什么。问-Q−Q-

2
因子旋转方法(方差最大,最小限度等)-名称含义是什么,这些方法是做什么的?
因子分析有几种旋转方法,例如方差,夸脱,最大等方,promax,oblimin等。我找不到任何将其名称与其实际数学或统计数据相关联的信息。为什么称其为“最大最大”或“最大最大”?轴或矩阵以哪种方式旋转,因此它们具有这样的名称? 不幸的是,它们大多数是1950年代至1970年代发明的,因此我无法联系他们的作者。

3
如果路径c不重要,但路径a和b是重要的怎么办?调解的间接影响
在经典的中介模型中,我们的路径如下图所示 , 其中测试M在X和Y之间的中介作用的第一步是X与Y显着相关(如图A所示)。 但是,我遇到了路径a和路径b非常重要而路径C却不重要的情况。与路径c相比,路径c'并不显着,但是系数降低了。 在这种情况下,谈论X,Y和M之间的关系是否仍然有价值?如果是这样,解决论文中这种关系的最佳方法是什么?我们可以说X对Y有间接作用但没有直接作用吗? 我正在用三个样本(测试相同的路径模型。ñ1个= 124 ,n2= 49 ,n3= 166ñ1个=124,ñ2=49,ñ3=166n_1 = 124, n_2 = 49, n_3 = 166

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.