统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
强化学习教科书
我正在寻找强化学习中的教科书/讲义。我喜欢“统计学习导论”,但不幸的是,它们没有涵盖此主题。我知道萨顿(Sutton)和巴托(Barto)的书是标准参考书,也许NDP也不错,但是它们的年代是1997-98,而且我希望找到一个更现代的博览会,因为该领域在最近可能会有相当大的发展。时间。

2
面板数据的机器学习算法
在这个问题中- 是否有一种考虑结构化/分层/多级预测变量的构造决策树的方法?-他们提到了树木的面板数据方法。 是否有支持矢量机和神经网络的特定面板数据方法?如果是这样,您能否引用一些有关算法和实现它的R包的文章?

2
多元线性回归中对p值的理解
关于多元线性回归分析的p值,Minitab网站的介绍如下所示。 每个项的p值检验零假设,即该系数等于零(无影响)。低p值(<0.05)表示您可以拒绝原假设。换句话说,具有低p值的预测变量可能是对模型有意义的补充,因为预测变量值的变化与响应变量的变化有关。 例如,我的合成MLR模型为 。输出结果如下所示。然后,可以使用该公式计算。ÿ= 0.46753 X1个− 0.2668 X2+ 1.6193 X3+ 4.5424 X4+ 14.48ÿ=0.46753X1个-0.2668X2+1.6193X3+4.5424X4+14.48 y=0.46753{{X}_{1}}-0.2668{{X}_{2}}+1.6193{{X}_{3}}+4.5424{{X}_{4}}+14.48 ÿÿy Estimate SE tStat pValue ________ ______ _________ _________ (Intercept) 14.48 5.0127 2.8886 0.0097836 x1 0.46753 1.2824 0.36458 0.71967 x2 -0.2668 3.3352 -0.079995 0.93712 x3 1.6193 9.0581 0.17877 0.86011 x4 4.5424 2.8565 1.5902 0.1292 根据上面的介绍,零假设是系数等于0。我的理解是,系数(例如的系数)将设置为0,而另一个y将被计算为。然后对和进行配对t检验,但是该t检验的p值为6.9e-12,不等于0.1292(系数的p值。X4X4X_{4}ÿ2= 0.46753 …

2
正弦波的概率分布
当存在一些测量误差时,我希望从一个振荡函数来分析计算采样点的概率分布。我已经计算了“无噪声”部分的概率分布(我将在结尾处进行介绍),但是我不知道如何包括“噪声”。 数值估算 更清楚地说,假设有一个函数,您可以在一个周期内随机选择点;如果您将直方图上的点归类,您将获得与分布有关的信息。ÿ(x )= 罪(x )ÿ(X)=罪⁡(X)y(x) = \sin(x) 无噪音 例如,这里是和相应的直方图š 我Ñ (X )s一世ñ(X)sin(x) 有噪音 现在,如果存在一些测量误差,那么它将改变直方图的形状(因此,我认为是基本分布)。例如 解析计算 因此,希望我已经说服了两者之间存在一些差异,现在我将写出如何计算“无噪音”情况: 无噪音 ÿ(x )= 罪(x )ÿ(X)=罪⁡(X) y(x) = \sin(x) 然后,如果我们采样的时间是均匀分布的,则的概率分布必须满足:ÿÿy P(y)dÿ= dX2个πP(ÿ)dÿ=dX2π P(y) dy = \frac{dx}{2\pi} 然后因为 dXdÿ= ddÿ(反正弦(y)) = 11 − y2-----√dXdÿ=ddÿ(反正弦⁡(ÿ))=1个1个-ÿ2\frac{dx}{dy} = \frac{d}{dy}\left(\arcsin(y)\right) = \frac{1}{\sqrt{1 - y^{2}}} 所以 P(y)= 12个π1 − y2-----√P(ÿ)=1个2π1个-ÿ2 …

2
如何比较两种排名算法?
我想比较两种排名算法。在这些算法中,客户在搜索中指定一些条件。根据客户的要求,这些算法应为数据库中的每个项目分配一个分数,并检索得分最高的项目。 我在该站点上阅读了与我的问题相关的不同主题,并在网上搜索。根据我的搜索,最相关的文章解释了一些用于比较排名算法的指标,这是:Brian McFee和Gert RG Lanckriet,Metric Learning to Rank,ICML 2010(https://bmcfee.github.io/papers/mlr .pdf)。我认为prec @ k,MAP,MRR和NDCG是可以使用的良好指标,但是我有一个问题: 我的算法对结果进行排序,因此结果列表中的第一项是得分最高的最佳项,第二项结果是第二高分,依此类推。我将搜索算法限制为例如找到5个最佳结果。结果是最热门的5个项目。因此,精度将为1。当我限制搜索以找到最佳结果时,它将找到最佳结果。同样,精度将为1。但是问题是,看到此结果的人无法接受。 我能做什么?我如何比较这些算法并显示一种算法优于另一种算法?

2
为什么R需要很长时间才能拟合具有多级因子的模型?
我用一个具有多个水平因子的模型拟合模型,并且R花费很长时间才能拟合该模型。为什么是这样? 例如,如果我拟合回归来预测球员的薪水,并包括针对所有球员各自国籍的因子预测器,那么与使用像球员的连续预测器那样的球员的薪资模型拟合起来相比,这将花费更长的时间。高度。

5
Ridge&LASSO规范
这篇文章遵循以下内容:为什么通过向对角线添加一个常数,使岭估计变得比OLS好? 这是我的问题: 据我所知,岭正则化使用 -norm(欧几里德距离)。但是,为什么我们要使用此规范的平方呢?(的直接应用将 beta平方和的平方根)。ℓ 2ℓ2ℓ2\ell_2ℓ2ℓ2\ell_2 作为比较,对于LASSO,它不使用 -norm进行正则化。但是,这里是“真实的”范数(只是beta绝对值的平方的和,而不是该和的平方)。ℓ 1ℓ1个ℓ1\ell_1ℓ1个ℓ1\ell_1 有人可以帮我澄清一下吗?




1
漂移序列与趋势序列之间的差异
可以将具有漂移的序列建模为 ,其中是漂移(常数),并且。 yt=c+ϕyt−1+εtyt=c+ϕyt−1+εty_t = c + \phi y_{t-1} + \varepsilon_tcccϕ=1ϕ=1\phi=1 可以将具有趋势的序列建模为,其中是漂移(常数),是确定的时间趋势,。yt=c+δt+ϕyt−1+εtyt=c+δt+ϕyt−1+εty_t = c + \delta t + \phi y_{t-1} + \varepsilon_tcccδtδt\delta tϕ=1ϕ=1\phi=1 这两个系列都是,我认为两者都表现出越来越高的行为。I(1)I(1)I(1) 如果我有一个表现出越来越高的表现的新系列,我怎么知道这个系列是具有漂移或趋势的系列? 我可以做两个ADF测试: ADF测试1:零假设是级数为具有漂移的I(1)I(1)I(1) ADF测试2:零假设是具有趋势的序列I(1)I(1)I(1) 但是,如果两个测试的原假设都不被拒绝怎么办?

2
序数和连续随机变量之间关联强度的非参数度量
我收到问题时就把问题扔到这里了。 我有两个随机变量。其中一个是连续的(Y),另一个是离散的,将作为序数(X)逼近。我把与查询一起收到的图放在下面。 向我发送数据的人想要衡量 X和Y之间关联的强度。我正在寻找不会随波逐流的假设而产生想法的想法。请注意,这并不是要找到一种非参数方法来测试关系的强度(例如在引导程序中),而是要找到一种非参数方法来测量关系的强度。 另一方面,效率不成问题,因为有很多数据点。


2
可以使用Poisson,Gamma或Tweedie分布作为错误分布族来评估Python / scikit-learn中的GLM吗?
试图学习一些Python和Sklearn,但是对于我的工作,我需要运行回归,使用Poisson,Gamma尤其是Tweedie系列的误差分布。 我没有在文档中看到关于它们的任何内容,但是它们在R发行版的几个部分中,因此我想知道是否有人在任何地方看到了Python的实现。如果您可以将我引向Tweedie发行版的SGD实现,那就太酷了!

1
是什么导致空间相关图中出现U形图案?
在我自己的工作中,我注意到在检查不同距离的空间相关图时会出现这种模式,在相关中出现了U形模式。更具体地,在小距离箱处的强正相关随距离而减小,然后在特定点到达凹坑,然后向上爬回。 这是来自自然生态保护博客“ 宏观生态游乐场”(3)–空间自相关的示例。 这些在更远距离上更强的正自相关理论上违反了Tobler的第一地理定律,因此我希望它是由数据中的其他某种模式引起的。我希望它们在某个距离处达到零,然后在更远的距离处徘徊在0左右(这在具有低阶AR或MA项的时间序列图中通常会发生)。 如果您执行Google图片搜索,则可以找到这种相同类型的图案的其他一些示例(另请参见此处)。在GIS站点的用户发布了两个例子,该模式出现莫兰的我,但不会出现Geary的C(1,2)。结合我自己的工作,这些模式对于原始数据是可观察到的,但是当使用空间项拟合模型并检查残差时,它们似乎不会持续存在。 我没有在时间序列分析中遇到过显示相似的ACF图的示例,因此我不确定原始数据中的哪种模式会导致这种情况。此评论中的Scortchi推测正弦曲线模式 可能是由于该时间序列中省略的季节性模式引起的。同一类型的空间趋势会在空间相关图中导致这种模式吗?还是相关性计算方式的其他人工产物? 这是我工作的一个例子。样本很大,浅灰色的线是原始数据的19个排列的集合,以生成参考分布(因此可以看到红线的变化预计会很小)。因此,尽管该图并不像第一个所示的那样戏剧性,但是在该图中很容易出现深坑,然后再上升。(还请注意,我的陷阱与其他示例一样不是负面的,如果这在本质上使示例有所不同,我不知道。) 这是数据的核密度图,以查看产生所述相关图的空间分布。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.