统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
测试两个斜率值之间的显着差异
对于两个不同区域中的特定物种,我拥有的数据是y〜time的回归斜率值,标准误差,n值和ap值。我想检查一个区域的回归斜率是否与另一区域的回归斜率显着不同-使用此类数据可以做到吗?有人对我该有什么建议吗?不幸的是,我无法访问原始数据... 抱歉,这是一个简单的问题!

6
在活动中花费的时间作为自变量
我想将花费在做某事上的时间(例如,数周的母乳喂养)作为线性模型中的自变量。但是,某些观察结果根本不参与该行为。将它们编码为0并不是真正正确的方法,因为0在质量上与大于0的任何值都存在差异(即,不进行母乳喂养的女性可能与做过母乳的女性(甚至是长期不做母乳的女性)有很大差异)。我能提供的最好的方法是对假人进行分类,以对花费的时间进行分类,但这浪费了宝贵的信息。零膨胀的Poisson之类的东西似乎也有可能,但是我无法确切地弄清楚这种情况下的情况。有没有人有什么建议?

1
经验CDF的置信区间
我有一个随机过程的100个数据点。我将如何围绕的估计值置信区间?分布函数未知且正偏。我的第一个倾向是根据我在本课程中阅读的材料使用引导程序,但是还有其他方法可以做到这一点吗?PR (X> x )镨(X>X)\Pr(X>x)
14 self-study 

1
如何找到残差并绘制它们
我得到了数据 x = c(21,34,6,47,10,49,23,32,12,16,29,49,28,8,57,9,31,10,21,26,31,52,21,8,18,5,18,26,27,26,32,2,59,58,19,14,16,9,23,28,34,70,69,54,39,9,21,54,26) y = c(47,76,33,78,62,78,33,64,83,67,61,85,46,53,55,71,59,41,82,56,39,89,31,43,29,55, 81,82,82,85,59,74,80,88,29,58,71,60,86,91,72,89,80,84,54,71,75,84,79) 如何获得残差并将其与作图xxx?以及我如何测试残差看起来是否近似正常? 我不确定我是否正确完成了原始线性拟合,因为我得到了方程但讲义指出线性回归线的形式应为。y=6.9x−5.5y=6.9x−5.5y=6.9x-5.5yi=β0+β1x+ϵyi=β0+β1x+ϵy_i=\beta_0+\beta_1x+\epsilon
14 r  regression 

2
分位数建模中的模型性能
我正在使用分位数回归(例如,通过gbm或quantreg在R中)-不关注中位数,而是关注较高的分位数(例如,第75位)。来自预测建模的背景,我想衡量模型在测试集上的拟合程度,并能够向业务用户进行描述。我的问题是?在具有连续目标的典型设置中,我可以执行以下操作: 计算总体RMSE 根据预测值对数据集进行十进制分析,然后将实际平均值与每个十分位数中预测的平均值进行比较。 等等。 在这种情况下,如果确实没有实际值(至少我不认为)可以与预测进行比较,该怎么办? 这是示例代码: install.packages("quantreg") library(quantreg) install.packages("gbm") library(gbm) data("barro") trainIndx<-sample(1:nrow(barro),size=round(nrow(barro)*0.7),replace=FALSE) train<-barro[trainIndx,] valid<-barro[-trainIndx,] modGBM<-gbm(y.net~., # formula data=train, # dataset distribution=list(name="quantile",alpha=0.75), # see the help for other choices n.trees=5000, # number of trees shrinkage=0.005, # shrinkage or learning rate, # 0.001 to 0.1 usually work interaction.depth=5, # 1: additive model, …


1
在随机森林上使用LASSO
我想使用以下过程创建一个随机森林: 使用信息增益确定拆分,在数据和要素的随机样本上构建树 如果叶子节点超过预定深度,则终止该叶子节点,否则任何拆分都会导致叶子数少于预定最小值 而不是为每棵树分配一个类标签,而是在叶节点中分配类的比例 在构建了预定义数量之后停止构建树木 这从两个方面打破了传统的随机森林过程。第一,它使用分配比例而不是类标签的修剪树。第二,停止标准是树木的预定数量,而不是一些袋外误差估计。 我的问题是这样的: 对于上面输出N棵树的过程,我可以使用Logistic回归和LASSO选择来拟合模型吗?有没有人有经验适合随机森林分类器并使用逻辑LASSO进行后处理? ISLE框架提到使用LASSO作为回归问题(而非分类问题)的后处理步骤。此外,在搜索“随机森林套索”时,我没有得到任何有用的结果。


1
预测性能更多地取决于数据分析师的专业知识,而不是方法?
我曾经谣传过一些研究表明,预测模型的性能更多地取决于使用所选方法的数据分析师的专业知识,而不是方法的选择。 换句话说,声称从更理论的角度来看,数据分析人员熟悉所选方法比该方法对问题的“合适性”显得更为重要。 这是在化学计量学的背景下提到的,它通常涉及许多变量(100s-1000s),多重共线性,当然样品太少的问题。预测可能是分类或回归。 我的个人经验表明,这是有道理的,但是有人提到了一项研究(我通过快速但不成功的搜索通过电子邮件问到提到这一点的人,但从未收到任何答复)。但是,通过更精细的搜索,我也无法找到任何论文。 有人知道这样的发现吗?如果没有,这里的大佬们的亲身经历怎么说?

3
贝叶斯变量选择-真的有效吗?
我以为我可能会喜欢上一些不错的博客文章和其中的链接论文,以选择一些贝叶斯变量来玩。我用rjags(我是个菜鸟)编写了一个程序,并获取了埃克森美孚的价格数据,以及一些不太可能解释其收益的信息(例如,钯金价格)以及其他应该高度相关的信息(例如SP500) )。 运行lm(),我们看到有强有力的证据证明模型过度参数化,但是绝对应该排除钯: Call: lm(formula = Exxon ~ 0 + SP + Palladium + Russell + OilETF + EnergyStks, data = chkr) Residuals: Min 1Q Median 3Q Max -1.663e-03 -4.419e-04 3.099e-05 3.991e-04 1.677e-03 Coefficients: Estimate Std. Error t value Pr(>|t|) SP 0.51913 0.19772 2.626 0.010588 * Palladium 0.01620 0.03744 0.433 …

1
如果相关,如何从另一个时间序列预测一个时间序列
一年多来,我一直在试图解决这一问题,但进展不大。它是我正在做的一个研究项目的一部分,但我将用我编写​​的一个故事示例进行说明,因为问题的实际范围有点令人困惑(视线跟踪)。 您是一架追踪穿越海洋的敌舰的飞机,因此您已收集了该舰的一系列(x,y,time)坐标。您知道,一艘隐藏的潜艇会随船一起航行以保护它,但是尽管它们的位置之间存在关联,但潜艇经常会从船上滑落,因此虽然它通常在船的附近,但是它也可能在船的另一侧世界偶尔。您想预测潜艇的路径,但不幸的是,它对您而言是隐藏的。 但是在4月份的一个月中,您会注意到潜艇忘记隐藏自己,因此您在进行1000次航行时都对潜艇和船只具有一系列坐标。使用这些数据,您想建立一个模型,以仅考虑船的运动来预测隐藏式潜艇的路径。天真的基准就是说“潜艇位置猜测=”船的当前位置”,但是从4月份可见潜艇的数据中,您会注意到潜艇有可能稍微领先于船舶,因此“潜艇位置“猜测= 1分钟内的位置”是一个更好的估计。此外,4月份的数据显示,当船舶停泊在水中一段较长的时间时,潜艇很可能不在沿海水域巡逻。还有其他模式当然。 以四月份的数据作为训练数据,您将如何构建该模型来预测潜艇的航行路线?我当前的解决方案是临时线性回归,其中因素包括“行程时间”,“船的x坐标”,“船闲置1天”等,然后让R找出权重并进行交叉验证。 。但是,我真的很喜欢从四月份的数据自动生成这些因素的方法。另外,使用序列或时间的模型会很好,因为线性回归不适用,而且我认为这很重要。 感谢您通读所有内容,我很乐意澄清所有内容。

2
空间自相关与空间平稳性
假设我们在二维空间中有点,并且我们希望测量属性对属性。典型的线性回归模型当然是 XXXyyyy=Xβ+ϵy=Xβ+ϵy= X\beta + \epsilon 这里有两个问题:第一个是ϵϵ\epsilon项可能在空间上相关(违反独立且相同的误差假设),第二个是回归斜率可能在整个空间中变化。可以通过将空间滞后项纳入模型来解决第一个问题,如 y=ρWy+Xβ+ϵy=ρWy+Xβ+ϵy=\rho W y + X\beta + \epsilon 我们甚至可以将LeSage和Pace所描述的空间Durbin模型与空间自回归遗漏变量(空间固定效应)结合在一起 y=ρWy+Xβ+WXλ+ϵy=ρWy+Xβ+WXλ+ϵy=\rho W y + X\beta + WX\lambda + \epsilon 其中ρρ\rho是权重矩阵W控制的空间相关强度WWW。显然,空间滞后的形式将取决于对空间相关形式的假设。 第二个问题已使用“地理加权回归”(GWR)解决,该技术我并不熟悉,但Brunsdon等人对此进行了解释。(1998)。据我所知,它涉及对加权子区域拟合一组回归模型,从而获得每个\ beta_i的估计值,这些\ beta_iβiβi\beta_i根据其空间而变化, β^i=(XTWiX)−1XTWiyβ^i=(XTWiX)−1XTWiy\hat{\beta}_i = (X^TW_iX)^{-1}X^T W_i y ,其中WWW是另一个空间权重矩阵,不一定与上面的矩阵不同。 我的问题:第一种方法(空间自回归)是否不足以对对的平均边际效应进行无偏估计?GWR似乎过拟合:当然会在空间中变化,但是如果我们想知道某种疗法的平均预期效果而又不考虑其空间位置,那么GWR可以做出什么贡献?XXXyyyββ\beta 这是我对初始答案的尝试: 如果我想知道特定邻里额外一间卧室的价格,似乎GWR是我最好的选择。 如果我想知道一间额外卧室的全球平均保费,我应该使用空间自回归技术。 很想听听其他观点。

2
金融/经济学研究中不规则的时间序列
在金融计量经济学研究中,以每日数据的形式调查金融时间序列之间的关系非常普遍。例如,通常通过取对数差将变量设为;LN (P 吨)- LN (P 吨- 1)。I(0)I(0)I(0)ln(Pt)−ln(Pt−1)ln⁡(Pt)−ln⁡(Pt−1)\ln(P_t)-\ln(P_{t-1}) 但是,每日数据意味着有555每周数据点,而星期六和星期日则丢失。在我所知道的应用文献中,这似乎没有提及。这是我根据观察得出的一些密切相关的问题: 即使金融市场在周末休市,这是否也属于不规则间隔的数据? 如果是这样,那么迄今为止,大量的忽略该问题的论文对现有经验结果的有效性有何影响?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.