统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
我的Poisson GLM应该使用偏移量吗?
我正在进行研究,以研究使用两种不同的水下视觉普查方法时鱼类密度和鱼类物种丰富度的差异。我的数据最初是计数数据,但通常将其更改为鱼的密度,但我仍然决定使用Poisson GLM,我希望它是正确的。 model1 <- glm(g_den ~ method + site + depth, poisson) 我输入的3个预测变量是方法,位置和深度,它们是我作为因素排序的。 我的反应变量是石斑鱼物种丰富度,石斑鱼密度,其他鱼类也一样。我知道密度不是整数,而是数字数据,例如1.34849。我现在却收到此错误: In dpois(y, mu, log = TRUE) : non-integer x = 0.037500 我一直在阅读,很多人建议使用偏移量,这是最明智的选择吗?

2
R中分类模型的增量学习
假设,我有一个分类器(可以是任何标准分类器,例如决策树,随机森林,逻辑回归等),可以使用以下代码进行欺诈检测 library(randomForest) rfFit = randomForest(Y ~ ., data = myData, ntree = 400) # A very basic classifier Say, Y is a binary outcome - Fraud/Not-Fraud 现在,我已经预测了一个看不见的数据集。 pred = predict(rfFit, newData) 然后,我从调查团队获得了有关我的分类的反馈,发现我犯了一个错误,将欺诈分类为“非欺诈”(即“ 一个假阴性”)。无论如何,我是否可以让我的算法理解它已经犯了一个错误?即是否可以在算法中添加反馈环,以便纠正错误? 我可以想到的一个选择就是构建一个,adaboost classifier以便新的分类器纠正旧分类器的错误。或我听到了Incremental Learning或的声音Online learning。中有任何现有的实现(包)R吗? 这是正确的方法吗?还是有其他方法可以调整模型而不是从头开始构建模型?

2
3维的多元线性回归是最佳拟合平面还是最佳拟合线?
我们的专家没有进入多元线性回归的数学甚至几何表示,这让我有些困惑。 一方面,即使在更高的维度上,它仍然被称为多元线性回归。在另一方面,如果我们有例如Ÿ = b 0 + b 1 X 1 + b 2 X 2,我们可以在任何值,插上我们想为X 1和X 2,就不该给我们一个可能的解决方案平面而不是一条线?Y^=b0+b1X1+b2X2Y^=b0+b1X1+b2X2\hat{Y} = b_0 + b_1 X_1 + b_2 X_2X1X1X_1X2X2X_2 总的来说,我们的预测表面不是k个独立变量的维超平面吗?kkkkkk

2
各个级别面板数据之间的差异
用单个级别面板数据指定差异模型中差异的正确方法是什么? 这里是设置:假设我在城市中嵌入了多年的个人级别面板数据,并且处理方式在城市年份级别上有所不同。形式上,让为个别的结果在城市和年和对是否干预影响城市的虚拟在一年。典型的DiD估算器(例如Bertrand等人(2004,第250页)中概述的估算器)基于简单的OLS模型,其中具有针对城市和年份的固定影响项:我小号吨d 小号吨小号吨ÿ我小号Ťÿ一世sŤy_{ist}一世一世isssŤŤtd小号ŤdsŤD_{st}sssŤŤt yist=As+Bt+cXist+βDst+ϵistÿ一世sŤ=一种s+乙Ť+CX一世sŤ+βdsŤ+ϵ一世sŤ y_{ist} = A_{s} + B_t + cX_{ist} + \beta D_{st} + \epsilon_{ist} 但是,该估计量是否忽略了个人层面的面板结构(即,对城市中每个人的多次观察)?用个体水平的固定效应项扩展该模型是否有意义?许多DiD应用程序使用重复的横截面数据,而没有单独级别的面板数据。Si小号一世S_i Bertrand,Marianne,Esther Duflo和Sendhil Mullainathan。2004年。“我们应该相信差异差异估计有多少?” 经济学季刊119(1):249–75。

1
如何解释TBATS模型结果和模型诊断
我有一个半小时的需求数据,这是一个多个季节的时间序列。我在R的package中使用tbats过forecast,并得到如下结果: TBATS(1, {5,4}, 0.838, {<48,6>, <336,6>, <17520,5>}) 这是否意味着该序列不一定要使用Box-Cox变换,并且误差项是ARMA(5,4),而6、6和5项则用来解释季节性?阻尼参数0.8383表示什么,也用于转换吗? 以下是模型的分解图: 我想知道该怎么做level并slope讲述该模型。“坡度”告诉趋势,那又如何level呢?如何获得更清晰的情节session 1和session 2,它们分别是每天和每周的季节性。 tbats除了RMSE值,我还知道如何进行模型诊断以评估模型。正常方法是检查错误是否为白噪声,但此处的错误应该是ARMA系列的。我绘制了错误的'acf'和'pacf',但我认为它看起来不像ARMA(5,4)。这是否意味着我的模型不好? acf(resid(model1),lag.max = 1000) pacf(resid(model1),lag.max=1000) 最后一个问题RMSE是通过使用拟合值和真实值来计算的。如果我使用预测值fc1.week$mean和真实值来评估模型RMSE怎么办,它仍被称为?或者,还有这个名字吗? fc1.week <-forecast(model1,h=48*7) fc1.week.demand<-fc1.week$mean

2
纵向数据的机器学习技术
我想知道是否有用于纵向数据建模的机器学习技术(无监督)?我一直使用混合效果模型(大多数是非线性的),但我想知道是否还有其他方法(使用机器学习)。 机器学习是指随机森林,分类/聚类,决策树甚至是深度学习等。

1
我什么时候停止寻找模特?
我正在寻找能源价格与天气之间的模型。我有在欧洲国家之间购买的MWatt的价格,以及很多天气值(Grib文件)。每5小时(2011-2015)的小时数。 价格/天 这是每天的一年。我有这个5年的每小时。 天气示例 3D散点图,用开尔文表示,一个小时。我每小时每个数据有1000个值,还有klevin,风,地势等200个数据。 我正在尝试预测兆瓦每小时的平均价格。 我的天气数据非常密集,每小时超过10000个值,因此相关性很高。这是一个简短的大数据问题。 我尝试了套索,脊线和SVR方法,将MWatt的平均价格作为结果,而将天气数据作为收入。我将70%作为训练数据,将30%作为测试。如果我的测试数据是非预测性的(在我的训练数据中的某处),则我的预测很好(R²= 0.89)。但是我想对我的数据进行预测。 因此,如果测试数据按时间顺序排在我的训练数据之后,则它什么也不能预测(R²= 0.05)。我认为这很正常,因为它是时间序列。并且存在很多自相关。 我以为我必须使用ARIMA这样的时间序列模型。我计算了方法的顺序(序列是固定的)并进行了测试。但这没用。我的意思是预测的r²为0.05。我对测试数据的预测完全不在我的测试数据上。我尝试将ARIMAX方法用作回归天气。说它不会添加任何信息。 ACF / PCF,测试/训练数据 所以我每天和每周做一次季节性裁员 天 第一周趋势 如果可以预见股价趋势,就可以拥有: 蓝色是我的预测,红色是真正的价值。 我将进行回归分析,将天气的滚动平均值作为收入,将股价趋势的趋势作为结果。但是到目前为止,我还没有找到任何关系。 但是,如果没有互动,我怎么知道什么都没有?也许只是我没有找到它。

4
良好的范例/书籍/资源,可学习有关应用机器学习的知识(不仅限于ML本身)
我以前参加过ML课程,但是现在我正在从事与ML相关的项目工作,因此我在实际应用中费了不少力气。我敢肯定,我正在做的事情已经过研究/处理,但是我找不到特定的主题。 我在网上找到的所有机器学习示例都很简单(例如,如何在Python中使用KMeans模型并查看预测)。我正在寻找有关如何实际应用这些资源的良好资源,也许是大规模机器学习实现和模型培训的代码示例。我想学习如何有效地处理和创建新数据,从而使ML算法更加有效。

2
残留网络是否与梯度提升相关?
最近,我们看到了残差神经网络的出现,其中,每个层都由一个计算模块和一个快捷连接组成,该连接保留了该层的输入,例如第i层的输出,表现为: 该网络允许提取残差特征并允许更深的深度,同时对消失的梯度问题更鲁棒,从而实现了最先进的性能。cicic_iyi+1=ci+yiyi+1=ci+yi y_{i+1} = c_i + y_i 深入研究了梯度提升,这是机器学习领域中一种非常强大的集成技术,它似乎也对损失的残差执行了一种梯度优化形式,很难不看到某种形式的相似性。 我知道它们相似但不相同 -我注意到的一个主要区别是,梯度增强对加法项进行了优化,而残差网络优化了整个网络。 我没有看到He等人在他们的原始论文中注意到这是他们动机的一部分。因此,我想知道您对此主题有何见解,并要求您共享自己拥有的有趣资源。 谢谢。

1
为什么必须谨慎进行批标准化的示例有什么解释?
我正在阅读批处理规范化论文 [1],其中有一个小节通过一个示例,试图说明为什么必须仔细进行规范化。老实说,我无法理解该示例的工作原理,并且我真的很好奇能够尽可能多地了解它们。首先让我在这里引用一下: 例如,考虑一个带有输入u的层,该层添加了学习的偏差b,并通过减去对训练数据计算的激活平均值来对结果进行归一化:其中 是训练集上的值的集合,。如果梯度下降步骤忽略了对的依赖性,则它将更新,其中。然后,。因此,更新到的组合X=Ü+b,X={X1。。。Ñ}Xë[X]=Σ Ñ 我= 1 X我ë[X]bb←b+Δ>bΔbα-∂升X^= x − E[ x ]x^=x−E[x]\hat{x} = x − E[x]x = u + b ,X= { x1个。。。ñ}x=u+b,X={x1...N}x=u+b, X =\{x_1...N \}XxxË[ x ] = ∑ñ我= 1X一世E[x]=∑i=1NxiE[x] = \sum^N_{i=1} x_iË[ x ]E[x] E[x] bbbb ← b + Δ > bb←b+Δ>bb ← b + \Delta > …

2
复杂调查数据中LASSO之后的交叉验证
我正在尝试使用具有连续结果的LASSO对一些候选预测变量进行模型选择。目标是选择具有最佳预测性能的最佳模型,通常可以从LASSO获得调整参数的求解路径后,通过K倍交叉验证来完成。这里的问题是数据来自复杂的多阶段调查设计(NHANES),并进行了聚类采样和分层。估计部分并不难,因为glmnetR中可以获取采样权重。但是交叉验证部分对我而言不太清楚,因为现在不再观察到观测值了,该程序如何解释代表有限总体的权重采样? 所以我的问题是: 1)如何对复杂的调查数据进行K折交叉验证以选择最佳调整参数?更具体地说,如何将样本数据适当地划分为训练集和验证集?以及如何定义预测误差的估计? 2)是否有选择最佳调整参数的替代方法?

4
神经网络-权重的含义
我正在使用前馈NN。我理解这个概念,但是我的问题是关于重量的。您如何解释它们,即它们代表什么或如何使其不受破坏(仅基于函数系数)?我发现了一种叫做“权重空间”的东西,但是我不太确定这意味着什么。

1
scikit-learn Python中的ElasticNet与R中的Glmnet之间的区别
是否有人尝试验证在同一数据集上的ElasticNetPython和glmnetR 中的scikit-learn中的Elastic Net模型拟合是否产生相同的算术结果?我一直在尝试使用参数的许多组合(因为这两个函数在传递给参数的默认值方面有所不同),并且还对数据进行了缩放,但是在这两种语言之间似乎并没有产生相同的模型。有人遇到过同样的问题吗?

3
高斯过程模型的主要优点
高斯过程已被广泛使用,尤其是在仿真中。已知计算需求很高()。0(n3)0(n3)0(n^3) 是什么使它们受欢迎? 它们的主要优势和隐藏优势是什么? 为什么使用它们代替参数模型(按参数模型,我指的是典型的线性回归,其中可以使用不同的参数形式来描述输入与输出趋势;例如qaudratic)? 我真的很感谢一个技术性的答案,它解释了使高斯过程独特且有利的内在属性。

2
在R中解释模型平均结果
我正在尝试了解和知道使用R中的模型平均对某些数据进行分析所报告的内容。 我正在使用以下脚本来分析给定变量的测量方法的效果:这是数据集:https : //www.dropbox.com/s/u9un273gzw9o30u/VMT4.csv?dl=0 适用车型: LM.1 <- gls(VMTf ~ turn+sex+method, na.action="na.fail", method = "ML",VMT4) 挖泥船全模型 require(MuMIn) d=dredge(LM.1) print(d) coefficients(d) 获取所有模型的摘要信息以获取参数估计 summary(model.avg(d)) 我知道可以对所有模型进行平均(完整模型平均),也可以对其中一部分进行条件平均。现在,我想知道:什么时候最好使用完全或条件平均进行推断。对于科学文章,我应该报告所有这些内容吗?对于模型平均情况,Z值和关联的p到底意味着什么? 为了使可视化我的问题更加容易。这是结果表, > summary(model.avg(d))# now, there are effects Call: model.avg(object = d) Component model call: gls(model = VMT ~ <8 unique rhs>, data = VMT4, method = ML, na.action …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.