统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
我们可以接受非劣效性测试中的空值吗?
在常规的均值t检验中,使用常规的假设检验方法,我们要么拒绝null要么不拒绝null,但是我们从不接受null。原因之一是,如果我们有更多的证据,那么相同的效应大小将变得很重要。 但是在非自卑感测验中会发生什么呢? 那是: H0:μ1−μ0≤xH0:μ1个-μ0≤XH_0: \mu_1 - \mu_0 \le x 与 H1:μ1−μ0>xH1个:μ1个-μ0>XH_1: \mu_1 - \mu_0 > x 其中是我们认为基本相同的一些量。因此,如果我们拒绝null,则说比至少。如果没有足够的证据,我们将不拒绝零值。 xXxμ1μ1个\mu_1μ0μ0\mu_0xXx 如果效果大小为或更大,则类似于常规t检验。但是,如果样本中的效应大小小于,该怎么办?然后,如果我们增加样本量并保持相同的效果,它将保持无关紧要。因此,在这种情况下,我们可以接受null吗?xXxxXx

1
我应该选择随机森林回归器还是分类器?
我通过随机森林对具有二进制目标类的数据集进行拟合。在python中,我可以通过randomforestclassifier或randomforestregressor做到这一点。 我可以直接从randomforestclassifier获得分类,也可以先运行randomforestregressor并获得一组估计分数(连续值)。然后,我可以找到一个临界值,以从分数集中得出预测的类别。两种方法都可以达到相同的目标(即预测测试数据的类别)。 我也可以观察到 randomforestclassifier.predict_proba(X_test)[:,1]) 与...不同 randomforestregressor.predict(X_test) 因此,我只想确认两种方法均有效,然后在随机森林应用中哪种方法更好?

4
AUC是否有可能正确分类每个类别中随机选择的实例?
我在纸上阅读了此标题,但从未在其他地方看到过这种方式描述的AUC。这是真的?有没有证明或简单的方法可以看到这一点? 图2显示了根据接收器工作特性曲线(AUC)下的面积表示的二分变量的预测精度,这相当于正确地将每个类别中的两个随机选择的用户正确分类的概率(例如,男性和女性) )。 在我看来,这不是真的,因为对于AUC = 0.5,以上内容表明一个人有50%的概率连续两次正确预测一次硬币翻转,但实际上,您只有25%的机会正确预测连续两次硬币翻转的过程。至少,我就是这么想的。

3
为什么AR(1)系数的OLS估算器有偏差?
我试图理解为什么OLS会给出AR(1)进程的有偏估计量。考虑 在此模型中,违反了严格的外生性,即和是相关的,而和是不相关的。但是,如果这是真的,那么为什么以下简单推导不成立? ý吨ε吨ý吨-1ε吨头激动 βytϵt=α+βyt−1+ϵt,∼iidN(0,1).yt=α+βyt−1+ϵt,ϵt∼iidN(0,1). \begin{aligned} y_{t} &= \alpha + \beta y_{t-1} + \epsilon_{t}, \\ \epsilon_{t} &\stackrel{iid}{\sim} N(0,1). \end{aligned} ytyty_tϵtϵt\epsilon_tyt−1yt−1y_{t-1}ϵtϵt\epsilon_tplim β^=Cov(yt,yt−1)Var(yt−1)=Cov(α+βyt−1+ϵt,yt−1)Var(yt−1)=β+Cov(ϵt,yt−1)Var(yt−1)=β.plim β^=Cov(yt,yt−1)Var(yt−1)=Cov(α+βyt−1+ϵt,yt−1)Var(yt−1)=β+Cov(ϵt,yt−1)Var(yt−1)=β. \begin{aligned} \text{plim} \ \hat{\beta} &= \frac{\text{Cov}(y_{t},y_{t-1})}{\text{Var}(y_{t-1})} \\ &=\frac{\text{Cov}(\alpha + \beta y_{t-1}+\epsilon_{t}, y_{t-1})}{\text{Var}(y_{t-1})} \\ &= \beta+ \frac{\text{Cov}(\epsilon_{t}, y_{t-1})}{\text{Var}(y_{t-1})} \\ &=\beta. \end{aligned}

3
使用Holt-Winters还是ARIMA?
我的问题是关于Holt-Winters和ARIMA之间的概念差异。 据我了解,Holt-Winters是ARIMA的特例。但是,哪种算法比另一种算法更可取呢?也许Holt-Winters是增量式的,因此可以用作内联(更快)算法? 期待在这里有一些见识。

3
逐步回归的优点是什么?
为了解决问题,我正在尝试逐步回归。所以,我有两个问题: 逐步回归的优点是什么?它的特长是什么? 您如何看待混合方法?在混合方法中,您将使用逐步回归来选择要素,然后应用常规回归将所​​有所选要素结合在一起?

2
使用LSTM处理语言建模任务中的未知单词
对于自然语言处理(NLP)任务,通常使用word2vec向量作为单词的嵌入。但是,可能有很多未知单词未被word2vec向量捕获,这仅仅是因为这些单词在训练数据中的出现频率不够高(许多实现在将单词添加到词汇表之前使用最少的计数)。尤其是来自Twitter的文本,尤其是单词拼写错误的情况。 在对NLP任务进行建模(例如使用长短期(LSTM)网络进行情感预测)时,如何处理这些未知单词?我看到两个选择: 在word2vec词典中添加“未知单词”标记。 删除这些未知单词,以使LSTM甚至不知道单词在句子中。 处理这些单词的首选方式是什么?


1
将二项式GLMM(glmer)拟合为比例或分数的响应变量
我希望有人可以帮助解决我认为相对简单的问题,我想我知道答案,但未经证实,这已经成为我无法确定的事情。 我有一些计数数据作为响应变量,我想测量该变量如何随某物的比例存在而变化。 更详细地,响应变量是在多个站点中昆虫物种的存在的计数,因此例如采样一个站点10次,并且该物种可能出现4次。 我想看看这是否与这些地点植物整体群落中一组植物物种的比例存在相关。 这意味着我的数据如下所示(这只是一个示例) Site, insectCount, NumberOfInsectSamples, ProportionalPlantGroupPresence 1, 5, 10, 0.5 2, 3, 10, 0.3 3, 7, 9, 0.6 4, 0, 9, 0.1 数据还包括位置的随机效应。 我想到了两种方法,一种是lmer将昆虫转换成一定比例的线性模型(),例如 lmer.model<-lmer(insectCount/NumberOfInsectSamples~ ProportionalPlantGroupPresence+(1|Location),data=Data) 第二个是二项式GLMM(glmer),例如 glmer.model <- glmer(cbind(insectCount,NumberOfInsectSamples-insectCount)~ ProportionalPlantGroupPresence+(1|Location), data=Data,family="binomial") 我相信二项式聚光镜是正确的方法,但是它们会产生完全不同的结果。我似乎无法在网络上找到明确的答案,而仍然没有一点不确定性,并希望确保自己没有犯错。 任何帮助或对替代方法的见解将不胜感激。

1
关于在训练/有效/测试集上减去平均值的问题
我正在进行数据预处理,然后在数据上构建一个Convonets。 我的问题是:假设我有100个图像的总数据集,我正在为100个图像中的每个图像计算平均值,然后从每个图像中减去它,然后将其拆分为训练集和验证集,我这样做给定测试集上进行处理的步骤,但根据此链接,看来这不是正确的方法:http : //cs231n.github.io/neural-networks-2/#datapre “ 常见的陷阱。进行预处理的重要一点是,任何预处理统计信息(例如数据均值)都必须仅在训练数据上计算,然后应用于验证/测试数据。例如,计算均值并从中减去整个数据集中的每幅图像然后将数据拆分为训练/验证/测试分割将是一个错误,相反,必须仅对训练数据计算平均值,然后从所有分割(训练/验证/测试)中均等地减去均值。 ” 我猜作者在说什么,不要计算平均值并在每个图像中减去它,而是计算整个图像集的平均值(即(image1 + ... + image100)/ 100),然后减去平均值每个图像。 我不太明白有人可以解释吗?并且还可能解释为什么我在做什么错了(如果确实错了)。


2
AR()模型的无偏估计
考虑一个AR()模型(为简单起见,假设均值为零):ppp xt=φ1xt−1+…+φpxt−p+εtxt=φ1xt−1+…+φpxt−p+εt x_t = \varphi_1 x_{t-1} + \dotsc + \varphi_p x_{t-p} + \varepsilon_t 如最近的线程所述,已知的OLS估计量(等于条件最大似然估计量是有偏差的。φ: =( φ1个,… ,φp)φ:=(φ1,…,φp)\mathbf{\varphi} := (\varphi_1,\dotsc,\varphi_p) (奇怪的是,我找不到汉密尔顿的《时间序列分析》或其他一些时间序列教科书中提到的偏见。但是,可以在各种讲义和学术文章中找到它,例如this。) 我无法找出AR()的确切最大似然估计是否有偏差;因此,我的第一个问题。ppp 问题1:是确切的 AR(最大似然估计)模型的自回归参数偏见吗?(让我们假设AR()过程是平稳的。否则,估计量甚至是不一致的,因为它被限制在平稳区域内;请参见Hamilton的“时间序列分析”,第123页。)φ 1,... ,φ p ppppφ1,…,φpφ1,…,φp\varphi_1,\dotsc,\varphi_pppp 也, 问题2:是否有任何合理简单的无偏估计量?

1
如何用二元工具和二元内生变量解释工具变量回归中的第二阶段系数?
(相当长的帖子,对不起。它包含许多背景信息,请随时跳到底部的问题。) 简介:我正在做一个项目,我们试图确定二进制内生变量对连续结果。我们提出了一个工具,我们坚信它是随机分配的。x1x1x_1yyyz1z1z_1 数据:数据本身是一个面板结构,其中约34,000个观测值分布在1000个单位和约56个时间段内。对于大约700个(2%​​)的观测值,取值为1;对于大约3000个(9%),取值为1 。111个(0.33%)观测值在和上均得分为1,如果观测值在上也得分为1,则其在上得分为1的可能性是原来的两倍。x1x1x_1z1z1z_1z1z1z_1x1x1x_1x1x1x_1z1z1z_1 估计:我们通过Stata的ivreg2-过程估计以下2SLS模型: x1=π0+π1z1+Zπ+vx1=π0+π1z1+Zπ+vx_1 = \pi_0 + \pi_1z_1 + \mathbf{Z}\mathbf{\pi} + v y=β0+β1x∗1+Zβ+uy=β0+β1x1∗+Zβ+uy = \beta_0 + \beta_1 x_1^* + \mathbf{Z}\mathbf{\beta} + u 其中是其他外生变量的向量, 是从第一阶段开始的的预测值,而和是误差项。ZZZx∗1x1∗x_1^*x1x1x_1uuuvvv 结果:一切似乎都运行良好;的估计在第一阶段非常重要,而的估计在第二阶段非常重要。所有符号均符合预期,包括其他外生变量的符号。但是,问题在于(感兴趣的系数)的估计值太大了(或者至少根据我们一直在解释它的方式),这令人难以置信。π1π1\pi_1β1β1\beta_1β1β1\beta_1 yyy范围为2到26,平均值和中位数为17,但是的估计值范围为30到40(取决于规格)!β1β1\beta_1 弱IV:我们的第一个想法是这是由于乐器太弱所致。就是说,它与内生变量之间的关系不大,但事实并非如此。为了检查该仪器的弱点,我们使用Finlay,Magnusson和Schaffer的weakiv-package,因为它提供的测试对于违反假设的情况很健壮(在此处具有相关性,因为我们拥有面板数据并将我们的SE聚类在单位级别)。i.i.d.i.i.d.i.i.d. 根据他们的AR测试,第二阶段系数的95%置信区间的下限在16到29之间(再次取决于规格)。对于所有接近零的值,拒绝概率实际上为1。 有影响的观察结果: 我们尝试估计模型,其中每个单元都被单独删除,每个观察值都被单独删除,并且单元簇被删除。没有真正的改变。 提议的解决方案:有人建议我们不应该以原始度量(0-1)来总结被测量的估计效果,而应该以其预测版本的度量来总结。范围是-0.01至0.1,平均值和中位数约为0.02,SD约为0.018。如果我们通过的一个SD增加来总结的估计效果,那将是 (其他规范给出的结果几乎相同)。这将是更合理的方法(但仍然很重要)。似乎是完美的解决方案。除了我从未见过有人这样做;每个人似乎都只是使用原始内生变量的度量来解释第二阶段系数。x1x1x_1x∗1x1∗x_1^*x1x1x_1x∗1x1∗x_1^*0.018∗30=0.540.018∗30=0.540.018*30 = 0.54 问题:在IV模型中,使用预测变量的度量来总结内生变量增加的估计效果(实际上是LATE)是否正确?在我们的案例中,该指标是预测概率。 注意:即使我们有一个二进制内生变量(使第一阶段成为LPM),我们仍使用2SLS。遵循Angrist&Krueger(2001):“仪器变量与识别:从供需到自然实验”),我们还尝试了Adams,Almeida和Ferreira(2009)中使用的三阶段程序:了解创始人-首席执行官与公司绩效之间的关系”。后一种方法由一个概率模型和一个2SLS组成,产生的系数更小且更合理,但是如果以0-1度量(大约9-10)进行解释,它们仍然很大。手动计算得到的结果与Cerulli ivtreatreg中的probit-2sls-option的结果相同。


2
两个独立正态随机变量的最大值(最小值)的分布是什么?
具体来说,假设和是正态随机变量(独立但不一定相同分布)。给定任何特定的,是否有一个很好的或类似概念的公式?我们是否知道\ max(X,Y)是正态分布的,也许是关于X和Y的均值和标准差的公式?我检查了平常的地方(维基百科,谷歌),但没有找到任何东西。XXXYYYaaaP(max(X,Y)≤x)P(max(X,Y)≤x)P(\max(X,Y)\leq x)max(X,Y)max(X,Y)\max(X,Y)XXXYYY

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.