统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何计算纯度?
在聚类分析中,我们如何计算纯度?等式是什么? 我不是在寻找为我做的代码。 让ωkωk\omega_k是集群k和cjcjc_j BE等级j。 那么纯度实际上是准确的吗?看起来好像是在样本量上对每个聚类的真正分类类别的数量求和。 方程源 问题是输出和输入之间的关系是什么? 如果有真实正值(TP),真实负数(TN),错误正数(FP),错误负数(FN)。是?Purity=TPK(TP+TN+FP+FN)Purity=TPK(TP+TN+FP+FN)Purity = \frac{TP_K}{(TP+TN+FP+FN)}
15 clustering 

4
如何在固定效果模型中保持时间不变变量
我有一家大型意大利公司10年以上员工的数据,我想看看随着时间的推移,男女收入差距中的性别差异是如何变化的。为此,我运行池OLS: ,其中y是每年的对数收入,X i t包括因个体和时间而异的协变量,d t是年份假人,如果工人是男性,则m a l e i等于1,否则为零。yit=X′itβ+δmalei+∑t=110γtdt+εityit=Xit′β+δmalei+∑t=110γtdt+εit y_{it} = X'_{it}\beta + \delta {\rm male}_i + \sum^{10}_{t=1}\gamma_t d_t + \varepsilon_{it} yyyXitXitX_{it}dtdtd_tmaleimalei{\rm male}_i 现在,我担心某些协变量可能与未观察到的固定效应相关。但是,当我使用固定效应(内部)估算器或初次差异时,我失去了性别虚拟对象,因为该变量不会随时间变化。我不想使用随机效应估计器,因为我经常听到人们说它提出的假设非常不现实,不太可能成立。 有什么方法可以同时保持性别虚拟和控制固定效果?如果有办法,我是否需要对性别变量的假设检验进行聚类或照顾其他带有错误的问题?

2
使用线性SVM混合连续数据和二进制数据?
因此,我一直在使用SVM,我想知道这是否是一件好事: 我有一组连续特征(0到1)和一组分类特征,这些特征已转换为虚拟变量。在这种情况下,我将测量日期编码为一个虚拟变量: 我有3个期间的数据,并为它们保留了3个特征号: 20:21:22: 因此,根据数据来自哪个周期,将为不同的功能分配1;其他人将获得0。 SVM是否可以与此同时正常工作,或者这是一件坏事? 我使用SVMLight和线性内核。

1
多元生物学时间序列:VAR和季节性
我有一个多元时间序列数据集,其中包括相互作用的生物学和环境变量(可能还有一些外生变量)。除季节性外,数据中没有明显的长期趋势。我的目的是查看哪些变量彼此相关。预测并不是真正需要的。 作为时间序列分析的新手,我阅读了一些参考资料。据我了解,向量自回归(VAR)模型是合适的,但我对季节性并不满意,大多数示例都涉及到没有季节性的经济学领域(通常是时间序列分析……)。 我应该如何处理我的季节性数据?我考虑过对它们进行反季节化处理-例如在R中,我将使用decompose,然后使用这些$trend + $rand值来获得看起来非常平稳的信号(根据判断acf)。VAR模型的结果使我感到困惑(选择了1滞后模型,而我会凭直觉期望更多,并且只有自回归系数(而不是与其他滞后变量的回归系数)才有意义)。我是在做错什么,还是应该得出结论,我的变量不(线性)相关/我的模型不是一个好模型(子问题:是否存在与VAR等效的非线性?)。 [或者,我读到我可能可以使用虚拟的季节性变量,尽管我无法确切地知道如何实现它]。 逐步的建议将不胜感激,因为有经验的用户的详细信息实际上可能对我有帮助(当然,非常欢迎R代码段或指向具体示例的链接)。

1
从质上讲什么是交叉熵
这个问题以公式的形式给出了交叉熵的定量定义。 维基百科说,我正在寻找一个更概念上的定义: 在信息论中,如果使用编码方案是基于给定的概率分布q而不是“真实”分布p,则两个概率分布之间的交叉熵衡量从一组可能性中识别事件所需的平均位数。。 我强调了让我难以理解的部分。我想要一个不错的定义,不需要对熵有单独的(预先存在的)理解。

1
为什么不能将glmer(family = binomial)输出与手动实现的Gauss-Newton算法匹配?
我想将lmer(really glmer)的输出与一个玩具二项式示例进行匹配。我读过小插曲,并相信自己了解发生了什么事。 但是显然我没有。卡住后,我根据随机效应固定了“真相”,然后单独估计了固定效应。我在下面包含此代码。要查看其合法性,您可以注释掉+ Z %*% b.k它,并将其与常规glm的结果匹配。我希望借用一些聪明才智来弄清楚为什么在包含随机效果的情况下我无法匹配lmer的输出。 # Setup - hard coding simple data set df <- data.frame(x1 = rep(c(1:5), 3), subject = sort(rep(c(1:3), 5))) df$subject <- factor(df$subject) # True coefficient values beta <- matrix(c(-3.3, 1), ncol = 1) # Intercept and slope, respectively u <- matrix(c(-.5, .6, .9), ncol = …



1
从多个线性模型直观呈现关系的最佳方法
我有一个带有约6个预测变量的线性模型,我将介绍估计值,F值,p值等。但是,我想知道哪种可视化图最好地代表单个预测变量对响应变量?散点图?条件图?效果图?等等?我将如何解释该情节? 我将在R中进行此操作,因此,如果可以的话,请随时提供示例。 编辑:我主要关心呈现任何给定的预测变量和响应变量之间的关系。

1
物流功能的黑森州
我很难在逻辑回归中得出目标函数的Hessian,其中为: l(θ)l(θ)l(\theta)l(θ)l(θ)l(\theta)l(θ)=∑i=1m[yilog(hθ(xi))+(1−yi)log(1−hθ(xi))]l(θ)=∑i=1m[yilog⁡(hθ(xi))+(1−yi)log⁡(1−hθ(xi))] l(\theta)=\sum_{i=1}^{m} \left[y_{i} \log(h_\theta(x_{i})) + (1- y_{i}) \log (1 - h_\theta(x_{i}))\right] hθ(x)hθ(x)h_\theta(x)是逻辑函数。粗体字是。我试图通过计算来导出它,但是对于我来说,如何从转换为矩阵符号并不明显。XTDXXTDXX^T D X∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 l(\theta)}{\partial \theta_i \partial \theta_j}∂2l(θ)∂θi∂θj∂2l(θ)∂θi∂θj\frac{\partial^2 l(\theta)}{\partial \theta_i \partial \theta_j} 有人知道推导X ^ TDX的任何简便方法XTDXXTDXX^T D X吗?
15 logistic 

3
在线学习中的正则化和功能扩展?
假设我有一个逻辑回归分类器。在正常的批处理学习中,我会使用正则化项来防止过度拟合并保持较小的体重。我还将规范化和缩放我的功能。 在在线学习环境中,我获得了连续的数据流。我对每个示例都进行了梯度下降更新,然后将其丢弃。我应该在在线学习中使用特征缩放和正则化术语吗?如果是,我该怎么办?例如,我没有一组可用于扩展的训练数据。我也没有设置验证来调整我的正则化参数。如果没有,为什么不呢? 在我的在线学习中,我不断获得大量示例。对于每个新示例,我都会做一个预测。然后在下一个时间步骤中,我得到了实际目标并进行了梯度下降更新。

2
与MCMC Metropolis-Hastings变化相混淆:随机行走,非随机行走,独立,都会
在过去的几周中,我一直在尝试了解MCMC和Metropolis-Hastings算法。每当我认为自己理解时,我就会意识到自己错了。我在网上找到的大多数代码示例都实现了与描述不一致的内容。即:他们说他们实施了Metropolis-Hastings,但实际上是实施了随机漫步的城市。其他人(几乎总是)默默地跳过黑斯廷斯校正率的实现,因为他们使用的是对称提案分配。实际上,到目前为止,我还没有找到一个简单的示例来计算比率。这让我更加困惑。有人可以给我以下代码示例(任何语言): 具有Hastings校正比率计算的Vanilla非随机步行Metropolis-Hastings算法(即使使用对称投标分布最终将为1)。 Vanilla Random Walk Metropolis-Hastings算法。 Vanilla Independent Metropolis-Hastings算法。 无需提供Metropolis算法,因为如果我没有记错的话,Metropolis和Metropolis-Hastings之间的唯一区别是,第一个总是从对称分布中采样,因此它们没有黑斯廷斯校正率。无需详细说明算法。我确实了解基本知识,但是对于Metropolis-Hastings算法的不同变体,我对所有不同的名称感到困惑,但对于在Vanilla非随机行走MH上实际实现黑斯廷斯校正率的方式,我还是感到困惑。请不要复制粘贴链接以部分回答我的问题,因为很可能我已经看过它们。这些联系使我感到困惑。谢谢。

4
R中ARIMA残差的Ljung-Box统计信息:令人困惑的测试结果
我正在尝试预测一个时间序列,为此我使用了季节性ARIMA(0,0,0)(0,1,0)[12]模型(= fit2)。它与R关于auto.arima的建议不同(R计算得出的ARIMA(0,1,1)(0,1,0)[12]会更好,我将其命名为fit1)。但是,在我的时间序列的最后12个月,我的模型(fit2)在调整后似乎更合适(长期存在偏差,我添加了剩余均值,新的拟合似乎更贴近原始时间序列这是过去12个月的示例,MAPE最近12个月的两种情况: 时间序列如下所示: 到目前为止,一切都很好。我对这两个模型都进行了残差分析,这就是困惑。 acf(resid(fit1))看起来很棒,非常白噪声: 但是,Ljung-Box测试不适用于例如20个滞后: Box.test(resid(fit1),type="Ljung",lag=20,fitdf=1) 我得到以下结果: X-squared = 26.8511, df = 19, p-value = 0.1082 据我了解,这是对残差不是独立的确认(p值太大,无法与独立假设一起保留)。 但是,对于滞后1来说,一切都很好: Box.test(resid(fit1),type="Ljung",lag=1,fitdf=1) 给我结果: X-squared = 0.3512, df = 0, p-value < 2.2e-16 我可能不理解该测试,或者与我在acf图上看到的有些矛盾。自相关性很低。 然后我检查了fit2。自相关函数如下所示: 尽管在最初的几个滞后处存在如此明显的自相关,但Ljung-Box测试在20个滞后处给我的结果比fit1好得多: Box.test(resid(fit2),type="Ljung",lag=20,fitdf=0) 结果是 : X-squared = 147.4062, df = 20, p-value < 2.2e-16 而仅仅在lag1处检查自相关,也可以得到零假设的证实! Box.test(resid(arima2.fit),type="Ljung",lag=1,fitdf=0) X-squared = 30.8958, …

5
Logistic回归是非参数检验吗?
我最近通过电子邮件收到了以下问题。我将在下面发布答案,但是我很想听听其他人的想法。 您是否将逻辑回归称为非参数检验?我的理解是仅仅标记测试非参数是不够的,因为它的数据不是正态分布的。这更多与缺乏假设有关。逻辑回归确实有假设。

2
如何在R中使用效果编码而不是伪编码进行回归?
我目前正在开发一个回归模型,其中我仅将分类/因子变量作为自变量。我的因变量是对数转换比率。 只需在R中运行正常回归就相当容易,因为R一旦它们成为“ factor”类型,R就会自动知道如何编写假人。但是,这种类型的编码还意味着将每个变量的一个类别用作基线,这使其难以解释。 我的教授告诉我,请改用效果编码(-1或1),因为这意味着对截距使用了均值。 有人知道如何处理吗? 到目前为止,我尝试过: gm <- mean(tapply(ds$ln.crea, ds$month, mean)) model <- lm(ln.crea ~ month + month*month + year + year*year, data = ds, contrasts = list(gm = contr.sum)) Call: lm(formula = ln.crea ~ month + month * month + year + year * year, data = ds, contrasts …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.