统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
Kolmogorov–Smirnov检验与t检验
我在理解2个样本KS检验的解释以及与2组之间的常规t检验有何不同方面遇到一些困难。 可以说我有男性和女性在做一些任务,而我从这项任务中收集了一些分数。我的最终目标是确定男性和女性在这项任务上的表现是否不同 因此,我可以做的一件事就是在两组之间进行测试。我可以做的另一件事是计算男性和女性的ECDF,绘制它们,然后进行2个样本KS测试。我会得到这样的东西: KS测试 KS检验的原假设是2组连续得分分布来自同一人群 进行KS测试时,我得到:D = 0.18888,p值= 0.04742 首先,我想检查一下我对结果的解释是否正确。在这里,我将拒绝原假设,并说男性和女性得分分布来自不同的人群。换句话说,男性和女性得分的分布彼此不同。 更具体地说,男性在此任务上获得较低分数的可能性更高,这就是我从情节中得出的两种性别之间的差异 T检验 现在在测试中,将在得分变量上测试男性和女性均值之间的差异。 让我们想象一下在此任务中男性表现比女性差的情况。在这种情况下,男性得分的分布将以低均值为中心,而女性得分的分布将以高均值为中心。这种情况与上面的情节是一致的,因为男性获得较低分数的可能性更高。 如果t检验显着,我可以得出结论,女性平均得分明显高于男性。或从人口角度而言,女性分数是从平均数高于男性人口的人口中得出的,这听起来与堪萨斯州得出的结论是来自不同人口的结论非常相似。 有什么不同? 因此,我在KS和t测试用例中得出的结论是相同的。男性相对于女性表现较差。那么,使用一种测试优于另一种测试有什么好处?使用KS测试是否可以获得任何新知识? 我认为,男性的分布以低均值为中心,女性的分布以高均值为中心是导致显着t检验的原因。但是,基于同样的事实,男性得分较低值的可能性更高,这将使该图看起来像上面,并进行有效的KS检验。因此,两种检验的结果都具有相同的根本原因,但也许有人可能会说,KS检验不仅考虑了分布的均值,而且还考虑了分布的形状,但是有可能解析出原因仅从测试结果中得出哪些重要的KS测试? 那么在测试中运行KS测试有什么价值呢?并假设我可以满足这个问题的t检验的假设

3
如何为纵向大数据建模?
传统上,我们使用混合模型来建模纵向数据,例如: id obs age treatment_lvl yield 1 0 11 M 0.2 1 1 11.5 M 0.5 1 2 12 L 0.6 2 0 17 H 1.2 2 1 18 M 0.9 我们可以假设不同人的随机截距或斜率。但是,我要解决的问题将涉及庞大的数据集(数百万人,每天进行1个月的观测,即每个人将进行30次观测),目前我不知道是否有软件包可以完成此级别的数据。 我可以使用spark / mahout,但它们不提供混合模型,我的问题是,是否仍然可以修改数据以便可以使用RandomForest或SVM对此数据集进行建模? 我可以利用任何功能工程技术来帮助RF / SVM解决自相关问题吗? 非常感谢! 一些潜在的方法,但我没有时间把它们写成火花 如何将随机效果纳入randomForest 具有纵向数据的SVM回归

1
广义可加模型Python库
我知道R具有用于通用加性模型的gam和mgcv库。但是我很难在Python生态系统中找到它们(statsmodels在沙箱中只有原型)。有人知道现有的python库吗?谁知道这可能是一个不错的项目,如果没有的话,它可以为scikit-learn开发/贡献。
14 gam 


1
GAM vs LOESS vs花键
语境:我想提请在不出现参数散点图一条线,所以我使用geom_smooth()的ggplot中R。它会自动返回geom_smooth: method="auto" and size of largest group is >=1000, so using gam with formula: y ~ s(x, bs = "cs"). Use 'method = x' to change the smoothing method.我收集的GAM代表广义加性模型,并使用三次样条曲线。 以下看法正确吗? 黄土以特定值估算响应。 样条曲线是连接适合数据的不同分段函数(构成广义加性模型)的近似值,三次样条曲线是此处使用的特定样条曲线类型。 最后,何时应使用花键,何时应使用LOESS?


4
有什么统计方法可以推荐像Netflix上的电影?
我正在寻找一种动态模型来向用户推荐电影。每当用户观看电影或对电影进行评级时,建议均应更新。为了简单起见,我考虑考虑两个因素: 用户过去其他电影的评分 用户观看某些过去的电影的时间 如何建立这样的模型?学术文献对此有何建议? 我是该领域的新手,我猜想线性再模型可以提供良好的结果,而不希望花一些复杂的方法来避免在参数估计中施加不必要的不​​确定性。但是,也许已经有了实践中常用的确定方法?

3
在GLM中,饱和模型的对数似然性是否始终为零?
作为广义线性模型输出的一部分,零偏差和残差偏差用于评估模型。我经常看到这些量的饱和模型的对数似然来表示的公式,例如:/stats//a/113022/22199,Logistic回归:如何获取饱和模型 据我所知,饱和模型是完全符合观察到的响应的模型。因此,在我见过的大多数地方,饱和模型的对数似然始终为零。 但是,给出偏差公式的方式表明,有时该量不为零。(好像总是始终为零,为什么还要包括它?) 在什么情况下可以为非零?如果它永远都不为零,为什么要在偏差公式中包括它?


2
Logistic回归预测的输出
我使用以下代码创建了Logistic回归: full.model.f = lm(Ft_45 ~ ., LOG_D) base.model.f = lm(Ft_45 ~ IP_util_E2pl_m02_flg) step(base.model.f, scope=list(upper=full.model.f, lower=~1), direction="forward", trace=FALSE) 然后,我使用输出来创建最终模型: final.model.f = lm(Ft_45 ~ IP_util_E2pl_m02_flg + IP_util_E2_m02_flg + AE_NumVisit1_flg + OP_NumVisit1_m01_flg + IP_TotLoS_m02 + Ft1_45 + IP_util_E1_m05_flg + IP_TotPrNonElecLoS_m02 + IP_util_E2pl_m03_flg + LTC_coding + OP_NumVisit0105_m03_flg + OP_NumVisit11pl_m03_flg + AE_ArrAmb_m02_flg) 然后,我使用了预测函数预测了不同数据集的结果: log.pred.f.v <- …

1
没有长尾的重尾分布示例
通过阅读有关重尾和长尾分布的信息,我了解到所有长尾分布都是重尾分布,但并非所有重尾分布都是长尾分布。 有人可以提供以下示例: 连续的,对称的,平均零密度的长尾函数 一个连续的,对称的,平均密度为零的函数,该函数重尾但不长尾 这样我可以更好地理解它们定义的含义? 如果两者都可以具有单位方差,那就更好了。

8
训练神经网络以区分偶数和奇数
问题:是否有可能仅使用数字本身作为输入来训练NN来区分奇数和偶数? 我有以下数据集: Number Target 1 0 2 1 3 0 4 1 5 0 6 1 ... ... 99 0 100 1 我使用一种非常简单的遗传算法训练了一个带有两个输入神经元(一个是变量Number,另一个是偏向神经元),隐藏层中的9个神经元和一个输出神经元的NN:在每个时期,两组权重“互相对抗;错误率最高的人将输掉,并由获胜者的修改版本代替。 该脚本可以轻松解决诸如AND,OR和XOR运算符之类的简单问题,但是在尝试对奇数和偶数进行分类时会遇到困难。目前,最好的方法是从100个数字中识别出53个数字,这花费了几个小时。我是否将输入归一化似乎没有什么区别。 如果我想作弊,我可以对数据进行预处理,并将%2作为输入提供给NN,但我不想这样做。NN应该能够近似所有函数,包括模运算符(我相信)。我究竟做错了什么?


2
R:glm函数,族=“二项式”和“重量”规格
我对体重与family =“ binomial”在glm中的工作方式非常困惑。在我的理解中,具有family =“ binomial”的glm的可能性指定如下: ,其中y是“观察到的成功比例”,n是已知的试验次数。ynf(y)=(nny)pny(1−p)n(1−y)=exp(n[ylogp1−p−(−log(1−p))]+log(nny))f(y)=(nny)pny(1−p)n(1−y)=exp⁡(n[ylog⁡p1−p−(−log⁡(1−p))]+log⁡(nny)) f(y) = {n\choose{ny}} p^{ny} (1-p)^{n(1-y)} = \exp \left(n \left[ y \log \frac{p}{1-p} - \left(-\log (1-p)\right) \right] + \log {n \choose ny}\right) yyynnn 以我的理解,成功概率ppp由一些线性系数\ beta参数ββ\beta化为p=p(β)p=p(β)p=p(\beta)并且glm函数带有family =“ binomial”搜索: argmaxβ∑ilogf(yi).argmaxβ∑ilog⁡f(yi). \textrm{arg}\max_{\beta} \sum_i \log f(y_i). 然后可以将此优化问题简化为: arg 最大β∑一世日志F(y一世)= arg 最大值β∑一世ñ一世[ y一世日志p (β)1 − p (β)- (- 日志(1 − …

2
准确度= 1-测试错误率
抱歉,这是一个非常明显的问题,但我一直在阅读各种文章,似乎找不到很好的确认。在分类的情况下,分类器的精度是否为1-测试错误率?我得到的准确度是,但是我的问题是准确度和测试错误率到底有何关系。 TP+TNP+NTP+TNP+N\frac{TP+TN}{P+N}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.