统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
当中位数相等时,为什么Mann–Whitney U检验显着?
我收到了我不理解的曼惠特尼等级测试结果。这两个总体的中位数相同(6.9)。每个群体的较高和较低分位数为: 6.64和7.2 6.60和7.1 比较这些总体的测试得出的p值为0.007。这些人群有何显着不同?是由于中位数的价差引起的吗?比较2的箱线图显示,第二个异常值远大于第一个异常值。感谢您的任何建议。

1
分布变量的已知最清晰的尾边界是什么?
令是具有自由度的卡方分布随机变量。以下概率的最明确的已知界限是什么X∼χ2kX∼χk2X \sim \chi^2_kkkk P[X&gt;t]≤1−δ1(t,k)P[X&gt;t]≤1−δ1(t,k) \mathbb{P}[X > t] \leq 1 - \delta_1(t, k) 和 P[X&lt;z]≤1−δ2(z,k)P[X&lt;z]≤1−δ2(z,k) \mathbb{P}[X < z] \leq 1 - \delta_2(z, k) 其中和是一些函数。指向相关论文的指针将不胜感激。δ1δ1\delta_1δ2δ2\delta_2

1
点过程之间的互相关分析
我想对我使用的一种分析方法提出建议,以了解它在统计上是否合理。 我已经测量了两个点过程和,我想确定如果中的事件以某种方式与T ^ 2中的事件相关。 T 2=t 2 1,t 2 2,...。。。,t 2 m T 1T1=t11,t12,...,t1nT1=t11,t21,...,tn1T^1 = t^1_1, t^1_2, ..., t^1_nT2=t21,t22,...,t2mT2=t12,t22,...,tm2T^2 = t^2_1, t^2_2, ..., t^2_mT1T1T^1T2T2T^2 我在文献中发现的一种方法是构造互相关直方图:对于每个t1ntn1t^1_n我们发现在给定的时间范围内(前后),所有T ^ 2事件的延迟t ^ 1_n),然后我们构建所有这些延迟的直方图。T2T2T^2t1ntn1t^1_n 如果两个过程不相关,那么我会期待一个平坦的直方图,因为在T ^ 1中的某个事件之后(或之前),T2T2T^2某个事件在所有延迟下的发生概率均相等。另一方面,如果直方图中有一个峰值,则表明两点过程在某种程度上相互影响(或至少具有一些共同的输入)。T1T1T^1 现在,这很好,但是我如何确定直方图是否确实有一个峰值(我必须说,对于我的特定数据集,它们显然是平坦的,但是采用统计方式仍会很好确认)? 因此,在这里,我已经完成了:我已经重复了多次生成直方图的过程,将保持原样,并使用了的“改组”版本。为了改组我计算了所有事件之间的间隔,将它们改组并求和以重新构成新的积分过程。在RI中,只需执行以下操作:T 2 T 2T1T1T^1T2T2T^2T2T2T^2 times2.swp &lt;- cumsum(sample(diff(times2))) 因此,我得到了1000个新的直方图,向我展示了中事件的密度与相比。 T 1T2∗T2∗T^{2*}T1T1T^1 对于这些直方图的每个bin(它们都以相同的方式进行了装箱),我计算了95%的直方图密度。换句话说,例如,在5 ms的时间延迟中,在95%的改组点过程中,在的事件之后在中找到事件的概率为x 。 T 1T2∗T2∗T^{2*}T1T1T^1 然后,我将所有时间延迟都采用此95%的值,并将其用作某个“置信度极限”(可能这不是正确的术语),以便在原始直方图中超过该极限的任何值都可以视为“真”峰”。 问题1:此方法在统计上是否正确?如果没有,您将如何解决这个问题? …



2
为什么需要在KNN中缩放数据
有人可以向我解释为什么在使用K个最近邻居时为什么需要规范化数据。 我已经尝试过查找,但是似乎还是无法理解。 我找到以下链接: https://discuss.analyticsvidhya.com/t/why-it-is-necessary-to-normalize-in-knn/2715 但是在这种解释中,我不明白为什么其中一项功能的较大范围会影响预测。

3
零膨胀分布,它们实际上是什么?
我正在努力理解零膨胀分布。这些是什么?重点是什么? 如果我有很多零的数据,那么我可以先进行逻辑回归拟合,然后计算出零的概率,然后再去除所有零,然后使用我选择的分布来拟合正则回归(例如,泊松)。 然后有人告诉我“嘿,使用零膨胀分布”,但是查找它,似乎与我上面的建议没有什么不同?它有一个规则参数,然后有另一个参数可以模拟零概率?只是两件事同时发生了吗?μμ\muppp

6
为什么我们在训练神经网络时需要洗牌?
在神经网络的小批量训练中,我听说一种重要的做法是在每个时期之前对训练数据进行洗牌。有人可以解释为什么每个时期的改组都有帮助吗? 从Google搜索中,我找到了以下答案: 它有助于培训快速收敛 它可以防止训练期间出现任何偏见 它阻止模型学习训练的顺序 但是,我很难理解为什么这些影响都是由随机改组引起的。有人可以提供直观的解释吗?


1
为什么为深度学习的Adam优化器包括偏差校正项很重要?
我正在阅读有关深度学习的Adam优化器的内容,并在Begnio,Goodfellow和Courtville撰写的新书Deep Learning中遇到了以下句子: 亚当包括对一阶矩(动量项)和(无心)二阶矩的估计值的偏差校正,以说明它们在原点处的初始化。 似乎包含这些偏差校正项的主要原因是,它以某种方式消除了和的初始化偏差。米Ť= 0mt=0m_t = 0vŤ= 0vt=0v_t = 0 我不是100%知道这是什么意思,但在我看来,这很可能意味着第一和第二时刻从零开始,并以某种方式从零开始倾斜,以不公平(或有用)的方式使值接近零。 ? 虽然我很想知道这意味着什么,以及它如何损害学习。特别是,在优化方面,不偏向优化器有哪些优势? 这如何帮助训练深度学习模型? 另外,无偏见是什么意思?我很熟悉无偏标准偏差的含义,但是我不清楚在这种情况下这意味着什么。 偏差校正真的很重要吗?还是亚当优化器论文过度夸大了它? 就是这样,人们知道我已经非常努力地理解原始论文,但是我从阅读和重新阅读原始论文中受益匪浅。我认为其中一些问题可能会在此处得到解答,但我似乎无法解析答案。

2
基于“ F回归”和基于
比较特征是否与将特征分别F-regression与标签关联并观察值相同?[R2R2R^2 我经常看到我的同事F regression在他们的机器学习管道中使用进行特征选择sklearn: sklearn.feature_selection.SelectKBest(score_func=sklearn.feature_selection.f_regression...)` 有些人请告诉我-为什么它给出与将其与label / depedendent变量相关联时相同的结果? 对我来说,尚不清楚F_regression在特征选择中使用优势。 这是我的代码:我正在使用mtcars来自的数据集R: import pandas as pd import numpy as np from sklearn import feature_selection from sklearn.linear_model import LinearRegression #....load mtcars dataset into a pandas dataframe called "df", not shown here for conciseness # only using these numerical columns as features ['mpg', 'disp', 'drat', …

1
维数诅咒对某些模型的影响是否大于对其他模型的影响?
我一直在阅读的有关维数诅咒的地方主要结合kNN和线性模型对其进行解释。我经常在Kaggle中看到排名靠前的排名,这些排名使用了数据集上几乎没有100k数据点的数千个功能。他们主要使用Boosted树和NN等。许多功能似乎太高了,我觉得它们会受到尺寸诅咒的影响。但是事实并非如此,因为这些模型使它们成为了竞争中的佼佼者。因此,回到我最初的问题-某些模型受维度诅咒的影响大于其他模型吗? 具体来说,我对以下模型感兴趣(仅因为这些是我知道/使用的模型): 线性和逻辑回归 决策树/随机森林/加强树 神经网络 支持向量机 神经网络 k均值聚类


2
为什么lrtest()与anova(test =“ LRT”)不匹配
我一直在寻找在R中进行似然比测试以比较模型拟合的方法。我首先自己编写了代码,然后在包中找到了默认anova()功能。但是,当我检查时,即使将“ test”参数设置为“ LRT” ,也总是会产生与其他两个略有不同的p值。实际上是在执行一些微妙的不同测试,还是我不了解某些内容?lrtest()lmtestanova()anova() 平台:在Linux Mint 17 lmtest版本0.9-33 上运行的R 3.2.0 样例代码: set.seed(1) # Reproducibility n=1000 y = runif(n, min=-1, max=1) a = factor(sample(1:5, size=n, replace=T)) b = runif(n) # Make y dependent on the other two variables y = y + b * 0.1 + ifelse(a==1, 0.25, 0) mydata = …

1
glmnet logistic回归可以直接处理因子(类别)变量而不需要虚拟变量吗?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 3年前关闭。 我正在使用LASSO方法在R中构建逻辑回归,并具有cv.glmnet用于选择lambda和glmnet用于最终模型的功能。 我已经知道关于自动模型选择的所有缺点,但是无论如何我都需要这样做。 我的问题是我需要在模型中包括因子(分类)变量,有什么方法可以在不创建大量虚拟变量的情况下做到这一点?此变量几乎是所有字符串,而不是数字。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.