统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

5
关于协方差定义的直觉
我试图更好地理解两个随机变量的协方差,并了解想到它的第一个人如何得出统计中通常使用的定义。我去了维基百科更好地了解它。从本文看来,良好候选度量或数量应具有以下属性:Co v (X,Y)Cov(X,Y)Cov(X,Y) 当两个随机变量相似时(即当一个随机变量增加另一个变量时,而当一个随机变量减小另一个变量时,它应具有正号)。 我们还希望当两个随机变量相反相似时(即,当一个随机变量增大时,另一个随机变量趋于减小),它具有负号。 最后,当两个变量彼此独立时(即它们彼此之间不互变),我们希望此协方差量为零(或可能很小?)。 根据以上属性,我们要定义。我的第一个问题是,对我来说,为什么C o v (X ,Y )= E [ (X - E [ X ] )(Y - E [ Y ] )]Co v (X,Y)Cov(X,Y)Cov(X,Y)Co v (X,Y)= E[ (X− E[ X] )(Y− E[ Y] )]Cov(X,Y)=E[(X−E[X])(Y−E[Y])]Cov(X,Y) = E[(X-E[X])(Y-E[Y])]满足这些特性。从我们拥有的属性来看,我希望更多的类似于“导数”的方程式是理想的选择。例如,更像是“如果X的变化为正,则Y的变化也应为正”。另外,为什么要从均值中减去差异才是“正确”的事情? 一个更切线但仍然有趣的问题,是否存在一个可以满足这些特性并且仍然有意义且有用的不同定义?我之所以这样问,是因为似乎没有人质疑我们为什么要首先使用此定义(感觉,它的“总是这样”,在我看来,这是一个可怕的原因,它阻碍了科学和技术的发展。数学的好奇心和思考)。公认的定义是否是我们可以拥有的“最佳”定义? 这些是我对为什么可接受的定义有意义的想法(它只是一个直观的论点): 让是变量X的一些差异(即,它从一些值改变为其他值在一段时间内)。类似地,对于定义Δ ÿ。ΔXΔX\Delta_XΔÿΔY\Delta_Y 对于某个时间实例,我们可以通过执行以下操作来计算它们是否相关: š 我克n (ΔX·&Δÿ)sign(ΔX⋅ΔY)sign(\Delta_X \cdot …

3
如何使用L1损失函数在R中训练(逻辑?)回归?
我可以在R使用中训练逻辑回归 glm(y ~ x, family=binomial(logit))) 但是,IIUC可以优化对数可能性。 有没有办法使用线性()损失函数(在这种情况下与总变化距离相同)来训练模型?大号1个大号1个L_1 即,给定一个数值向量和一个位(逻辑)向量,我想构造一个单调(实际上是增加的)函数,使得被最小化。XXxÿÿyFFf∑ | F(x )− y|∑|F(X)-ÿ|\sum |f(x)-y| 也可以看看 如何使用L1损失函数训练R中的逻辑回归?
11 logistic 

2
Logistic回归:解释连续变量
我有几个问题需要解释逻辑回归中连续变量的比值比。我觉得这些是关于逻辑回归的基本问题(可能还有关于回归的一般问题),尽管我为自己不知道答案感到as愧,但我还是要以我的骄傲为由并问他们,以便我在未来! 这是我的情况...我正在查看一个受审判的青年样本,作为试用期的一部分,他们参加了工作/生活技能培训计划。我想看看他们从计划中被释放的年龄在计划被释放六个月后的预期就业率。 (此外,请记住,模型中还有其他预测变量,但由于它们在统计上不显着,因此我将它们排除在外,我想尽可能地使之清晰。) 预测变量:从培训计划中释放的年龄(平均年龄= 17.4,SD = 1.2,范围14.3-20.5) 结果:是否就业(就业= 1,未就业= 0) 结果:赔率3.01(p <.005)(我已经排除了拟合优度等,因为我只寻求解释比值比的答案;我对模型拟合,CI的评估感到满意等) 简而言之:随着年龄增长一年,出院后六个月被雇用的几率增加了三个单位。 问题: 1)当我说“随着年龄的增长……”,年龄的起点是什么? 年龄从零开始吗?例如,“随着年龄从0开始增加(即,如果要将此模型放在图表上,则是最低年龄)...” 年龄是否从样本年龄范围内的最低年龄开始?例如,“随着年龄从14.3开始增加...” 要么 年龄是否从样本的平均年龄开始?例如,“随着年龄从17.4 ...开始增加”, 2)居中会帮助我解释这个结果,还是仅在解释y-int时有效?如果有帮助,我正在考虑进行平均居中或从样本中的所有其他年龄中减去该范围内的最低年龄。有什么建议么? 3)最后,是否恰当地说,与14岁的年轻人相比,17岁的年轻人受雇的可能性高9倍?我之所以问,是因为我知道逻辑回归假设为S型关系,并且我对这3个单位的几率增加是否在沿回归线的任何点都保持一致感到好奇。 非常感谢! 亚伦


1
我们如何预测罕见事件?
我正在开发保险风险预测模型。这些模型具有“罕见事件”的特征,例如航空公司的空机预测,硬件故障检测等。准备数据集时,我尝试应用分类,但是由于否定案例的比例很高,因此无法获得有用的分类器。 除了高中统计课程外,我在统计和数据建模方面没有太多经验,所以我有点困惑。 首先想到的是,我一直在考虑使用不均匀的泊松过程模型。我根据事件数据(日期,纬度,经度)对它进行了分类,从而可以很好地估计在特定日期,特定地点的特定时间发生风险的可能性。 我想知道,预测稀有事件的方法/算法是什么? 您如何建议您解决此问题?

1
如何选择罕见事件的Logistic回归的截止概率
我有100,000个观察值(9个虚拟指标变量),具有1000个正值。Logistic回归在这种情况下应该可以正常工作,但临界概率使我感到困惑。 在普通文献中,我们选择50%截止值来预测1和0。我无法执行此操作,因为我的模型给出的最大值约为1%。因此,阈值可以在0.007或附近。 我确实了解ROC曲线以及曲线下的面积如何帮助我在同一数据集的两个LR模型之间进行选择。但是,ROC并不能帮助我选择最佳截断概率,该概率可以用来对样本外数据进行模型测试。 我是否应该简单地使用最小化阈值的截止值misclassification rate?(http://www2.sas.com/proceedings/sugi31/210-31.pdf) 添加->对于如此低的事件发生率,我的错误分类率受到大量误报的影响。虽然总体宇宙的大小也很大,但总体上看来该比率很高,但是我的模型不应有那么多的误报(因为它是投资回报模型)。5/10系数很重要。

4
非参数统计简介
我过去两年一直在研究统计数据。我所学的几乎所有内容都是关于参数统计的。现在,我想了解更多有关非参数统计的信息。有人可以建议对此领域进行一些简要介绍(也许也可读)吗?

2
推导标准误差的通用方法
我似乎找不到在任何地方导出标准错误的通用方法。我看过Google,这个网站,甚至在教科书上,但我所能找到的只是平均值,方差,比例,风险比等的标准误差公式,而不是这些公式是如何得出的。 如果有人可以用简单的方式来解释它,或者甚至将我链接到一个很好的资源来解释它,我将不胜感激。

3
我应该使用哪种算法将庞大的二进制数据集聚为几类?
我有一个很大的(650K行* 62列)二进制数据矩阵(仅0-1个条目)。矩阵大部分是稀疏的:大约占8%。 我想将其分为5组-从1到5命名。我尝试了层次化群集,但是它无法处理大小。考虑到长度为62的650K位向量,我还使用了基于汉明距离的k-means聚类算法。在这些情况下,我都没有得到正确的结果。 请帮忙。

1
逆变换的置信区间
遇到此讨论后,我提出了关于逆变换后的置信区间约定的问题。 根据本文,对数正态随机变量的均值的标称覆盖率逆变换CI为: LCL(X)=exp(Y+var(Y) üC大号(X)= exp(是+ var (Y)2+ zVAR (ÿ)ñ+ var (Y)22 (n − 1 )------------√) UCL(X)=exp⁡(Y+var(Y)2+zvar(Y)n+var(Y)22(n−1))\ UCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}+z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) L C大号(X)= exp(是+ var (Y)2− zVAR (ÿ)ñ+ var (Y)22 (n − 1 )------------√) LCL(X)=exp⁡(Y+var(Y)2−zvar(Y)n+var(Y)22(n−1))\ LCL(X)= \exp\left(Y+\frac{\text{var}(Y)}{2}-z\sqrt{\frac{\text{var}(Y)}{n}+\frac{\text{var}(Y)^2}{2(n-1)}}\right) /而不是朴素的 /经验值((是)+ zVAR (ÿ)------√)exp⁡((Y)+zvar(Y))\exp((Y)+z\sqrt{\text{var}(Y)}) 现在,用于以下转换的配置项是什么? X--√x\sqrt{x}和X1 / 3x1/3x^{1/3} 反正弦(x--√)arcsin(x)\text{arcsin}(\sqrt{x}) 日志(x1 − x)log⁡(x1−x)\log(\frac{x}{1-x}) 1 / x1/x1/x 随机变量本身的公差区间如何(我的意思是从总体中随机抽取一个样本值)?逆变换的间隔是否存在相同的问题,或者它们具有名义覆盖率?

1
偏正态分布的参数估计
偏态正态的公式参数估计是什么?如果可以的话,通过MLE或Mom进行派生也将是很棒的。谢谢 编辑。 我有一组数据,可以通过绘图直观地看出这些数据的左侧偏斜。我想估算均值和方差,然后进行拟合优度检验(这就是为什么我需要参数估算值的原因)。我是否以为我只需要猜测偏斜(alpha)(也许做几次偏斜并测试哪种才是最好的?)就对了吗? 我想根据自己的理解来推导MLE,因为我对MLE较熟悉,所以更喜欢MLE。 我不确定是否有多个通用偏斜法线-我只是说一个负偏斜法线!如果可能的话,偏指数幂参数估计也将有所帮助!

3
最小二乘什么时候会是个坏主意?
如果我有回归模型: 其中 和,ÿ= Xβ+ εY=Xβ+ε Y = X\beta + \varepsilon V [ε]=Id∈ [Rn × nV[ε]=Id∈Rn×n\mathbb{V}[\varepsilon] = Id \in \mathcal{R} ^{n \times n}E [ε]=(0,…,0)E[ε]=(0,…,0)\mathbb{E}[\varepsilon]=(0, \ldots , 0) 什么时候使用(的普通最小二乘估计量)对估计量而言是一个糟糕的选择?β最小二乘βOLS\beta_{\text{OLS}}ββ\beta 我试图找出一个最小二乘效果不好的例子。因此,我正在寻找能够满足先前假设但产生不良结果的错误分布。如果分布族由均值和方差决定,那将是很大的。如果没有,也可以。 我知道“不好的结果”有点模糊,但我认为这个想法是可以理解的。 为了避免混淆,我知道最小二乘不是最佳的,并且有更好的估算器,例如岭回归。但这不是我的目标。我想要一个最小二乘不自然的例子。 我可以想象,误差向量位于的非凸区域中,但是我不确定。ϵϵ\epsilon[RñRn\mathbb{R}^n 编辑1:作为帮助答案的想法(我想不出进一步的方法)。为蓝色。因此,考虑线性无偏估计量何时不是一个好主意可能会有所帮助。β最小二乘βOLS\beta_{\text{OLS}} 编辑2:正如Brian指出的那样,如果的条件不好,则是一个坏主意,因为方差太大,应改用Ridge回归。我更感兴趣的是知道应该采用哪种分布,以使最小二乘无效。XX′XX′XX'β最小二乘βOLS\beta_{\text{OLS}}εε\varepsilon β最小二乘〜β+(X′X)− 1X′εβOLS∼β+(X′X)−1X′ε\beta_{\text{OLS}} \sim \beta+(X'X)^{-1}X'\varepsilon是否与零均值和方差的身份矩阵分布,使这个估计不是有效?εε\varepsilon

2
平均相关系数的意义
免责声明:如果您发现这个问题与另一个问题过于相似,我很高兴将其合并。但是,我在其他任何地方都找不到满意的答案(并且还没有“声誉”来发表评论或投票),所以我认为最好自己问一个新问题。 我的问题是这个。对于12个人类受试者中的每一个,我已经计算出自变量X的6个水平与因变量Y的相应观察值之间的相关系数(斯皮尔曼Rho)。(注意:受试者之间X的水平不相等。)零假设是,在一般人群中,这种相关性等于零。我用两种方法检验了这个假设: 对我的12个受试者获得的相关系数进行一次样本t检验。 通过将我的X水平和Y观测值居中,使得每个参与者的均值(X)= 0和均值(Y)= 0,然后计算汇总数据之间的相关性(72个X水平和72个Y观测值) 。 现在,从阅读有关使用相关系数(在这里和其他地方)的知识开始,我开始怀疑第一种方法是否有效。特别是,我看到以下方程式在几个地方突然出现,(显然)表示为平均相关系数的t检验: t=rSEr=n−2−−−−−√1−r2−−−−−√Ť=[R小号Ë[R=ñ-21个-[R2t = \frac{r}{SE_{r}} = \frac{\sqrt{n-2}}{\sqrt{1-r^{2}}} 其中,是平均相关系数(假设我们首先使用每个对象系数的Fisher变换获得了该系数),是观察数。直觉上,这对我来说似乎是错误的,因为它不包含任何受试者间变异性的度量。换句话说,如果我具有3个相关系数,则无论它们是[0.1、0.5、0.9]还是[0.45 0.5 0.55]还是任何均值相同(且)的值,我都会得到相同的t统计量n n = 3r[Rrnñnn=3ñ=3n=3 因此,我怀疑上面的方程式在检验相关系数平均值的显着性时实际上不适用,而在基于2个变量的观察值检验单个相关系数的显着性时实际上并不适用。nñn 在座的任何人都可以确认这种直觉或解释为什么错了吗?另外,如果此公式不适用于我的情况,是否有人知道正确的方法?也许我自己的测试编号2已经有效?非常感谢您的任何帮助(包括指向我可能遗漏或误解的先前答案的指针)。

1
SurveyMonkey是否会忽略您获得非随机样本的事实?
SurveyMonkey提供了一些步骤和图表,可根据您的总体数量来确定在给定的误差范围或置信区间内需要的样本量。 SurveyMonkey样本大小 该图表是否只是忽略了这样一个事实,即您只会得到那些愿意回答调查问卷的人,因此不会获得随机样本? 当我输入此内容时,我会收到警告,问题似乎是主观的,所以也许我没有正确询问。它不是真的与SurveyMonkey有关,而是一个更笼统的问题-您是否可以使用一些我不知道的高级技术从自愿响应数据中实际计算出置信区间? 在出口民意测验或国家调查中,显然他们必须处理这个问题。我的教育并未深入探讨调查抽样技术,但我认为它涉及收集人口统计数据,并以此来了解您所代表的样本的代表性。 除此之外,对于一个简单的在线调查,他们是否只是假设那些愿意回答的人是整个人口的随机样本?

3
第一个主要组件不会分隔类别,而其他PC会分开。那怎么可能?
我对17个定量变量运行了PCA,以获取较小的变量集(即主要成分),该变量集用于有监督的机器学习中,用于将实例分为两类。在PCA之后,PC1占数据方差的31%,PC2占数据的17%,PC3占10%,PC4占8%,PC5占7%,PC6占6%。 但是,当我看两类计算机之间的均值差异时,令人惊讶的是,PC1不能很好地区分两类计算机。剩下的PC就是很好的鉴别器。另外,PC1在决策树中使用时变得无关紧要,这意味着在修剪树后甚至在树中都不存在它。该树由PC2-PC6组成。 这个现象有什么解释吗?衍生变量会出问题吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.