统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
有界数据集的变异系数最大值
在有关标准偏差是否可以超出均值的最新问题之后的讨论中,曾短暂提出一个问题,但从未完全回答。所以我在这里问。 考虑一组非负数 ,其中表示。不需要是不同的,也就是说,集合可以是多集。该集合的均值和方差定义为 ,标准偏差为。请注意,数字集不是来自总体的样本,我们也不是估算总体均值或总体方差。那么问题是:nnnxixix_i0≤xi≤c0≤xi≤c0 \leq x_i \leq c1≤i≤n1≤i≤n1 \leq i \leq nxixix_ix¯=1n∑i=1nxi, σ2x=1n∑i=1n(xi−x¯)2=(1n∑i=1nx2i)−x¯2x¯=1n∑i=1nxi, σx2=1n∑i=1n(xi−x¯)2=(1n∑i=1nxi2)−x¯2\bar{x} = \frac{1}{n}\sum_{i=1}^n x_i, ~~ \sigma_x^2 = \frac{1}{n}\sum_{i=1}^n (x_i - \bar{x})^2 = \left(\frac{1}{n}\sum_{i=1}^n x_i^2\right) - \bar{x}^2σxσx\sigma_x 在间隔[0,c]中,对于x_i的所有选择,\ dfrac {\ sigma_x} {\ bar {x}}的最大值σxx¯σxx¯\dfrac{\sigma_x}{\bar{x}}(变异系数)是多少?xixix_i[0,c][0,c][0,c] 我可以找到的最大值σxx¯σxx¯\frac{\sigma_x}{\bar{x}}是n−1−−−−−√n−1\sqrt{n-1} 时,其实现了n−1n−1n-1所述的xixix_i具有值000和剩余的(离群值)xixix_i 具有值ccc,给出 x¯=cn, 1n∑x2i=c2n⇒σx=c2n−c2n2−−−−−−−√=cnn−1−−−−−√.x¯=cn, 1n∑xi2=c2n⇒σx=c2n−c2n2=cnn−1.\bar{x} = \frac{c}{n},~~ \frac{1}{n}\sum x_i^2 = \frac{c^2}{n} \Rightarrow \sigma_x …

5
单变量随机变量的均值是否始终等于其分位数函数的积分?
我只是注意到,对从p = 0到p = 1的单变量随机变量的分位数函数(逆cdf)进行积分会产生变量的平均值。我之前从未听说过这种关系,所以我想知道:是否总是这样?如果是这样,这种关系是否广为人知? 这是python中的示例: from math import sqrt from scipy.integrate import quad from scipy.special import erfinv def normalPdf(x, mu, sigma): return 1.0 / sqrt(2.0 * pi * sigma**2.0) * exp(-(x - mu)**2.0 / (2.0 * sigma**2.0)) def normalQf(p, mu, sigma): return mu + sigma * sqrt(2.0) * erfinv(2.0 …

2
您如何撰写Tukey事后调查结果?
编写Tukey事后结果的正确方法是什么? 有几个结果不同的例子吗? 假设您有北,南,东和西。 North N=50 Mean=2.45 SD=3.9 std error=.577 LB=1.29 UB=3.62 South N=40 Mean=2.54 SD=3.8 std error=.576 LB=1.29 UB=3.63 East N=55 Mean=3.45 SD=3.7 std error=.575 LB=1.29 UB=3.64 West N=45 Mean=3.54 SD=3.6 std error=.574 LB=1.29 UB=3.65 北部在统计上具有重要性(东部(sig = .009)和西部(sig = .040),但南部没有(sig = .450)。东部与南部(.049)在统计上具有显着性。




4
SVD / PCA的“规范化”变量
假设我们有NNN可测量的变量(a1,a2,…,aN)(a1,a2,…,aN)(a_1, a_2, \ldots, a_N),我们进行了M>NM>NM > N个测量,然后希望对结果进行奇异值分解,以找到最大方差轴。N维空间中的MMM个点。(注意:假设的装置一个我已经减去,所以⟨ 一个我 ⟩ = 0对于所有我)。NNNaiaia_i⟨ai⟩=0⟨ai⟩=0\langle a_i \rangle = 0iii 现在假设一个(或多个)变量的特征量级与其余变量具有显着不同的特征量级。例如a1a1a_1可具有值的范围在10−10010−10010-100其余的可能约为0.1−10.1−10.1-1。这将扭曲向最高方差的轴a1a1a_1的轴非常多。 大小上的差异可能仅仅是由于不幸地选择了度量单位(如果我们谈论的是物理数据,例如公里与米),但是实际上不同的变量可能具有完全不同的尺寸(例如重量与体积),因此可能没有任何明显的方法为它们选择“可比较”的单位。 问题: 我想知道是否存在任何标准/通用方法来规范化数据以避免这种问题。我更感兴趣的是产生了相当的幅度标准技术a1−aNa1−aNa_1 - a_N为了这个目的,而不是想出一些新的东西。 编辑: 一种可能性是通过其标准偏差或类似的东西标准化每个变量。但是,随后出现以下问题:让我们将数据解释为NNN维空间中的点云。该点云可以旋转,并且这种类型的归一化将根据旋转给出不同的最终结果(在SVD之后)。(例如,在最极端的情况下,想象精确地旋转数据以使主轴与主轴对齐。) 我希望不会有任何旋转不变的方法,但是如果有人能指出我对文献中有关此问题的某些讨论,特别是关于结果解释中的注意事项,我将不胜感激。


2
预测流失的生存模型-时变预测因子?
我正在寻找一个用于预测客户流失的预测模型,并希望使用一个适合于个人期间训练数据集的离散时间生存模型(每个客户一行,他们处于危险状态的离散时期,带有事件指标–等于1如果流失发生在那个时期,则为0)。 我使用Singer和Willet的技术使用普通逻辑回归拟合模型。 客户流失可以在一个月内的任何地方发生,但是直到月底我们才知道(例如,他们离开该月的某个时间)。24个月用于培训。 使用的时间变量是样本的原始时间-截至2008年12月31日,所有活跃的客户-截至2009年1月,他们都收到t = 0(这不是经典的实现方式,但我相信构建时的方式预测模型与传统统计模型的对比)。使用的协变量是客户在该时间点的任期。 构造了一系列协变量-有些协变量在数据集的行中(对于给定的客户)不会改变,而有些则会。 这些时变协变量是问题所在,也是使我质疑生存率预测的生存模型的原因(与常规分类器相比,该分类器根据当前快照数据预测未来x个月的波动)。时不变的描述了前一个月的活动,预计将是重要的触发因素。 至少基于我当前的想法,这种预测模型的实现是在每个月底为客户群打分,计算下个月某个时间流失的可能性/风险。然后在接下来的1,2或3个月内再次使用。然后用于接下来的1,2,3,4,5,6个月。对于3个月和6个月的客户流失率,我将使用估计的生存曲线。 问题: 在考虑评分时,我该如何纳入时变预测变量?似乎我只能对时不变的预测变量评分,或者包括那些时不变的预测变量,您必须使它们成为时不变的-设置为“现在”值。 有人对这种生存模型的使用有经验或想法吗? 基于@JVM的更新: 问题不在于估计模型,解释系数,使用训练数据绘制有趣的协变量值的危险/生存图等。问题在于使用模型来预测给定客户的风险。说在本月底,我想给仍然是该模型活跃客户的每个人评分。我想预测该风险估计x个周期(下个月月底关闭帐户的风险。从现在起两个月末关闭帐户的风险,等等)。如果存在随时间变化的协变量,则它们的值在以后的任何时期都是未知的,那么如何利用该模型? 最终更新: 人员时间段数据集将为每个人以及每个处于风险期间的时间段都有一个条目。假设有J个时间段(可能是J = 1 ... 24,为24个月),我建立了一个离散的时间生存模型,为简单起见,我们将时间T视为线性,并且有两个协变量X和Z,其中X是时间-不变,这意味着第一个人在每个周期中都是恒定的,并且Z是随时间变化的,这意味着第一个人的每个记录都可以采用不同的值。例如,X可能是客户性别,Z可能是上个月他们对公司的价值。第j个时间段中第i个人的危害的logit模型为: logit(h(tij))=α0+α1Tj+β1Xi+β2Zijlogit(h(tij))=α0+α1Tj+β1Xi+β2Zijlogit(h(t_{ij}))=\alpha_{0}+\alpha_{1}T_{j}+\beta_{1}X_{i}+\beta_{2}Z_{ij} 因此,问题在于,当使用时变协变量并使用新数据进行预测(到尚未看到的未来)时,是未知的。ZjZjZ_{j} 我能想到的唯一解决方案是: 不要使用像Z这样的时变协变量。这会大大削弱模型来预测搅动事件,尽管例如,因为看到Z的减少会告诉我们客户正在脱离并可能准备离开。 使用随时间变化的协变量但滞后(如Z在上方),这使我们能够预测出我们滞后了变量的多个周期(再次考虑对新的当前数据进行评分的模型)。 使用随时间变化的协变量,但在预测中将其保留为常数(因此,该模型适合于变化的数据,但对于预测,我们将其保留为常数,并模拟这些值的变化(如果稍后实际观察到的话)将如何影响搅动风险。 使用时变协变量,但根据已知数据的预测来估算其未来值。例如,预测每个客户的。ZjZjZ_{j}

5
数据清理会使统计分析的结果恶化吗?
在流行期间,由于病毒传播(例如2002年美国的西尼罗河病毒),人民抵抗力下降,食物或水的污染减少,蚊子。这些流行病将以每1至5年发生一次的异常值出现。通过消除这些异常值,我们将消除流行病的证据,这些证据构成了预测和疾病理解的重要组成部分。 在处理由流行病引起的异常值时是否需要清理数据? 是要改善结果还是使统计分析结果恶化?

1
如何使用Sweave和xtable创建彩色表?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我正在使用Sweave和xtable生成报告。 我想在桌子上添加一些颜色。但是我还没有找到任何用xtable生成彩色表的方法。 还有其他选择吗?


3
交互式数据可视化什么时候有用?
在准备一个演讲中,我将尽快给,我最近开始挖成两个主要(免费)工具,交互式数据可视化:GGobi和蒙德里安 -都提供大范围的能力(即使他们有点马车)。 我想请您帮助阐明(对我自己,以及对我的未来听众​​)何时使用交互式图解会有所帮助?用于数据探索(针对我们自己)和数据表示(针对“客户”)? 对于向客户解释数据时,我可以看到以下动画的值: 使用“标识/链接/画笔”来查看图形中的哪个数据点是什么。 呈现数据的敏感性分析(例如:“如果我们删除这一点,这将是我们得到的) 在数据中显示不同组的影响(例如:“让我们看看我们的男性图表,现在是女性图表”) 显示时间的影响(或年龄,或总体而言,为演示文稿提供另一个维度) 对于我们自己探索数据时,在我们正在研究的数据集中探索异常值时,我可以看到标识/链接/刷涂的价值。 但是除了这两个示例之外,我不确定这些技术还提供了哪些实际用途。特别是对于我们自己的数据探索! 可以说,交互部分对于探索(例如)数据中不同组/集群的不同行为非常有用。但是,当(在实践中)我遇到这种情况时,我倾向于做的是运行相关的统计程序(以及事后检验),然后我发现很重要的事情会用彩色清楚地将数据划分为相关群体。从我所看到的情况来看,这是一种比“游刃有余”的数据更安全的方法(这很容易导致数据疏导(校正所需的多重比较的范围甚至不清楚)。 我很高兴阅读您在此问题上的经验/想法。 (此问题可以是Wiki-尽管它不是主观的,并且经过深思熟虑的答案将很乐意赢得我的“答案”标记:))

2
“每个蓝色T恤衫的人”是否都是系统样本?
我正在教入门统计课程,并正在审查采样类型,包括系统采样,即您对第k个个体或对象进行采样。 一个学生问对每个具有特定特征的人进行采样是否会完成相同的事情。 例如,对每个穿着蓝色T恤衫的人进行抽样是否足够随机并足以代表整个人口?至少,如果您要问的问题不是“您喜欢穿哪种颜色的T恤?” 我的感觉不是,但是我想知道这里是否有人对此有任何想法。
17 sampling 

3
主成分分析“向后”:给定的变量线性组合可解释多少数据差异?
我对六个变量AAA,BBB,CCC,DDD,EEE和进行了主成分分析FFF。如果我理解正确,未旋转的PC1会告诉我这些变量的线性组合描述/解释了数据中的最大方差,而PC2告诉我这些变量的线性组合描述了数据中的第二大方差,依此类推。 我只是很好奇-有什么办法可以做到这一点吗?假设我选择了这些变量的线性组合-例如A+2B+5CA+2B+5CA+2B+5C,我能算出所描述数据的方差是多少?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.