统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
两种分布的纵向比较
我有六个月间隔四次对2500人进行血液测试的测试结果。结果主要包括两种免疫反应指标:一种在存在某些结核病抗原的情况下进行,另一种在不存在的情况下进行。目前,每项测试都会根据抗原反应和无反应之间的差异来评估阳性或阴性(其想法是,如果您的免疫系统对TB抗原有反应,您可能会在某个时候暴露于细菌本身)。从本质上讲,该测试假设未暴露个体的零和结核病反应分布应基本相同,而患有结核病的人的结核病反应将来自不同的分布(较高值)。 警告:响应非常非常不正常,并且在自然地板和工具截断的天花板上都出现了值聚集。 但是,在这种纵向情况下,我们似乎很清楚地看到,由于抗原和无应答的波动(通常很小),我们会得到“假阳性”(我担心潜伏性结核没有实际的金标准)。尽管在某些情况下可能很难避免这种情况(您可能只有一次机会对某人进行测试),但在许多情况下,每年大约需要对人们进行结核病常规检测-在美国,这对于医护人员来说很常见,军队,无家可归者住在庇护所等。忽略先前的测试结果似乎很可耻,因为现有标准恰好是横截面的。 我认为我想做的是我粗略地将其视为纵向混合分析。就像横截面标准一样,我希望能够估计从同一分布中得出个体的TB和无应答的概率-但要使该估计值包含先前的测试结果以及来自样本的信息整体(例如,我是否可以使用个体内变异的样本范围分布来改善对特定个体零或TB分布的估计?)。当然,估计的概率将需要能够随时间变化,以考虑新感染的可能性。 我已经全神贯注地试图以不同寻常的方式思考这个问题,但是我觉得这种概念化与我将要提出的任何想法一样好。如果没有任何意义,请随时进行澄清。如果我对情况的理解似乎不对,请随时告诉我。非常感谢你的帮助。 针对Srikant: 这是使用两个连续(但非正常且被截断)的测试结果进行潜在分类(是否感染TB)的情况。现在,该分类使用截止值完成(简化形式为TB-nil> .35->正数)。测试结果显示为(零,TB,结果),基本原型*为: 可能的负数:(0.06,0.15,-)(0.24,0.23,-)(0.09,0.11,-)(0.16,0.15,-) 可能的正数:(0.05,3.75,+)(0.05,1.56,+)(0.06 ,5.02,+)( 0.08,4.43 ,+)摇摆器:(0.05,0.29,-)(0.09,0.68 ,+)(0.08,0.31,-)(0.07,0.28,-) Wobbler的第二项测试的阳性结果显然是一种畸变,但您将如何建模?我的思路之一是使用重复测量多级模型来估计每个时间点的结核病和无结核病之间的“真正差异”,但我真正想知道的是该人的无病应答和结核病应答它们来自相同的分布,或者它们的免疫系统是否识别TB抗原并激活,从而产生增强的反应。 至于除了感染以外还可能导致阳性测试的原因:我不确定。我怀疑结果通常只是个人差异,但肯定还有其他因素的可能性。我们确实在每个时间点都有调查表,但是我还没有研究太多。 *捏造但说明性的数据


2
内核密度估计中的内核带宽
我正在进行一些内核密度估计,并在N维上设置了加权点(即,每个样本的权重都不是必需的)。而且,这些样本只是在度量空间中(即,我们可以定义它们之间的距离),而没有别的。例如,我们无法确定采样点的均值,标准差,也无法确定一个变量与另一个变量的比例。内核仅受此距离以及每个样本的重量的影响: f(x)=1.∑weightsi∗∑weightih∗Kernel(distance(x,xi)h)f(x)=1.∑weightsi∗∑weightih∗Kernel(distance(x,xi)h)f(x) = \frac{1.}{\sum weights_i} * \sum\frac{weight_i}{h} * Kernel(\frac{distance(x,x_i)}{h}) 在这种情况下,我试图为内核带宽找到一个鲁棒的估计,可能在空间上变化,并且最好在训练数据集x i上给出准确的重建。如有必要,我们可以假设函数相对平滑。hhhxixix_i 我尝试使用到第一个或第二个最近邻居的距离,但得出的结果很差。我尝试了留一法最优化,但是在Nd的这种情况下我很难找到一个最佳的方法来进行优化,因此它发现非常差的估计,尤其是对于训练样本本身。由于无法计算标准差,因此无法基于正常假设使用贪婪估计。我发现使用协方差矩阵来获取各向异性内核的引用,但同样,它在该空间中不成立... 有人有想法或参考吗?

4
如何在图中寻找谷底?
我正在研究一些基因组覆盖率数据,这些数据基本上是一长串整数(几百万个值),每个整数都表示覆盖基因组中此位置的程度(或“深度”)。 我想在此数据中寻找“山谷”,即比周围环境明显“低”的区域。 请注意,我要寻找的山谷的大小可能在50个碱基到数千个碱基之间。 您会建议使用哪种范例来找到那些山谷? 更新 数据的一些图形示例: 更新2 定义什么是山谷当然是我一直在努力的问题之一。这些对我来说是显而易见的: 但是还有一些更复杂的情况。通常,我考虑3个标准:1.相对于全局平均值,窗口中的(平均?最大?)覆盖率。2.窗口中相对于其周围的覆盖范围。3.窗口有多大:如果我看到很短的覆盖范围很有趣,如果我看到很长的覆盖范围很有趣,如果我看到很短的覆盖很短的范围也不是很有趣。 ,但如果我看到很长一段时间的覆盖率偏低-是的,所以这是sapn长度和覆盖率的结合。时间越长,我就越会覆盖,但仍然认为它是一个山谷。 谢谢, 戴夫



4
多项式的渐近分布
我正在寻找关于d个结果的多项式分布的极限分布。IE浏览器,以下的分布 林n → ∞ñ− 12Xñlimn→∞n−12Xn\lim_{n\to \infty} n^{-\frac{1}{2}} \mathbf{X_n} 其中XñXn\mathbf{X_n}是与密度的矢量值随机变量Fñ(x)fn(x)f_n(\mathbf{x})为Xx\mathbf{x},使得∑一世X一世= n∑ixi=n\sum_i x_i=n,X一世∈ ž,X一世≥ 0xi∈Z,xi≥0x_i\in \mathbb{Z}, x_i\ge 0和对于所有其他\ mathbf {x}为0 Xx\mathbf{x},其中 Fñ(x)= n !∏我= 1dpX一世一世X一世!fn(x)=n!∏i=1dpixixi!f_{n}(\mathbf{x})=n!\prod_{i=1}^d\frac{p_i^{x_i}}{x_i!} 我在拉里·瓦瑟曼(Larry Wasserman)的“所有统计”定理14.6(第237页)中找到了一种形式,但是为了限制分布,它为Normal提供了奇异的协方差矩阵,因此我不确定如何对其进行归一化。您可以将随机向量投影到(d-1)维空间中,以使协方差矩阵满秩,但是要使用什么投影? 更新11/5 雷·库普曼(Ray Koopman)对奇高斯问题做了一个很好的总结。基本上,奇异协方差矩阵表示变量之间的完美相关性,这不可能用高斯表示。但是,条件随机密度的取值可以是高斯分布,其前提是随机向量的值是有效的(在上述情况下,分量的总和为ñnn)。 条件高斯的不同之处在于,用伪逆代替了逆,并且归一化因子使用“非零特征值的乘积”而不是“所有特征值的乘积”。伊恩·弗里斯(Ian Frisce)提供了一些细节的链接。 还有一种无需参考特征值即可表达条件高斯归一化因子的方法, 这是一个推导

11
最近50年的统计革命?[关闭]
按照目前的情况,这个问题并不适合我们的问答形式。我们希望答案得到事实,参考或专业知识的支持,但是这个问题可能会引起辩论,争论,民意调查或扩展讨论。如果您认为此问题可以解决并且可以重新提出,请访问帮助中心以获取指导。 9年前关闭。 在过去的50年中,哪些统计领域发生了重大变化?例如,大约40年前,Akaike和同事们革新了统计模型歧视领域。大约10年前,Hyndman及其同事革新了指数平滑领域。大约二十年前,... 我如何继续列表,请输入年份和名称?所谓统计,是指巴塞洛缪(Bartholomew)1995年的总统讲话,钱伯斯(Chambers)的大小统计之和的全部四种类型,正如汉德(Hand)最近在“现代统计”中的主席讲话中所提到的那样,等等。
10 history 

2
是否可以直接读取CSV列作为分类数据?
我需要使用R分析来自CSV格式的医学调查(带有100多个编码列)的数据。我将使用拨浪鼓进行一些初步分析,但在后台它仍然是R。 如果我读取.csv()文件,则将带有数字代码的列视为数字数据。我知道我可以使用factor()从它们创建分类列,但是要对100多个列执行此操作很麻烦。 我希望有一种更好的方法告诉R直接将列作为因素导入。或至少在以后将它们转换到位。 谢谢!

1
您使用哪种类型的残差拟合后分析?
当执行OLS多元线性回归时,我不是针对拟合值绘制残差,而是针对拟合值绘制(内部)学生化残差(协变量为dito)。这些残差定义为: Ë∗一世= e一世s2(1 - ħ我我)---------√ei∗=eis2(1−hii)\begin{equation} e^*_i = \frac{e_i}{\sqrt{s^2 (1-h_{ii})}} \end{equation} 其中是残差,h_ {ii}是帽子矩阵的对角元素。要获得R中的这些学生化残差,可以使用命令。Ë一世eie_iH我我hiih_{ii}rstandard 人们在这种情况下通常使用什么类型的残差?例如,您只是坚持使用Ë一世eie_i还是使用折刀残差或完全使用其他方式。 注意:我对定义没有人使用过的一种新型残差的论文不感兴趣。


5
除了平方根,对数等普通转换外,还常用哪些其他归一化转换?
在测试成绩的分析中(例如在教育或心理学中),常用的分析技术通常会假设数据是正态分布的。但是,有时分数往往会与正常水平大相径庭。 我熟悉一些基本的规范化转换,例如:平方根,对数,用于减少正偏斜的倒数转换,用于减少负偏斜的上述反射形式,平方函数的平方。我听说过反正弦变换和幂变换,尽管我并不真正了解它们。 因此,我对分析师通常使用的其他转换感到好奇吗?

2
从分层数据中获取并解释自举的置信区间
我对获得数量X的自举置信区间很感兴趣,因为该数量在10个人中各有10次测量。 一种方法是获取每个人的均值,然后重新引导均值(例如,用替换对均值进行重新采样)。 另一种方法是在自举过程的每次迭代中执行以下操作:在每个个体内,用替换对那个个体的10个观察值重新采样,然后为那个个体计算一个新的均值,最后计算一个新的组均值。在这种方法中,原始数据集中观察到的每个个体在引导程序的每次迭代中总是对组均值有所贡献。 最后,第三种方法是将上述两种方法结合起来:对个体进行重新采样,然后在这些个体内进行重新采样。此方法与先前的方法不同之处在于,它允许同一个人在每次迭代中对组均值贡献乘数,尽管由于每个贡献都是通过独立的重采样过程生成的,所以这些贡献可能会彼此略有不同。 在实践中,我发现这些方法对置信区间的估计不同(例如,使用一个数据集,我发现第三种方法的置信区间要比前两种方法大得多),所以我很好奇每种方法可能是什么解释代表。

1
估计随着时间的变化
我有一个数据集,其中包含来自约2500个个体的约7,500个血液测试。我试图找出血液测试的变异性是随着两次测试之间的时间而增加还是减少。例如-我抽取您的血液进行基线测试,然后立即抽取第二个样品。六个月后,我画了另一个样本。人们可能期望基线和立即重复测试之间的差异小于基线和六个月测试之间的差异。 下图上的每个点反映了两次测试之间的差异。X是两次测试之间的天数;Y是两个测试之间差异的大小。如您所见,测试并非沿X均匀分布-这项研究并非旨在解决这个问题。由于这些点的平均高度重叠,因此基于28天的窗口,我包括了95%(蓝色)和99%(红色)的分位数线。这些显然被更极端的因素所牵制,但您明白了。 替代文字http://a.imageshack.us/img175/6595/diffsbydays.png 在我看来,可变性相当稳定。如果有的话,在短时间内重复进行测试会更高-这是违反直觉的。我该如何系统地解决这个问题,并考虑每个时间点的n值变化(某些时期根本没有测试)?非常感谢您的想法。 仅供参考,这是测试与重新测试之间的天数分布: 替代文字http://a.imageshack.us/img697/6572/testsateachtimepoint.png

2
功能数据分析和高维数据分析有什么区别
在统计文献中,有很多关于“ 功能数据 ”(即曲线数据)的参考,也有许多关于“ 高维数据 ”(即当数据是高维向量时)的参考。我的问题是两种数据之间的区别。 当谈论在情况1中应用的应用统计方法时,可以理解为是从情况2通过投影到函数空间的有限维子空间中对方法进行的表述,它可以是多项式,样条,小波,傅立叶等。并将函数问题转化为有限维向量问题(因为在应用数学中,所有事情在某些时候都是有限的)。 我的问题是: 我们可以说适用于功能数据的任何统计程序也可以(几乎直接)适用于高维数据,而专用于高维数据的任何程序也可以(几乎直接)适用于功能数据吗? 如果答案是否定的,您能举例说明吗? 在Simon Byrne的答案的帮助下进行编辑/更新: 稀疏性(S-稀疏假设,球和弱升p球p &lt; 1)被用作在高维统计分析的结构的假设。升p升pl^p升p升pl^pp &lt; 1p&lt;1个p<1 “平滑度”在功能数据分析中用作结构假设。 另一方面,傅里叶逆变换和小波逆变换将稀疏性转换为平滑度,而通过小波和傅立叶变换将平滑度转换为稀疏度。这使得西蒙提到的关键差异不是那么关键吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.