统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
矩生成函数和傅立叶变换?
矩生成函数是概率密度函数的傅立叶变换吗? 换句话说,力矩生成函数是否只是随机变量的概率密度分布的频谱分辨率,即以振幅,相位和频率而不是参数来表征函数的等效方法? 如果是这样,我们可以对这只野兽进行物理解释吗? 我之所以问是因为,在统计物理学中,累积量生成函数(矩生成函数的对数)是表征物理系统的加性。如果您将能量视为随机变量,那么它的累积量生成函数可以非常直观地解释能量在整个系统中的分布。力矩产生函数是否有类似的直观解释? 我了解它的数学实用性,但它不仅是一个技巧概念,在概念上肯定还有其含义吗?
10 moments  mgf  cumulants 



2
为了选择零件数量,有什么好的指标可以评估PCA配合的质量?
评估主成分分析(PCA)质量的良好指标是什么? 我在数据集上执行了该算法。我的目标是减少功能数量(信息非常冗余)。我知道保留的方差百分比可以很好地表明我们保留了多少信息,是否可以使用其他信息指标来确保我删除了冗余信息并且没有“丢失”此类信息?

1
解释PR曲线下的面积
我目前正在比较三种方法,并且我以Accuracy,auROC和auPR作为指标。我有以下结果: 方法A-acc:0.75,auROC:0.75,auPR:0.45 方法B-acc:0.65,auROC:0.55,auPR:0.40 方法C-acc:0.55,auROC:0.70,auPR:0.65 我对准确性和auROC有很好的理解(要记得很好,我经常想出一个句子,例如“ auROC =很好地表征预测阳性学生的能力”,而并非完全正确的话可以帮助我记住)。我从来没有过auPR数据,而在我了解它是如何构建的时,我无法理解它的背后。 实际上,我无法理解为什么方法C的auPR得分非常高,而准确性和auPR却差/平均。 如果有人能通过简单的解释帮助我更好地理解它,那将是非常不错的。谢谢。

2
计算NBA投篮一致性
评估/确定NBA球员三分球命中率一致性的正确方法是什么?例如,我有一个球员的三分球命中率是37%,全年要进行200次尝试。 我正在考虑拍摄任意数量(例如20张)的3分滚动平均值。然后使用这些平均值确定与37%平均值的标准偏差。使用20张滚动的滚动样本大小只能使5%的拍摄准确率,但是我担心使用过多的拍摄不会显示出性能上的不一致。 有没有更好的方法来确定一致性?

2
异常检测:使用什么算法?
背景信息:我正在开发一个分析临床数据的系统,以过滤掉可能是错别字的难以置信的数据。 到目前为止,我做了什么: 为了量化真实性,到目前为止,我的尝试是对数据进行归一化,然后根据点p与集合D中已知数据点的距离(=训练集合)计算点p的真实性值: plausibility(p)=∑q∈DGauss(distance(p,q))plausibility(p)=∑q∈DGauss(distance(p,q))\text{plausibility}(p)=\sum_{q\in D}\text{Gauss}(\text{distance}(p,q)) 通过这种量化,我可以选择一个阈值,将合理的数据与不可信的数据分开。我正在使用python / numpy。 我的问题: 该算法无法检测独立的维度。理想情况下,我可以将关于记录的所有信息放入算法中,让它自己发现维度X不会影响记录的合理性。 该算法不适用于布尔值或选择输入等离散值。它们可以映射到连续值上,但是与Select 3相比,Select 1与Select 2更接近Select 2是违反直觉的。 题: 我应该为该任务寻找哪种算法?似乎有很多选择,包括基于最近邻居,基于聚类和统计方法。另外,我很难找到有关这种复杂性异常检测的论文。 任何建议都受到高度赞赏。 [编辑]示例: 假设数据由一个人的身高,一个人的体重和时间戳组成-因此它是3D数据。体重和身高是相关的,但时间戳是完全独立的。如果仅考虑欧几里德距离,则必须选择一个小的阈值以适合我的大多数交叉验证数据。理想情况下,该算法将只忽略时间戳记维度,因为确定记录是否合理是无关紧要的,因为时间戳记与任何其他维度都不相关。任何时间戳都是合理的。 另一方面,可以组成一些示例,其中时间戳确实很重要。例如,特征X的值Y在某个日期之前而不是某个日期之后测量时可能是合理的。

1
有一个定理说
令为具有定义的均值μ和标准偏差σ的任何分布。中心极限定理说 √XXXμμ\muσσ\sigma 收敛于标准正态分布。如果用样本标准差S代替σ,则有一个定理表明 √n−−√X¯−μσnX¯−μσ \sqrt{n}\frac{\bar{X} - \mu}{\sigma} σσ\sigmaSSS 收敛到t分布吗?由于对于较大的n,t分布接近正态,因此如果存在该定理,则该定理可以声明该极限为标准正态分布。因此,在我看来t分布不是​​很有用-仅当X大致为正态时才有用。是这样吗 n−−√X¯−μSnX¯−μS \sqrt{n}\frac{\bar{X} - \mu}{S} nnnXXX 如果可能的话,当被S替换时,您是否会指出包含该CLT证明的引用?这样的参考可以优选地使用度量理论概念。但是在这一点上,任何事情对我来说都是很棒的。σσ\sigmaSSS

3
统计测试以比较两个设备的精度
我正在比较两种温度控制设备,它们均设计用于将麻醉患者的体温保持在恰好37度。该设备适合500名患者,分为两组。A组(400例患者)-设备1,B组(100例患者)-设备2。每位患者每小时测量一次体温,持续36小时,为我提供了两组的18000个数据点。我需要确定在36小时内哪种设备可以更精确地控制患者的体温。我已经构造了折线图,将每个时间点的中位数与四分位数条连接起来,在视觉上似乎有所不同。我应该如何分析我的数据以证明统计差异?


2
我应该在集群级别还是在个人级别进行引导?
我有一个将患者嵌套在医院中的生存模型,其中包括医院的随机效应。随机效应是伽马分布的,我试图以易于理解的规模报告该术语的“相关性”。 我发现以下使用中位数危险比(有点像中位数赔率)的参考文献进行了计算。 Bengtsson T,Dribe M:历史方法43:15,2010年 但是,现在我想使用自举报告该估计的不确定性。数据是生存数据,因此每个患者有多个观察结果,每个医院有多个患者。似乎很明显,我需要在重新采样时对患者的观察结果进行聚类。但是我不知道我是否也应该对医院进行聚类(即对医院重新采样,而不是对患者进行抽样? 我想知道答案是否取决于感兴趣的参数,如果目标是与患者有关而不是与医院有关的东西,那会有所不同吗? 如果有帮助,我在下面列出了Stata代码。 cap program drop est_mhr program define est_mhr, rclass stcox patient_var1 patient_var2 /// , shared(hospital) /// noshow local twoinvtheta2 = 2 / (e(theta)^2) local mhr = exp(sqrt(2*e(theta))*invF(`twoinvtheta2',`twoinvtheta2',0.75)) return scalar mhr = `mhr' end bootstrap r(mhr), reps(50) cluster(hospital): est_mhr


2
Spearman-Brown的预言公式如何受到不同困难的问题的影响?
Spearman-Brown预言公式的结果如何受到具有不同难度或容易或困难的评分者的测验问题的影响?一篇受人尊敬的文字说,SB受到了影响,但未提供详细信息。(请参见下面的引用。) Guion,R.M(2011)。人事决策的评估,度量和预测,第二版。477页 “可以通过使用Spearman-Brown方程合并评估者来提高可靠性。...如果单个评级的可靠性为.50,那么两个,四个或六个并行评级的可靠性将分别约为.67,.80 ,和.86”(休斯顿,雷蒙德和史维克,1991年,第409页)。我喜欢这种说法,因为这个词大致上可以理解,如果所有的假设都按预期进行,则统计估计值是“平均”的陈述。除此之外,操作词是平行的。例如,如果一个评分者系统地宽大,则对评分进行平均(或使用Spearman-Brown),则完全不符合该假设。如果一篇论文的评价是由两个评价者来进行的,一个评价者对另一个评价者比较宽大,那么问题就好比使用两个难度不等(非平行形式)的多项选择题。基于不同(不相等)测试形式的分数无法比较。混合宽松和困难的评估者也是如此;经典测试理论的Spearman-Brown方程错误地估计了合并评级的可靠性。如果每个法官对结构的定义有所不同,情况就更糟了。”

1
蒙特卡洛分析所需的模拟数量
我的问题是有关蒙特卡洛分析方法所需的模拟数量。据我所知,对于任何允许的百分比误差(例如5),所需的仿真次数为 ËËEn = { 100 ⋅ žC⋅ 标准( X )Ë⋅ 平均值(x )}2,ñ={100⋅žC⋅性病(X)Ë⋅意思(X)}2, n = \left\{\frac{100 \cdot z_c \cdot \text{std}(x)}{E \cdot \text{mean}(x)} \right\}^2 , 其中是所得采样的标准偏差,是置信度系数(例如,对于95%,它是1.96)。因此,以这种方式可以检查模拟的结果平均值和标准偏差是否代表置信度为95%的实际平均值和标准偏差。标准(x )性病(X)\text{std}(x)žCžCz_cññn 就我而言,我运行了7500次仿真,并从7500个仿真中计算出每100个样本的移动平均值和标准偏差。我获得的所需模拟次数始终小于100,但均值和标准差与整个结果的均值和标准差的百分比误差并不总是小于5%。在大多数情况下,平均值的百分比误差小于5%,但std的误差高达30%。 在不知道实际均值和标准差的情况下确定所需模拟次数的最佳方法是什么(在我的情况下,模拟结果呈正态分布)? 在此先感谢您的帮助。 为了对无限次运行迭代时模拟结果的分布情况有所了解:我决定找到结果分布的拟合函数,而不是使用n次模拟后的结果均值和方差,但是这里n必须完全填充允许的%错误。我认为通过这种方式,我可以找到与97.5%相关的累积分布函数的更正确结果。因为当我比较400和7000仿真的结果时,两个采样的分布的拟合函数看起来彼此相似,只有第二个曲线更平滑。同样,因此在MATLAB / Simulink中的模型是非线性的,尽管生成的输入参数是正态分布的,但由于我使用了“广义极值分布”,因此模拟结果的直方图也不是正态的,在MATLAB中称为“ gev”。但是,对于这种方法,我还是不太确定,谢谢您提前发出任何命令

1
为什么非正态分布的错误会影响我们的重要性陈述的有效性?
考虑OLS模型时,存在一个正态性假设,即误差是正态分布的。我一直在浏览交叉验证,这听起来像Y和X不一定是正常的,以便使错误正常。我的问题是,为什么当我们出现非正态分布的错误时,重要性声明的有效性受到了损害?为什么置信区间太宽或太窄?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.