统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
寻找平均GPS点
我需要编写一个程序以从大量点中找到平均GPS点。 实际上,发生以下情况: 每个月,一个人记录一个相同静态资产的GPS点。 由于GPS的性质,这些点每个月都会略有不同。 有时,一个人犯了一个错误,并在完全不同的位置记录了错误的资产。 每个GPS点都有确定性权重(HDOP),该权重表示当前GPS数据的准确性。HDOP值较高的GPS点优先于HDOP较低的GPS点。 我如何确定以下内容: 处理具有2个值与单个值(如age)的数据。(找到人口的平均年龄) 确定离群值。在下面的示例中,这些值为[-28.252,25.018]和[-28.632,25.219] 排除异常值后,在其中找到平均GPS点可能是[-28.389,25.245]。 如果可以使用HDOP值为每个点提供的“权重”,那将是一个额外的奖励。
11 outliers  spatial 

3
离散分布近似
当您知道离散分布X的均值\ mu,方差\ sigma ^ 2,偏度\ gamma_1和超峰度\ gamma_2时,对于给定的两个整数m,n逼近的最佳方法是什么,并且从形状\ gamma_1和\ gamma_2的(非零)度量中清楚看出,法线近似不适合吗?米,Ñ μ σ 2 γ 1 γ 2 X γ 1 γ 2P[R [ Ñ ≤ X≤ 米]Pr[n≤X≤m]Pr[n \leq X \leq m]米,Ñm,nm,nμμ\muσ2σ2\sigma^2γ1个γ1\gamma_1γ2γ2\gamma_2XXXγ1个γ1\gamma_1γ2γ2\gamma_2 通常,我会使用带整数校正的正态近似值... P[R [ (Ñ - ½)≤ X≤ (m + ½)] = P[R [ (Ñ - ½)- μσ≤ ž≤ (米+ ½)- …

6
具有背包约束的统计资料库
假设您有200美元的资金来建立(非常)小的统计书籍图书馆。您会选择什么?您可能会假设亚马逊免费送货,并且互联网上任何可免费获取的文本都是公平的游戏,但假设每页打印收取5美分的费用。 (我的灵感来自多佛尔的书,但是他们提供的大多数产品似乎有点过时了)。

3
如何订购或排列一组专家?
我有一个数据库,其中包含一个领域的大量专家。对于每个专家,我都有各种属性/数据点,例如: 多年的经验。 执照 评论数量 这些评论的文字内容 这些评论中的每条评论均获得5星评分,其中包括速度,质量等诸多因素。 奖项,协会,会议等 我想根据他们的重要性给这些专家说10分。一些专家可能缺少一些数据点。现在我的问题是如何提出这样的算法?谁能指出我一些相关的文献? 我也担心,与所有评分/评论一样,该数字可能会在一些值附近聚集。例如,其中大多数可能最终得到8或5。是否有一种方法可以仅将某些属性突出显示小差异,使得分差异更大。 我认为其他一些讨论可能是相关的: 贝叶斯评分系统,每个评分具有多个类别 您将如何计算IMDB电影分级? 选拔专家 输入为上下投票的最佳排名算法是什么?
11 rating  valuation 

1
R中princomp()对象的summary()和loadings()之间有什么区别?
示例代码: (pc.cr <- princomp(USArrests)) summary(pc.cr) loadings(pc.cr) ## note that blank entries are small but not zero 我从每个人那里得到了不同的输出,而且我不确定我理解有什么不同。 这是输出: > summary(pc.cr) Importance of components: Comp.1 Comp.2 Comp.3 Comp.4 Standard deviation 82.8908472 14.06956001 6.424204055 2.4578367034 Proportion of Variance 0.9655342 0.02781734 0.005799535 0.0008489079 Cumulative Proportion 0.9655342 0.99335156 0.999151092 1.0000000000 > loadings(pc.cr) ## note …
11 r  pca 

4
单变量逻辑回归的样本量计算
如何计算一项研究所需的样本量,在该研究中,一组受试者将在手术时测量一个连续变量,然后在两年后将其分类为功能预后或预后不良。 我们想看看这种测量是否可以预测出不良的结果。在某个时候,我们可能想在连续变量中得出一个切入点,在该切入点之上,我们将尝试进行干预以减少结果受损的可能性。 有任何想法吗?任何R实现。


6
介绍概率时,您最喜欢的问题是什么?
我喜欢通过讨论男孩或女孩或贝特朗悖论来引入概率。 还有哪些(简短的)问题/博弈对概率有积极的介绍?(请给每个答复一个答案) PS:这是对概率的简要介绍,但在我看来,它与统计学教学有关,因为它允许进一步讨论离散事件,贝叶斯定理,概率/可测量空间等。
11 teaching 

4
关于临床试验的好的文字?
我是一名本科统计学专业的学生,​​正在寻找一种对临床试验分析进行良好治疗的方法。文字应涵盖实验设计,阻断,功效分析,拉丁方设计和聚类随机化设计等基础知识。 我具有数学统计和实际分析的本科知识,但是如果有很棒的文章需要更高的统计或分析水平,我可以努力解决。

3
什么是一致性检查?
有人问我“您是否在日常工作中进行了一致性检查?”这样的问题。在电话采访生物统计学家的职位时。我不知道该怎么回答。任何信息表示赞赏。
11 validation 

3
难道这些公式转换P,LSD,MSD,HSD,CI,以SE作为一个确切的或夸大/保守估计
背景 我正在进行一项荟萃分析,其中包括以前发布的数据。通常,用P值,最小显着差异(LSD)和其他统计数据报告处理之间的差异,但无法直接估算出差异。 在我使用的模型的上下文中,可以高估方差。 问题 这里是变换来的列表其中(萨维尔2003) ,我考虑,反馈理解; 下面,我假定α = 0.05所以1 - α / 2 = 0.975 和变量是正态分布的,除非另有说明:SESESESE=MSE/n−−−−−−−√SE=MSE/nSE=\sqrt{MSE/n} α = 0.05α=0.05\alpha=0.051 -α/2= 0.9751个-α/2=0.9751-^{\alpha}/_2=0.975 问题: 给定的,Ñ,和治疗手段ˉ X 1和ˉ X 2小号Ë = ˉ X 1 - ˉ X 2PPPññnX¯1个X¯1个\bar X_1X¯2X¯2\bar X_2 小号Ë= X¯1个- X¯2Ť(1 − P2,2 n − 2 )2 / n---√小号Ë=X¯1个-X¯2Ť(1个-P2,2ñ-2)2/ñSE=\frac{\bar X_1-\bar X_2}{t_{(1-\frac{P}{2},2n-2)}\sqrt{2/n}} …


6
将n点李克特量表数据视为来自二项式过程的n次试验是否合适?
我从来没有喜欢过人们通常如何分析李克特量表的数据,就像人们有合理的期望至少在量表的极端情况下违反了这些假设一样,误差是连续的和高斯的。您如何看待以下替代方案: 如果响应在n点尺度上取值为,则将该数据扩展到n个试验,其中k 个试验的值为1,n - k其试验的值为0。因此,我们将李克特量表的响应视为如果它是一系列二项式试验的秘密集合(实际上,从认知科学的角度来看,这实际上是此类决策场景中所涉及机制的吸引人模型)。使用扩展的数据,您现在可以使用混合效应模型,将响应者指定为随机效应(如果有多个问题,还可以将问题指定为随机效应),并使用二项式链接函数指定误差分布。ķkkñnnñnnķkkn − kn−kn-k 任何人都可以看到这种方法的任何假设违规或其他有害方面吗?

2
快速评估(可视化)R中有序分类数据之间的相关性?
我在调查中寻找不同问题的答案之间的相关性(“嗯,让我们看看问题11的答案是否与问题78的答案相关”)。所有答案都是分类的(大多数答案的范围是从“非常不高兴”到“非常高兴”),但是有几个答案却有所不同。它们中的大多数都可以视为序数,因此让我们在这里考虑这种情况。 由于我无权使用商业统计程序,因此必须使用R。 我尝试了Rattle(R的一个免费软件数据挖掘程序包,非常漂亮),但是不幸的是它不支持分类数据。我可以使用的一种技巧是在R中导入具有数字(1..5)的调查的编码版本,而不是“非常不高兴” ...“高兴”,并让Rattle相信它们是数字数据。 我当时想做一个散点图,并且使点的大小与每对数字的数量成正比。经过一番谷歌搜索后,我发现http://www.r-statistics.com/2010/04/correlation-scatter-plot-matrix-for-ordered-categorical-data/,但是(对我来说)这似乎很复杂。 我不是统计学家(而是程序员),但是对此事有一定的了解,如果我理解正确的话,Spearman的观点是合适的。 因此,对于那些急着想解决问题的人来说,这是一个简短的问题:是否有办法快速将Spearman的rho绘制在R中?图形比数字矩阵更可取,因为它更易于观察,也可以包含在材料中。 先感谢您。 PS我考虑了一段时间,是将其发布在主要的SO网站还是此处。在两个网站上搜索R相关性后,我觉得这个网站更适合这个问题。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.