统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
如何计算与异常大的Z分数相关的概率?
用于网络主题检测的软件包可以返回非常高的Z分数(我见过的最高Z分数是600,000+,但是Z分数超过100的情况非常普遍)。我打算证明这些Z分数是伪造的。 巨大的Z得分对应于极低的关联概率。相关概率的值在正态分布的Wikipedia页面(以及可能的每个统计资料教科书)上给出,Z分数最高为6。所以... 问题:如何计算n到1,000,000之间的误差函数?1−erf(n/2–√)1−erf(n/2)1-\mathrm{erf}(n/\sqrt{2}) 我特别希望已经实施了此软件包(如果可能)。到目前为止,我发现的最好的是WolframAlpha,它设法以n = 150(此处)进行计算。

1
为什么在非参数统计中联系如此困难?
我的非参数文本《实践非参数统计》经常为期望,方差,检验统计等提供清晰的公式,但包括警告,只有在我们忽略联系时才有效。在计算Mann-Whitney U统计量时,建议您在比较较大的对数时扔掉配对。 我知道这种联系并不能真正告诉我们哪个人口更大(如果这就是我们感兴趣的人口),因为两个群体都不比另一个更大,但是在开发渐近分布时似乎并不重要。 那为什么在某些非参数过程中如此处理联系呢?有没有办法从关系中提取任何有用的信息,而不是简单地将它们扔掉? 编辑:关于@whuber的评论,我再次检查了我的消息来源,并且某些过程使用了平均等级,而不是完全放弃绑定值。尽管在保留信息方面似乎更明智,但在我看来,它也不够严格。但是,问题的精神仍然存在。

4
在R中计算AUPR
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 8个月前关闭。 在ROC下很容易找到包装计算面积,但是有一个包装在精确召回曲线下计算面积吗?

2
有人可以阐明线性混合效应还是非线性混合效应?
我将要学习R,而我的学习项目将需要对数据集应用混合或随机效应回归,以开发预测方程。我在这篇文章中分享了作者的关注点。 如何为混合效果模型选择nlme或lme4 R库?想知道NLME还是LME4是使自己熟悉的更好的软件包。一个更基本的问题是:线性和非线性混合效应建模之间有什么区别? 作为背景知识,我在我的MS研究中应用了ME建模(在MATLAB中,不是在R中),因此我熟悉固定变量和随机变量的处理方式。但是我不确定我所做的工作是线性的还是非线性的。它仅仅是所用方程式的函数形式还是其他形式?


1
得出总的(类内+类间)散点矩阵
我对PCA和LDA方法很不满意,但我陷入了困境,我感到它是如此简单以至于看不到它。 类内()和类间()散布矩阵定义为:小号乙SWSWS_W小号乙SBS_B 小号w ^= ∑我= 1C∑t = 1ñ(x一世Ť- μ一世)(x一世Ť- μ一世)ŤSW=∑i=1C∑t=1N(xti−μi)(xti−μi)T S_W = \sum_{i=1}^C\sum_{t=1}^N(x_t^i - \mu_i)(x_t^i - \mu_i)^T 小号乙= ∑我= 1Cñ(μ一世- μ )(μ一世- μ )ŤSB=∑i=1CN(μi−μ)(μi−μ)T S_B = \sum_{i=1}^CN(\mu_i-\mu)(\mu_i-\mu)^T 总散射矩阵给出为:小号ŤSTS_T 小号Ť= ∑我= 1C∑t = 1ñ(x一世Ť- μ )(X一世Ť- μ )Ť= Sw ^+ S乙ST=∑i=1C∑t=1N(xti−μ)(xti−μ)T=SW+SB S_T = \sum_{i=1}^C\sum_{t=1}^N(x_t^i - \mu)(x_t^i - \mu)^T = S_W + …


3
分析纵向数据集时使用aov()和lme()有什么区别?
谁能告诉我使用aov()和lme()分析纵向数据之间的区别,以及如何解释这两种方法的结果? 下面,我使用aov()和分析相同的数据集,lme()并得到2个不同的结果。使用时aov(),我在治疗交互作用的时间上得到了显着的结果,但是在拟合线性混合模型时,通过治疗交互作用的时间是无关紧要的。 > UOP.kg.aov <- aov(UOP.kg~time*treat+Error(id), raw3.42) > summary(UOP.kg.aov) Error: id Df Sum Sq Mean Sq F value Pr(>F) treat 1 0.142 0.1421 0.0377 0.8471 Residuals 39 147.129 3.7725 Error: Within Df Sum Sq Mean Sq F value Pr(>F) time 1 194.087 194.087 534.3542 < 2e-16 *** time:treat 1 2.077 …

2
人口密度估计模型
通过为每个形状(例如人口普查区,地区,县,州等多边形)分配恒定的人口/面积值,可以使用(人口,面积,形状)数据库来绘制人口密度图。但是,种群通常在其多边形内并不是均匀分布的。 对称映射是通过辅助数据细化这些密度估计的过程。正如最近的评论所指出的,这是社会科学中的一个重要问题。 然后,假设我们有一个辅助的土地覆盖图(或任何其他离散因子)。在最简单的情况下,我们可以使用明显不适合居住的区域(例如水域)来划定人口不在的区域,并相应地将所有人口分配到其余区域。更一般地,每个单元人口普查被雕刻成具有表面区域部分,。因此,我们的数据集被扩充到元组列表ķ X Ĵ 我我= 1 ,2 ,... ,ķjjjkkkxjixjix_{ji}i=1,2,…,ki=1,2,…,ki = 1, 2, \ldots, k (yj,xj1,xj2,…,xjk)(yj,xj1,xj2,…,xjk)(y_{j}, x_{j1}, x_{j2}, \ldots, x_{jk}) 其中是单位的总体(假定无误差地测量),并且-尽管并非严格如此-我们可以假设每个也都被精确测量。用这些术语,目标是将每个分成一个总和 j x j i y jyjyjy_{j}jjjxjixjix_{ji}yjyjy_{j} yj=zj1+zj2+⋯+zjkyj=zj1+zj2+⋯+zjk y_j = z_{j1} + z_{j2} + \cdots + z_{jk} 其中每个和估计居住在土地覆盖类别单元的人口。估计需要无偏见。此分区通过将密度分配给人口普查多边形与土地覆盖类别的交点来细化人口密度图。 ž Ĵ 我 Ĵ 我ž Ĵ 我 / X Ĵ 我 Ĵ …

2
用简单的英语解释模型调整
阅读有关统计分析的方法和结果,尤其是流行病学方面的信息时,我经常听到有关模型调整或控制的信息。 您如何向非统计人员解释其目的?控制某些变量后,如何解释结果? 只需在Stata或R中进行少量漫游,或在线指向一个指针,便会成为真正的瑰宝。

1
如何确定重复测量方差分析所需的样本量?
我需要有关重复测量方差分析的一些帮助。 我们正在调查某些病房中某些干预措施对降低血流感染(BSI)率的影响。我们计划每月获取一次BSI费率信息,首先是在没有干预的情况下12个月,然后在有干预的情况下12个月。 我们正在考虑进行时间序列或重复测量方差分析,在我对第一个方法没有太多想法之前,我希望使用后一个方法(额外的问题:时间点太少了吧?),但是接下来另一个问题是,我们需要多少病房才能证明干预对BSI率确实有统计学上的显着影响? 我想我要进行两个ANOVA,一个用于“干预之前”,一个用于“干预期间”,并且我认为“ ANOVA”在“干预之前”不应进行显着的F比率检验。 我二维地考虑“样本量”一词,无论是病房数还是重复测量数。


1
熵如何取决于位置和尺度?
密度函数为f的连续分布的熵定义为log (f )期望值的负值,因此等于Fff日志(f),log⁡(f),\log(f), HF= - ∫∞- ∞日志(f(x ))f(x )d x 。Hf=−∫−∞∞log⁡(f(x))f(x)dx.H_f = -\int_{-\infty}^{\infty} \log(f(x)) f(x)\mathrm{d}x. 我们还说,任何分布具有密度f的随机变量XXX都有熵H f。 (即使f为零,该积分也是明确定义的,因为在这样的值下log (f (x ())f (x )可以等于零。)FffHF。Hf.H_f.Fff日志(f(x ))f(x )log⁡(f(x))f(x)\log(f(x))f(x) 当XXX和ÿYY是ÿ= X+ μY=X+μY = X+\mu(μμ\mu为常数)的随机变量时,ÿYY被称为是XXX 移位μ 。μ.\mu. 类似地,当ÿ= XσY=XσY = X\sigma(σσ\sigma是正的常数),ÿYY被说成是一个版本XXX 缩放由σ。σ.\sigma.组合秤与换档给出Y=Xσ+μ.Y=Xσ+μ.Y=X\sigma + \mu. 这些关系经常发生。例如,更改XXX的度量单位将对其进行缩放和缩放。 如何的熵Y=Xσ+μY=Xσ+μY = X\sigma + \mu涉及于的X?X?X?

3
炸弹在哪里:给定行和列的总数,如何估计概率?
这个问题的灵感来自《口袋妖怪魂银》的迷你游戏: 想象一下,在这个5x6区域隐藏了15枚炸弹(编辑:最多1枚炸弹/细胞): 现在,考虑到行/列的总数,您如何估计在特定区域找到炸弹的概率? 如果查看第5列(炸弹总数= 5),那么您可能会认为:在此列中,在第2行中找到炸弹的机会是在第1行中找到一个炸弹的机会的两倍。 直接比例性的这种(错误)假设基本上可以描述为将标准独立性测试操作(例如在Chi-Square中)引入错误的上下文中,将导致以下估计: 如您所见,直接成比例导致概率估计超过100%,甚至在此之前是错误的。 因此,我对所有可能的排列进行了计算仿真,得出了放置15枚炸弹的276种独特可能性。(给出行和列的总数) 以下是276个解决方案的平均值: 这是正确的解决方案,但是由于需要进行指数计算,因此我想找到一种估算方法。 我的问题现在是:是否有一种确定的统计方法来对此进行估算?我想知道这是否是一个已知问题,如何称呼它,以及是否有您可以推荐的论文/网站!

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.