统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
当是概率密度函数时如何找到?
我该如何解决?我需要中间方程式。也许答案是。−tf(x)−tf(x)-tf(x) ddt[∫∞txf(x)dx]ddt[∫t∞xf(x)dx] \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] f(x)f(x)f(x)是概率密度函数。 也就是说,和\ lim \ limits_ {x \ to \ infty} F(x)= 1limx→∞f(x)=0limx→∞f(x)=0\lim\limits_{x \to \infty} f(x) = 0limx→∞F(x)=1limx→∞F(x)=1\lim\limits_{x \to \infty} F(x) = 1 来源:http: //www.actuaries.jp/lib/collection/books/H22/H22A.pdf第40页 尝试下面的中间方程式: ddt[∫∞txf(x)dx]=ddt[[xF(x)]∞t−∫∞tF(x)dx]??ddt[∫t∞xf(x)dx]=ddt[[xF(x)]t∞−∫t∞F(x)dx]?? \frac{d}{dt} \left [\int_t^\infty xf(x)\,dx \right ] = \frac{d}{dt} \left [\left [xF(x) \right ]_t^\infty - \int_t^\infty F(x)\,dx …

3
如何选择置信度?
我经常使用90%的置信度,因为它比95%或99%具有更大的不确定性。 但是,关于如何选择正确的置信度水平有任何指导原则吗?还是不同领域使用的置信度准则? 此外,在解释和显示置信度时,是否有任何指南将数字转换为语言?例如,诸如针对Pearson's r的指南(编辑:这些描述适用于社会科学): http://faculty.quinnipiac.edu/libarts/polsci/Statistics.html 更新资料 感谢您下面的回答。他们都很乐于助人,有见地和有启发性。 此外,以下是一些不错的文章,这些文章是我在研究此问题时遇到的有关选择重要性级别(基本上是同一问题)的文章。他们验证以下答案中的内容。 “ 0.05的显着性意义是什么?” http://www.p-value.info/2013/01/whats-significance-of-005-significance_6.html “关于.05级统计意义的起源” http://www.radford.edu/~jaspelme/611/Spring-2007/Cowles-n-Davis_Am-Psyc_orignis-of-05-level.pdf “科学方法:统计错误” http://www.nature.com/news/scientific-method-statistical-errors-1.14700


3
实验设计中可能存在的混淆
问题概述 警告:这个问题需要很多设置。请多多包涵。 我和我的一位同事正在进行实验设计。设计必须解决许多约束,我将在下面列出。我已经开发出一种可以满足约束条件的设计,并且可以对我们的利益产生无偏的估计。但是,我的同事认为设计中存在混淆。我们在没有解决问题的情况下就这一点进行了辩论,因此,在此我想提出一些外部意见。 我将在下面描述研究的目标,我们的制约因素,潜在的困惑以及为什么我相信这个“​​困惑”不是问题。在阅读每一部分时,请记住我的总体问题: 我描述的设计中是否有混淆? [此实验的细节已修改,但提出我的问题所需的基本要素保持不变] 实验目标 我们希望确定白人男性撰写的论文是否比白人女性,黑人男性或黑人女性撰写的论文(论文作者身份变量)更受好评。我们还希望确定我们发现的任何偏差在高质量或低质量的赠款(质量变量)中是否显示更多。最后,我们希望包括有关12个不同主题(主题变量)的论文。但是,只有前两个变量具有实质意义。尽管主题必须随文章的不同而不同,但是我们对评估在主题之间的不同方式没有实质性的兴趣。 约束条件 我们可以收集的参与者数量和论文数量都有限制。结果是,作者身份不能完全在参与者之间操纵,也不能完全在论文之间操纵(即,每篇单独的论文必须分配给多个条件)。 尽管每篇文章都可以有白人,白人,黑人和黑人女性,但是每篇文章只能是高质量和低质量之一,并且只能涉及一个主题。或者,以不同的方式施加此约束,论文中的质量和主题都无法操纵,因为它们是给定论文的固有特征。 由于疲劳,给定参与者可以评估的论文数量有限。 给定人员阅读的所有文章都必须与单个主题有关。换句话说,不能将论文完全随机地分配给参与者,因为我们需要确保每个参与者仅阅读相似主题的论文。 每个参与者只能查看一个据称由非白人男性作者撰写的论文,因为我们不希望参与者对实验的目的产生怀疑,因为他们的论文太多是由黑人或女性作者撰写的。 拟议的设计 我提出的设计首先将每篇文章分成4种不同的作者版本(白人男性,白人女性等)。然后,使用来自相似主题的四篇论文来定义一个“集合”,每篇论文都由两篇高质量和两篇低质量的论文组成。每个参与者从给定的集合中收到三篇论文,如下图所示。然后,每个参与者对他或她分配的三篇论文中的每篇论文都提供一个单独的评分。 潜在的困惑 我的同事认为上述设计存在混淆。他说,问题在于,当高质量的论文被指派由非白人男性作家撰写时,它总是与一篇高质量的论文和一部劣质的论文配对(关于论文1,请参见参与者1-3在图中)。另一方面,当同一篇论文被指派由白人男性作家撰写时,它与一部高质量的论文和一部低质量的论文配对三遍(对于论文1,参与者4-6)和两篇低质量的论文三对。次(论文1,参与者7-9)。 低质量的论文也存在类似的问题。当低质量的论文有非白人男性作者时,通常会以低质量的论文和高质量的论文来见(关于论文3,请参见参与者7-9)。但是,当同一篇文章中有一位白人男性作者时,可以看到一篇高质量的论文和一篇低质量的论文三遍(对于论文3,参与者10-12),而两次高质量的论文则是三遍(对于论文3,参与者1-3)。 上述模式可能存在问题的原因是,如果我们假设存在“对比效果”。具体而言,如果将高质量的论文与两份低质量的论文搭配在一起比在一篇低质量的论文和一份高质量的论文(合理的假设)上配对的平均评价更好,那么白人男性论文可能会获得比白人女性,黑人男性和黑人女性散文是作者身份以外的原因。 低质量论文的对比效果可能会或可能不会平衡高质量论文的对比效果;也就是说,对低质量论文和两篇高质量论文进行配对的情况可能会,也可能不会,特别是不利。无论如何,我的同事认为,任何形式的对比效果都可能使该设计成为问题,以便确定白人男性撰写的论文是否比其他作者的论文更受好评。 为什么我相信潜在的困惑不是问题 对我来说重要的是,即使存在对比效应,我们是否能够估计白人男性论文与其他论文的评价程度(即我们是否可以估计我们感兴趣的效果)。因此,我进行了一次模拟,在其中模拟了50个包含对比效果并适合测试我们感兴趣的效果的数据集。 具体模型是一种混合效果模型,具有随机的文章截距(每篇论文由多个参与者评估)和参与者(每个参与者评估多篇论文)。文章级别还包含种族,性别及其相互作用的随机斜率(这两个变量都在文章中操纵),参与者级别也包含质量的随机斜率(质量在参与者内部操纵)。兴趣的影响是种族,性别,种族与性别之间的相互作用以及这些变量和质量中的每一个之间的高级交互作用的影响。此模拟的目的是确定在数据中引入对比效果是否会造成种族,性别,种族与性别之间的相互作用,以及这些变量和质量之间的高级交互作用。有关更多详细信息,请参见下面的代码块。 根据模拟,对比效果的存在不会使我们感兴趣的任何效果的估计值产生偏差。此外,可以在与设计中其他效果相同的统计模型中估算对比效果的大小;对我来说,这已经表明我的同事所确定的“对比效果”并不是一个困惑。但是,我的同事仍然持怀疑态度。 require(lme4) require(plyr) participant <- rep(1:12, 3) essay <- c(rep(1, 9), rep(2, 9), rep(3, 9), rep(4, 9)) quality <- ifelse(essay == 1 | essay == 2, …


2
偏离ANOVA中的正态性假设:峰度或偏度更重要吗?
Kutner等人应用线性统计模型。陈述了以下有关偏离ANOVA模型正态性假设的内容:就推断的影响而言,误差分布的峰度(比正态分布或多或少达到峰值)比分布的偏度更为重要。 我对此声明感到有点困惑,并且没有在书中或在线上找到任何相关信息。我很困惑,因为我还了解到,尾巴较重的QQ曲线表明线性回归模型的正态性假设“足够好”,而偏斜的QQ曲线则更受关注(即,进行转换可能会合适) 。 我是否对ANOVA进行同样的推理,并且对单词的选择(就推理的影响而言更重要)选择得很差,是否正确?也就是说,偏斜的分布会产生更严重的后果,应避免,而少量峰度是可以接受的。 编辑:正如rolando2所说,很难说一个在所有情况下都比另一个更重要,但是我只是在寻找一些一般的见识。我的主要问题是,我被告知,在简单的线性回归中,尾巴较重(=峰度?)的QQ曲线是可以的,因为F检验对此非常有力。另一方面,倾斜的QQ曲线(抛物线形)通常是一个更大的问题。尽管ANOVA模型可以转换为回归模型,并且应该具有相同的假设,但这似乎与我的教科书为ANOVA提供的指导方针直接背道而驰。 我确信我忽略了某件事,或者我有一个错误的假设,但是我无法弄清楚这可能是什么。

2
Wishart-Wishart后验的参数是什么?
当推断用于生成 D维向量的正态分布的精度矩阵时 我们通常将Wishart放在之前,因为Wishart分布是具有已知均值和未知方差的多元正态分布的命题: 其中是自由度和的ΛΛ\boldsymbol{\Lambda}NNNx1,..,xNx1,..,xN\mathbf{x_1},..,\mathbf{x_N} xi∼N(μ,Λ−1)xi∼N(μ,Λ−1)\begin{align} \mathbf{x_i} &\sim \mathcal{N}(\boldsymbol{\mu, \Lambda^{-1}}) \\ \end{align}ΛΛ\boldsymbol{\Lambda}Λ∼W(υ,Λ0)Λ∼W(υ,Λ0)\begin{align} \mathbf{\Lambda} &\sim \mathcal{W}(\upsilon, \boldsymbol{\Lambda_0}) \\ \end{align}υυ\upsilonΛ0Λ0\boldsymbol{\Lambda_0}比例矩阵。为了增加模型的鲁棒性和灵活性,我们对Wishart的参数设置了优先级。例如,Görür和Rasmussen建议: 其中是伽马分布。Λ01υ−D+1∼W(D,1DΛx)∼G(1,1D)Λ0∼W(D,1DΛx)1υ−D+1∼G(1,1D)\begin{align} \mathbf{\Lambda_0} &\sim \mathcal{W}(D, \frac{1}{D}\boldsymbol{\Lambda_x}) \\ \frac{1}{\upsilon-D + 1} &\sim \mathcal{G}(1, \frac{1}{D}) \\ \end{align}GG\mathcal{G} 题: 为了采样Λ0Λ0\boldsymbol{\Lambda_0} p(Λ0|X,Λ,υ,D,Λx)∝W(Λ|υ,Λ0)W(Λ0|D,1DΛx)p(Λ0|X,Λ,υ,D,Λx)∝W(Λ|υ,Λ0)W(Λ0|D,1DΛx)\begin{align} p(\boldsymbol{\Lambda_0 | X, \Lambda}, \upsilon, D, \boldsymbol{\Lambda_x}) \propto \mathcal{W}(\boldsymbol{\Lambda} | \upsilon, \boldsymbol{\Lambda_0}) \mathcal{W}(\boldsymbol{\Lambda_0} |D, \frac{1}{D}\boldsymbol{\Lambda_x}) \\ …

1
如何读取邓恩测试的结果?
我如何阅读邓恩 测试的结果?具体来说,下表中的值告诉我什么? 我有4组的非参数数据,我首先进行了Kruskal-Wallis检验,以确认各组的分布彼此之间以及汇总数据集之间是不同的。然后,我使用Dunn的检验来查看哪些组彼此不同,哪些没有。 library(dunn.test) dunn.test(data, g=area, kw=TRUE) Kruskal-Wallis rank sum test data: x and area Kruskal-Wallis chi-squared = 1730.4401, df = 3, p-value = 0 Comparison of x by area (No adjustment) Row Mean-| Col Mean | A B C ---------+--------------------------------- B | 20.62310 | 0.0000 | C | 26.66519 …


3
仅给出边际计数的联合分布的最大似然估计
令是两个类别变量的联合分布,其中。说从该分布中抽取了样本,但仅给出了边际计数,即: X ,ÿ X ,ÿ ∈ { 1 ,... ,ķ } Ñ Ĵ = 1 ,... ,ķpx,ypx,yp_{x,y}X,YX,YX,Yx,y∈{1,…,K}x,y∈{1,…,K}x,y\in\{1,\ldots,K\}nnnj=1,…,Kj=1,…,Kj=1,\ldots,K Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j),Sj=∑i=1nδ(Xi=l),Tj=∑i=1nδ(Yi=j), S_j = \sum_{i=1}^{n}{\delta(X_i=l)}, T_j = \sum_{i=1}^{n}{\delta(Y_i=j)}, 给定,的最大似然估计是?这是已知的吗?计算上可行吗?除了机器学习之外,还有其他合理的方法来解决这个问题吗?小号Ĵ,Ť Ĵpx,ypx,yp_{x,y}Sj,TjSj,TjS_j,T_j

3
可视化4维数据有哪些流行的选择?
假设我有以下四个维度的数据,其中前三个可以视为坐标,最后一个可以视为值。 c1, c2, c3, value 1, 2, 6, 0.456 34, 34, 12 0.27 12, 1, 66 0.95 如何更好地可视化前三个坐标对最后一个值的影响? 我知道三种方法。 一个是前三个坐标的3D图,以点的大小作为四个值。但是要看到数据的趋势并不是那么容易。 另一种方法是使用一系列3D图,每个图的坐标都固定。 另一个可能是R晶格中的所谓“网格图”。虽然不是出于这个目的,但看起来确实如此。

1
R中具有回归样条的Logistic回归
我一直在根据英国颅脑损伤国家创伤数据库的回顾性数据开发逻辑回归模型。关键结果是30天死亡率(称为“生存”度量)。在以前的研究中,已公开证据表明对结果有重大影响的其他措施包括: Year - Year of procedure = 1994-2013 Age - Age of patient = 16.0-101.5 ISS - Injury Severity Score = 0-75 Sex - Gender of patient = Male or Female inctoCran - Time from head injury to craniotomy in minutes = 0-2880 (After 2880 minutes is defined as a …

1
如何在MCMC中解释自相关图
通过阅读John K. Kruschke 的《做贝叶斯数据分析》一书,我也熟悉贝叶斯统计数据,该书也被称为“小狗书”。在第9章中,通过以下简单示例介绍了层次模型: 和伯努利观察是3枚硬币,每次10个翻转。一个显示9个头,另一个显示5个头,另一个显示1个头。yjiθjμκ∼Bernoulli(θj)∼Beta(μκ,(1−μ)κ)∼Beta(Aμ,Bμ)∼Gamma(Sκ,Rκ)yji∼Bernoulli(θj)θj∼Beta(μκ,(1−μ)κ)μ∼Beta(Aμ,Bμ)κ∼Gamma(Sκ,Rκ)\begin{align} y_{ji} &\sim {\rm Bernoulli}(\theta_j) \\ \theta_j &\sim {\rm Beta}(\mu\kappa, (1-\mu)\kappa) \\ \mu &\sim {\rm Beta}(A_\mu, B_\mu) \\ \kappa &\sim {\rm Gamma}(S_\kappa, R_\kappa) \end{align} 我已经使用pymc来推断超参数。 with pm.Model() as model: # define the mu = pm.Beta('mu', 2, 2) kappa = pm.Gamma('kappa', 1, 0.1) # define the prior …

4
多大比例的独立分布给出正态分布?
两个独立正态分布的比率给出柯西分布。t分布是正态分布除以独立的卡方分布。两个独立的卡方分布的比率给出F分布。 我正在寻找独立连续分布的比率,该比率给出均值和方差正态分布随机变量?σ 2μμ\muσ2σ2\sigma^2 可能有无限可能的答案。您能给我一些可能的答案吗?如果要计算比率的两个独立分布相同或至少具有相似的方差,我将特别感激。

3
了解用于线性回归的高斯基函数参数
我想将高斯基函数应用到线性回归实现中。不幸的是,我很难理解基本函数中的几个参数。特别是和。μμ\muσσ\sigma 我的数据集是10,000 x 31矩阵。10,000个样本和31个功能。我已经读过“每个基函数将输入向量x转换为标量值”。所以我假设x是1个样本,所以是1 x 31向量。从这里我很困惑。参数到底是什么?我已经读到,这支配着基本函数的位置。那这不是什么意思吗?我也被下标j(和)所,这让我想到了第j行。但这似乎没有道理。是载体?现在为μjμj\mu_jμμ\muϕϕ\phiμjμj\mu_jσσ\sigma“控制空间规模”。那到底是什么 我已经看到一些实现对此参数尝试使用.1,.5、2.5之类的实现。这些值如何计算?我一直在进行研究并寻找可以学习的例子,但到目前为止我还没有找到任何例子。任何帮助或指示将不胜感激!谢谢。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.