统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
时间线分析
我正在使用来自多个1年出生队列的数据(例如http://www.ncbi.nlm.nih.gov/pmc/articles/PMC2908417/)来研究一个人的出生顺序与以后的肥胖风险之间的关系。 一个关键的挑战是,出生顺序与其他特征(如产妇年龄,年轻和/或较年长的兄弟姐妹的数量以及生育间隔)相关联,这些特征也可能通过不同的机制影响结果。此外,这些因素对以后肥胖风险的任何影响都可以通过兄弟姐妹的性别组成来改变,包括“索引孩子”(出生队列的参与者)。 对于每个索引孩子,可以绘制一个时间表,显示该家庭的所有出生情况,其中母亲的年龄为时间变量。 我正在尝试确定分析此类数据的方法,其中事件的顺序,时间和性质可能都很重要。由于成员使用的应用程序多种多样,我在这里提出这个问题-我希望有人提出一些立即的建议,这些建议将使我花更长的时间才能单独找到。任何在正确方向上的轻推都将不胜感激。 相关问题: 我应该如何分析有关妇女出生间隔的数据?
10 timelines 

3
将类别标签分配给k-均值聚类
关于群集,我有一个非常基本的问题。找到具有质心的k个聚类后,如何解释已聚类的数据点的类(将有意义的类标签分配给每个类)。我不是在谈论对发现的集群的验证。 可以给定一个小的标记数据点集,计算这些标记点属于哪个群集,并根据每个群集接收的点的类型和数量来确定标签吗?这似乎很明显,但我不知道以这种方式将标签分配给群集的标准。 需要明确的是,我想执行不使用任何标签的无监督群集来首先找到我的群集。找到集群之后,我想根据一些示例数据点的属性为集群分配有意义的类标签。
10 k-means 

3
如何可视化贝叶斯拟合优度进行逻辑回归
对于贝叶斯逻辑回归问题,我创建了后验预测分布。我从预测分布中进行采样,对于每个观测值,我都会收到数千个(0,1)的采样。可视化拟合优度并不有趣,例如: 此图显示了1万个样本+观察到的基准点(左侧的一条可以画出一条红线:是的,是观察值)。问题在于该图很难提供信息,我将使用其中的23个,每个数据点一个。 是否有更好的方法可视化23个数据点以及后面的样本。 另一尝试: 基于纸张的另一种尝试这里


3
与在回归中建立多个模型相比,估算的优势是什么?
我想知道是否有人可以提供为什么缺失数据的插补比仅仅为缺失数据的案例建立不同模型更好的见解。尤其是在[广义]线性模型的情况下(我也许可以看到在非线性情况下情况有所不同) 假设我们有基本的线性模型: ÿ= β1个X1个+ β2X2+ β3X3+ ϵÿ=β1个X1个+β2X2+β3X3+ϵ Y = \beta_1 X_1 + \beta_2 X_2 + \beta_3 X_3 + \epsilon 但是我们的数据集包含一些缺少记录。在将使用模型的预测数据集中,也将丢失X 3的情况。似乎有两种方法可以进行:X3X3X_3X3X3X_3 多种型号 我们可以将数据分为和非X 3两种情况,并为每种情况建立一个单独的模型。如果我们假设X 3与X 2紧密相关,则丢失的数据模型可以使X 2超重以获得最佳的二变量预测。同样,如果丢失的数据案例略有不同(由于缺少数据机制),则可以合并该差异。不利的一面是,这两个模型只能分别拟合一部分数据,而不能“互相帮助”,因此在有限的数据集上拟合可能较差。X3X3X_3X3X3X_3X3X3X_3X2X2X_2X2X2X_2 归因 回归多重插补将首先通过基于X 1和X 2建立模型来填充,然后随机采样以保持插补数据中的噪声。由于这又是两个模型,这会不会最终与上述的多模型方法相同?如果它能跑赢大市-收益来自何处?仅仅是X 1的拟合在整个集合上完成了吗?X3X3X_3X1个X1个X_1X2X2X_2X1个X1个X_1 编辑: 尽管到目前为止,Steffan的回答说明,将完整的案例模型拟合到推算的数据上将胜过对完整数据的拟合,而且显然相反的事实是正确的,但是对于缺失数据预测仍然存在一些误解。 如果我拥有上述模型,甚至可以完美拟合,那么如果我在预测时仅输入零,则通常将是一个糟糕的预测模型。可以想象,例如,然后X 2是完全无用的(β 2 = 0),当X 3是存在的,但仍然是在不存在有用的X 3。X2= X3+ ηX2=X3+ηX_2 = X_3+\etaX2X2X_2β2= 0β2=0\beta_2 = 0X3X3X_3X3X3X_3 我不明白的关键问题是:构建两个模型,一个使用和一个使用(X 1,X …

1
统计用于机器学习,论文开始吗?
我具有计算机编程和基本数论方面的背景,但没有进行过实际的统计学培训,并且最近“发现”了一系列技术的惊人领域实际上是一个统计领域。看来矩阵分解,矩阵完成,高维张量,嵌入,密度估计,贝叶斯推断,马尔可夫分区,特征向量计算,PageRank都是高度统计技术,并且使用此类事物的机器学习算法会使用大量统计数据。 我的目标是能够阅读讨论此类问题的论文,并实现或创建算法,同时了解所使用的符号,“证明”和统计参数。我猜最难的是遵循涉及矩阵的所有证明。 哪些基本论文可以帮助我入门?还是一本值得练习的好教科书? 具体来说,我想完全理解的一些文章是: 通过凸优化实现精确的矩阵完成,Candes,Reckt,2008年 快速柯西变换和快速鲁棒线性回归,克拉克森等,2013年 支持向量机的随机投影,Paul等,2013 使用深度密度模型进行高维概率估计,Rippel,Adams,2013年 获取低秩矩阵完成的最小化误差估计和通用明智误差界,Király,Theran,2013年

2
不对称分布的核密度估计
令是从未知(但肯定是非对称的)概率分布中得出的观察结果。{ x1个,… ,xñ}{X1个,…,Xñ}\{x_1,\ldots,x_N\} 我想通过KDE方法找到概率分布: 但是,我尝试使用高斯内核,但是由于它是对称的,因此性能很差。因此,尽管我不了解如何使用它们,但我已经看到一些有关Gamma和Beta内核的工作已经发布。F^(x )= 1ñH∑我= 1ñķ( x − x一世H)F^(X)=1个ñH∑一世=1个ñķ(X-X一世H) \hat{f}(x) = \frac{1}{Nh}\sum_{i=1}^{N} K\bigl(\frac{x-x_i}{h}\bigr) 我的问题是:假设基础分布的支持不在区间,如何处理这种不对称情况?[ 0 ,1 ][0,1个][0,1]


3
掷硬币概率的一个严重的深度问题
可以说我正在掷一万枚硬币。我想知道连续获得4个或更多连续磁头需要多少次翻转。 计数将按以下方式进行,您将计数连续的一轮翻转仅是正面(4头或更多)。当一条尾巴击中并破坏了头的条纹时,计数将从下一次翻转开始。然后重复10,000次翻转。 我想知道不仅连续出现4个或更多磁头的概率,而且是6个或更多,10个或更多的概率。为了澄清是否达到9个头的条纹,将其记为1个条纹4个或更多(和/或6个或更多),而不是2个单独的条纹。例如,如果硬币来到THTHTHTHHHHHH /// THAHTHT...。计数将为13,并在下一条尾部再次开始。 假设数据偏右偏;平均为40次翻转,条纹达到4个或更多,分布为u =28。显然是偏斜的。 我正在尽力寻找一种方法来从描述性数据中弄清楚,除非到目前为止我什么都没发现。 我想找到一种方法来从中获得一些合理的可能性。就像+/- 1 SD为68%的正态曲线等。我研究了对数归一化,它仅真正用于参数测试,这并不是我的目标。 有人告诉我Beta发行版,但我提出的每条建议都令人困惑。我一年前曾问过这个问题,并获得了一些见识,但不幸的是我仍然没有答案。谢谢任何有想法的人。

1
条件密度图的解释
我想知道如何正确解释条件密度图。我在下面用R创建的下面插入了两个cdplot。 例如,当变量1为150时大约80%的结果等于1 的概率吗? 暗灰色区域是Result等于1 的条件概率,对吧? 从cdplot文档中: 在给定y的水平(由y的边际分布加权)的情况下,cdplot计算x的条件密度。密度是在y级别上累积得出的。 这种积累如何影响这些图的解释?


2
对数转换线性回归,对数回归与对数混合模型之间有什么区别?
假设我有10个学生,每个学生都尝试解决20个数学问题。对问题的评分为正确或不正确(在longdata中),每个学生的表现都可以通过准确性度量(在subjdata中)进行总结。下面的模型1、2和4看起来会产生不同的结果,但是我知道它们在做相同的事情。他们为什么产生不同的结果?(我提供了模型3作为参考。) library(lme4) set.seed(1) nsubjs=10 nprobs=20 subjdata = data.frame('subj'=rep(1:nsubjs),'iq'=rep(seq(80,120,10),nsubjs/5)) longdata = subjdata[rep(seq_len(nrow(subjdata)), each=nprobs), ] longdata$correct = runif(nsubjs*nprobs)<pnorm(longdata$iq/50-1.4) subjdata$acc = by(longdata$correct,longdata$subj,mean) model1 = lm(logit(acc)~iq,subjdata) model2 = glm(acc~iq,subjdata,family=gaussian(link='logit')) model3 = glm(acc~iq,subjdata,family=binomial(link='logit')) model4 = lmer(correct~iq+(1|subj),longdata,family=binomial(link='logit'))

3
为通过网站的旅程构建路径概率树
我目前正在网站上进行分析,这要求我创建一个决策树图,以显示人们到达网站时可能采取的路线。我正在处理一个data.frame从首页开始显示所有客户到站点的路径的。例如,客户可以采用以下路径: Homepage - pg 1 Kitchen Items page - pg 2 Pots and Pans page - pg 3 因此该客户将进行3页的旅程。我想在R中尝试做的是结合所有客户路径,从而按照站点上的某个路径为客户分配概率。例如,如果我检查所有路径,我会发现34%的到达首页的人进入了“厨房用品页面”。R有这个设施吗? 我已经通过rpart和partykit软件包查找了不同的方法,但是它们似乎没有任何帮助。 任何朝着正确方向前进的方向都非常感谢!

3
小n大p问题中基于树的集成方法的极限?
基于树的集成方法(例如,Random Forest和随后的导数(例如,条件森林))都声称可用于所谓的“ small n,large p ”问题,以识别相对变量的重要性。确实,情况确实如此,但是我的问题是,这种能力可以走多远?可以说30个观察值和100个变量吗?这种方法的突破点是什么,是否存在任何体面的经验法则?我希望并接受使用模拟或真实数据集的,以实际证据(而非推测)为链接的答案。我对后者没有太多了解(在这里和这里),因此非常欢迎您提出想法/建议/(关于主题)参考建议!

3
两个独立泊松随机变量的加权和
通过使用维基百科,我找到了一种方法来计算由两个泊松随机变量之和得出的概率质量函数。但是,我认为我的方法是错误的。 令是两个独立的Poisson随机变量,均值和,其中和是常数,则的概率生成函数由 现在,利用泊松随机变量的概率生成函数为,我们可以写出两个独立泊松随机变量之和为 X1,X2X1,X2X_1, X_2λ1,λ2λ1,λ2\lambda_1, \lambda_2S2=a1X1+a2X2S2=a1X1+a2X2S_2 = a_1 X_1+a_2 X_2a1a1a_1a2a2a_2S2S2S_2ģ X 我(ż)= È λ 我(ž - 1 )G ^ 小号2(Ž )GS2(z)=E(zS2)=E(za1X1+a2X2)GX1(za1)GX2(za2).GS2(z)=E⁡(zS2)=E⁡(za1X1+a2X2)GX1(za1)GX2(za2). G_{S_2}(z) = \operatorname{E}(z^{S_2})= \operatorname{E}(z^{a_1 X_1+a_2 X_2}) G_{X_1}(z^{a_1})G_{X_2}(z^{a_2}). GXi(z)=eλi(z−1)GXi(z)=eλi(z−1)G_{X_i}(z) = \textrm{e}^{\lambda_i(z - 1)}S2G S 2(z)Pr(S2=k)= G (k )S 2(0)GS2(z)=eλ1(za1−1)eλ2(za2−1)=eλ1(za1−1)+λ2(za2−1).GS2(z)=eλ1(za1−1)eλ2(za2−1)=eλ1(za1−1)+λ2(za2−1). \begin{aligned} G_{S_2}(z) &= \textrm{e}^{\lambda_1(z^{a_1} - 1)}\textrm{e}^{\lambda_2(z^{a_2} - 1)} \\ &= \textrm{e}^{\lambda_1(z^{a_1} …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.