统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
在线性,二次方和费舍尔判别分析上,来源似乎存在分歧
我正在研究判别分析,但在调和几种不同的解释时遇到了困难。我相信我一定会错过一些东西,因为我以前从未遇到过这种(似乎)差异水平。话虽如此,有关该网站上判别分析的问题数量似乎证明了其复杂性。 LDA和QDA几类 我的主要教科书是强生公司的应用多元统计分析(AMSA)和基于此的老师的笔记。我将忽略两组设置,因为我相信此设置中的简化公式至少会引起一些混乱。根据此来源,LDA和QDA被定义为基于预期的误分类成本(ECM)的分类规则的参数(假设多元正态性)扩展。ECM对将新观察值x划分到任何组的条件期望成本求和(包括误分类成本和先验概率),我们选择将其最小化的分类区域。其中ECM=∑i=1groupspi[∑k=1; i≠kgroupsP(k|i)c(k|i)]ECM=∑i=1groupspi[∑k=1; i≠kgroupsP(k|i)c(k|i)]ECM = \sum_{i=1}^{groups} p_i [\sum_{k=1;\space i \ne k}^{groups}P(k|i)c(k|i)]P(k|i)=P(classifying item as group k | item is group i)=∫Rkfi(x)dxP(k|i)=P(classifying item as group k | item is group i)=∫Rkfi(x)dxP(k|i) = P(\text{classifying item as group k } | \text{ item is group i}) = \int_{R_k} f_i(\boldsymbol{x})d\boldsymbol{x},fi(x)fi(x) f_i(\boldsymbol{x})是人口密度,RkRkR_k是k组中的一组观测值,ccc是成本,pipip_i是先验概率。然后可以将新的观测值分配给内部项最小或等效的内部项p_k f_k(\ boldsymbol {x})剩余部分pkfk(x)pkfk(x)p_k …

1
一篇论文提到了“蒙特卡罗模拟以确定主成分的数量”;它是如何工作的?
我正在对MRI数据进行Matlab分析,其中我在尺寸为10304x236的矩阵上执行了PCA,其中10304是体素(以像素为单位)的数量,而236是时间点的数量。PCA给了我236个特征值及其相关系数。一切都很好。但是,当需要确定要保留多少个组件时,我要复制的论文说如下(请让我知道是否需要澄清,因为这只是整篇论文的一小部分): 然后,我们进行了蒙特卡洛模拟以确定每次扫描从讨厌的ROI数据中提取的主要成分(PC)的数量。通过对与编码和静止干扰ROI数据等级相同的正态分布数据执行PCA,分别为每个受试者的编码和静止数据生成了预期特征值的零分布。如果PC的相关特征值超过了来自Monte Carlo模拟的特征值的第99个置信区间,则从真实的ROI数据中选择PC进行给定的休息或编码扫描。 Tambini&Davachi,PNAS,2013年,海马多体素模式在编码后休息中的持久性与记忆有关。 我绝对不知道该怎么办。我习惯于根据解释的累积方差来选择组件。我的想法是这样的: 然后,我们进行了蒙特卡洛模拟以确定每次扫描从讨厌的ROI数据中提取的主要成分(PC)的数量。 蒙特卡洛模拟人生只是意味着要进行以下1000次(或类似次数),对吗? 通过对与编码和剩余扰动ROI数据同等等级的正态分布数据执行PCA,可以生成预期特征值的零分布。 首先,我假设“相等等级”基本上意味着我将创建一个与原始矩阵大小相同的矩阵(10304x236)。就“等秩的正态分布数据”而言……这是否意味着我应该根据正态分布创建一个随机数为10304x236的矩阵?Matlab具有一个称为“ normrnd”的功能,可以执行此操作,但需要输入mu和sigma。我会使用与从初始数据集中获得的相同的mu和sigma吗?这或多或少是“期望特征值”的含义,因为我不知道期望特征值的分布是什么样。 我猜我的问题或多或少是我不知道如何对特征值进行“零分布”。

1
如何在一幅图中绘制拟合的伽玛分布图和实际图?
加载所需的包。 library(ggplot2) library(MASS) 生成10,000个适合伽玛分布的数字。 x <- round(rgamma(100000,shape = 2,rate = 0.2),1) x <- x[which(x>0)] 假设我们不知道x符合哪个分布,则绘制概率密度函数。 t1 <- as.data.frame(table(x)) names(t1) <- c("x","y") t1 <- transform(t1,x=as.numeric(as.character(x))) t1$y <- t1$y/sum(t1[,2]) ggplot() + geom_point(data = t1,aes(x = x,y = y)) + theme_classic() 从图中可以看出,x的分布与伽马分布非常相似,因此fitdistr()在包中使用它MASS可以获取形状和伽马分布速率的参数。 fitdistr(x,"gamma") ## output ## shape rate ## 2.0108224880 0.2011198260 ## (0.0083543575) …

2
如何从非负整数的离散分布中采样?
我有以下离散分布,其中是已知常数:α,βα,β\alpha,\beta p(x;α,β)=Beta(α+1,β+x)Beta(α,β)for x=0,1,2,…p(x;α,β)=Beta(α+1,β+x)Beta(α,β)for x=0,1,2,… p(x;\alpha,\beta) = \frac{\text{Beta}(\alpha+1, \beta+x)}{\text{Beta}(\alpha,\beta)} \;\;\;\;\text{for } x = 0,1,2,\dots 有什么方法可以有效地从这种分布中采样?

3
非随机样本的随机化
我总是对参加实验研究的心理广告感到惊讶。可以肯定的是,对这些广告做出回应的人们并不是随机抽样的,因此是一个自我选择的人群。 因为众所周知,随机化解决了自选问题,所以我想知道非随机样本的随机化是否真的改变了一切。 你怎么看 ?而且,我们应该基于大量自选样本对所有这些心理实验做些什么?

1
方差分析回答什么问题?
我想学习方差分析。在我开始学习算法如何工作(必须进行哪些计算)以及为什么工作之前,我首先想知道我们使用ANOVA实际解决了什么问题,或者我们试图回答什么问题。换句话说:算法的输入是什么,输出是什么? 我确实了解我们用作输入的内容。我们有一组数字。每个数字都带有一个或多个分类变量(也称为“因子”)的值。例如: +------------+------------+-------+ | factor 1 | factor 2 | value | +------------+------------+-------+ | "A" | "a" | 1.0 | | "A" | "a" | 2.4 | | "A" | "b" | 0.3 | | "A" | "b" | 7.4 | | "B" | "a" | 1.2 | | "B" …
10 anova 

3
递归神经网络(LSTM,GRU)的结构
我试图了解RNN的体系结构。我发现本教程非常有帮助:http : //colah.github.io/posts/2015-08-Understanding-LSTMs/ 特别是这张图片: 这如何适应前馈网络?该图像只是每一层中的另一个节点吗?


2
计算互信息时的箱数
我想使用互信息来量化两个变量A和B之间的关系。计算它的方法是对观察值进行分箱(请参见下面的示例Python代码)。但是,什么因素决定合理数量的箱?我需要计算速度快,所以我不能简单地使用很多垃圾箱来保证安全。 from sklearn.metrics import mutual_info_score def calc_MI(x, y, bins): c_xy = np.histogram2d(x, y, bins)[0] mi = mutual_info_score(None, None, contingency=c_xy) return mi

2
R的coxph()究竟如何处理重复的测量?
语境 我试图了解R的coxph()如何接受和处理主题(或患者/客户,如果您愿意的话)的重复条目。有些人称这种长格式,有些人称其为“重复措施”。 例如,请参见以下答案部分中包含ID列的数据集: 协变量随时间变化的最佳Cox模型 还要假设协变量始终随时间变化,并且恰好有一个检查变量(即事件),它是二进制的。 问题 1)在上述链接的答案中,如果在调用coxph()时未提供ID作为参数,结果是否应与将cluster(ID)作为coxph()的参数包含在内? 我试图搜索文档,但以下内容似乎并未明确说明(1):https : //stat.ethz.ch/pipermail/r-help//2013-July/357466.html 2)如果对(1)的回答为“否”,那么(数学上)为什么?似乎coxph()中的cluster()根据pg上的“ cluster”小节在主题之间寻求关联。20点 https://cran.r-project.org/web/packages/survival/survival.pdf 3)含糊的问题:重复测量的coxph()与R的脆弱包装回归方法相比如何? 附加物 以下是有关使用cluster(ID)的提示: 是否存在可重复测量的logrank测试版本? 和: https://stat.ethz.ch/pipermail/r-help//2013-July/357466.html GEE方法:将“ + cluster(subject)”添加到coxph的模型语句中混合模型方法:将“ +(1 | subject)”添加到coxme的模型语句中。 提前致谢!

1
使用中位数计算方差
我有一个一维随机变量,它非常偏斜。为了规范化此分布,我想使用中位数而不是均值。我的问题是:我可以使用公式中的中位数而不是均值来计算分布的方差吗? 即我可以更换 Var(X)=∑[(Xi−mean(X))2]/nVar(X)=∑[(Xi−mean(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{mean}(X))^2]/n 与 Var(X)=∑[(Xi−median(X))2]/nVar(X)=∑[(Xi−median(X))2]/n \mathrm{Var}(X) = \sum[(X_i - \mathrm{median}(X))^2]/n 我这样做的理由是,由于方差是衡量分布的趋势,而分布是集中分布的主要趋势,所以这不应该成为问题,但我正在寻找验证这种逻辑的方法。
10 variance  mean  median 

3
使用回归来投影超出数据范围可以吗?永远不行吗?有时候好吗?
您对使用回归来投影数据范围之外有什么想法?如果我们确定模型遵循线性或幂模型形状,那么超出数据范围的模型是否有用?例如,我的数量受价格驱动。我们应该能够预测我认为超出数据范围的价格。你的想法? VOL PRICE 3044 4.97 2549 4.97 3131 4.98 2708 4.98 2860 4.98 2907 4.98 3107 4.98 3194 4.98 2753 4.98 3228 4.98 3019 4.98 3077 4.99 2597 4.99 2706 4.99 3000 4.99 3022 4.99 3084 4.99 3973 4.99 3675 4.99 3065 4.99 3407 4.99 2359 4.99 2802 4.99 2589 …

1
贝叶斯与蒙特卡洛相结合
我正在阅读变分贝叶斯,据我所知,它归结为这样的想法:使用函数q逼近(其中z是模型的潜在变量,而x是观察到的数据)(z ),假设q分解为q i(z i),其中z i是潜在变量的子集。然后可以证明最优因子q i(z i)为: q ∗p (ž∣ x )p(z∣x)p(z\mid x)žzzXxxq(z)q(z)q(z)qqqq一世(z一世)qi(zi)q_i(z_i)ž一世ziz_iqi(zi)qi(zi)q_i(z_i)q∗i(zi)=⟨lnp(x,z)⟩z/i+const.qi∗(zi)=⟨ln⁡p(x,z)⟩z/i+const. q^*_i(z_i) = \langle \ln p(x, z)\rangle_{z/i} + \text{const.} 其中尖括号表示除以外的所有潜在变量对分布q (z )的期望。ziziz_iq(z)q(z)q(z) 现在,通常通过分析来评估此表达式,以给出近似目标值的准确答案。但是,在我看来,由于这是一个期望,因此一个显而易见的方法是通过抽样来近似该期望。这将为您提供近似目标函数的近似答案,但是它使算法非常简单,甚至在分析方法不可行的情况下。 我的问题是,这是已知方法吗?它有名字吗?是否有理由为什么它可能无法很好地工作,或者可能无法产生如此简单的算法?

1
word2vec中的交叉熵损失的导数
我正在尝试通过CS224D斯坦福大学在线课程材料的第一个问题集解决问题,而我对问题3A遇到一些问题:当使用带有softmax预测函数和交叉熵损失函数的跳过语法word2vec模型时,我们想要计算相对于预测单词向量的梯度。所以给定softmax函数: wi^=Pr(wordi∣r^,w)=exp(wTir^)∑|V|jexp(wTjr^)wi^=Pr(wordi∣r^,w)=exp⁡(wiTr^)∑j|V|exp(wjTr^) \hat{w_i} = \Pr(word_i\mid\hat{r}, w) = \frac{\exp(w_i^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})} 和交叉熵函数: CE(w,w^)=−∑kwklog(wk^)CE(w,w^)=−∑kwklog(wk^)CE(w, \hat{w}) = -\sum\nolimits_{k} w_klog(\hat{w_k}) 我们需要计算∂CE∂r^∂CE∂r^\frac{\partial{CE}}{\partial{\hat{r}}} 我的步骤如下: CE(w,w^)=−∑|V|kwklog(exp(wTkr^)∑|V|jexp(wTjr^))CE(w,w^)=−∑k|V|wklog(exp⁡(wkTr^)∑j|V|exp(wjTr^))CE(w, \hat{w}) = -\sum_{k}^{|V|} w_klog(\frac{\exp(w_k^T \hat{r})}{\sum_{j}^{|V|}exp(w_j^T\hat{r})}) =−∑|V|kwklog(exp(wTkr^)−wklog(∑|V|jexp(wTjr^))=−∑k|V|wklog(exp⁡(wkTr^)−wklog(∑j|V|exp(wjTr^))= -\sum_{k}^{|V|} w_klog(\exp(w_k^T \hat{r}) - w_klog(\sum_{j}^{|V|}exp(w_j^T\hat{r})) 现在给定是一个热向量,而我是正确的类:wkwkw_k CE(w,w^)=−wTir^+log(∑|V|jexp(wTjr^))CE(w,w^)=−wiTr^+log(∑j|V|exp(wjTr^))CE(w, \hat{w}) = - w_i^T\hat{r} + log(\sum_{j}^{|V|}exp(w_j^T\hat{r})) ∂CE∂r^=−wi+1∑|V|jexp(wTjr^)∑|V|jexp(wTjr^)wj∂CE∂r^=−wi+1∑j|V|exp(wjTr^)∑j|V|exp(wjTr^)wj\frac{\partial{CE}}{\partial{\hat{r}}} = -w_i + \frac{1}{\sum_{j}^{|V|}exp(w_j^T\hat{r})}\sum_{j}^{|V|}exp(w_j^T\hat{r})w_j 这是正确的还是可以进一步简化?我想尝试确保自己走在正确的轨道上,因为问题集解决方案未在线发布。另外,正确完成书面作业对正确完成编程作业很重要。

2
病例对照研究中的成活率趋势
我提交的一篇文章由于执行生存分析的方法不正确而被拒绝。裁判员除了:“对时间趋势进行生存分析需要更复杂的审查方式”之外,没有留下其他细节或解释。 问题: 在过去的几十年中,吸烟者死亡的额外风险是否有所降低? 数据: 德国有25,000名烟民。在1995年至2014年之间的任何时间,他们都被纳入了该队列。每个吸烟者(在入组时)都已与性别和年龄相匹配的对照组(未吸烟者)进行了匹配。对于整个学习期间死亡的每个人,我都有确切的死亡时间。那些在随访期间未死亡的人将受到审查。该研究旨在检查1995年至2014年期间每年吸烟者的额外死亡风险。 目的是计算: 每年吸烟者和非吸烟者的死亡率发生率,并研究这些趋势 每年(或连续几年)吸烟者死亡的额外风险。 应该如何分析数据?回想一下,1998年被包括在内的某人可能会在2015年去世。是否每年都使用使用开始和结束的计数过程格式的正确方法? 这是裁判员不喜欢的方法: 发病率通过泊松回归法计算。我们在模型中纳入了随访时间作为补偿,并在模型中纳入了年龄,性别,吸烟状况和日历期间(连续两年)。然后,使用R的predict()函数计算每1000人年的比率。偏移量(跟进时间)是指从入学起的整个观察时间(天)。 使用Cox模型估算从研究开始到结束的每个时期吸烟者的相对风险。为简单起见,我们将第一个时期的危险比与最后一个时期的危险比进行了比较。 问题:-一个人(连同他的控制权)可能在1998年被包括在内,因此属于该日历组,但在2006年遭受一个事件。-应该如何布置数据以进行Poisson和Cox回归分析?考克斯的计数过程?什么是开始和停止时间?-在这种情况下如何评估趋势? 需要说明的是:假设某位患者在1998年6月15日首次被观察到,并且经历了1998年12月31日的事件,该患者的时间变量值为730个可能的天中的182.5天,因为该时间段由随后的2年组成。每个时间段内观察到的最大时间为730天。 如果在一个时间段内观察到患者,但在另一个时间段内对患者进行检查(即经历过事件,事件或辍学),那么应该将观察到的天数添加到下一个时间段内吗? 因此,主要问题是后续时间和日历年度(用作连续两个年度的分类变量)的处理。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.