统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
转换数据:所有变量还是非常规变量?
在Andy Field的《使用SPSS发现统计信息》中,他指出必须对所有变量进行转换。 但是,在出版物:“使用地理加权回归研究土地利用与水质之间的空间变化关系I:模型设计和评估”中,他们特别指出,只有非正态变量才被转换。 这种分析具体吗?例如,在均值比较中,将日志与原始数据进行比较显然会产生显着差异,而当使用类似回归的方法来调查变量之间的关系时,它就变得不那么重要了。 编辑:这是“数据转换”部分中的全文页面: 这是论文的链接:http : //www.sciencedirect.com/science/article/pii/S0048969708009121

3
如何以编程方式检测数据序列的片段以适合不同的曲线?
是否有记录在案的算法将给定数据集的各个部分分成最适合的不同曲线? 例如,大多数查看此数据图表的人都可以将其轻松分为3部分:正弦曲线段,线性段和反指数段。实际上,我是用正弦波,一条直线和一个简单的指数公式制作的。 是否存在用于查找类似零件的现有算法,然后可以将这些零件分别拟合到各种曲线/线上以形成一种最佳数据子集的复合系列? 请注意,尽管示例中段的末端几乎对齐,但这并不一定是这种情况。在分段截止时,这些值也可能突然震荡。也许这些情况将更容易发现。 更新:这是一小部分真实数据的图像: 更新2:这是一组非常小的实际数据集(仅509个数据点): 4,53,53,53,53,58,56,52,49,52,56,51,44,39,39,39,37,33,27,21,18,12,19,30,45,66,92,118,135,148,153,160,168,174,181,187,191,190,191,192,194,194,194,193,193,201,200,199,199,199,197,193,190,187,176,162,157,154,144,126,110,87,74,57,46,44,51,60,65,66,90,106,99,87,84,85,83,91,95,99,101,102,102,103,105,110,107,108,135,171,171,141,120,78,42,44,52,54,103,128,82,103,46,27,73,123,125,77,24,30,27,36,42,49,32,55,20,16,21,31,78,140,116,99,58,139,70,22,44,7,48,32,18,16,25,16,17,35,29,11,13,8,8,18,14,0,10,18,2,1,4,0,61,87,91,2,0,2,9,40,21,2,14,5,9,49,116,100,114,115,62,41,119,191,190,164,156,109,37,15,0,5,1,0,0,2,4,2,0,48,129,168,112,98,95,119,125,191,241,209,229,230,231,246,249,240,99,32,0,0,2,13,28,39,15,15,19,31,47,61,92,91,99,108,114,118,121,125,129,129,125,125,131,135,138,142,147,141,149,153,152,153,159,161,158,158,162,167,171,173,174,176,178,184,190,190,185,190,200,199,189,196,197,197,196,199,200,195,187,191,192,190,186,184,184,179,173,171,170,164,156,155,156,151,141,141,139,143,143,140,146,145,130,126,127,127,125,122,122,127,131,134,140,150,160,166,175,192,208,243,251,255,255,255,249,221,190,181,181,181,181,179,173,165,159,153,162,169,165,154,144,142,145,136,134,131,130,128,124,119,115,103,78,54,40,25,8,2,7,12,25,13,22,15,33,34,57,71,48,16,1,2,0,2,21,112,174,191,190,152,153,161,159,153,71,16,28,3,4,0,14,26,30,26,15,12,19,21,18,53,89,125,139,140,142,141,135,136,140,159,170,173,176,184,180,170,167,168,170,167,161,163,170,164,161,160,163,163,160,160,163,169,166,161,156,155,156,158,160,150,149,149,151,154,156,156,156,151,149,150,153,154,151,146,144,149,150,151,152,151,150,148,147,144,141,137,133,130,128,128,128,136,143,159,180,196,205,212,218,222,225,227,227,225,223,222,222,221,220,220,220,220,221,222,223,221,223,225,226,227,228,232,235,234,236,238,240,241,240,239,237,238,240,240,237,236,239,238,235 这,绘制,与appoximate的位置有些已知的真实世界元素边用虚线标记,奢侈品,我们通常不会有: 然而,我们确实拥有的一种奢望是事后观察:就我而言,数据不是时间序列,而是与空间相关的。一次分析整个数据集(通常为5000-15000个数据点)是有意义的,而不是持续进行。

3
铰链损失与物流损失的优缺点/局限性
铰链损失可以使用定义max(0,1−yiwTxi)max(0,1−yiwTxi)\text{max}(0, 1-y_i\mathbf{w}^T\mathbf{x}_i)和日志损失可以被定义为log(1+exp(−yiwTxi))log(1+exp⁡(−yiwTxi))\text{log}(1 + \exp(-y_i\mathbf{w}^T\mathbf{x}_i)) 我有以下问题: 铰链丢失是否存在任何缺点(例如,对http://www.unc.edu/~yfliu/papers/rsvm.pdf中提到的异常值敏感)? 一个与另一个相比有什么区别,优点和缺点?

3
推导OLS估计量的假设
有人可以为我简要解释一下,为什么要计算OLS估计量需要六个假设中的每一个?我只发现了多重共线性-如果存在多重共线性,则无法求反(X'X)矩阵,进而无法估计总体估计量。其他的怎么样(例如,线性度,零均值误差等)?

4
样本量很大时的置信区间
我的问题可以改写为“如何使用大数据评估抽样误差”,特别是对于期刊出版物。这是说明挑战的示例。 通过一个非常大的数据集(来自100多家医院的100000例独特患者及其处方药),我有兴趣估算服用特定药物的患者比例。得到这个比例很简单。它的置信区间(例如,参数或自举)非常紧密/狭窄,因为n非常大。尽管样本量很大很幸运,但我仍在寻找一种方法来评估,呈现和/或可视化某些形式的错误概率。尽管置入/可视化置信区间似乎无益(如果没有误导)(例如95%CI:.65878-.65881),但似乎也无法避免一些不确定性陈述。 请让我知道你的想法。我将不胜感激有关该主题的任何文献。即使样本量很大也可以避免对数据过度自信的方法。

1
为什么混合效应模型可以解决依赖关系?
假设我们对学生考试成绩如何受到这些学生学习时间的影响感兴趣。为了探究这种关系,我们可以运行下面的线性回归: exam.gradesi=a+β1×hours.studiedi+eiexam.gradesi=a+β1×hours.studiedi+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + e_i 但是,如果我们从几所不同的学校对学生进行抽样调查,我们可能期望同一所学校的学生比来自不同学校的学生彼此更相似。为了解决此依赖性问题,许多教科书/网络上的建议是运行混合效果并以随机效果进入学校。因此,该模型将成为: exam.gradesi=a+β1×hours.studiedi+schoolj+eiexam.gradesi=a+β1×hours.studiedi+schoolj+ei \text{exam.grades}_i = a + \beta_1 \times \text{hours.studied}_i + \text{school}_j + e_i 但为什么这个解决依赖问题存在于线性回归? 请回应,就像您正在与12岁的孩子聊天一样

1
Logistic回归和支持向量机之间的区别?
我知道逻辑回归可以找到一个将训练样本分开的超平面。我也知道,支持向量机会找到具有最大余量的超平面。 我的问题:逻辑回归(LR)和支持向量机(SVM)之间的区别是,LR找到任何将训练样本分开的超平面,而SVM找到具有最大余量的超平面吗?还是我错了? 注意:记得在LR中,当,逻辑函数给出。如果我们假设作为分类阈值,则是超平面或决策边界。θ ·&X = 0θ⋅X=0\theta \cdot x = 00.50.50.50.50.50.5θ ·&X = 0θ⋅X=0\theta \cdot x = 0

1
为什么添加滞后效应会增加贝叶斯分层模型中的平均偏差?
背景:我目前正在做一些比较各种贝叶斯层次模型的工作。数据是参与者i和时间j的幸福感的数字量度。我大约有1000位参与者,每位参与者5到10个观察值。ÿ我Ĵÿ一世Ĵy_{ij}一世一世iĴĴj 像大多数纵向数据集一样,我希望看到某种形式的自相关,其中时间上较近的观测值比距离较远的观测值具有更大的相关性。简化几件事,基本模型如下: ÿ我Ĵ〜ñ(μ我Ĵ,σ2)ÿ一世Ĵ〜ñ(μ一世Ĵ,σ2)y_{ij} \sim N(\mu_{ij}, \sigma^2) 我在比较无滞后模型的地方: μ我Ĵ= β0 我μ一世Ĵ=β0一世\mu_{ij} = \beta_{0i} 使用滞后模型: μ我Ĵ= β0 我+ β1个(yi (j − 1 )- β0 我)μ一世Ĵ=β0一世+β1个(ÿ一世(Ĵ-1个)-β0一世)\mu_{ij} = \beta_{0i} + \beta_{1} (y_{i(j-1)} - \beta_{0i}) 其中是一个人级的均值和ββ0 我β0一世\beta_{0i}β1个β1个\beta_1ÿ我0ÿ一世0y_{i0} 我得到的结果表明: 滞后参数约为0.18,95%CI [.14,.21]。即非零 当模型中包含滞后时,平均偏差和DIC都会增加数百 后验预测检查表明,通过包括滞后效应,模型可以更好地恢复数据中的自相关 因此,总的来说,非零滞后参数和后验预测表明滞后模型更好。但均值偏差和DIC表明无滞后模型更好。这让我感到困惑。 我的一般经验是,如果添加有用的参数,则至少应减少平均偏差(即使在复杂度降低后DIC也不会得到改善)。此外,滞后参数的零值将实现与无滞后模型相同的偏差。 题 为什么即使滞后参数不为零并且增加滞后效应,也可以增加贝叶斯分层模型中的平均偏差,从而改善后验预测性检查? 最初的想法 我已经做了很多 收敛性检查(例如,查看轨迹图;检查跨链和跨运行的偏差结果的变化),并且两个模型似乎都收敛于后验。 我已经执行了代码检查,将滞后效应强制为零,这确实恢复了无滞后模型偏差。 我还研究了平均偏差减去惩罚值,该偏差值应使偏差超出预期值,这也使滞后模型显得更糟。 β0iβ0i\beta_{0i} 我如何估计第一次观察之前的隐含时间点可能存在一些问题。 在此数据中,滞后效应可能只是微弱的 我尝试使用lme与的最大相似度来估计模型correlation=corAR1()。滞后参数的估计值非常相似。在这种情况下,与没有滞后的模型相比,滞后模型具有更大的对数可能性和较小的AIC(大约100)(即,它表明滞后模型更好)。因此,这加强了这样的想法,即增加滞后还应降低贝叶斯模型中的偏差。 …

2
GLM:验证分发和链接功能的选择
我有一个采用高斯分布和对数链接函数的广义线性模型。拟合模型后,我检查残差:QQ图,残差与预测值,残差的直方图(确认需要格外小心)。一切看起来都很好。(对我而言)这似乎表明,选择高斯分布非常合理。或者至少,残差与我在模型中使用的分布一致。 问题1:声明它能验证我的发行选择是否太过分了? 我选择了一个日志链接函数,因为我的响应变量始终为正,但是我想要某种确认,它是一个不错的选择。 问题2:是否有任何测试可以支持我对链接功能的选择,例如检查残差以选择分布?(对我来说,选择链接功能似乎有些武断,因为我可以找到的唯一指导是非常模糊和动摇的,大概是出于充分的理由。)

2
通过插入号和基本randomForest包从randomForest获得不同的结果
我有点困惑:经过插入符号训练的模型的结果与原始包装中的模型有什么不同?我阅读了使用带有插入符号包的RandomForest的FinalModel进行预测之前是否需要进行预处理?但我在这里不使用任何预处理。 我通过使用插入符号包并调整了不同的mtry值来训练了不同的随机森林。 > cvCtrl = trainControl(method = "repeatedcv",number = 10, repeats = 3, classProbs = TRUE, summaryFunction = twoClassSummary) > newGrid = expand.grid(mtry = c(2,4,8,15)) > classifierRandomForest = train(case_success ~ ., data = train_data, trControl = cvCtrl, method = "rf", metric="ROC", tuneGrid = newGrid) > curClassifier = classifierRandomForest 我发现mtry = …

1
我们什么时候使用密义数字和中间数字而不是分位数和中间数字?
我无法在Wikipedia或Wolfram Mathworld上找到密义或中间的定义,但是在Bílková,D.和Mala,I.(2012),“ 对收入分配建模时应用L-矩方法的应用 ”中给出了以下解释在捷克共和国 ”,奥地利统计杂志,第41卷第 2期,第125-132页。 中间值为(样本)的密不可分值,就像样本中位数等于样本分位数)的值一样。样品密实度以及样品分位数均基于订购的样品。首先,对有序样本中观测值的累积总和进行评估。然后,对于给定的百分比,,将零位定义为分析变量的值,该变量将有序样本中的所有观测值分为两部分:较小或相等的观测值之和为占总观测值的,大于总观测值的表示该总和的剩余。50 %p 0 &lt; p &lt; 100 p %p %(100 - p )%50%50%50\%50%50%50\%ppp0&lt;p&lt;1000&lt;p&lt;1000<p<100p%p%p\%p%p%p\%(100−p)%(100−p)%(100-p)\% 什么时候将这些用作位置度量而不是更常规的中位数或其他分位数有意义?该论文给出了一种可能的情况,即家庭收入: 从这个定义可以得出,中间收入可以用作收入水平的合理特征,因为收入较低或等于中间收入的家庭将获得样本中总收入的一半,收入较高的家庭比接受另一半的内侧 在这种情况下,发现家庭收入中位数为117,497 捷克克朗(即,有一半家庭的收入高于该水平,另一半家庭的收入高于上述水平),而家庭中位收入为133,930捷克克朗(收入高于该数字的家庭则获得了一半的收入)总收入)。请注意,这种比较并不一定反映家庭收入的偏度,甚至不一定是其不均匀性:即使家庭收入是均匀分配的,中位数仍将高于中位数。据我了解的定义,如果所有家庭都获得相同的收入,则中位数将仅等于中位数。 那么,在这种情况下,是否有任何特定的原因更喜欢内侧,或者至少将其用作辅助措施?中位数和中位数之间的比较究竟告诉我们什么?出于我刚刚指出的原因,中间似乎并不能直接与其他集中趋势指标相提并论。在其他情况下,中间/义齿是否被广泛使用或被视为特别有用?在样本研究论文中使用它们的实际例子将是非常受欢迎的,而在更广泛的背景下直观证明它们可能有用的想法会更好。 它必须要求总计和小计是有意义的-似乎与金钱有关的东西,以及“饼”的分配方式-但即使加法动作也仅对某些数量有意义。对于密集而不是广泛的属性(例如密度或温度),任何形式的求和在物理上都是没有意义的。在我看来,广泛的属性是必要的,但不足以使密宗有所帮助,因为我可以想象一位运输分析师对所运送的货物的重量有限制,因此所有货物(按重量计)的50%它承载的重量等于或大于此重量,但我无法想象生态学家会对new的长度感兴趣,以至于所有new的总长度的50%是由该长度或更长的new贡献的。

1
均值相同,方差不同
假设您有八位跑步者参加比赛;他们各自的运行时间的分布是正常的,每个平均有秒。流道的标准偏差是最小的,第二个是第二个,第三个是最小,依此类推,八个最大。有两个问题使我感到困惑:(1)第一个击败最后一个的概率是多少;(2)谁最有可能赢得比赛?111111 我的答案分别是和。由于它们的均值相同,因此的概率仅为,不是吗?我该如何严格地证明第二部分,以及可以计算出获胜的确切概率?提前致谢。1/21/21/2888x¯1−x¯8&lt;0x¯1−x¯8&lt;0\bar x_1-\bar x_8\lt 01/21/21/2

1
从exp(系数)到几率及其对数Logistic回归的解释
我根据SAT分数和家庭/种族背景对大学的录取率进行了线性回归。数据是虚构的。这是对先前已回答问题的跟进。这个问题的重点是在为简单起见而撇开SAT分数时收集和解释优势比的方法。 变量是Accepted(0或1)和Background(“红色”或“蓝色”)。我设置了数据,以便具有“红色”背景的人们更容易进入: fit &lt;- glm(Accepted~Background, data=dat, family="binomial") exp(cbind(Odds_Ratio_RedvBlue=coef(fit), confint(fit))) Odds_Ratio_RedvBlue 2.5 % 97.5 % (Intercept) 0.7088608 0.5553459 0.9017961 Backgroundred 2.4480042 1.7397640 3.4595454 问题: 0.7是接受“蓝色”背景的人的比例吗?我之所以这样问是因为,Backgroundblue如果我改为运行以下代码,也会获得0.7的“ ”: fit &lt;- glm(Accepted~Background-1, data=dat, family="binomial") exp(cbind(OR=coef(fit), confint(fit))) 甲Ç Ç é p 吨ë d / [R ë d :阿Ç Ç é p 吨ë d /乙升ù ë一种CCËpŤËd/[RËd:一种CCËpŤËd/乙升üË\rm …
14 r  regression  logistic 

2
Dirichlet聚类流程:如何处理标签?
问:使用Dirichlet流程对数据进行聚类的标准方法是什么? 使用吉布斯采样时,采样簇会出现并消失。此外,由于后验分布对于聚类重标记是不变的,因此我们存在可识别性问题。因此,我们不能说哪个是用户集群,而是两个用户在同一个集群中(即)。p(ci=cj)p(ci=cj)p(c_i=c_j) 我们可以总结一下类的分配,以便如果是点的集群分配,那么现在不仅是而且是?cicic_iiiici=cjci=cjc_i=c_jci=cj=cj=...=czci=cj=cj=...=czc_i=c_j=c_j=...=c_z 这些是我找到的替代方案,也是为什么我认为它们不完整或被误导的原因。 (1)DP-GMM + Gibbs采样+基于对的混淆矩阵 为了将Dirichlet过程高斯混合模型(DP-GMM)用于聚类,我实现了本文,其中作者提出了使用Gibbs采样进行密度估计的DP-GMM 。 为了探讨集群性能,他们说: 由于在[MCMC]链上组件的数量发生了变化,因此需要形成一个混淆矩阵,显示每个数据对在整个链中分配给同一组件的频率,见图6。 缺点:这不是真正的“完整”群集,而是成对群集。该图看起来不错,因为我们知道了真实的簇,并据此安排了矩阵。 (2)DP-GMM + Gibbs采样+采样直到没有任何变化 我一直在搜索,发现有些人声称使用Gibbs采样器基于Dirichlet Process进行聚类。例如,这篇文章认为当聚类数量或均值没有更多变化时,链收敛,因此可以从那里获得汇总。 缺点:我不确定这是否允许,因为如果我没有记错的话: (a)在MCMC期间可能会有标签切换。 (b)即使在固定分布中,采样器也可以不时创建一些簇。 (3)DP-GMM + Gibbs采样+选择最可能划分的采样 在本文中,作者说: 在“老化”阶段之后,可以从Gibbs采样器中提取来自IGMM后分布的无偏样本。可以通过绘制许多此类样本并使用类别指标变量的联合可能性最高的样本来找到硬聚类。我们使用M. Mandel编写的经过修改的IGMM实现。 缺点:除非这是一个折叠的吉布斯采样器,我们仅对分配进行采样,否则我们可以计算而不是边际。(取而代之的是获得具有最高的状态,这是一个好习惯吗?)p (c)p (c,θ )p(c|θ)p(c|θ)p(\mathbf{c} | \theta)p(c)p(c)p(\mathbf{c})p(c,θ)p(c,θ)p(\mathbf{c}, \theta) (4)具有可变推论的DP-GMM: 我已经看到一些库使用变分推理。我不太了解变分推理,但我想您那里没有可识别性问题。但是,我想坚持使用MCMC方法(如果可能)。 任何参考将有所帮助。

1
训练堆叠式自动编码器和2层神经网络有什么区别吗?
假设我正在编写一种用于构建2层堆叠式自动编码器和2层神经网络的算法。它们是一样的还是不同的? 我了解的是,当我构建一个堆叠式自动编码器时,我会逐层构建。对于神经网络,我将初始化网络中的所有参数,然后对于每个数据点,将其通过网络并计算损耗(例如,euclean距离)并进行反向传播。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.