统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
为什么要使用记录变量?
可能这是一个非常基本的问题,但我似乎无法找到一个可靠的答案。我希望在这里,我可以。 我目前正在阅读论文,以准备自己的硕士学位论文。目前,我正在阅读一篇研究推文与股市特征之间关系的论文。 在他们的假设之一中,他们提出“增加的推文交易量与交易量的增加有关”。 我希望它们以成对相关性tweetVolume与关联tradingVolume,但是相反,它们使用记录的版本进行报告:LN(tweetVolume)和LN(tradingVolume)。 对于我的论文,我复制了他们的论文的这一部分。我收集了大约100个公司的6个月以上的推文(tweetVolume)和同一时间段的股票交易量。如果我将绝对变量相关联,r=.282, p.000则会发现,但是当我使用记录的版本时,会发现r=.488, p=.000。 我不明白为什么研究人员有时会使用变量的记录版本,以及为什么相关性似乎要高得多。这是什么原因,为什么可以使用记录的变量? 非常感谢您的帮助:-)

5
贝叶斯主义者是否曾经争论过,在某些情况下他们的方法与惯常方法相提并论/重叠?
贝叶斯主义者是否曾经争论说他们的方法可以归纳为常人主义方法,因为人们可以使用非信息先验,因此可以恢复典型的常人主义模型结构? 如果确实使用过这种说法,谁能将我引到一个我可以阅读该论点的地方? 编辑:这个问题的措词可能不完全是我想表达它的方式。问题是:“是否有讨论使用贝叶斯方法和频繁主义者方法通过使用特定先验来重叠/相交/具有共同点的情况的讨论?” 一个例子是使用不适当的先验,但是我很确定这只是冰山一角。p (θ )= 1p(θ)=1p(\theta) = 1


3
缺少值的矩阵的SVD
假设我具有Netflix风格的推荐矩阵,并且我想建立一个模型来预测给定用户的未来电影收视率。使用Simon Funk的方法,可以使用随机梯度下降法来最小化完整矩阵与逐项*用户对用户矩阵之间的Frobenius范数,并结合L2正则化项。 在实践中,人们如何处理推荐矩阵中的缺失值,这是整个计算的重点?通过阅读Simon的博客文章,我的猜测是,他仅使用非缺失项(由(例如)推荐矩阵的1%组成)来构建模型(可以明智地选择超参数和正则化)来预测其他99%的矩阵? 实际上,您真的跳过所有这些值吗?还是在进行随机梯度下降之前尽可能多地推断?处理缺失值的一些标准最佳实践是什么?

2
PCA和随机森林
对于最近的Kaggle竞赛,我(手动)为我的训练集定义了10个其他功能,然后将其用于训练随机森林分类器。我决定在具有新功能的数据集上运行PCA,以查看它们之间的比较。我发现〜98%的方差由第一个分量(第一个特征向量)承载。然后,我多次训练分类器,一次添加一个功能,然后使用交叉验证和RMS误差比较分类的质量。我发现,每增加一个附加功能,分类都会有所改善,并且最终结果(包含所有10个新功能)远远优于(带有)两个功能的首次运行。 鉴于PCA声称〜98%的方差在我的数据集的第一部分中,为什么分类的质量有了很大的提高? 这对其他分类器是否成立?RF跨多个内核扩展,因此训练速度比(例如)SVM要快得多。 如果将数据集转换到“ PCA”空间,然后在转换后的空间上运行分类器,该怎么办?我的结果将如何变化?

2
探索性和确认性因素分析在确定结构独立性方面的差异
研究人员经常使用两项具有非常相似项目的度量标准,并争辩说它们测量的是不同的事物(例如,“我总是在汽车周围时会担心”;“我担心汽车”)。让我们从汽车量表中将假设的量度称为“汽车恐惧量度”和“焦虑量度”。如果他们确实评估了不同的潜在结构,或者它们测量的是相同的东西,我会对经验进行测试感兴趣。 我认为做到这一点的两种最佳方法是通过工厂探索性分析(EFA)或确认性因素分析(CFA)。我认为EFA会很好,因为它允许所有项目不受限制地自由加载。如果两个量表中的项目使用相同的因子,那么我可以得出结论,这些度量可能无法很好地评估不同的事物。但是,我还将看到CFA的好处,因为我将测试预定义的模型。例如,我可以比较一个模型的拟合度,在该模型中,所有项目都加载到一个因素上(即,他们没有评估不同的结构),或者项目被划分为预期的度量。我想,CFA的一个问题是它不会真正考虑替代模型(例如,三因素模型)。 为了讨论的目的,让我们也许考虑一下,我想把另外两种非常相似的方法(例如,汽车焦虑调查表和用于评估汽车恐惧的量表)加入其中! 我怎样才能最好地从统计角度确定两种措施是否评估了不同的结构?

2
如何结合因素分析,内部一致性和项目响应理论来减少项目数量?
我正在根据经验设计调查表,在此示例中,我将使用任意数字进行说明。就上下文而言,我正在开发一项心理调查表,旨在评估焦虑症患者中常见的思维模式。一个项目可能看起来像是“我需要反复检查烤箱,因为我不能确定烤箱已关闭 ”。 我有20个问题(5分李克特),可能由一个或两个因素组成(请注意,实际上我有将近200个问题,由10个量表组成,每个量表可能由两个因素组成)。我愿意删掉大约一半的项目,只针对两个因素之一提出10个问题。 我熟悉探索性因素分析(EFA),内部一致性(克朗巴赫(Cronbach's alpha))以及项目响应理论(IRT)中的项目特征曲线。我可以看到我将如何使用这些方法中的任何一个来确定哪些项目是任何单个范围内的“较差”。我很欣赏每种方法还可以回答不同的问题,尽管它们可能导致相似的结果,而且我不确定哪个“问题”最重要。 在开始之前,请确保我分别知道每种方法的用途。 使用EFA,我将确定因素的数量,并删除在其各自因素上负荷最小(假设为<.30)或在各个因素之间交叉负荷的项目。 使用内部一致性,我将删除“如果删除了项目,则alpha值更差”的项目。我可以在假设我的量表中有一个因子的情况下进行此操作,也可以在初始EFA之后执行该操作以识别因子的数量,然后对每个因子运行alpha。 使用IRT,我将删除(5 Likert)响应选项中未评估关注因素的项目。我会盯着项目特征曲线。我基本上是在寻找一个45度角的直线,该直线从李克特量表的选项1一直沿潜分数上升到5。我可以假设一个因素,也可以在初始 EFA之后执行该步骤以识别多个因素,然后为每个因素运行曲线。 我不确定要使用哪种方法才能最好地确定哪些项目是“最差的”。我从广义上使用最差的方法,以使该项目在可靠性或有效性方面都不利于测量,这两者对我来说都同样重要。大概我可以结合使用它们,但是我不确定如何使用。 如果要继续我现在所知道的并尽我所能,请执行以下操作: 进行全民教育,以确定许多因素。还要删除因其各自因素而导致加载不良的项目,因为我不希望加载不良的项目,无论它们在其他分析中的表现如何。 如果IFA中还有任何残留物,则也要进行IRT并从该分析中判断出还除去不良品。 只需报告Cronbach的Alpha,不要将其用作删除项目的手段。 任何一般准则将不胜感激! 这也是您可能会回答的特定问题的列表: 在基于因子负荷删除项目和基于Chronbach的alpha删除项目之间(在两种分析中使用相同的因子布局)之间的实际区别是什么? 我应该先做什么?假设我用一个因素进行EFA和IRT,并且都确定了应删除的不同项目,那么哪个分析应该优先? 尽管我将报告Chronbach的Alpha值,但我对进行所有这些分析并不感到困难。我觉得仅执行IRT会遗漏某些内容,对于EFA同样如此。

4
我可以对偏斜和非正常数据使用Z分数吗?[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加细节并通过编辑此帖子来澄清问题。 5年前关闭。 我一直在处理一些过程周期时间数据,并使用标准的z分数进行缩放,以便在整个周期时间的各个部分之间进行比较。 由于数据严重右偏/非正常,我是否应该使用其他转换?(“异常值”永远不会花费消极时间,并且通常比“平均”花费更长的时间) 使用z分数似乎仍然“有效” ... ############### # R code ############### mydata <- rweibull(1000,1,1.5) hist(mydata) hist(scale(mydata))

1
什么是偏差校正?[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加细节并通过编辑此帖子来澄清问题。 4年前关闭。 我已经看到许多地方都有输入/输出数据集,它们首先创建线性回归线,更正了偏差,然后仅将该数据用于他们的模型。我没有得到这个偏差校正是什么?


1
绘制具有多个预测变量的Logit模型的概率曲线
我有以下概率函数: Prob=11+e−zProb=11+e−z\text{Prob} = \frac{1}{1 + e^{-z}} 哪里 z=B0+B1X1+⋯+BnXn.z=B0+B1X1+⋯+BnXn.z = B_0 + B_1X_1 + \dots + B_nX_n. 我的模特看起来像 Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid})]\right)} 这通过如下所示的概率曲线可视化。 我正在考虑在原始回归方程式中添加几个变量。假设我在模型中添加了性别(类别:F和M)和年龄(类别:<25和> 26),最后得到: Pr(Y=1)=11+exp(−[−3.92+0.014×(bid)+0.25×(gender)+0.15×(age)])Pr(Y=1)=11+exp⁡(−[−3.92+0.014×(bid)+0.25×(gender)+0.15×(age)])\Pr(Y=1) = \frac{1}{1 + \exp\left(-[-3.92 + 0.014\times(\text{bid}) + 0.25\times(\text{gender}) + 0.15\times(\text{age})]\right)} 在RI中可以生成类似的概率曲线,当考虑所有三个预测变量时,它将告诉我Y = 1的概率。我迷路的地方是我想找到这些变化的每种可能排列的概率。 因此,当出价= 1,性别= M,年龄> = 26时,Y = 1的概率是多少?同样,当出价= 2,性别= F,年龄> …

2
Logistic回归残差分析
这个问题有点笼统,任重而道远,但请耐心等待。 在我的应用程序中,我有许多数据集,每个数据集包含约20,000个数据点,这些数据点具有约50个特征和一个相关的二进制变量。我正在尝试使用正则逻辑回归(R包glmnet)对数据集建模 作为分析的一部分,我创建了如下的残差图。对于每个功能,我根据该功能的值对数据点进行排序,将数据点分为100个存储桶,然后计算每个存储桶内的平均输出值和平均预测值。我绘制这些差异。 这是残差图示例: 在上图中,特征的范围为[0,1](浓浓度为1)。如您所见,当特征值较低时,模型似乎偏向于高估1输出的可能性。例如,在最左边的存储桶中,模型将概率高估了大约9%。 有了这些信息,我想以一种简单的方式更改功能定义,以大致纠正这种偏差。更换等变更 x → x--√x→xx \rightarrow \sqrt{x} 要么 x → f一个(x )= { aX 如果 x &lt; a 其他x→fa(x)={a if x&lt;a x elsex \rightarrow f_a(x) = \cases{a & if $x<a$ \cr x & else} 我怎样才能做到这一点?我正在寻找一种通用的方法,以便人类可以快速滚动浏览所有约50个图并进行更改,然后对所有数据集执行此操作,并经常重复进行此操作,以使模型随着数据随时间的变化而保持最新。 作为一个普遍的问题,这是否是正确的方法?Google搜索“逻辑回归残差分析”不会返回许多具有良好实践建议的结果。他们似乎专心回答以下问题:“此模型是否合适?” 并提供Hosmer-Lemeshow等各种测试来回答。但是我不在乎我的模型是否好,我想知道如何使其更好!

1
将复杂模型重复拟合到大数据集时,如何优化计算效率?
使用MCMCglmmR中的程序包运行混合效果模型时出现性能问题。代码如下: MC1&lt;-MCMCglmm(bull~1,random=~school,data=dt,family="categorical" , prior=list(R=list(V=1,fix=1), G=list(G1=list(V=1, nu=0))) , slice=T, nitt=iter, ,burnin=burn, verbose=F) 数据中大约有20,000个观测值,它们聚集在大约200所学校中。在运行之前,我从数据框中删除了所有未使用的变量,并从内存中删除了所有其他对象。我的问题是,除非将迭代次数减少到无法接受的程度,否则运行时间将非常长。经过50,000次迭代,需要5个小时,而且我要运行许多不同的模型。所以我想知道是否有加速代码执行的方法,或者我可以使用其他软件包。我正在使用,MCMCglmm因为我想要随机效果的置信区间。 另一方面,我希望在今年晚些时候购买一台新PC,但运气好的话,我也许可以将其推广,所以我一直在想如何最好地在新硬件上花有限的钱-更多的RAM ,更快的CPU等。通过观察任务管理器,我不认为RAM是问题(它永远不会超过物理使用的50%),但是CPU使用率也不会超过50%,这让我感到奇怪。我当前的设置是Intel Core i5 2.66GHz,4GB RAM,7200rpm HDD。以尽可能多的RAM为代价,获取尽可能快的CPU是否合理?我还想知道3级CPU缓存大小对像这样的统计计算问题的影响吗? 更新:已经问的元SO我一直建议重新措辞上的超级用户的问题和岗位。为此,我需要提供有关MCMCglmm中“幕后工作”的详细信息。我是否认为大部分的计算时间都花在了优化上,这是对的吗?我的意思是找到一些复杂函数的最大值?矩阵求逆和/或其他线性代数运算是否也是可能引起瓶颈的常见运算?我将非常感激能够提供给超级用户社区的任何其他信息。

6
如果您使用使最大化的点估计,那对您的哲学有何看法?(是常客还是贝叶斯或其他?)
如果有人说 “该方法对最大使用参数的MLE点估计,因此它是常客的;而且它不是贝叶斯。”P (x | θ )P(x|θ)\mathrm{P}(x|\theta) 你同意吗? 背景资料:最近我读了一篇自称是常客的论文。我不同意他们的主张,充其量我感到模棱两可。本文未明确提及MLE(或MAP)。他们只进行点估计,就好像这个点估计是正确的一样继续进行。他们不对这个估计量的采样分布进行任何分析,或者类似的分析;该模型非常复杂,因此可能无法进行此类分析。他们也不在任何时候使用“后”一词。他们只是将这一点的估计值作为票面价值,然后转到他们感兴趣的主要主题-推断丢失的数据。我认为他们的方法没有任何东西可以说明他们的哲学。他们可能打算成为常客(因为他们觉得有必要在袖子上穿上自己的哲学),但是他们的实际做法却很简单/方便/懒惰/模棱两可。我现在要说的是,这项研究实际上没有任何哲学依据。相反,我认为他们的态度更加务实或方便: “我已经观察到数据,并且希望估计一些缺失的数据。有一个参数控制着和之间的关系。我真的不在乎只是作为达到目的的一种手段。如果我有一个的估计,它将使从预测变得更加容易。我会选择一个的点估计,因为它很方便,尤其是我会选择最大化的。”ž θ žXxxžzzθθ\thetažzzθ θ ž X θ θ P(X | θ )Xxxθθ\thetaθθ\thetazzzxxxθθ\thetaθ^θ^\hat{\theta}P(x|θ)P(x|θ)\mathrm{P}(x|\theta) 一个无偏估计量的想法显然是一个频率主义的概念。这是因为它不以数据为条件,并且描述了一个很好的属性(无偏),该属性可以容纳参数的所有值。 在贝叶斯方法中,数据和参数的作用有点相反。特别是,我们现在以观察到的数据为条件,并继续对参数的值进行推断。这需要先验。 到目前为止,一切都很好,但是MLE(最大似然估计)在哪里适合呢?我给人的印象是,很多人认为它是频率论者(或更确切地说,它不是贝叶斯主义者)。但是我觉得它是贝叶斯方法,因为它涉及获取观察到的数据,然后找到使最大化的。MLE隐式地使用统一的先验并以数据为条件,并使最大化。公平地说,MLE看起来既是频率派的又是贝叶斯的?还是每个简单的工具都必须完全属于这两种类别之一?P (p 一个ř 一米ë 吨ë [R | d 一吨一)P(data|parameter)P(data|parameter)P(data | parameter)P(parameter|data)P(parameter|data)P(parameter | data) MLE是一致的,但我认为一致性可以表示为贝叶斯思想。给定任意大的样本,估计值收敛于正确答案。对于参数的所有值,语句“估计值将等于真实值”成立。有趣的是,如果您以观察到的数据为条件,则该语句也成立,从而使其成为贝叶斯式。除了MLE之外,还有其他有趣的地方,但对于无偏估计器却没有。 这就是为什么我认为MLE是方法中的“最高级贝叶斯”方法,可以说是“频繁方法”。 无论如何,大多数频率属性(例如无偏)都适用于所有情况,包括有限的样本量。一致性仅在不可能的情况下保持有效(一个实验中有无限个样本),这一事实表明一致性并不是一个有用的属性。 给定一个现实的(即有限的)样本,是否存在一个适用于MLE的Frequentist属性?如果不是这样,那么MLE并不是真正的频率偏高者。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.