统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

7
从统计理论和应用中了解
我最近获得了医学和生物学建模硕士学位,并以工程数学为背景。尽管我的教育计划包括大量的数学统计学课程(请参见下面的列表),而且我都取得了很高的成绩,但我经常最终完全迷失了对统计学的理论和应用的迷恋。我不得不说,与“纯粹的”数学相比,统计学对我而言确实没有什么意义。尤其是大多数统计学家(包括我以前的讲师)使用的符号和语言令人费解,并且到目前为止,我所见过的几乎所有资源(包括维基百科)都没有简单的例子可以轻松地与给定的理论联系起来并与之联系在一起。 .. 这是背景;我也意识到,如果没有牢牢掌握统计数据,尤其是在生物信息学领域,我就无法从事研究人员/工程师的工作,这真是令人痛苦的现实。 我希望可以从经验丰富的统计学家/数学家那里获得一些提示。如何克服上面提到的这个问题?你知道任何好的资源吗?例如书籍,电子书,公开课程(例如,通过iTunes或OpenCourseware)。 编辑:正如我提到的那样,我对统计的一般标题下的大多数文献都持偏颇(消极)的态度,并且由于我无法在每个统计分支购买大量(昂贵的)教科书,因此我需要就一本书而言,它与Tipler&Mosca 的物理学相似,但与统计学无关。 对于那些不了解Tipler的人;它是一本大型教科书,涵盖了人们在高等教育中可能遇到的绝大多数主题,并从基础入门到更详细地介绍了它们。基本上是一本完美的参考书,在我读大学的第一年就买了,仍然偶尔使用。 我参加过的统计课程: 大型的入门课程 平稳的随机过程 马尔可夫过程 蒙特卡洛方法 生存分析

1
似然比和贝叶斯模型比较是否可以为零假设检验提供更好且足够的替代方案?
为了回应越来越多的统计学家和研究人员批评将零假设检验(NHT)用于科学作为一种累积努力的做法,美国心理学会统计推断工作组避免了彻底禁止NHT的禁令,而是建议研究人员除了从NHT导出的p值外,还报告效果大小。 但是,效果大小在整个研究中不容易累积。元分析方法可以累积效应量的分布,但是效应量通常以原始效应量与给定实验数据中无法解释的“噪声”之比来计算,这意味着效应量的分布不仅受各个研究之间的原始效果差异很大,而且各个研究之间的噪音表现也存在差异。 相比之下,效应强度的替代度量,似然比既可以在逐项研究的基础上进行直观的解释,又可以轻松地在各个研究中汇总以进行荟萃分析。在每项研究中,似然度代表包含给定效果的模型相对于不包含效果的模型的证据权重,通常可以报告为例如“计算X效果的似然比”揭示了该效应的证据是其无效证据的8倍。” 此外,似然比还允许直观表示无效结果的强度,因为低于1的似然比表示赞成采用无效的情况,取该值的倒数表示无效对效果的证据权重。值得注意的是 似然比在数学上表示为两个模型的无法解释的方差之比,其差异仅在于效应所解释的方差,因此在概念上与效应大小没有太大的偏差。另一方面,荟萃分析似然比的计算代表了整个研究中某项效应的证据权重,这仅仅是取各个研究中似然比的乘积即可。 因此,我认为,对于寻求建立有利于效应/模型的总体证据程度的科学而言,似然比是可行的方法。 在更细微的情况下,模型仅在效果的特定大小上才是可区分的,在这种情况下,我们认为区间的某种表示形式(我们认为数据与效果参数值一致)可能是首选的。确实,APA工作组还建议报告置信区间,可以将其用于此目的,但是我怀疑这也是一种考虑不周的方法。 令人遗憾的是,置信区间经常被误解(被学生和研究人员都误解了)。我还担心它们在NHT中的使用能力(通过评估CI中是否包含零)将只会进一步推论NHT的灭绝。 相反,当理论只能通过效应的大小来区分时,我建议贝叶斯方法会更合适,因为每种效应的先验分布由每个模型分别定义,然后比较所得的后验分布。 这种方法用似然比替换p值,影响大小和置信区间,并且在必要时用贝叶斯模型比较是否似乎足够?是否错过了此处所针对的替代方案所提供的某些必要的推论功能?

5
如何证明Elo评分或Page排名对我的作品有意义?
我有一组球员。他们互相对抗(成对)。对玩家是随机选择的。在任何游戏中,一名玩家获胜,另一名玩家输。玩家彼此玩有限数量的游戏(有些玩家玩更多的游戏,有些玩的更少)。因此,我有数据(谁赢得了谁,赢得了多少次)。现在,我假设每个玩家的排名都决定了获胜的可能性。 我想检查一下这个假设是否真的是事实。当然,我可以使用Elo评分系统或PageRank算法来计算每个玩家的评分。但是,通过计算等级,我不能证明它们(等级)确实存在或没有任何意义。 换句话说,我想有一种方法来证明(或检查)球员确实有不同的优势。我该怎么做? 添加 更具体地说,我有8位玩家,只有18场比赛。因此,有很多对彼此不对战的玩家,并且有很多对彼此仅玩过一次的玩家。结果,我无法估计给定玩家对获胜的可能性。例如,我还看到有一个玩家在6场比赛中赢得了6次胜利。但这也许只是一个巧合。

5
逐步逻辑回归和抽样
我正在对SPSS中的一组数据进行逐步逻辑回归。在此过程中,我将模型拟合到一个随机子集,该子集约为。样本总数的60%,约330例。 我发现有趣的是,每次重新采样数据时,最终模型中都会弹出不同的变量。最终模型中总是存在一些预测变量,但其他预测变量会根据样本而突然出现。 我的问题是这个。处理此问题的最佳方法是什么?我希望看到预测变量的收敛,但事实并非如此。从操作的角度来看,某些模型更具直觉意义(并且更容易向决策者解释),而其他模型则更适合数据。 简而言之,既然变数乱七八糟,那么您将如何建议我呢? 提前谢谢了。

1
套索的LARS与坐标下降
使用LARS [1]与使用坐标下降来拟合L1正则化线性回归有什么优缺点? 我主要对性能方面感兴趣(我的问题往往有N成千上万且p小于20。)但是,任何其他见解也将受到赞赏。 编辑:自从我发布问题以来,chl亲切地指出了Friedman等人的论文[2],其中坐标下降比其他方法快得多。如果是这样,作为执业医生,我是否应该忘掉LARS来支持协调下降? [1]埃弗隆·布拉德利;海蒂·特雷弗;约翰·斯通,伊恩和蒂布希拉尼·罗伯特(2004)。“最小角度回归”。统计年鉴32(2):第407-499页。 [2] Jerome H. Friedman,Trevor Hastie,Rob Tibshirani,“通过坐标下降的广义线性模型的正则化路径”,《统计软件》,第1卷。33,第1期,2010年2月。

1
在R中没有lm对象的情况下计算Newey-West标准误差
我昨天在StackOverflow上问了这个问题,并得到了答案,但我们同意,它似乎有点骇人听闻,并且也许有一种更好的方法来查看它。 问题:我想计算向量(在本例中为股票收益向量)的Newey-West(HAC)标准误差。该功能NeweyWest()在sandwich包这样做,但需要一个lm对象作为输入。Joris Meys提供的解决方案是将向量投影到1上,这会将我的向量转换为残差并馈入NeweyWest()。那是: as.numeric(NeweyWest(lm(rnorm(100) ~ 1))) 均值的方差。 我应该这样吗?还是有一种方法可以更直接地做我想做的事情?谢谢!

2
用于学习统计数据,练习(带有解决方案)的在线资源?
我目前在我的大学担任统计学入门课程(面向医学生)的助教。 在离线状态下,有很多书籍可以帮助老师。但是,我有兴趣知道的是,您是否可以引导我进入提供统计活动(包括解决方案)的任何(良好)资源,这些资源可以在线获取?(例如:教师注释)。 主题材料的范围可以在描述性统计,概率和参数/非参数统计推断之间。

1
中位数中位数计算
我做了很多房地产报告,经​​常会报告中位数价格,尤其是NAR(全国房地产经纪人协会)的报告。尽我所能说,他们只能得到每个地区的房地产价格中位数。我的问题是,鉴于数据限制,应如何计算国家中位数?作为中位数的中位数,是中位数的简单平均值,还是中位数的加权平均值或完全不同的东西?第二,这些估计的有效性如何?我知道NAR并没有获得总交易额表,那么在国家层面上仍可以估算中位数的合理准确代表吗?我特别要问,因为区域密度和价格以及市场差异很大。
13 median 


1
是否可以半自动化MCMC收敛诊断程序来设置老化时间?
我想自动选择MCMC链的老化选项,例如通过基于收敛性诊断删除前n行。 此步骤可以安全地自动化到什么程度?即使我仍然仔细检查自相关,mcmc跟踪和pdf,也可以自动选择老化长度。 我的问题很笼统,但是如果您可以提供处理R mcmc.object的细节,那就太好了;我在R中使用rjags和coda软件包。
13 r  bayesian  mcmc 

1
内核密度的解释/使用
这可能是一个幼稚的问题,但这是可行的。如果我有一组经验数据并对其拟合了核密度,然后获得了一个新的单一值,该值可能来自生成原始数据集的同一过程,那么我可以分配一个新值属于该集合的概率吗? /过程,只需从y轴上读取值即可,其中x轴上的新值与内核密度线相交并除以密度线下的面积?
13 kde 

2
了解AIC和Schwarz标准
我正在运行一个物流模型。实际的模型数据集具有100多个变量,但我选择的测试数据集中包含25个变量。在此之前,我还制作了一个具有8-9个变量的数据集。有人告诉我AIC和SC值可以用来比较模型。我观察到,即使变量的p值较低(例如0053),该模型的SC值也较高。据我的直觉,具有变量的显着性水平的模型应该导致较低的SC和AIC值。但这并没有发生。有人可以澄清一下吗?简而言之,我想问以下问题: 变量的数量与SC AIC有关系吗? 我应该专注于p值还是较低的SC AIC值? 降低SC AIC值的典型方法是什么?

3
添加系数以获得交互作用-SE怎么办?
我有一个多元回归,其中包括相互作用。例如,要估算最差的五分位数的治疗效果,我需要将来自治疗回归指标的系数与来自交互变量(与治疗和五分位数1相互作用)的系数相加。通过回归将两个系数相加时,如何获得标准误差?是否可以将两个系数的标准误差相加?那t统计呢?是否可以添加这些?我猜不是,但是我找不到任何指导。 提前非常感谢您的帮助!


4
ANCOVA中的事后测试
问题: 在对协变量的影响进行调整之后,有什么好的方法可以进行事后检验组均值之间的差异? 典型示例: 四组,每组30名参与者(例如,四个不同的临床心理学人群) 因变量是数字(例如,智力得分) 协变量是数字(例如,社会经济地位指数) 研究问题涉及在控制协变量之后,任何一对组在因变量上是否存在显着差异 相关问题: 首选方法是什么? R中有哪些可用的实现? 关于协变量如何更改事后检验程序,是否有任何一般性参考?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.