统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
从贝叶斯角度来看,ML估计量的不变性是荒谬的吗?
Casella和Berger表示ML估计量的不变性如下: 但是,在我看来,他们以完全临时的,荒谬的方式定义的“可能性” :ηη\eta 如果我将概率论的基本规则应用于简单情况,我将得到以下结果: 现在应用贝叶斯定理,然后应用和是互斥的,因此我们可以应用求和规则: 大号(η | X )= p (X | θ 2 = η )= p (X | θ = - √η= τ(θ )= θ2η=τ(θ)=θ2\eta=\tau(\theta)=\theta^2甲乙p(X|甲∨乙)=p(X) p (甲∨ 乙| X )L (η| x)=p(x | θ2= η)= p (X | θ = - η–√∨ θ = η–√)= : p (X …

2
如果我希望有95%的机会出现少于1%的对象有故障,我需要多少个样本?
我需要确保我的XML网站地图的垃圾少于(链接断开)。URL的列表是成百上千的,即使出于所有原因我也可能不愿意一一测试所有URL,但我还是不愿意这样做:1%1%1\% 1 - Saved bandwidth 2 - Faster traffic for real clients 3 - Less noise in visitor statistics (because my test would count as a visit) 5 - I could go on... 所以我认为随机取一个子集就足够了,问题是我不知道概率。 我可以使用一个简单的功能吗? 如果有帮助的话,我们可以假设有一个先验信息,可了解链路在运行过程中断裂的可能性。假设在每次运行中,给定链接的断开为。0.75%0.75%0.75\%

1
为什么多项式回归中的贝叶斯可信区间偏向而置信区间正确?
考虑下面的绘图,在该绘图中,我模拟了以下数据。我们看一下二元结果,用黑线表示真实概率为1。协变量x和p (y o b s = 1 | x )之间的函数关系是具有逻辑链接的三阶多项式(因此在双向过程中是非线性的)。yobsyobsy_{obs}xxxp(yobs=1|x)p(yobs=1|x)p(y_{obs}=1 | x) 绿线是GLM logistic回归拟合,其中被引入为三阶多项式。虚线绿线是围绕预测的95%置信区间p (Ý ø b 小号 = 1 | X ,β),其中β拟合回归系数。我曾经和这个。xxxp(yobs=1|x,β^)p(yobs=1|x,β^)p(y_{obs}=1 | x, \hat{\beta})β^β^\hat{\beta}R glmpredict.glm 类似地,pruple线与95%可信区间的平均后的使用均匀现有贝叶斯逻辑回归模型的。为此,我使用了具有功能的软件包(设置提供了统一的先验信息)。p(yobs=1|x,β)p(yobs=1|x,β)p(y_{obs}=1 | x, \beta)MCMCpackMCMClogitB0=0 红点表示数据集中的观测值,黑点表示y o b s = 0的观测值。请注意,在分类/离散分析中常见的是y,但没有观察到p (y o b s = 1 | x )。yobs=1yobs=1y_{obs}=1yobs=0yobs=0y_{obs}=0yyyp(yobs=1|x)p(yobs=1|x)p(y_{obs}=1 | x) 可以看到几件事: 我故意模拟了左手稀疏。我希望由于缺乏信息(观察)而在这里扩大信心和可信区间。xxx …


1
自适应GAM在mgcv中平滑
Simon Wood关于GAM的书及其相关的R包mgcv在谈到GAM理论以及对真实数据和模拟数据进行模型拟合时都非常详尽且内容丰富。 对于一维平滑,除了决定是否实施循环基函数和自适应基函数外,实际上没有什么可担心的,与三次,薄板和P样条平滑相比,它可以提供非常不同的预测结果,因为适应性情况下,多个GAM沿着样条曲线拟合到不同区域。据我所知,时间序列建模中循环基数很常见,而当数据相对于响应变量变化很大时,应该考虑采用自适应平滑。但是,应该“谨慎并谨慎地”使用自适应平滑。 我已经研究GAM一段时间了,考虑到我的研究问题,我发现自己在实施顺利方面的想法很多。mgcv包括17种不同的平滑效果(根据我的数量)。我已经考虑了三次和P样条平滑。 我现在的问题是:如果最终目标是将拟合的GAM用于预测目的,那么何时应考虑对非自适应对应变量进行自适应平滑?就我的目的而言,我坚持使用默认的GCV平滑度标准,即使该标准可能会变得不够平滑。 应用生态GAM的文献在不断增长,但是我还没有遇到能够实现自适应平滑的研究。 任何建议表示赞赏。
9 r  mgcv 

2
社会科学中大多数已发表的相关性值得信赖吗?对此该怎么办?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 2年前关闭。 尽管个人为揭示掠夺性期刊的行为付出了重要的努力,但仍大肆挥霍,但社会科学研究的阴影笼罩着更大,更根本的威胁(尽管研究人员肯定需要解决多个问题)。为了弄清楚这一点,根据一种观点,我们可能无法信任从小于250的样本得出的相关系数。 人们很难找到一种比可信赖的相关系数更依赖于推断社会科学中的度量之间存在关联,方向和强度的测试。但是,将不会难于找到同行评议的报告,这些报告基于从少于250种情况下的数据计算出的相关系数,对两种结构之间的关系提出了强有力的主张。 考虑到当前社会科学面临的复制危机(请参见上面的第二个链接),我们应该如何仅在大样本(至少按照某些社会科学领域的标准)上查看有关相关系数稳定的报告?这是同行评议的社会科学研究领域的又一裂缝,还是在介绍中被夸大了的相对琐碎的问题? 由于对此问题不可能有一个正确的答案,因此我希望创建一个话题,可以共享,深思熟虑和辩论有关此问题的资源(当然要礼貌而有礼貌地进行)。

2
调查人口之间的差异
假设我们有两个样本:A和B。假设这些人口是由个体组成的,我们选择根据特征来描述个体。这些功能中有些是分类的(例如,它们开车上班吗?),有些是数字的(例如,它们的高度)。我们称这些功能为:。我们收集了数百个这样的功能(例如n = 200),为简单起见,我们假设所有个人都没有错误也没有噪音。X1个… XñX1…XnX_1 \ldots X_n 我们假设两个人口是不同的。我们的目标是回答以下两个问题: 它们实际上有很大不同吗? 它们之间有何显着不同? 决策树(例如,随机森林)和线性回归分析等方法可以提供帮助。例如,可以查看随机森林中的要素重要性或线性回归中的拟合系数,以了解可以区分这些类别的要素,并探索要素与种群之间的关系。 在走这条路之前,我想先了解一下我的选择,什么是好做法以及现代与坏做法。请注意,我的目的不是预测本身,而是测试并发现组之间的任何重大差异。 解决该问题的一些原则方法是什么? 这是我的一些担忧: 线性回归分析之类的方法可能无法完全回答(2),对吧?例如,一次拟合可以帮助您找到一些差异,但不是所有明显的差异。例如,多重共线性可能使我们无法找到所有特征在组之间的变化方式(至少在一次拟合中)。出于同样的原因,我希望方差分析也无法提供(2)的完整答案。 尚不清楚预测方法将如何回答(1)。例如,我们应该最小化什么分类/预测损失函数?而且一旦适应后,我们如何测试两组之间是否存在显着差异?最后,我担心我得到的答案(1)可能取决于我使用的特定分类模型集。

1
我们可以从得出结论,是独立的吗?
好吧,我们无法看到 有趣的反例,例如https://en.wikipedia.org/wiki/Subindependence。但是真正的问题是:是否有某种方法可以加强这种状况,从而使独立性得以遵循?例如,有一些组的功能使得如果对于所有然后独立如下?而且,这样的函数集必须有多大?E g i(X )g j(Y )= E g i(X )E g j(Y )i ,jG1个,… ,gñg1,…,gng_1, \dotsc, g_nËG一世(X)克Ĵ(是)= EG一世(X)EGĴ(是)E⁡gi(X)gj(Y)=E⁡gi(X)E⁡gj(Y)\E g_i(X) g_j(Y) =\E g_i(X) \E g_j(Y)我,Ĵi,ji,j 而且,还有一些很好的参考资料可以解决这个问题吗?

4
为什么1个中位数低于另一个中位数的事实并不意味着第1组中的大多数都少于第2组中的大多数?
我认为下面的箱线图可以解释为“大多数男人比大多数女人快”(在此数据集中),主要是因为中位男性的时间低于中位女性的时间。但是有关R和统计知识测验的EdX课程告诉我,这是不正确的。请帮助我理解为什么我的直觉是不正确的。 这是问题: 让我们考虑一个2002年纽约马拉松比赛的完成者的随机样本。可以在UsingR包中找到此数据集。加载库,然后加载nym.2002数据集。 library(dplyr) data(nym.2002, package="UsingR") 使用箱线图和直方图比较男性和女性的完成时间。以下哪项最能描述差异? 男性和女性具有相同的分布。 大多数男性比大多数女性快。 男性和女性的偏斜分布与前者相似,向左偏移20分钟。 两种分布的正态分布均相差约30分钟。 以下是纽约市男女马拉松比赛时间,以分位数,直方图和方框图的形式: # Men's time quantile 0% 25% 50% 75% 100% 147.3333 226.1333 256.0167 290.6375 508.0833 # Women's time quantile 0% 25% 50% 75% 100% 175.5333 250.8208 277.7250 309.4625 566.7833

1
为什么在拉丁方格中将行,处理和列称为正交
我一直在几何学领域听说过“正交”(也请注意,我不是英语母语人士)。对于拉丁方,我不理解以下内容(教科书中的引用): 每种处理(ABCD)每行出现一次。因此,处理和行是正交的。...行和列与处理正交。 12341ABCD2BCDA3CDAB4DABC12341ABCD2BCDA3CDAB4DABC\begin{matrix}\,&1&2&3&4\\1&A&B&C&D\\2&B&C&D&A\\3&C&D&A&B\\4&D&A&B&C\end{matrix} 正交在这里是什么意思?

2
Kaplan-Meier曲线似乎与Cox回归不同
在R中,我正在对癌症患者进行生存数据分析。 我已经在CrossValidated和其他地方阅读了有关生存分析的非常有用的文章,并认为我了解如何解释Cox回归结果。然而,一个结果仍然困扰着我... 我正在比较生存与性别。Kaplan-Meier曲线显然对女性患者有利(我检查了几次我添加的图例是正确的,最大存活时间为4856天的患者确实是女性): 而Cox回归正在返回: Call: coxph(formula = survival ~ gender, data = Clinical) n= 348, number of events= 154 coef exp(coef) se(coef) z Pr(>|z|) gendermale -0.3707 0.6903 0.1758 -2.109 0.035 * --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 exp(coef) exp(-coef) lower .95 …

1
P值和似然原理
这个问题在课堂上出现:如果我们使用p值评估实验中的假设,那么我们不遵守似然原理的哪一部分:充分性或条件性? 我的直觉是说充分性,因为计算p值取决于实验的未观察结果,而充分性似乎在单个实验中处理的观察更多,而条件性似乎对不同的实验进行更多的处理。

2
多次碰撞的反向生日问题
假设您有一个外星年,其长度N未知。如果您随机抽样所述外星人,并且其中一些人共同生日,您是否可以使用此数据来估算该年的长短? 例如,在100个样本中,您可能有两个三胞胎(即每个生日由三个外星人共享)和五个对和八十四个单身人士。在估算N时,绝对最小值是91,最大值是无界的,但是我如何找到一个合理的期望值? 假设包括“所有生日都有同等可能性”之类的事情。 与这里回答的另一个问题不同,房间中存在已知的碰撞。任何足够长的一年对于一个外星人房间都极有可能不会发生碰撞。但是很长的年份发生任何碰撞的几率较低,而短几年的发生几次碰撞的几率较低,因此为最可能的年份长度提供了一个(理论上的)范围。


3
贝叶斯模型选择和可信区间
我有一个包含三个变量的数据集,其中所有变量都是定量的。让我们将其称为,和。我通过MCMC在贝叶斯角度拟合回归模型yyyx1x1x_1x2x2x_2rjags 我进行了探索性分析,的散点图建议应使用二次项。然后我装了两个模型y×x2y×x2y\times x_2 (1)y=β0+β1∗x1+β2∗x2y=β0+β1∗x1+β2∗x2y=\beta_0+\beta_1*x_1+\beta_2*x_2 (2)y=β0+β1∗x1+β2∗x2+β3∗x1x2+β4∗x21+β5∗x22y=β0+β1∗x1+β2∗x2+β3∗x1x2+β4∗x12+β5∗x22y=\beta_0+\beta_1*x1+\beta_2*x_2+\beta_3*x_1x_2+\beta_4*x_1^2+\beta_5*x_2^2 在模型1中,每个参数的效果大小都不小,并且95%可信区间的值不为。000 在模型2中,参数和的效果大小较小,并且所有参数的可信区间均包含。β3β3\beta_3β4β4\beta_4000 可信区间包含的事实足以说明该参数不重要吗?000 然后我调整了以下模型 (3)y=β0+β1∗x1+β2∗x2+β3∗x22y=β0+β1∗x1+β2∗x2+β3∗x22y=\beta_0+\beta_1*x_1+\beta_2*x_2+\beta_3*x^2_2 每个参数的效果大小都不小,但是除外,所有可信区间都包含。 0β1β1\beta_1000 在贝叶斯统计中进行变量选择的正确方法是哪种? 编辑:我可以在任何回归模型(如Beta模型)中使用套索吗?我使用的是变量分散的模型,其中 其中是向量。我也应该在使用Laplace 吗?δlog(σ)=−δδXlog(σ)=−δδXlog(\sigma)=-\pmb{\delta}Xδδδδδ\pmb{\delta}δδδδ\pmb{\delta} EDIT2:我安装了两个模型,一个模型具有针对,高斯先验模型,另一种具有Laplace(double-exponential)模型。δ Ĵβjβj\beta_jδjδj\delta_j 高斯模型的估计是 Mean SD Naive SE Time-series SE B[1] -1.17767 0.07112 0.0007497 0.0007498 B[2] -0.15624 0.03916 0.0004128 0.0004249 B[3] 0.15600 0.05500 0.0005797 0.0005889 B[4] 0.07682 0.04720 0.0004975 0.0005209 delta[1] -3.42286 0.32934 0.0034715 0.0034712 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.