统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
与应用科学家合作的建议
我是统计学专业的研究生,因此与应用科学家(经济学家,林务员等)进行了几次合作。这些协作很有趣(大部分时间),我确实学到了很多东西,但是也有一些复杂性,例如: 有时,我对一个好的统计模型的看法与我的合作者的背景以及他们所在领域的惯例不同。这样一来,很难说服他们尝试新的东西,要么是因为他们难以理解模型,要么是因为他们不愿意改变自己的习惯 当提议使用不同的统计方法时,我经常给人一种印象,我的合作者认为这是对他们的“标准”方法的批评。但是,我绝不是要批评任何人的统计知识或习惯 最后还有另一个极端:有些人期望过高。他们认为我可以在没有他们帮助的情况下从他们的数据中奇迹般地提取出有趣的信息。当然,这是不对的,特别是如果我错过了特定学科的背景 我可能会想到更多的要点,但这是我想到的第一个要点。 我要问的问题是: 您在协作中遇到相同或相似的困难吗?你如何面对他们?通常,您如何做才能成为出色的统计合作伙伴? 是否有任何有关此主题的第三方资源,即统计学家与应用科学家之间合作所需的软技能? 注意:这个问题或多或少相反的这一个。
14 references 

4
预测模型:统计数据可能无法击败机器学习吗?[关闭]
已关闭。这个问题需要更加集中。它当前不接受答案。 想改善这个问题吗?更新问题,使其仅通过编辑此帖子来关注一个问题。 2年前关闭。 我目前正在关注一个专注于统计/计量经济学的硕士课程。在我的主人看来,所有学生都必须进行3个月的研究。上周,所有小组都必须向其余的硕士生介绍他们的研究。 几乎每个小组都针对他们的研究主题进行了一些统计建模和一些机器学习建模,并且每一次样本外预测都谈到了简单的机器学习模型击败了非常复杂的统计模型,在过去的3个研究中,每个人都非常努力几个月。无论每个人的统计模型多么出色,一个简单的随机森林几乎总是会得到较低的样本外误差。 我想知道这是否是一个普遍接受的观察?那如果要进行样本外预测,就没有办法击败简单的随机森林或极端梯度增强模型吗?这两种方法使用R包实现起来非常简单,而每个人都想出的所有统计模型都需要大量的技能,知识和精力来进行估算。 您对此有何看法?统计/计量经济学模型的唯一好处是您可以获得解释吗?还是我们的模型不够好,以至于它们不能明显胜过简单的随机森林预测?有没有解决这个问题的论文?

6
细读“相关”的主动/被动用法
我犹豫是在统计StackExchange中还是在语言学/英语中问这个问题,但我认为这里可能比其他论坛中精通统计的用户更多选择语言的用户;) 我经常阅读一些报告,其中提到相关性是主动语态中的动词,如“我们然后将A与B相关联并找到...”。对我而言,该动词仅在被动语态中才有意义,例如说“我们发现A和B显着相关”时。我可能会错,因为这实际上在语法上构成了主动语音与被动语音,但是我所描述的是对A和B进行某种操作(使它们最终都改变)与从中计算出第三个变量(例如R coeff)之间的区别。 当然,可以主动取消两个变量的关联,但在我看来,“关联”它们(而不是引用活动的变量)只是用作检查是否存在重要的此类关联的简写! 我错了吗?从统计学上讲,您将A与B相关联是否有意义?

1
为什么我们不使用非恒定学习率来实现除神经网络以外的其他事物的梯度体面?
在梯度下降中使用非恒定的学习率,深度学习文学充满了巧妙的技巧。像指数衰减,RMSprop,Adagrad等之类的东西很容易实现,并且在每个深度学习包中都可用,但是在神经网络之外似乎并不存在。有什么理由吗?如果只是人们根本不在乎,是否有理由为什么我们不必在神经网络之外关心?

1
哈密​​尔顿蒙特卡洛假人
您能否逐步解释一下汉密尔顿蒙特卡洛的工作原理? PS:我已经读答案在这里,汉密尔顿蒙特卡罗,在这里,汉密尔顿蒙特卡洛与序贯蒙特卡罗,在这里,汉密尔顿蒙特卡洛:如何使大都市黑廷斯建议的意义吗?并且他们没有逐步解决它。
14 bayesian  hmc 

3
量子计算可能会受益于哪些统计问题?
我们正处在量子计算的时代,量子语言期望硬件量子计算机现在可以在高和低级别用于模拟量子计算机。量子计算带来了新的基本功能,例如量子位的纠缠和传送,量子位的测量以及在量子位上的叠加。 量子计算可能会受益于哪些统计问题? 例如,量子计算机会提供更普遍的真实随机数生成吗?那么计算便宜的伪随机数生成又如何呢?量子计算会帮助加速MCMC收敛,还是确保收敛时间上限?是否会有其他基于采样的估计量的量子算法? 这是一个广泛的问题,可以接受的答案也将是广泛的,但是如果它们能够区分量子计算和经典计算,则是一种赞誉。(如果这是一个过于笼统的问题,请帮助我使其成为一个更好的问题。)



5
为什么线性回归基于假设和输入数据点之间的垂直距离使用成本函数?
假设我们有输入(预测)数据和输出(响应)数据点A,B,C,D,E,并且我们希望通过这些点拟合一条线。这是一个简单的问题,可以说明问题,但也可以扩展到更高的维度。 问题陈述 当前最佳拟合或假设由上面的黑线表示。蓝色箭头()表示数据点与当前最佳拟合之间的垂直距离,方法是从该点绘制一条垂直线直至与该线相交。→→\color{blue}\rightarrow 绘制绿色箭头(),使其在相交点处垂直于当前假设,因此代表数据点与当前假设之间的最小距离。对于点A和点B,绘制一条垂直于当前最佳猜测的线,并且该线类似于垂直于x轴的线。对于这两点,蓝线和绿线重叠,但对于C,D和E点则不重叠。→→\color{green}\rightarrow 最小二乘原理通过在任何给定的训练周期中通过一条数据线(A,B,C,D或E)绘制一条垂直线到估计的假设()来定义线性回归的成本函数,并由表示→→\color{blue}\rightarrow CostFunction=∑Ni=1(yi−hθ(xi))2CostFunction=∑i=1N(yi−hθ(xi))2Cost Function = \sum_{i=1}^N(y_i-h_\theta(x_i))^2 这里代表数据点,代表最佳拟合。(xi,yi)(xi,yi)(x_i, y_i)hθ(xi)hθ(xi)h_\theta(x_i) 点(A,B,C,D或E)之间的最小距离由从该点到当前最佳猜测的垂直线(绿色箭头)表示。 最小二乘函数的目的是定义一个目标函数,当最小化该函数时,将使假设与所有组合点之间的距离最小,但不一定会使假设与单个输入点之间的距离最小。 **题** 我们为什么不将线性回归的成本函数定义为输入数据点与通过输入数据点的假设(由垂直于假设的直线定义)之间的最小距离,如()?→→\color{green}\rightarrow

3
分配家庭的定义?
分布族对统计的定义是否不同于其他学科? 通常,曲线族是一组曲线,每条曲线由一个函数或参数化给定,其中一个或多个参数发生变化。这样的族例如用于表征电子部件。 为了进行统计,根据形状来源的一个族是改变形状参数的结果。那么,我们如何才能理解伽玛分布具有形状和比例参数,并且只有广义伽玛分布才具有位置参数?这是否会使家庭成为改变位置参数的结果?根据@whuber一个家庭的意义是隐式A中的家庭的“参数化”是从ℝ的一个子集的连续映射Ñ,以其平常的拓扑结构,为分布的空间,其图像是家庭。n^n 用简单的语言来说,统计分布族是什么? 关于同一个家庭的分布的统计属性之间的关系的一个问题已经为另一个问题引起了很大的争议,因此似乎值得探讨其含义。 不一定是一个简单的问题,是因为它在指数族这一短语中的使用而产生的,它与曲线族无关,但与通过重新参数化(不仅是参数)改变分布的PDF的形式有关。 ,还可以替换独立随机变量的功能。

4
零假设为真的概率
因此,这可能是一个常见问题,但我从未找到令人满意的答案。 您如何确定原假设为真(或假)的概率? 假设您给学生提供了两种不同的测试版本,并且想要查看这些版本是否等效。您执行t检验,其p值为.02。多么好的p值!那一定意味着测试不可能等效,对吗?不会。不幸的是,看来P(results | null)不能告诉您P(null | results)。正常的做法是在遇到低p值时拒绝原假设,但是我们如何知道我们并未拒绝很可能是真的原假设呢?举一个愚蠢的例子,我可以设计一个误报率为0.02的埃博拉病毒测试:将50个球装进一个桶中,并在上面写下“埃博拉病毒”。如果我对此进行测试,然后他们选择“埃博拉”球,则p值(P(捡起球|他们没有埃博拉))为.02, 到目前为止,我已经考虑过的事情: 假设P(null | results)〜= P(results | null)–对于某些重要应用显然是错误的。 在不知道P(null |结果)的情况下接受或拒绝假设–那么我们为什么接受或拒绝它们呢?难道我们不是要拒绝我们认为是假的而是接受是假的全部吗? 使用贝叶斯定理–但是您如何获得先验?您是否最终还是回到原地试图通过实验确定它们?先验地挑选他们似乎很武断。 我在这里发现了一个非常类似的问题:stats.stackexchange.com/questions/231580/。这里的一个答案似乎基本上是在说,因为这是贝叶斯问题,所以问零假设为真的可能性是没有意义的。也许我的心是贝叶斯,但我无法想象不问这个问题。实际上,p值最常见的误解似乎是它们是真实零假设的概率。如果您真的不能作为常客问这个问题,那么我的主要问题是#3:如何在不陷入困境的情况下获得先验知识? 编辑:感谢您的所有周到的答复。我想谈谈几个共同的主题。 概率的定义:我肯定对此有很多文献,但是我的幼稚概念是“相信完全理性的人会提供信息”或“在这种情况下能使利润最大化的下注几率”被重复,未知数被允许改变”。 我们可以知道P(H0 |结果)吗?当然,这似乎是一个棘手的问题。但是我相信,每个概率在理论上都是可以理解的,因为概率总是以给定信息为条件。每个事件都会发生或不会发生,因此没有完整的信息就不存在概率。它仅在没有足够信息时存在,因此应该是可知的。例如,如果我被告知某人有一个硬币,并询问正面的概率,我会说是50%。可能硬币的正面重量为70%,但我没有得到该信息,所以我所拥有的信息的概率为50%,就像它碰巧掉在地上一样,概率为70%当我知道这一点。由于概率总是以一组(不足的)数据为条件, 编辑:“总是”可能太强了。可能存在一些我们无法确定概率的哲学问题。尽管如此,在现实世界中,尽管我们可以“几乎永远”拥有绝对的确定性,但“几乎总是”应该是一个最佳估计。



4
如何将其困在鞍点上?
目前,我对如何在鞍点处捕获小批量梯度下降感到有些困惑。 解决方案可能太琐碎,以至于我不明白。 你会得到一个新的样品每一个时代,并计算基于新的一批新的错误,所以成本功能仅适用于每一批静态这意味着梯度也应该为每个小批量根据改变..但这个应该香草的实施是否有鞍点问题? 最小化神经网络常见的高度非凸误差函数的另一个关键挑战是避免陷入其众多次优局部最小值中。Dauphin等。[19]认为困难实际上不是由局部极小值引起的,而是由鞍点引起的,即一维向上倾斜而另一维向下倾斜的点。这些鞍点通常被相同误差的平稳段包围,这使得SGD很难逃脱,因为在所有维度上梯度都接近于零。 我的意思是,随着SGD趋于收敛,特别是SGD相对于鞍点将具有明显的优势...波动和随机采样以及每个时期的成本函数不同,应该足以成为避免陷入困境的充分原因。 对于整批梯度,体形确实有意义,因为误差函数是恒定的,所以可以将其困在鞍点中。 我对其他两个部分有些困惑。

5
效果大小真的优于p值吗?
在应用研究中,很多重点放在依赖和报告效应大小上,而不是p值上(例如,下面进一步引用)。 但是,不是像p值一样,效应大小是随机变量,并且在重复相同实验时,样本之间的影响大小可能会有所不同吗?换句话说,我在问什么统计特征(例如,效应大小在样本之间的可变性小于p值)使效应大小比p值更好的证据衡量指标? 但是,我应该提到一个重要的事实,它将p值与效果大小区分开。也就是说,效果大小之所以可以估算,是因为它具有总体参数,而p值却没有任何估算,因为它没有任何总体参数。 对我而言,效应大小只是在某些研究领域(例如,人类研究)有助于将来自各种研究人员开发的测量工具的经验发现转化为通用度量的度量(可以说,使用人类研究可以更好地适应这种度量)量化研究俱乐部)。 也许如果我们将一个简单的比例作为效应大小,那么以下(R中的)是什么表明效应大小超过p值的优势?(p值会发生变化,但效果大小不会改变) binom.test(55, 100, .5) ## p-value = 0.3682 ## proportion of success 55% binom.test(550, 1000, .5) ## p-value = 0.001731 ## proportion of success 55% 请注意,大多数效果大小与测试统计量线性相关。因此,使用效应量进行零假设检验很容易。 例如,事前设计产生的统计量可以很容易地转换为相应的科恩效应大小。这样,Cohen d的分布只是at分布的比例定位版本。 引号: 由于p值是混杂指标,因此理论上100个样本大小不同且影响大小不同100项的研究可能具有相同的单个p值,而100个具有相同单一影响值的研究可能各自具有100个不同的p值。 要么 p值是随样本不同而变化的随机变量。。。。因此,比较两个不同实验的p值,或对同一实验中测量的两个变量的测试的p值进行比较,并声明一个比另一个重要,是不合适的。 引文: 汤普森(2006)。行为统计的基础:一种基于洞察力的方法。纽约,纽约:吉尔福德出版社。 Good,PI和Hardin,JW(2003)。统计中的常见错误(以及如何避免)。纽约:威利。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.