统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如果随机变量的值范围是有界的,我们如何获得正态分布为?
假设我们有一个随机变量,其值的范围由和界定,其中是最小值,是最大值。b a baaabbbaaabbb 有人告诉我,,其中是我们的样本大小,我们样本均值的抽样分布是正态分布。也就是说,当我们增加我们越来越接近正态分布,但实际极限是相等的正态分布。ñ ñ ñ →交通∞n→∞n→∞n \to \inftynnnnnnn→∞n→∞n \to \infty 但是,它不是必须从扩展到的正态分布的定义的一部分吗?∞−∞−∞- \infty∞∞\infty 如果我们范围的最大值为,则最大样本均值(与样本大小无关)将等于,最小样本均值将等于。b 一bbbbbbaaa 因此在我看来,即使当接近无穷大时采用极限,我们的分布也不是实际的正态分布,因为它受和。一个bnnnaaabbb 我想念什么?

1
LASSO自由度的直觉
邹等。“关于套索的“自由度””(2007年)表明,非零系数的数量是对套索的自由度的无偏且一致的估计。 对我来说似乎有点违反直觉。 假设我们有一个回归模型(变量为零均值) y=βx+ε.y=βx+ε.y=\beta x + \varepsilon. 假设的无限制OLS估计值为\ hat \ beta_ {OLS} = 0.5。对于非常低的惩罚强度,它可能与LASSO估计值\ beta大致吻合。ββ\betaβ^OLS=0.5β^OLS=0.5\hat\beta_{OLS}=0.5ββ\beta 进一步假设特定惩罚强度\ lambda ^ *的LASSO估计λ∗λ∗\lambda^*值为β^LASSO,λ∗=0.4β^LASSO,λ∗=0.4\hat\beta_{LASSO,\lambda^*}=0.4。例如,对于使用交叉验证发现的现有数据集,λ∗λ∗\lambda^*可能是“最优” λλ\lambda。 如果我理解正确,则在两种情况下自由度均为1,因为两次均存在一个非零回归系数。 题: 即使β^LASSO,λ∗=0.4β^LASSO,λ∗=0.4\hat\beta_{LASSO,\lambda^*}=0.4表示拟合的“自由度”比\ hat \ beta_ {OLS} = 0.5小,两种情况下的自由度又如何相同β^OLS=0.5β^OLS=0.5\hat\beta_{OLS}=0.5? 参考文献: 邹辉,特雷弗·哈斯蒂和罗伯特·蒂布希拉尼。“关于套索的“自由度”。” 统计年鉴 35.5(2007):2173-2192。


4
布莱克威尔的赌注
我已经读过布莱克韦尔关于“ 徒劳壁橱”的赌注悖论。这是摘要:您将两个信封和。信封中有随机的钱,但是您对钱的分配一无所知。您打开一个,检查其中有多少钱(),然后必须选择:拿信封或?ExExE_xEyEyE_yxxxExExE_xEyEyE_y 徒劳的壁橱指的是一个叫伦纳德·瓦普纳(Leonard Wapner)的数学家:“出乎意料的是,除了打开另一个信封,您可以做一些事情,以使自己获得比正确解决方案更好的机会。” 这个想法对我来说似乎是错误的,它如下:选择一个随机数。如果,则取。如果,请选择。dddd&lt;xd&lt;xd < xExExE_xd&gt;xd&gt;xd > xEyEyE_y Wapner:“如果d介于x和y之间,那么您的预测(如d所示)将保证是正确的。假设这以概率p发生。如果d小于x和y,那么只有在您选择的数字x大于两个时,您的预测才是正确的。有50%的机会。同样,如果d大于两个数字,则仅当您选择的数字小于两个数字时,您的预测才是正确的。发生这种情况的可能性也为50%。” 如果在的概率大于零,则此方法的平均成功率为。这意味着通过观察不相关的随机变量可以提供更多信息。ddd[x,y][x,y][x,y]12+p212+p2\frac{1}{2} + \frac{p}{2} 我认为这都是错误的,问题出在选择随机整数。这是什么意思?像是整数?在这种情况下,概率即谎言之间和为零,因为这两个和是有限的。d X ÿ X ÿpppdddxxxyyyxxxyyy 如果说有关于钱的最大量的限制,说,或者至少我们选择从D,然后配方归结为选择的琐碎建议如果和如果则选择。1 ... 中号Ë ý X &lt; 中号/ 2 ë X X &gt; 中号/ 2MMM1...M1...M1...MEyEyE_yx&lt;M/2x&lt;M/2x < M/2ExExE_xx&gt;M/2x&gt;M/2x > M/2 我在这里想念什么吗? 编辑 好的,现在我开始看看明显的矛盾来自何处。在我看来,不相关的随机变量无法提供附加信息。 但是,请注意,我们需要有意识地选择d的分布。例如,选择均匀分布的边界或Poissionian分布的等。显然,如果我们在玩花生游戏,我们选择d的分布在美元,。最后一个概率将首先取决于我们对信封中可能存在的内容的判断。[ 10 9,2 ⋅ 10 9 ] P (d ∈ (X …


6
英国退欧:“离开”是否具有统计学意义?[关闭]
已关闭。这个问题是基于观点的。它当前不接受答案。 想改善这个问题吗?更新问题,以便通过编辑此帖子以事实和引用的形式回答。 3年前关闭。 在这篇文章中,我们提出一个有关自然现象的问题,即人类试图通过计算选票来寻求决策。这个问题涉及的这种自然现象的具体事件是英国脱欧案。 注意:问题不在于政治。目的是尝试从基于观察的统计角度讨论这种自然现象。 具体问题是: 问:什么是 Brexit票离开的意思吗?例如,这是否意味着公众真的想离开欧盟?这是否仅表示公众不确定,需要更多时间思考?或者是别的什么?51.9 %51.9%51.9\% 假设1:投票过程中没有错误。

2
在第一个实验的95%置信区间内,重复实验的哪个比例的效应大小?
让我们坚持理想的情况,使用随机抽样,高斯总体,均等方差,无P黑客攻击等。 步骤1.您运行一个实验,说比较两个样本均值,然后为这两个总体均值之间的差异计算95%的置信区间。 第2步。您进行了更多的实验(数千个)。由于随机抽样,平均值之间的差异因实验而异。 问题:步骤2中的实验收集所得的均值之间的差异的哪一部分位于步骤1的置信区间内? 那无法回答。这完全取决于步骤1中发生的情况。如果步骤1中的实验非常不典型,则该问题的答案可能非常低。 因此,想象两个步骤都重复了很多次(步骤2重复了很多次)。我认为,现在应该有可能对重复实验的平均比例有一个期望,该效应大小在第一次实验的95%置信区间内。 似乎需要了解这些问题的答案,以评估研究的可重复性,这是一个非常热门的领域。

2
置信椭圆的真实含义
阅读有关95%置信椭圆的真实含义的信息,我倾向于碰到两种解释: 包含95%数据的椭圆 不是上面的,而是解释数据差异的椭圆。我不确定我是否理解正确,但是它们似乎意味着,如果有新的数据点出现,则新的方差有95%的机会会保留在椭圆中。 你能阐明一点吗?

1
如何为ACF函数计算置信区间?
例如,在R中,如果调用该acf()函数,则默认情况下会绘制相关图,并绘制95%的置信区间。查看代码,如果调用plot(acf_object, ci.type="white"),您将看到: qnorm((1 + ci)/2)/sqrt(x$n.used) 作为白噪声类型的上限。有人可以解释这种方法背后的理论吗?为什么我们得到的qnorm为1 + 0.95,然后除以2,然后除以观察数?


4
如何(系统地)使用梯度下降作为优化器来调整学习率?
ML / DL领域的局外人;开始了基于Tensorflow的Udacity深度学习课程;做作业3的问题4; 尝试使用以下配置调整学习率: 批次大小128 步骤数:足以填满2个纪元 隐藏层的大小:1024、305、75 重量初始化:使用std正常截断。sqrt(2 / n)的偏差,其中n是上一层的大小 失学保持机率:0.75 正则化:不适用 学习率算法:指数衰减 玩弄学习率参数;在大多数情况下,它们似乎没有作用;在这里编码 ; 结果: Accuracy learning_rate decay_steps decay_rate staircase 93.7 .1 3000 .96 True 94.0 .3 3000 .86 False 94.0 .3 3000 .96 False 94.0 .3 3000 .96 True 94.0 .5 3000 .96 True 我应该如何系统地调整学习率? 学习率与步数有何关系?

1
变量选择与模型选择
因此,我知道变量选择是模型选择的一部分。但是,模型选择究竟由什么组成?它不只是以下内容: 1)为您的模型选择一个分布 2)选择解释变量 我之所以这么问,是因为我正在阅读伯纳姆和安德森的文章:AIC与BIC,他们在模型选择中谈论AIC和BIC。阅读本文后,我意识到我一直在将“模型选择”视为“变量选择”(参考注释BIC是否试图找到一个真正的模型?) 从文章摘录中,他们讨论了“通用性”程度不断提高的12个模型,当针对12个模型绘制KL-Information时,这些模型显示出“渐缩效应”(图1): 不同的哲学和目标模型 ...尽管BIC的目标比AIC的目标模型更通用,但是BIC在这里最常选择的模型将不如Model 7通用,除非n非常大。它可能是模型5或模型6。众所周知(从大量的论文和模拟文献中),在渐缩效应的情况下(图1),AIC的性能优于BIC。如果这是真实数据分析的上下文,则应使用AIC。 如何BIC 曾经选择一个模型,模型选择我不明白,比AIC更复杂!什么是“模型选择”?什么时候BIC选择比AIC更“通用”的模型? 如果我们谈论的是变量选择,那么BIC必须确保始终选择变量数量最少的模型,对吗?BIC中的项总是比AIC中的项对附加变量的惩罚更多。但是,当“ BIC的目标是比AIC的目标模型更通用的模型 ”时,这是否合理?2ln(N)k2ln(N)k2ln(N)k2k2k2k 编辑: 从“意见”中评论的讨论中,是否有理由比其他更喜欢AIC或BIC?我们在评论中看到了@Michael Chernick和@ user13273之间的一小段讨论,这使我相信这并不是一件小事: 我认为将这种讨论称为“特征”选择或“协变量”选择更为合适。对我而言,模型选择范围更广,涉及到误差分布的规范,链接函数的形式以及协变量的形式。当我们谈论AIC / BIC时,通常会处于模型构建的所有方面都是固定的情况,除了协变量的选择。– user13273 2012年8月13日在21:17 确定要包含在模型中的特定协变量通常是用模型选择一词来完成的,书名中有许多带有模型选择的书主要决定了模型中应包含哪些模型协变量/参数。–迈克尔·切尔尼克(Michael Chernick)2012年8月24日14:44

2
ICC作为同一组中两个随机抽取的单元之间的预期相关性
在多层次建模中,类内相关性通常是根据随机效应方差分析来计算的 yij=γ00+uj+eijyij=γ00+uj+eij y_{ij} = \gamma_{00} + u_j + e_{ij} 其中ujuju_j是2级残差,而eijeije_{ij}是1级残差。然后,我们得到的估计σ^2uσ^u2\hat{\sigma}_u^2和σ 2 Ë为的方差ü Ĵ和Ë 我Ĵ分别,并将其插入公式如下:σ^2eσ^e2\hat{\sigma}_e^2ujuju_jeijeije_{ij} ρ=σ^2uσ^2u+σ^2eρ=σ^u2σ^u2+σ^e2 ρ = \frac{\hat{\sigma}_u^2}{\hat{\sigma}_u^2 +\hat{\sigma}_e^2} Hox(2002)在第15页上写道 类内相关ρ也可以解释为同一组中两个随机绘制的单元之间的预期相关性 有一个问题在这里,询问了先进的问题(为什么它正好等于这个代替近似相等),并获得了先进的答案。 但是,我想问一个简单得多的问题。 问题:谈论同一组中两个随机绘制的单元之间的相关性甚至意味着什么? 我对类内关联适用于组而不适用于成对的数据这一事实有基本的了解。但是,如果我们只有来自同一组的两个随机抽取的单位,我仍然不知道如何计算相关性。例如,如果我查看Wikipedia页面上ICC的点图,则我们有多个组,每个组中有多个点。

1
奥兹(Oz)会不会有不幸的Tribble?
这是一个学生给我带来的有趣的问题。尽管它最初的用语是用枪消灭定期发射的子弹,但我认为您可能会感到更和平。 在奥兹无限平坦的世界中,黄砖路始于翡翠城的中心,蜿蜒穿过乡村,一直持续到没有穿越自己的时候。每天中午,一个精力充沛的年轻雌雄同体的Tribble沿着这条路从其起点滚动,以统一的随机选择速度进行,最高可达每天一公里。在整个旅程中,它将保持相同的速度滚动,永不停止。但是,如果某个Tribble在道路上超越另一个Tribble,则每个人都会立即认出自己的灵魂伴侣,而两个人就会掉到一边(大概是为了繁殖并最终向家中提供更多Tribbles)。 如您所知,这种交配经常发生,因为任何两个Tribble以完全相同的速度滚动的机会为零。哦,Tribbles开心!但是,生活是否一定对所有人都有好处? 至少一个Tribble永远持续存在,从未超车或被超车的机会是什么?

4
检测音频记录中的峰值数量
我正在尝试弄清楚如何检测一个录音语料库中的音节数。我认为一个好的代理可能是wave文件中的峰值。 这是我尝试用英语说的文件的内容(我的实际用例是斯瓦西里语)。该示例录音的记录是:“这是我试图使用计时器功能。我正在查看暂停和发声。” 此段落共有22个音节。 WAV文件:https://www.dropbox.com/s/koqyfeaqge8t9iw/test.wav? dl = 0 seewaveR中的程序包很棒,并且有多个潜在功能。首先,导入wave文件。 library(seewave) library(tuneR) w &lt;- readWave("YOURPATHHERE/test.wav") w # Wave Object # Number of Samples: 278528 # Duration (seconds): 6.32 # Samplingrate (Hertz): 44100 # Channels (Mono/Stereo): Stereo # PCM (integer format): TRUE # Bit (8/16/24/32/64): 16 我尝试的第一件事是timer()功能。它返回的内容之一是每次发声的持续时间。此功能可识别7个发声,远远少于22个音节。快速浏览情节表明,发声不等于音节。 t &lt;- timer(w, threshold=2, msmooth=c(400,90), dmin=0.1) …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.