统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
通过采样直到10次失败来估计伯努利过程中的概率:是否有偏差?
假设我们有一个故障概率为的伯努利过程(该概率很小,例如),从中进行采样直到遇到故障。因此,我们将失败概率估计为,其中是样本数。q ≤ 0.01 10 q:= 10 / Ñ Ñqqqq≤ 0.01q≤0.01q \leq 0.01101010q^:= 10 / Nq^:=10/ñ\hat{q}:=10/NññN 问题:是否对有偏差?而且,如果是这样,有没有办法纠正它? qq^q^\hat{q}qqq 我担心坚持最后一个样本是一次失败会使估计值产生偏差。

5
两种一级方程式资格赛格式的统计差异
我刚刚读了这篇BBC文章,其中涉及一级方程式的排位赛格式。 组织者希望降低排位赛的可预测性,即增加结果的统计差异。在一些无关紧要的细节上,现在(根据具体情况)两次尝试按照最佳单圈对车手进行排名。 一位F1负责人让·托德(Jean Todt)提出,将驾驶员平均排名两圈会增加统计差异,因为驾驶员犯错的可能性可能是其两倍。其他资料认为,任何平均数肯定会减少统计差异。 我们可以说在合理的假设下谁是对的?我想它可以归结为与的相对方差,其中和是代表驾驶员两个圈速的随机变量?mean(x,y)mean(x,y)\text{mean}(x,y)min(x,y)min(x,y)\text{min}(x,y)xxxyyy
15 variance 

1
尽管一个变量是其他变量的线性组合,但是为什么这种回归不会由于完美的多重共线性而失败?
今天,我正在研究一个小的数据集,并执行了一个简单的OLS回归,由于完美的多重共线性,我预计会失败。但是,事实并非如此。这意味着我对多重共线性的理解是错误的。 我的问题是:我哪里错了? 我认为我可以证明我的一个变量是其他变量的线性组合。这将导致没有完整等级的回归矩阵,因此不应识别系数。 我生成了一个小的可复制数据集(下面的代码): exporter importer flow dist intraUS 1 Canada Canada 996.8677 6.367287 0 2 Florida Canada 995.8219 9.190562 0 3 Texas Canada 1001.6475 4.359063 0 4 Mexico Canada 1002.4371 7.476649 0 5 Canada Florida 1002.8789 5.389223 0 6 Florida Florida 1007.5589 6.779686 1 7 Texas Florida 996.8938 1.570600 …

2
何时停止完善模型?
在过去的三年中,我一直在研究许多书籍中的统计数据,并且由于这个站点,我学到了很多东西。然而,对于我来说,一个基本问题仍然没有答案。它可能有一个非常简单或非常困难的答案,但我可以肯定地知道它需要对统计数据有一定的了解。 在将模型拟合到数据时(无论是常客方法还是贝叶斯方法),我们提出一个模型,该模型可能包括似然函数,先验函数或核(非参数)等的函数形式。问题在于任何模型使样品具有一定的优度。与当前的模型相比,总是可以找到更好或更坏的模型。在某个时候,我们停止并开始得出结论,推广到总体参数,报告置信区间,计算风险等。因此,无论得出什么结论,总是以我们决定采用的模型为条件。即使我们使用诸如AIC,MDL等之类的工具来估计预期的KL距离,也并没有说绝对的立场,而只是相对改善了我们的估计。 现在假设我们想定义一个逐步过程,以在构建模型时应用于任何数据集。我们应该指定什么作为停止规则?我们是否可以至少限制模型误差,该误差将为我们提供一个客观的停止点(这与使用验证样本停止训练不同,因为它还会在评估的模型类内提供停止点,而不是真正的DGP)?

2
如果“标准误差”和“置信区间”衡量的是测量精度,那么精度的测量是什么?
在第40页的“傻瓜生物统计学”一书中,我读到: 标准误差(缩写为SE)是表明您对某物的估计或测量的精确度的一种方法。 和 置信区间提供了另一种方法来指示某事物的估计或度量的精度。 但是,没有任何关于如何指示测量精度的文章。 问题:如何指示某物的测量精度如何?有哪些方法? 不要与测试的准确性和准确性相混淆:https : //en.wikipedia.org/wiki/Accuracy_and_precision#In_binary_classification

2
的pdf
假设来自其中和未知X1,X2,...,XnX1,X2,...,XnX_1, X_2,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)μ∈Rμ∈R\mu \in \mathcal Rσ2>0σ2>0\sigma^2>0 令 S是此处的标准偏差。Z=X1−X¯S,Z=X1−X¯S,Z=\frac{X_1-\bar{X}}{S}, 可以看出 具有Lebesgue pdfZZZ f(z)=n−−√Γ(n−12)π−−√(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n√)(|Z|)f(z)=nΓ(n−12)π(n−1)Γ(n−22)[1−nz2(n−1)2]n/2−2I(0,(n−1)/n)(|Z|)f(z)=\frac{\sqrt{n} \Gamma\left(\frac{n-1}{2}\right)}{\sqrt{\pi}(n-1)\Gamma\left(\frac{n-2}{2}\right)}\left[1-\frac{nz^2}{(n-1)^2}\right]^{n/2-2}I_{(0,(n-1)/\sqrt{n})}(|Z|) 然后我的问题是如何获取此pdf? 问题是从示例3.3.4中的此处开始,以找到的UMVUE 。我可以理解找到UMVUE的逻辑和过程,但不知道如何获取pdf。P(X1≤c)P(X1≤c)P(X_1 \le c) 我认为这个问题也涉及到这一个 非常感谢您的帮助,或指向任何相关参考文献也将适用。
15 self-study  umvue 

1
了解QR分解
我有一个可行的示例(在R中),我试图进一步理解。我正在使用Limma创建线性模型,并试图逐步了解倍数变化计算中发生的情况。我主要是想弄清楚如何计算系数。据我所知,QR分解用于获取系数,因此我本质上是在寻找一种解释或逐步查看正在计算的方程式的方法,或者在其中寻找qr()的源代码。 R自己追踪。 使用以下数据: expression_data <- c(1.27135202935009, 1.41816160331787, 1.2572772420417, 1.70943398046296, 1.30290218641586, 0.632660015122616, 1.73084258791384, 0.863826352944684, 0.62481665344628, 0.356064235030147, 1.31542028558644, 0.30549909383238, 0.464963176430548, 0.132181421105667, -0.284799809563931, 0.216198538884642, -0.0841133304341238, -0.00184472290008803, -0.0924271878885008, -0.340291804468472, -0.236829711453303, 0.0529690806587626, 0.16321956624511, -0.310513510587778, -0.12970035111176, -0.126398635780533, 0.152550803185228, -0.458542514769473, 0.00243517688116406, -0.0190192219685527, 0.199329876859774, 0.0493831375210439, -0.30903829000185, -0.289604319193543, -0.110019942085281, -0.220289950537685, 0.0680403723818882, -0.210977291862137, 0.253649629045288, 0.0740109953273042, 0.115109148186167, 0.187043445057404, 0.705155251555554, 0.105479342752451, 0.344672919872447, …

5
同时滚动的各种多面体骰子的分布是什么?
从一组地下城与龙的骰子中取出5种柏拉图式固体。这些骰子由4面,6面(常规),8面,12面和20面骰子组成。所有数字均从数字1开始,然后向上计数至总数1。 立即将它们全部滚动,取其总和(最小总和为5,最大为50)。这样做多次。分布是什么? 显然,它们的趋势将趋向于低端,因为更低的数字多于更高的数字。但是在单个模具的每个边界处是否会有明显的拐点? [编辑:显然,似乎没有。根据其中一位评论员,平均值为(5 + 50)/2=27.5。我没想到这一点。我仍然希望看到一个图形。] [Edit2:看到n个骰子的分布分别与每个骰子相同(加在一起)更有意义。]

1
RNN建模的可行序列长度是多少?
我正在研究使用递归神经网络(RNN)的LSTM(长期短期记忆)版本对时间序列数据进行建模。随着数据序列长度的增加,网络的复杂性也随之增加。因此,我很好奇准确建模的序列长度是多少? 我想使用相对简单的LSTM版本,而又不难实施最新技术。我的时间序列中的每个观测值可能都有4个数字变量,观测值的数量在100.000到1.000.000之间。

1
在什么级别上,检验在数学上与比例的检验相同?
背景:请安全跳过-在此仅供参考,并将问题合法化。 本文开头为: “卡尔·皮尔森(Karl Pearson)著名的卡方偶发性测验是基于正态分布,从另一个称为z统计量的统计量得出的。的最简单版本可以证明在数学上等同于等效z检验。在所有情况下,结果都是相同的。对于所有意图和目的,“卡方”都可以称为“ z平方”。一个自由度的的临界值是z的相应临界值的平方。χ2χ2\chi^2χ2χ2\chi^2 这已在CV中多次声明(此处,此处,此处及其他)。 而事实上,我们可以证明该相当于与:χ21dfχ1df2\chi^2_{1\,df}X2X2X^2X∼N(0,1)X∼N(0,1)X\sim N(0,1) 假设且并使用cdf方法求出的密度:X∼N(0,1)X∼N(0,1)X \sim N(0,1)Y=X2Y=X2Y=X^2YYYcdfcdfcdf p(Y≤y)=p(X2≤y)=p(−y√≤x≤y√)p(Y≤y)=p(X2≤y)=p(−y≤x≤y)p(Y \leq y) = p(X^2 \leq y)= p(-\sqrt{y} \leq x \leq \sqrt{y})。问题是我们不能以正态分布的密度紧密结合。但是我们可以表达它: FX(y)=FX(y√)−FX(−y√).FX(y)=FX(y)−FX(−y). F_X(y) = F_X(\sqrt{y})- F_X(-\sqrt[]{y}).取导数: fX(y)=F′X(y√)12y√+F′X(−y−−−√)12y√.fX(y)=FX′(y)12y+FX′(−y)12y. f_X(y)= F_X'(\sqrt{y})\,\frac{1}{2\sqrt{y}}+ F_X'(\sqrt{-y})\,\frac{1}{2\sqrt{y}}. 由于普通pdf的值pdfpdfpdf是对称的: fX(y)=F′X(y√)1y√fX(y)=FX′(y)1y f_X(y)= F_X'(\sqrt{y})\,\frac{1}{\sqrt{y}}。这等同于pdfpdfpdf正常的(即现在的xxx在pdfpdfpdf将y√y\sqrt{y},以被插入到e−x22e−x22e^{-\frac{x^2}{2}}正常的一部分pdfpdfpdf); 并记住最后要包含1y√1y\frac{1}{\sqrt{y}}: fX(y)=F′X(y√)1y√=12π−−√e−y21y√=12π−−√e−y2y12−1fX(y)=FX′(y)1y=12πe−y21y=12πe−y2y12−1 f_X(y)= F_X'(\sqrt[]{y})\,\frac{1}{\sqrt[]{y}}= \frac{1}{\sqrt{2\pi}}\,e^{-\frac{y}{2}}\, \frac{1}{\sqrt[]{y}}=\frac{1}{\sqrt{2\pi}}\,e^{-\frac{y}{2}}\, y^{\frac{1}{2}- 1} 与卡方的pdf相比: fX(x)=12ν/2Γ(ν2)e−x2xν2−1fX(x)=12ν/2Γ(ν2)e−x2xν2−1 f_X(x)= \frac{1}{2^{\nu/2}\Gamma(\frac{\nu}{2})}e^{\frac{-x}{2}}x^{\frac{\nu}{2}-1} 由于,对于 df,我们精确地得出了卡方的。 …

7
您想做什么来记住贝叶斯的规则?
我认为记住公式的一种好方法是考虑这样的公式: 给定独立事件B的结果,某些事件A具有特定结果的概率=两个结果同时发生的概率/无论我们说事件A期望结果的概率是如果我们不知道事件B的结果。 例如,考虑一个疾病测试:如果我们有一个患者的疾病测试呈阳性,并且我们知道:40%的疾病患者在我们的测试中呈阳性;60%的人患有这种疾病;共有26%的人对该病呈阳性反应;然后得出: 1)在我们抽样的所有人中,有24%的人呈阳性并患有疾病,这意味着在26名呈阳性的人中有24人患有该疾病;因此,2)该特定患者患病的可能性为92.3%。
15 bayesian  bayes 

4
文本挖掘:如何通过人工智能将文本(例如新闻文章)聚类?
我为不同的任务建立了一些神经网络(MLP(完全连接),Elman(递归)),例如打Pong,对手写数字和东西进行分类... 另外,我尝试建立一些第一个卷积神经网络,例如用于对多位数的手写笔记进行分类,但是我是全新的分析和聚类文本的人,例如在图像识别/聚类任务中,人们可以依靠标准化输入,例如25x25大小的图像, RGB或灰度等...有很多预设定功能。 对于文本挖掘(例如新闻报道),您需要不断变化的输入大小(不同的单词,不同的句子,不同的文本长度等)。 如何利用人工智能(最好是神经网络/ SOM)实现一种现代的文本挖掘工具? 不幸的是,我无法找到简单的入门教程。复杂的科学论文难以阅读,也不是学习主题的最佳选择(就我个人而言)。我已经阅读了很多有关MLP,辍学技术,卷积神经网络等的论文,但是我找不到关于文本挖掘的基础文章-对于我非常有限的文本挖掘技能来说,我发现的水平太高了。

1
ARIMA模型的正则化
我知道线性回归模型中的LASSO,山脊和弹性网正则化类型。 题: 可以将这种(或类似的)惩罚估计应用于ARIMA建模(具有非空MA部分)吗? pmaxpmaxp_{max}qmaxqmaxq_{max} q ⩽ q 米一个Xp⩽pmaxp⩽pmaxp \leqslant p_{max}q⩽qmaxq⩽qmaxq \leqslant q_{max} 我的其他问题是: 我们是否可以包括(,)之前的所有项,但是会惩罚系数的大小(可能一直到零)?那有道理吗? q 中号一个Xpmaxpmaxp_{max}qmaxqmaXq_{max} 如果可以,是否已在R或其他软件中实现?如果没有,那是什么麻烦? 一些相关的帖子可以在这里找到。

1
线性模型的BLUE(OLS解决方案)以外的其他无偏估计量
对于线性模型,OLS解决方案为参数提供了最佳的线性无偏估计量。 当然,我们可以将偏差换成较低的方差,例如岭回归。但是我的问题是关于没有偏见。是否还有其他一些较常用的估计器,它们没有偏倚但与OLS估计的参数相比具有更高的方差? 如果我有一个庞大的数据集,我当然可以对其进行二次采样,并用较少的数据估计参数,并增加方差。我认为这可能是有用的。 这更多是一个修辞性的问题,因为当我阅读有关BLUE估计量的信息时,没有提供更糟糕的选择。我猜想提供更差的选择还可以帮助人们更好地理解BLUE估计器的功能。

1
如何回应贝叶斯多级模型中要求p值的评论者?
审阅者要求我们提供p值,以便更好地了解我们的贝叶斯多级模型中的模型估计。该模型是实验中每个参与者的多个观察值的典型模型。我们使用Stan估计了模型,因此我们可以轻松地计算其他后验统计量。目前,我们正在报告(通过视觉和表格形式)平均估算值以及0.025和0.975分位数。 到目前为止,我的回应包括: P值与贝叶斯模型不一致,即P(X| θ)≠P(θ | X)。P(X|θ)≠P(θ|X)。P(X|\theta) \neq P(\theta|X). 基于后验,我们可以计算出参数大于(小于)0的概率。这看起来有点像传统的p值。 我的问题是,这是否可以使评论者满意,还是只会引起更多的混乱? 10月10日更新:考虑到答案,我们使用建议将论文重写了。该论文已被接受,因此我将重申先前的评论,这确实是有用的建议!

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.