统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

6
我想学习概率论,度量理论,最后是机器学习。我从哪里开始?[关闭]
已关闭。这个问题需要更加集中。它当前不接受答案。 想改善这个问题吗?更新问题,使其仅通过编辑此帖子来关注一个问题。 3年前关闭。 我想学习概率论,度量理论,最后是机器学习。我的最终目标是在一个软件中使用机器学习。 我在大学里学习了微积分和非常基本的概率,但是仅此而已。您知道一些我可以用来学习这些主题的在线课程或书籍吗?我在网上找到了很多资源,但它们似乎都是针对专业观众的。我知道这将需要一些时间,但是如果我想从头开始学习,该从哪里开始呢?

3
贝叶斯何时(以及为什么)拒绝有效的贝叶斯方法?[关闭]
已关闭。这个问题需要细节或说明。它当前不接受答案。 想改善这个问题吗?添加详细信息并通过编辑此帖子来澄清问题。 3年前关闭。 从我阅读的内容以及对我在此处提出的其他问题的答案来看,许多所谓的常客方法在数学上都对应于特殊情况(所谓“频繁主义者”在数学上相对应,我不在乎它们是否在数学上相对应,我只是在乎它是否在数学上相对应)。贝叶斯方法(对于那些反对者,请参阅此问题底部的注释)。这个对相关问题(不是我的问题)的回答支持以下结论: 大多数Frequentist方法都具有贝叶斯等效项,在大多数情况下,其结果基本相同。 注意,在下文中,数学上相同意味着给出相同结果。如果您描述两种方法的特征,可以证明它们总是能得到与“不同”相同的结果,那是您的权利,但这是一种哲学判断,而不是数学判断或实践判断。 但是,许多自称为“贝叶斯方法”的人似乎拒绝在任何情况下都使用最大似然估计,尽管这是(数学上)贝叶斯方法的特例,因为它是“频率论方法”。显然,与贝叶斯主义者相比,贝叶斯主义者还使用有限/有限数量的分布,即使从贝叶斯观点来看,这些分布在数学上也是正确的。 问题:从贝叶斯的角度来看,贝叶斯何时,为什么拒绝在数学上正确的方法?有没有不是“哲学上的”理由吗? 背景/上下文:以下是我对CrossValidated上一个问题的回答和评论中的引文: 贝叶斯与频繁主义者辩论的数学基础非常简单。在贝叶斯统计中,未知参数被视为随机变量。在常客统计中,它被视为固定要素... 从以上所述,我可以得出以下结论:(从数学上来说)贝叶斯方法比常客方法更通用,在某种意义上,常客模型满足所有与贝叶斯模型相同的数学假设,反之则不然。但是,相同的答案也认为我从以上得出的结论是错误的(以下是我的结论): 尽管常数是随机变量的特例,但我还是会得出结论,贝叶斯主义更为笼统。简单地将随机变量折叠成一个常数,就不会从贝叶斯函数得到频繁的结果。区别更加深刻... 根据个人喜好...我不喜欢贝叶斯统计使用可用分布的有限子集。 另一位用户,在他们的答案,说正好相反,贝叶斯方法都比较一般,但奇怪的是我能找到的,为什么这可能是这种情况的最好理由是以前的答案,有人作为一个训练有素的频率论定。 数学上的结果是,频繁主义者认为概率的基本方程式有时仅适用,而贝叶斯主义者则认为它们总是适用。因此,他们认为相同的方程式是正确的,但是在通用性上却有所不同……贝叶斯严格比频率论更为通用。由于任何事实都可能存在不确定性,因此可以为任何事实分配概率。特别是,如果您正在处理的事实与现实世界的频率有关(无论是您预测的还是数据的一部分),那么贝叶斯方法就可以像对待任何其他现实世界的事实一样考虑和使用它们。因此,频频主义者觉得他们的方法适用于贝叶斯方法的任何问题也可以自然地解决。 从以上答案中,我得到的印象是,至少有两个常用的贝叶斯术语的不同定义。首先,我将其称为“数学贝叶斯”,它涵盖了所有统计方法,因为它包含了恒定RV和非恒定RV的参数。然后是“文化上的贝叶斯”方法,它拒绝了某些“数学上的贝叶斯”方法,因为这些方法是“频繁的”(即出于对参数的个人仇恨,有时将其建模为常数或频率)。对上述问题的另一个答案似乎也支持这一推测: 还要注意的是,两个营地所使用的模型之间存在很大的差异,这与已完成的事情比可以完成的事情更多相关(即,一个营地传统上使用的许多模型可以由另一个营地证明))。 因此,我想表达我的问题的另一种方式是:如果文化贝叶斯人拒绝许多数学上的贝叶斯方法,为什么他们会称自己为贝叶斯人?为什么他们拒绝这些数学上的贝叶斯方法?对于最经常使用这些特定方法的人来说,这是个人仇恨吗? 编辑:如果两个对象具有相同的属性,则无论它们如何构造,在数学上都是等效的。例如,我可以想到至少五种不同的方式来构造虚部。然而,关于虚数的研究至少没有五种不同的“思想流派”。实际上,我相信只有一个人,即研究他们属性的那个人。对于那些反对使用最大似然来获得点估计与使用最大先验和统一先验来获得点估计的人不同,因为所涉及的计算是不同的,我承认它们在哲学意义上是不同的,但是他们总是在多大程度上一世ii给出相同的估计值,它们在数学上是等效的,因为它们具有相同的属性。哲学上的差异可能与您个人相关,但与该问题无关。 注意:此问题最初具有统一先验的MLE估计和MAP估计的不正确表征。

1
法线的二次形式的分布
我试图找出 这里 Ž 我〜Ñ(0 ,1 ),IID我知道,单独服用各条款, Ñ Σ我= 1 ž 2 我〜χ 2(Ñ ) 和 1(n−1)∑i=1nZ2i−(∑i=1nZi)2(∗)(n−1)∑i=1nZi2−(∑i=1nZi)2(∗) (n-1) \sum_{i=1}^n Z_i^2 - \left( \sum_{i=1}^n Z_i \right)^2 \qquad (*) Zi∼N(0,1)Zi∼N(0,1)Z_i \sim \mathcal{N}(0,1)∑i=1nZ2i∼χ2(n)∑i=1nZi2∼χ2(n) \sum_{i=1}^n Z_i^2 \sim \chi^2(n) 但是我不确定(*)的分布1n(∑i=1nZi)2∼χ2(1).1n(∑i=1nZi)2∼χ2(1). \frac{1}{n}\left( \sum_{i=1}^n Z_i \right)^2 \sim \chi^2(1).

2
模拟板球保龄球手击球手
我有一个数据集,详细介绍了许多板球比赛(数千场)。在板球比赛中,“保龄球手”反复向“蝙蝠侠”接连投球。圆顶硬礼帽试图使击球手“离开”。在这方面,它与棒球中的投手和击球手非常相似。 如果我将整个数据集除以击球手得到的球的总数除以保龄球的总数,我可以看到投球手得到击球手的平均概率为-大约为0.03(希望我没有错吗?) 我感兴趣的是我可以做些什么,以尝试计算下一个球上某个特定的投球手被一个特定的投球手击出的概率。 数据集足够大,以至于任何给定的投球手都可以将数千个球投向各种击球手。因此,我相信我可以简单地将投球手的出球次数除以他投球的次数,从而计算出该特定投球手从下一个球出局的新概率。 我的问题是数据集不够大,无法保证给定的投球手在给定的击球手处投了统计上显着数量的球。因此,如果我对计算特定投球手面对特定板球手的出局概率感兴趣,我认为这不可能以同样简单的方式完成。 我的问题是以下方法是否有效: 在整个数据集中,球出局的概率为0.03。 如果我计算出平均礼帽A有超过0.06的概率(即,平均礼帽的两倍), 并且平均而言,击球手B的概率超过0.01(是平均击球手的三分之一), 那么可以说那个特定的击球手在那个特定的投球手的下一个球上出球的概率是0.06 *(0.01 / 0.03)= 0.02吗?

1
奥运会-匈牙利的金双位数铅?(人口相对)
我创建了一个网页,其中提取了汤普森·路透社的实时奥运奖牌结果以及中央情报局的全球人口统计。 结果对我来说很有趣-匈牙利在世界其他地区的金牌获得两位数的领先优势。而且,美国和中国几乎在每个类别中都排名最低。 我的问题是-我是否以公平的方式展示数据?我简单地考虑了最大的人口,然后在此基础上为每个国家/地区创建了一个因子。 相对奖牌计数列基于该因子。 我可以添加哪些列?我还能添加什么其他因素来呈现最公正的看法?绝对观点很容易-路透社做到了。如何创建一个公平的看法? https://rack.pub/rio

1
线性基础学习器如何促进学习?以及它如何在xgboost库中工作?
我知道如何在XGBoost中实现线性目标函数和线性提升。我的具体问题是:当算法适合残差(或负梯度)时,是在每个步骤使用一个特征(即单变量模型)还是在所有特征(多元模型)中使用? 任何有关XGBoost中线性增强功能的文档参考都将受到赞赏。 编辑:通过将“ booster”参数设置为“ gblinear”,可以在XGBoost中实现线性增强。有关线性增强的有用信息,请参见:http : //www.ncbi.nlm.nih.gov/pmc/articles/PMC3885826/。请注意,我并不是在谈论目标函数(也可以是线性的),而是关于提升它们自己。 谢谢!

1
查找
考虑从均匀分布提取的3个iid样本 ,其中是参数。我想找到 其中是订单统计。θ È [ X (2 ) | X (1 ),X (3 ) ] X (i ) iu(θ,2θ)u(θ,2θ)u(\theta, 2\theta)θθ\thetaE[X(2)|X(1),X(3)]E[X(2)|X(1),X(3)] \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] X(i)X(i)X_{(i)}iii 我希望结果是 但是我唯一能显示此结果的方法似乎也是冗长,我无法提出简单的解决方案,我是否缺少某些东西,是否有一些捷径?E[X(2)|X(1),X(3)]=X(1)+X(3)2E[X(2)|X(1),X(3)]=X(1)+X(3)2 \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] = \frac{X_{(1)}+ X_{(3)}}{2} 我要做的是以下几点: 我发现条件密度 f(x(2)|x(1),x(3))=f(x(1),x(2),x(3))f(x(1),x(3))f(x(2)|x(1),x(3))=f(x(1),x(2),x(3))f(x(1),x(3)) f(x_{(2)}| x_{(1)}, x_{(3)}) = \frac{ f(x_{(1)}, x_{(2)}, x_{(3)})}{f(x_{(1)}, x_{(3)})} 我整合 E[X(2)|X(1),X(3)]=∫xf(x|x(1),x(3))dxE[X(2)|X(1),X(3)]=∫xf(x|x(1),x(3))dx \mathbb{E}\left[X_{(2)}| X_{(1)}, X_{(3)}\right] = …

2
可扩展的尺寸缩减
考虑到特征数量恒定,Barnes-Hut t-SNE的复杂度为,随机投影和PCA的复杂度为使它们对于非常大的数据集“负担得起”。O (n )O(nlogn)O(nlog⁡n)O(n\log n)O(n)O(n)O(n) 另一方面,依赖多维缩放的方法具有复杂度。O(n2)O(n2)O(n^2) 是否存在其他复杂度低于降维技术(除了琐碎的降维技术,例如,看前列?O (n log n )kkkO(nlogn)O(nlog⁡n)O(n\log n)

1
我刚刚进行了200万次回归-综合可能性
我目前正在努力实现一种流行的论文中使用的方法,该论文的标题为“ I Just Ran 200万Regressions”。其背后的基本思想是,在某些情况下,不清楚应在模型中包括哪些控件。在这种情况下,您可以做的一件事是随机绘制控件,运行数百万种不同的回归,然后查看您感兴趣的变量如何反应。如果它在所有规范中通常都具有相同的符号,那么我们可以认为它比符号总是变化的变量更可靠。 大部分论文非常清楚。但是,本文通过以下方式对所有这些不同的回归进行加权:给定规范的综合可能性除以所有规范的所有综合可能性之和。 我遇到的麻烦是,我不确定积分的可能性与我想运行的OLS回归(在Stata中)如何相关。在我不断碰到诸如混合效应逻辑回归之类的问题时,诸如“状态综合可能性”之类的谷歌搜索主题一直是死胡同。我承认这些模型太复杂了,我无法掌握。 我目前的工作是,我确实(有点)理解文献中使用了不同的加权方案。例如,可以基于似然比指数对每个回归进行加权。甚至有一个使用lri作为权重的R包。当然,我也想实施原始版本。 有什么建议吗? 论文链接:http : //down.cenet.org.cn/upfile/34/2009112141315178.pdf


1
二项式条件下未来成功比例的预测间隔
假设我拟合了二项式回归并获得了点估计和回归系数的方差-协方差矩阵。这样一来,我就可以为将来的实验的预期成功比例获得CI ,但是我需要为观察到的比例获得CI。已经发布了一些相关的答案,包括模拟(假设我不想这样做)和指向Krishnamoorthya等人的链接(并不能完全回答我的问题)。ppp 我的推理如下:如果仅使用二项式模型,则不得不假定是从正态分布中采样的(具有相应的Wald CI),因此不可能以封闭形式获得观察比例的CI。如果我们假设p是从beta分布中采样的,那么事情就容易多了,因为成功次数将遵循Beta-Binomial分布。我们将不得不假设估计的beta参数α和β没有不确定性ppppppαα\alphaββ\beta。 有三个问题: 1)理论上:仅使用beta参数的点估计值可以吗?我知道在多元线性回归中构造CI以便将来观察 ÿ= x′β+ ε ,ε 〜Ñ(0 ,σ2)ÿ=X′β+ϵ,ϵ〜ñ(0,σ2)Y = x'\beta + \epsilon, \epsilon \sim N(0, \sigma^2) 他们这样做的WRT误差项方差,。我把它(如果我错了纠正我)的理由是,在实践中σ 2估计比回归系数远远更高的精度,我们不会得到太多的试图将不确定性σ 2。类似的理由适用于估计的beta参数α和β吗?σ2σ2\sigma^2σ2σ2\sigma^2σ2σ2\sigma^2αα\alphaββ\beta 2)哪种软件包更好(R:gamlss-bb,betareg,odd ?;我也可以使用SAS)。 3)给定估计的beta参数,是否有(近似)捷径来获得未来成功计数的分位数(2.5%,97.5%),或者更好的是,根据Beta-Binomial分布获得未来成功的比例。

1
使用ARIMA和LSTM进行时间序列预测
我要处理的问题是预测时间序列值。我正在一次查看一个时间序列,例如,基于15%的输入数据,我想预测其未来值。到目前为止,我遇到了两种模型: LSTM(长期短期记忆;一类递归神经网络) 有马 我都尝试过并阅读了一些文章。现在,我试图更好地了解如何比较两者。到目前为止,我发现了什么: 如果我们要处理大量数据并且有足够的训练数据,那么LSTM会更好地工作,而ARIMA对于较小的数据集则更好(这是正确的吗?) ARIMA需要一系列(p,q,d)必须根据数据计算的参数,而LSTM不需要设置此类参数。但是,我们需要为LSTM调整一些超参数。 除了上述特性之外,我找不到其他可以帮助我选择最佳模型的要点或事实。如果有人可以帮助我查找文章,论文或其他东西,我将非常感谢(到目前为止,还没有运气,这里和那里只有一些一般性意见,而没有基于实验的内容。) 我不得不提到,最初我是在处理流数据,但是现在我使用的是NAB数据集,其中包括50个数据集,最大大小为2万个数据点。

2
“拉普拉斯噪声”是什么意思?
我目前正在使用Laplace机制编写差分隐私算法。 不幸的是,我没有统计学背景,因此我不知道很多术语。因此,现在我对术语“ 拉普拉斯噪声”不休。为了使数据集微分私有,所有论文都只是讨论根据函数的Laplace分布添加Laplace噪声。 k(X)=f(X)+Y(X)k(X)=f(X)+Y(X)k(X) = f(X) + Y(X) (k是微分私有值,f是评估函数返回的值,Y是拉普拉斯噪声) 这是否意味着我根据Wikipedia https://en.wikipedia.org/wiki/Laplace_distribution的功能从Laplace分布中创建随机变量? Y=μ−b sgn(U)ln(1−2|U|)Y=μ−b sgn(U)ln⁡⁡(1−2|U|) Y = μ − b\ \text{sgn}(U) \ln ⁡ ( 1 − 2 | U | ) 更新:我从上面的函数中绘制了多达100个随机变量,但这并没有给我拉普拉斯分布(甚至不接近)。但是我认为它应该为拉普拉斯分布建模。 UPDATE2: 这些是我的定义: (拉普拉斯机制)。给定任何函数f:N|X|→Rkf:N|X|→Rkf:N^{|X|}→R^k,拉普拉斯机制定义为:ML(x,f(⋅),ϵ)=f(x)+(Y1,...,Yk)ML(x,f(·),ϵ)=f(x)+(Y1,...,Yk)M_L(x, f(·),\epsilon)=f(x)+(Y_1,...,Y_k),其中Y是从Lap(∆f / \ epsilon)得出的iid随机变量Lap(Δf/ϵ)Lap(∆f/ϵ)Lap(∆f/\epsilon) 以及: 要生成Y(X),通常的选择是使用均值为零且标度参数为((f)/ε)的拉普拉斯分布

2
如何在线性回归中计算x截距的置信区间?
由于通常对响应变量给出线性回归的标准误差,因此我想知道如何在另一个方向上获取置信区间,例如对于x截距。我可以看到它可能是什么,但是我敢肯定必须有一种简单的方法来做到这一点。下面是R中如何形象化显示的示例: set.seed(1) x <- 1:10 a <- 20 b <- -2 y <- a + b*x + rnorm(length(x), mean=0, sd=1) fit <- lm(y ~ x) XINT <- -coef(fit)[1]/coef(fit)[2] plot(y ~ x, xlim=c(0, XINT*1.1), ylim=c(-2,max(y))) abline(h=0, lty=2, col=8); abline(fit, col=2) points(XINT, 0, col=4, pch=4) newdat <- data.frame(x=seq(-2,12,len=1000)) # CI pred <- …

1
可以使用线性回归中的标准化
我试图解释一篇文章的结果,他们运用多元回归来预测各种结果。但是的(定义为标准B系数,其中是从属变量且是预测变量)报告似乎与报告的不匹配:ββ\betaβx1=Bx1⋅SDx1SDyβx1=Bx1⋅SDx1SDy\beta_{x_1} = B_{x_1} \cdot \frac{\mathrm{SD}_{x_1}}{\mathrm{SD}_y}yyyx1x1x_1R2R2R^2 尽管为-0.83,-0.29,-0.16,-0.43、0.25和-0.29,但报告的仅为0.20。ββ\betaR2R2R^2 同样,三个预测因子:体重,BMI和脂肪%是共线的,在性别内彼此相关,r = 0.8-0.9。 值是否适合这些,或者与之间没有直接关系?R2R2R^2ββ\betaββ\betaR2R2R^2 此外,多共线性预测变量的问题可能会影响第四个预测变量的(VO2max),它与上述三个变量在r = 0.4附近相关吗?ββ\beta

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.