统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何是所定义时
假设ÿYY是连续随机变量,而XXX是离散变量。 PR (X=x | ÿ= y)=Pr (X= x)Pr (Y= y| X= x)镨(ÿ= y)Pr(X=x|Y=y)=Pr(X=x)Pr(Y=y|X=x)Pr(Y=y) \Pr(X=x|Y=y) = \frac{\Pr(X=x)\Pr(Y=y|X=x)}{\Pr(Y=y)} 众所周知,镨(ÿ=y)= 0Pr(Y=y)=0\Pr(Y=y) = 0因为ÿYY是连续的随机变量。并且据此,我很容易得出结论,概率镨(X= x |ÿ=y)Pr(X=x|Y=y)\Pr(X=x|Y=y)是不确定的。 但是,维基百科在此声称实际上定义如下: PR (X= x | ÿ= y)= Pr (X= x )fÿ| X= x(y)Fÿ(y)Pr(X=x|Y=y)=Pr(X=x)fY|X=x(y)fY(y) \Pr(X=x|Y=y) = \frac{\Pr(X=x) f_{Y|X=x}(y)}{f_Y(y)} 问题:维基百科如何设法确定这种可能性? 我的尝试 这是我的尝试,目的是使Wikipedia在限制方面获得结果: PR (X= x | ÿ= y)= Pr (X= …

1
Iid随机变量之和的平方根的中心极限定理
出于对math.stackexchange的一个问题的兴趣,并进行了实证研究,我想知道以下有关iid随机变量之和的平方根的陈述。 假设是具有有限非零均值和方差 iid随机变量,并且。中心极限定理说随着增加。X1个,X2,… ,XñX1,X2,…,XnX_1, X_2, \ldots, X_nμμ\muσ2σ2\sigma^2ÿ= ∑我= 1ñX一世Y=∑i=1nXi\displaystyle Y=\sum_{i=1}^n X_iÑÿ- Ñ μñ σ2---√ →d ñ(0 ,1 )Y−nμnσ2 →d N(0,1)\displaystyle \dfrac{Y - n\mu}{\sqrt{n\sigma^2}} \ \xrightarrow{d}\ N(0,1)ñnn 如果,我也可以说类似随着增加?ž - √ž= | ÿ|---√Z=|Y|Z=\sqrt{|Y|}Ñž− n | μ | - σ24 | μ |--------√σ24 | μ |---√ →d ñ(0 ,1 )Z−n|μ|−σ24|μ|σ24|μ| →d N(0,1)\displaystyle \dfrac{Z …

1
R / mgcv:为什么te()和ti()张量积产生不同的曲面?
的mgcv软件包R具有两个功能,用于拟合张量积相互作用:te()和ti()。我了解两者之间的基本分工(拟合非线性交互与将这种交互分解为主要效果和交互)。我不明白的是为什么te(x1, x2)而ti(x1) + ti(x2) + ti(x1, x2)可能产生(略)不同的结果。 MWE(改编自?ti): require(mgcv) test1 <- function(x,z,sx=0.3,sz=0.4) { x <- x*20 (pi**sx*sz)*(1.2*exp(-(x-0.2)^2/sx^2-(z-0.3)^2/sz^2)+ 0.8*exp(-(x-0.7)^2/sx^2-(z-0.8)^2/sz^2)) } n <- 500 x <- runif(n)/20;z <- runif(n); xs <- seq(0,1,length=30)/20;zs <- seq(0,1,length=30) pr <- data.frame(x=rep(xs,30),z=rep(zs,rep(30,30))) truth <- matrix(test1(pr$x,pr$z),30,30) f <- test1(x,z) y <- f + rnorm(n)*0.2 par(mfrow = c(2,2)) # …
11 r  gam  mgcv  conditional-probability  mixed-model  references  bayesian  estimation  conditional-probability  machine-learning  optimization  gradient-descent  r  hypothesis-testing  wilcoxon-mann-whitney  time-series  bayesian  inference  change-point  time-series  anova  repeated-measures  statistical-significance  bayesian  contingency-tables  regression  prediction  quantiles  classification  auc  k-means  scikit-learn  regression  spatial  circular-statistics  t-test  effect-size  cohens-d  r  cross-validation  feature-selection  caret  machine-learning  modeling  python  optimization  frequentist  correlation  sample-size  normalization  group-differences  heteroscedasticity  independence  generalized-least-squares  lme4-nlme  references  mcmc  metropolis-hastings  optimization  r  logistic  feature-selection  separation  clustering  k-means  normal-distribution  gaussian-mixture  kullback-leibler  java  spark-mllib  data-visualization  categorical-data  barplot  hypothesis-testing  statistical-significance  chi-squared  type-i-and-ii-errors  pca  scikit-learn  conditional-expectation  statistical-significance  meta-analysis  intuition  r  time-series  multivariate-analysis  garch  machine-learning  classification  data-mining  missing-data  cart  regression  cross-validation  matrix-decomposition  categorical-data  repeated-measures  chi-squared  assumptions  contingency-tables  prediction  binary-data  trend  test-for-trend  matrix-inverse  anova  categorical-data  regression-coefficients  standard-error  r  distributions  exponential  interarrival-time  copula  log-likelihood  time-series  forecasting  prediction-interval  mean  standard-error  meta-analysis  meta-regression  network-meta-analysis  systematic-review  normal-distribution  multiple-regression  generalized-linear-model  poisson-distribution  poisson-regression  r  sas  cohens-kappa 

1
为什么非负性对于协作过滤/推荐系统很重要?
在我所看到的所有现代推荐器系统中,都依赖于矩阵分解,在用户电影矩阵上执行非负矩阵分解。我能理解为什么非负性对于可解释性和/或想要稀疏因子很重要。但是,如果您只关心预测性能,例如在netflix奖金竞赛中,为什么要施加非负性限制?与在因数分解中也允许负值相比,这似乎更加糟糕。 本文是在协同过滤中使用非负矩阵分解的一个被高度引用的示例。

2
机器学习技术,用于学习字符串模式
我有一个单词列表,属于不同的自定义类别。每个类别都有其自己的模式(例如,一个具有固定长度的特殊字符,另一种仅存在于“单词”的类别中的字符,...)。 例如: "ABC" -> type1 "ACC" -> type1 "a8 219" -> type2 "c 827" -> type2 "ASDF 123" -> type2 "123123" -> type3 ... 我正在寻找一种机器学习技术,根据训练数据自行学习这些模式。我已经尝试自己定义一些预测变量(例如,字长,特殊字符的数量...),然后使用神经网络来学习和预测类别。但这根本不是我想要的。我希望有一种技术可以自己学习每个类别的模式,甚至可以学习我从未想过的模式。 因此,我提供了算法学习数据(由单词类别示例组成),并希望它学习每种类别的模式,以便以后根据相似或相等的单词来预测类别。 有最先进的方法吗? 谢谢你的帮助

3
逆指数分布的均值
给定一个随机变量,G = 1的均值和方差是多少ÿ= EX p (λ )Y=Exp(λ)Y = Exp(\lambda)?G = 1ÿG=1YG=\dfrac{1}{Y} 我看了逆伽玛分布,但均值和方差仅分别针对和α > 2进行了定义...α > 1α>1\alpha>1α > 2α>2\alpha>2


2
正弦和余弦之间的相关性
假设XXX均匀地分布在[ 0 ,2个π][0,2π][0, 2\pi]。让ÿ= 罪XY=sin⁡XY = \sin X和ž= cosXZ=cos⁡XZ = \cos X。证明ÿYY和之间的相关性žZZ为零。 看来我需要知道正弦和余弦的标准偏差及其协方差。我该如何计算? 我认为我需要假设XXX具有均匀的分布,然后看一下转换后的变量ÿ= 罪(X)Y=sin⁡(X)Y=\sin(X)和ž= cos(X)Z=cos⁡(X)Z=\cos(X)。然后潜意识统计学家的定律将给出期望值 Ë[ Y] = 1b − a∫∞- ∞罪(x )dXE[Y]=1b−a∫−∞∞sin⁡(x)dxE[Y] = \frac{1}{b-a}\int_{-\infty}^{\infty} \sin(x)dx和Ë[ Z] = 1b − a∫∞- ∞cos(x )dXE[Z]=1b−a∫−∞∞cos⁡(x)dxE[Z] = \frac{1}{b-a}\int_{-\infty}^{\infty} \cos(x)dx (密度是恒定的,因为它是均匀的分布,因此可以从积分中移出)。 但是,这些积分没有定义(但我认为柯西主值是零)。 我该如何解决这个问题?我想我知道解决方案(相关性为零,因为正弦和余弦具有相反的相位),但是我找不到如何导出它。

2
线性回归,条件期望和期望值
好的,所以在一些事情上有些朦胧,任何帮助将不胜感激。据我了解,线性回归模型是通过条件期望来预测的 E(Y|X)=b+Xb+eE(Y|X)=b+Xb+eE(Y|X)=b+Xb+e 我们是否假设和都是具有未知概率分布的随机变量?据我了解,只有残差和估计的β系数是随机变量。如果是这样,例如,如果肥胖,年龄,如果我们采用条件期望含义,那么如果个体在整个样本中为,则肥胖的期望值是多少?对于那些观测值,只需取y的平均值(算术平均值)即可。但是,期望值不是必须将其乘以发生的概率吗?但是从这个意义上讲,我们如何找到的概率Y Y = X = E (Y | X = 35 )35 X = 35 XXXXYYYY=Y=Y =X=X=X =E(Y|X=35)E(Y|X=35)E(Y|X=35)353535X=35X=35X=35XXX值变量是否代表年龄? 如果代表汇率之类的东西,会被归类为随机的吗?您究竟如何在不知道概率的情况下找到期望值?还是期望值等于极限中的平均值。XXX 如果我们不假设因变量本身就是随机变量,那么由于我们不推论概率,那么我们假设它们是什么?只是固定值之类的?但是如果是这种情况,我们如何以一个非随机变量为条件呢?关于自变量分布,我们假设什么? 很抱歉,如果没有任何意义或对任何人来说都是显而易见的。
11 regression 


1
凭直觉,为什么交叉熵可以度量两个概率分布的距离?
对于两个离散分布和,交叉熵定义为pppqqq H(p ,q)= − ∑Xp (x )对数q( x )。H(p,q)=-∑Xp(X)日志⁡q(X)。H(p,q)=-\sum_x p(x)\log q(x). 我不知道为什么这将是两个概率分布之间距离的直观度量? 我看到是熵p,其中的措施“惊喜” p。H(p,q)是用q代替p的度量。我仍然不理解该定义背后的直观含义。H(p ,p )H(p,p)H(p,p)ppppppH(p ,q)H(p,q)H(p,q)pppqqq

2
《统计学习入门》中的“函数”的方差是什么意思?
在pg。统计学习入门中的 34 :\newcommand{\Var}{{\rm Var}} 虽然数学证明超出了本书的范围,有可能表明期望的测试MSE,给定值X0X0x_0,总是可以分解为三个基本量的总和:在变化的F^(x0)F^(X0)\hat{f}(x_0),平方偏差的F^(x0)F^(X0)\hat{f}(x_0)和误差项的方差εε\varepsilon。那是, Ë(y0−f^(x0))2=Var(f^(x0))+[Bias(f^(x0))]2+Var(ε)Ë(ÿ0-F^(X0))2=V一个[R(F^(X0))+[乙一世一个s(F^(X0))]2+V一个[R(ε) E\left(y_0 - \hat{f}(x_0)\right)^2 = \Var\big(\hat{f}(x_0)\big) + \Big[{\rm Bias}\big(\hat{f}(x_0)\big)\Big]^2 + \Var(\varepsilon) [...]方差是指如果我们使用不同的训练数据集来估计f^F^\hat{f}变化量。 问题:由于Var(f^(x0))V一个[R(F^(X0))\Var\big(\hat{f}(x_0)\big)似乎表示函数的方差,因此这在形式上是什么意思? 也就是说,我熟悉随机变量X的方差的概念XXX,但是一组函数的方差又如何呢?可以将其视为函数形式的另一个随机变量的方差吗?

2
在线参考介绍OLS
我开始研究普通最小二乘(OLS)估计量,但仍处于起步阶段。我已经买了一些关于计量经济学的书,但是我没有在网上找到任何东西。因此,我想知道是否存在一个网站,主页或其他在线资源,它们以详尽的方式解释了最小二乘估计。我正在寻找提供一般介绍或概述的材料。到目前为止,我在互联网上没有发现任何令人难以置信的东西。有人有一些有用的参考吗? 理想的在线参考文献以一种简单的方式解释了OLS的用途。理想情况下,它还提供有关特定主题的示例和更多信息,例如估算器的数学推导,OLS的假设或估算器无偏的数学点。我不是在寻找计量经济学书的pdf文件。

2
长短期记忆(LSTM)递归神经网络背后的直觉是什么?
循环神经网络(RNN)背后的想法对我很清楚。我以以下方式理解它:我们有一系列观察()(或换句话说,多元时间序列)。每个单个观测是一个维数值向量。在RNN模型中,我们假定下一个观测值是先前观测值以及先前的“隐藏状态”,其中隐藏状态也由数字表示向量(观察状态和隐藏状态的尺寸可以不同)。还假定隐藏状态本身取决于先前的观察和隐藏状态:o⃗ 1,o⃗ 2,…,o⃗ nØ→1个,Ø→2,…,Ø→ñ\vec o_1, \vec o_2, \dots, \vec o_no⃗ iØ→一世\vec o_iNñNo⃗ i+1Ø→一世+1个\vec o_{i+1}o⃗ iØ→一世\vec o_{i}h⃗ iH→一世\vec h_i Ø⃗ 一世,小时⃗ 一世= F(o⃗ i − 1,小时⃗ i − 1)Ø→一世,H→一世=F(Ø→一世-1个,H→一世-1个)\vec o_i, \vec h_i = F (\vec o_{i-1}, \vec h_{i-1}) 最后,在RNN模型中,函数FFF被假定为神经网络。我们使用可用数据(观察序列)训练(拟合)神经网络。我们训练的目标是能够使用先前的观察结果尽可能准确地预测下一个观察结果。 现在,LSTM网络是对RNN网络的修改。据我了解,LSTM背后的动机是解决RNN特有的短存储问题(常规RNN在相关事件之间存在时间间隔过长的问题)。 我了解LSTM网络是如何工作的。这是我发现的LSTM的最佳解释。基本思想如下: 除了隐藏状态向量之外,我们还引入了一种所谓的“单元状态”向量,该向量具有与隐藏状态向量(C⃗ 一世C→一世\vec c_i)相同的大小(维数)。我认为引入了“细胞状态”向量来建模长期记忆。与常规RNN一样,LSTM网络将观察到的和隐藏的状态作为输入。使用此输入,我们可以通过以下方式计算新的“单元状态”: C⃗ 我+ 1= ω⃗ 1个(o⃗ 一世,小时⃗ 一世)⋅ …

1
(线性回归)预测的调整
全面披露:我不是统计学家,也不声称自己是统计学家。我是一个低级的IT管理员。请和我一起玩。:) 我负责收集和预测我们企业的磁盘存储使用情况。我们每月收集存储使用情况,并使用简单的滚动式十二个月线性回归进行预测(换句话说,进行预测时仅考虑前十二个月的数据)。我们将这些信息用于分配和资本支出计划,例如“基于此模型,如果要在y个月内存储以满足我们的需求,我们将需要购买x数量。” 所有这些都能很好地满足我们的需求。 周期性地,我们的数字出现了一次大的波动,这使预测不合时宜。例如,某人发现不再需要的500GB旧备份,并将其删除。对他们有利于回收空间!但是,我们的预测现在因一个月的大幅下降而偏离了。我们一直都接受这样的下降需要9到10个月的时间才能摆脱模型,但是如果我们进入资本支出计划的季节,那可能会花费很长时间。 我想知道是否有一种方法可以处理这些一次性变化,以使预测值不会受到太大影响(例如,线的斜率不会发生太大变化),但是将它们考虑在内(例如与特定时间点相关的y值的一次变化)。我们为解决这个问题而进行的首次尝试已产生了一些丑陋的结果(例如指数增长曲线)。如果重要的话,我们将在SQL Server中进行所有处理。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.