统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
非随机伯努利变量的这个随机和的概率分布是多少?
我试图找到随机分布的变量总数之和的概率分布。这是一个例子: 约翰在客户服务呼叫中心工作。他接到有问题的电话,并设法解决问题。他无法解决的问题,他将其转发给上级。假设他一天接到的电话数量遵循Poisson分布,平均值为。每个问题的难度从非常简单的东西(他绝对可以解决)到非常专业的问题(他都不知道如何解决)不等。假设他将能够解决第i个问题的概率p i遵循具有参数α和β的Beta分布,并且与先前的问题无关。他一天解决的电话数量分布如何?μμ\mup一世pip_iαα\alphaββ\beta 更正式地说,我有: 为我= 0 ,1 ,2 ,。。。,Nÿ= 我(N> 0 )∑ñ我= 0X一世Y=I(N>0)∑i=0NXiY = I(N > 0)\sum_{i = 0}^{N} X_i我= 0 ,1 ,2 ,。。。,Ni=0,1,2,...,Ni = 0, 1, 2, ..., N 其中,(X 我| p 我)〜乙Ë ř Ñ Ò ù 升升我(p 我)和p 我〜乙Ë 吨一个(α ,β )ñ〜P ø 我小号小号ø Ñ(μ )N∼Poisson(μ)N \sim \mathrm{Poisson}(\mu)(X一世| …

1
何时使用Deming回归
我目前正在研究一种将两种不同的磷测试值相互转换的方法。 背景 存在许多(提取)方法来测量土壤中植物有效磷的含量。不同的国家采用不同的方法,因此要比较各个国家的P生育率,有必要根据P检验值y计算P检验值x,反之亦然。因此,响应和协变量是可互换的。 萃取剂1中的P含量= [mg / 100g土壤]中的P_CAL 萃取剂2中的P量= [mg / 100g土壤]中的P_DL 为了建立这样的“转化方程”,用CAL和DL提取物分析了136个土壤样品的P含量。还测量了其他参数,例如土壤pH值,总有机碳,总氮,粘土和碳酸盐。目的是得出一个简单的回归模型。第二步也是多重模型。 为了提供数据概述,我向您展示了两个具有简单线性(OLS)回归线的散点图。 问题: 据我了解,如果respone(y)和解释性(x)变量都具有(测量)错误并且可以互换,则进行deming回归是合适的。Deming回归假设方差比是已知的。由于我没有关于P提取测量准确度的详细信息,是否还有另一种确定方差比的方法?此处表示哪个差异?我假设它不是计算出来的var(DL_P)/var(CAL_P)? 问题1:如何确定抽样回归的方差比? 定型回归的一种特殊情况是正交回归。假设方差比= 1。 问题2:是否有一种方法可以诊断假设δ= 1是否“大致”正确,或者(假)假设需要很高的预测误差? 如果我假设δ= 1,则正交回归将提供以下(四舍五入)的输出 library(MethComp) deming <- Deming(y=P_CAL, x=P_DL, vr=1) 截距:0.75;斜率:0.71;sigma P_DL:3.17;sigma P_CAL:3.17 在上面的图中绘制deming回归线,表明deming回归与a)CAL-P = f(DL-P)回归非常接近,但与b)DL-P = f(CAL-P)非常不同方程。 问题3:在正交回归中,CAL-P = f(DL-P)和DL-P = f(CAL-P)用相同的方程表示是正确的吗?如果没有,如何为两者推导正确的方程式?我在这里想念什么? 由于两种萃取液的特性,DL-P值往往比CAL-P值高25%左右,因此CAL-P = f(DL-P)的斜率应高于DL-P = f(CAL -P)。但是,只有一个斜率时,这不会在deming回归中表达。这给了我最后一个问题。 问题4:对我而言,定义回归是一种有效的方法吗?

3
在存在多重共线性的情况下确定线性回归系数的统计显着性
假设我有一堆人口规模不同的城市,我想看看城市中酒类商店的数量与DUI的数量之间是否存在正线性关系。我根据估计的回归系数的t检验确定这种关系是否重要。 现在显然是流行音乐。城市的规模将与DUI的数量以及酒类商店的数量呈正相关。因此,如果我仅对酒类商店进行简单的线性回归,并查看其回归系数是否在统计上有意义,那么我可能会遇到多重共线性问题,并高估了酒类商店对DUI的影响。 我应该使用两种方法中的哪一种来纠正此问题? 我应该将城市中的酒类商店数量除以其人口数,以获得人均酒类商店价值,然后以此为基础进行回归。 我应该对白酒储存量和大小进行回归,然后查看在控制大小时白酒储存系数是否显着。 还有其他方法吗? 老实说,我无法确定哪个看起来更明智。我在他们之间摇摆不定,这取决于我想到的那一个,我是否能够使自己确信这是正确的方法。 一方面,人均酒类商店似乎是使用的正确变量,因为DUI是由个人实施的,但是从统计角度来看,这似乎并不十分严格。另一方面,控制大小似乎在统计上是严格的,但是是间接的。此外,如果在计算了人均酒量变量后重新定标,则两种方法之间的回归系数非常相似,但是方法1会产生较小的p值。

4
如何确定两个相关性是否显着不同?
我想确定两组数据(B1,B2)中的哪一组与另一组(A)更好地相关(皮尔森r)。所有数据集中都缺少数据。如何确定所得的相关性是否显着不同? 例如,在A和B1中都存在8426值,r = 0.74。A和B2中都存在8798,r = 0.72。 我认为这个问题可能会有所帮助,但尚未得到答案:如何知道一个系统明显优于另一个系统?

1
哪种深度学习模型可以对不互斥的类别进行分类
示例:我的职位描述中有一句话:“英国Java高级工程师”。 我想使用深度学习模型将其预测为2类:English 和IT jobs。如果我使用传统的分类模型,则只能预测softmax最后一层具有功能的标签。因此,我可以使用2个模型神经网络来预测两个类别的“是” /“否”,但是如果我们有更多类别,那就太贵了。那么,我们是否有任何深度学习或机器学习模型可以同时预测2个或更多类别? “编辑”:使用传统方法使用3个标签,它将由[1,0,0]编码,但在我的情况下,它将由[1,1,0]或[1,1,1]编码 示例:如果我们有3个标签,并且所有这些标签都适合一个句子。因此,如果softmax函数的输出为[0.45,0.35,0.2],我们应该将其分类为3个标签或2个标签,或者可以是一个?我们这样做的主要问题是:分类为1个,2个或3个标签的最佳阈值是多少?
9 machine-learning  deep-learning  natural-language  tensorflow  sampling  distance  non-independent  application  regression  machine-learning  logistic  mixed-model  control-group  crossover  r  multivariate-analysis  ecology  procrustes-analysis  vegan  regression  hypothesis-testing  interpretation  chi-squared  bootstrap  r  bioinformatics  bayesian  exponential  beta-distribution  bernoulli-distribution  conjugate-prior  distributions  bayesian  prior  beta-distribution  covariance  naive-bayes  smoothing  laplace-smoothing  distributions  data-visualization  regression  probit  penalized  estimation  unbiased-estimator  fisher-information  unbalanced-classes  bayesian  model-selection  aic  multiple-regression  cross-validation  regression-coefficients  nonlinear-regression  standardization  naive-bayes  trend  machine-learning  clustering  unsupervised-learning  wilcoxon-mann-whitney  z-score  econometrics  generalized-moments  method-of-moments  machine-learning  conv-neural-network  image-processing  ocr  machine-learning  neural-networks  conv-neural-network  tensorflow  r  logistic  scoring-rules  probability  self-study  pdf  cdf  classification  svm  resampling  forecasting  rms  volatility-forecasting  diebold-mariano  neural-networks  prediction-interval  uncertainty 

2
偏差方差分解:期望平方预测误差的项减去不可约误差
Hastie等。“统计学习的要素”(2009年)考虑了数据生成过程 其中和。È(ε )= 0 无功(ε )= σ 2 εÿ= f(X)+ εY=f(X)+ε Y = f(X) + \varepsilon E(ε)=0E(ε)=0\mathbb{E}(\varepsilon)=0Var(ε)=σ2εVar(ε)=σε2\text{Var}(\varepsilon)=\sigma^2_{\varepsilon} 他们对点(第223页,公式7.9)处的期望平方预测误差进行了以下偏差方差分解: 在我的自己的工作我没有指定而是取一个任意的预测(如果相关)。问题:我正在寻找 或更确切地说 的术语 错误(x 0)x0x0x_0˚F(⋅) ÿErr(x0)=E([y−f^(x0)]2|X=x0)=…=σ2ε+Bias2(f^(x0))+Var(f^(x0))=Irreducible error+Bias2+Variance.Err(x0)=E([y−f^(x0)]2|X=x0)=…=σε2+Bias2(f^(x0))+Var(f^(x0))=Irreducible error+Bias2+Variance.\begin{aligned} \text{Err}(x_0) &= \mathbb{E}\left( [ y - \hat f(x_0) ]^2 | X = x_0 \right) \\ &= \dots \\ &= \sigma^2_{\varepsilon} + \text{Bias}^2(\hat f(x_0)) + …

1
朴素贝叶斯是否变得越来越受欢迎?为什么?
这是2004年1月至2017年4月从“朴素贝叶斯”短语获得的Google趋势结果(链接)。根据此数字,2017年4月“朴素贝叶斯”的搜索率比整个时间段内的最高值高出约25%。这是否意味着这种简单而古老的方法正在获得更多关注?为什么? 一个合理的解释(根据Sycorax的评论)是,这种流行是对机器学习的日益关注的间接影响。但是,似乎某些方法(例如朴素贝叶斯)比其他方法(例如决策树和SVM)获得了更多关注。从下图可以清楚地看出:

6
使用p值计算假设为真的可能性;还需要什么?
题: 对p值的一个普遍误解是,它们代表原假设为真的概率。我知道这是不正确的,并且我知道p值仅代表找到样本的可能性,因为原假设是真的。但是,从直觉上讲,一个人应该能够从后者派生第一个。没有人这样做,一定有原因。我们缺少哪些信息,这些信息限制了我们从p值和相关数据得出假设成立的可能性? 例: 我们的假设是“维生素D影响情绪”(无效假设是“无效”)。假设我们对1000人进行了适当的统计研究,发现情绪与维生素水平之间存在相关性。在所有其他条件相同的情况下,p值0.01表示真实假设的可能性比p值0.05更高。假设我们得到的p值为0.05。为什么我们不能计算假设为真的实际概率?我们缺少什么信息? 常客统计学家的备用术语: 如果您接受我的问题的前提,则可以在这里停止阅读。以下内容适用于拒绝接受假设可以进行概率解释的人们。让我们暂时忘记术语。代替... 假设您与朋友下注。您的朋友向您展示了有关无关主题的一千项统计研究。对于每个研究,您只能查看p值,样本大小和样本的标准偏差。对于每项研究,您的朋友都会给您提供一定的机会来打赌研究中提出的假设是正确的。您可以选择下注或不下注。在为所有1000项研究下注后,一个先知会升华,并告诉您哪个假设是正确的。此信息使您可以下注。我的主张是该游戏存在最佳策略。在我的世界观中,这相当于知道假设为真的概率,但是如果我们不同意,那就很好。在那种情况下,我们可以简单地讨论采用p值以最大程度地期望下注的方法。

4
如何解释考克斯风险模型的生存曲线?
您如何从考克斯比例风险模型解释生存曲线? 在这个玩具示例中,假设我们对数据age变量有一个cox比例风险模型kidney,并生成了生存曲线。 library(survival) fit <- coxph(Surv(time, status)~age, data=kidney) plot(conf.int="none", survfit(fit)) grid() 例如,在时间,哪个说法是正确的?还是两者都不对?200200200 陈述1:我们将剩下20%的主题(例如,如果我们有人,那么到200天时,我们应该剩下200个左右), 100010001000200200200200200200 陈述2:对于一个给定的人,他/她有200 20%20%20\%机会在200天生存200200200。 我的尝试:我不认为这两个陈述是相同的(如果我错了,请纠正我),因为我们没有iid假设(所有人的生存时间不是独立地来自一个分布)。在这里我的问题类似于逻辑回归,每个人的危险率取决于该人的。βTxβTx\beta^Tx

3
当n,p都大时,PCA太慢:替代方案?
问题设定 我有高维度(4096)的数据点(图像),我正尝试以2D方式进行可视化。为此,我以类似于以下Karpathy示例代码的方式使用t- sne。 该scikit学习文档,建议使用PCA先降低数据的维度: 如果特征数量非常多,强烈建议使用另一种降维方法(例如,对于密集数据使用PCA或对于稀疏数据使用TruncatedSVD)将尺寸数量减少到合理的数量(例如50个)。 我正在使用Darks.Liu的以下代码在Java中执行PCA: //C=X*X^t / m DoubleMatrix covMatrix = source.mmul(source.transpose()).div(source.columns); ComplexDoubleMatrix eigVal = Eigen.eigenvalues(covMatrix); ComplexDoubleMatrix[] eigVectorsVal = Eigen.eigenvectors(covMatrix); ComplexDoubleMatrix eigVectors = eigVectorsVal[0]; //Sort sigen vector from big to small by eigen values List<PCABean> beans = new ArrayList<PCA.PCABean>(); for (int i = 0; i < eigVectors.columns; i++) { …


1
百分率加起来怎么可能呢?
我正在阅读有关鱼菜共生的论文,某些统计数据对所列百分比没有任何意义。哪种方法可以允许这些百分比存在? 按百分比计,最常见的水生动物是罗非鱼(69%),观赏鱼(43%),cat鱼(25%),其他水生动物(18%),鲈鱼(16%),蓝g(15%),鳟鱼( 10%)和低音(7%)。〜http ://www.sciencedirect.com/science/article/pii/S0044848614004724

1
正态分布误差和中心极限定理
在Wooldridge的《计量经济学入门》一书中有一个报价: 证明误差的正态分布合理的参数通常是这样的:由于是影响的许多不同的未观察因素的总和,因此我们可以调用中心极限定理来得出具有近似正态分布的结论。uuuyyyuuu 此引用与线性模型假设之一有关,即: u∼N(μ,σ2)u∼N(μ,σ2)u \sim N(μ, σ^2) 其中uuu是总体模型中的误差项。 现在,据我所知,中心极限定理指出 Zi=(Yi¯¯¯¯¯−μ)/(σ/√n)Zi=(Yi¯−μ)/(σ/√n)Z_i=(\overline{Y_i}-μ)/(σ/√n) (其中Yi¯¯¯¯¯Yi¯\overline{Y_i} 是从任何具有均值μμμ和方差σ^ 2的总体中抽取的随机样本的平均值σ2σ2σ^2) 接近标准正态变量的n→∞n→∞n \rightarrow \infty。 题: 帮助我了解Z_i的渐近正态性如何ZiZiZ_i暗示u∼N(μ,σ2)u∼N(μ,σ2)u \sim N(μ, σ^2)


2
模型错误指定下的统计推断
我有一个一般的方法论问题。之前可能已经回答过,但是我无法找到相关的线程。我将感谢可能重复的指针。 (这是一个很好的答案,但是没有答案。即使在回答时,这在精神上也很相似,但是从我的角度来看,后者太具体了。这也很贴切,在发布问题后才发现。) 主题是,当看到数据之前制定的模型未能充分描述数据生成过程时,如何进行有效的统计推断。这个问题很笼统,但是我将提供一个特定的例子来说明这一点。但是,我希望答案会集中在一般的方法论问题上,而不是挑剔特定示例的细节。 考虑一个具体的示例:在时间序列设置中,我假设数据生成过程为 其中。我的目标是检验的主题假设。我根据模型以获得与我的主题假设相对应的可行的统计对应关系,即 到目前为止,一切都很好。但是,当我观察数据时,我发现该模型无法充分描述数据。假设存在线性趋势,因此真实数据生成过程为 其中yt=β0+β1xt+ut(1)(1)yt=β0+β1xt+ut y_t=\beta_0 + \beta_1 x_t+u_t \tag{1} ut∼i.i.N(0,σ2u)ut∼i.i.N(0,σu2)u_t \sim i.i.N(0,\sigma_u^2)dydx=1dydx=1\frac{dy}{dx}=1(1)(1)(1)H0: β1=1.H0: β1=1. H_0\colon \ \beta_1=1. yt=γ0+γ1xt+γ2t+vt(2)(2)yt=γ0+γ1xt+γ2t+vt y_t=\gamma_0 + \gamma_1 x_t+\gamma_2 t + v_t \tag{2} vt∼i.i.N(0,σ2v)vt∼i.i.N(0,σv2)v_t \sim i.i.N(0,\sigma_v^2)。 如何对主题假设进行有效的统计推断?dydx=1dydx=1\frac{dy}{dx}=1 如果我使用原始模型,则会违反其假设,并且的估计量不会具有否则会好的分布。因此,我无法使用检验检验假设。β1β1\beta_1ttt 如果查看数据后,我从模型切换到,并将我的统计假设从更改为,则满足模型假设,我得到一个表现良好的估计量,并且可以使用轻松测试。 但是,从切换到(1)(1)(1)(2)(2)(2)H0: β1=1H0: β1=1H_0\colon \ \beta_1=1H′0: γ1=1H0′: γ1=1H'_0\colon \ \gamma_1=1γ1γ1\gamma_1H′0H0′H'_0ttt(1)(1)(1)(2)(2)(2)可以从我要检验假设的数据集中获悉。这使得估算器分布(以及推断也)取决于基础模型的变化,这是由于观察到的数据所致。显然,引入这种条件并不令人满意。 有没有好的出路?(如果不是常客,那么也许是一些贝叶斯替代方法?)

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.