统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
Normal-Wishart后验的推导
我正在研究Normal-Wishart后验的推导,但是我陷入了其中一个参数(比例矩阵的后验,见底部)的问题。 仅出于上下文和完整性考虑,以下是模型和其他派生工具: xiμΛ∼N(μ,Λ)∼N(μ0,(κ0Λ)−1)∼W(υ0,W0)xi∼N(μ,Λ)μ∼N(μ0,(κ0Λ)−1)Λ∼W(υ0,W0)\begin{align} x_i &\sim \mathcal{N}(\boldsymbol{\mu}, \boldsymbol{\Lambda})\\ \boldsymbol{\mu} &\sim \mathcal{N}(\boldsymbol{\mu_0}, (\kappa_0 \boldsymbol{\Lambda})^{-1})\\ \boldsymbol{\Lambda} &\sim \mathcal{W}(\upsilon_0, \mathbf{W}_0) \end{align} 这三个因子中每个因子的展开形式为(最大比例常数)为: 可能性: N(xi|μ,Λ)∝|Λ|N/2exp(−12∑i=1N(xTiΛxi−2μTΛxi+μTΛμ))N(xi|μ,Λ)∝|Λ|N/2exp⁡(−12∑i=1N(xiTΛxi−2μTΛxi+μTΛμ))\begin{align} \mathcal{N}(\mathbf{x}_i &| \boldsymbol{\mu}, \boldsymbol{\Lambda}) \propto\notag\\ &|\boldsymbol{\Lambda}|^{N/2} \exp{\left(-\frac{1}{2}\sum_{i=1}^N \left( \mathbf{x}_i^T\boldsymbol{\Lambda}\mathbf{x}_i - 2 \boldsymbol{\mu}^T \boldsymbol{\Lambda}\mathbf{x}_i + \boldsymbol{\mu}^T\boldsymbol{\Lambda}\boldsymbol{\mu}\right) \right)} \end{align} 普通优先级: N(μ|(μ0,κ0Λ)−1)∝|Λ|1/2exp(−12(μTκ0Λμ−2μTκ0Λμ0+μT0κ0Λμ0))N(μ|(μ0,κ0Λ)−1)∝|Λ|1/2exp⁡(−12(μTκ0Λμ−2μTκ0Λμ0+μ0Tκ0Λμ0))\begin{align} \mathcal{N}(\boldsymbol{\mu} &| (\boldsymbol{\mu}_0, \kappa_0 \boldsymbol{\Lambda})^{-1}) \propto\notag\\ &|\boldsymbol{\Lambda}|^{1/2} \exp{\left(-\frac{1}{2}\left( \boldsymbol{\mu}^T\kappa_0 \boldsymbol{\Lambda}\boldsymbol{\mu} - …

1
如何在不过度拟合数据的情况下选择最佳拟合?使用N个正态函数等对双峰分布进行建模
我有一个明显的双峰值分布,我试图适应这一分布。可以使用2个正常函数(双峰)或3个正常函数很好地拟合数据。此外,将数据拟合为3还有一个合理的物理原因。 引入的参数越多,拟合就越完美,因为有了足够的常数,一个人就可以“ 拟合大象 ”。 这是分布,与3条正态(高斯)曲线的总和拟合: 这些是每次拟合的数据。我不确定应该在这里应用哪种测试来确定合适的位置。数据由91点组成。 1正常功能: RSS:1.06231 X ^ 2:3.1674 F.测试:0.3092 2个正常功能: RSS:0.010939 X ^ 2:0.053896 F.测试:0.97101 3种正常功能: RSS:0.00536 X ^ 2:0.02794 F.测试:0.99249 什么是可以用来确定这3个拟合中的哪一个最合适的正确统计检验?显然,1个法线函数拟合不足。那么如何区分2和3? 另外,我主要使用Excel和一些Python来完成此操作;我还不熟悉R或其他统计语言。

1
使用null和模型偏差测试GLM模型
我已经在R中建立了一个glm模型,并已经通过一个测试和培训小组对其进行了测试,因此确信它可以很好地工作。R的结果是: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) -2.781e+00 1.677e-02 -165.789 < 2e-16 *** Coeff_A 1.663e-05 5.438e-06 3.059 0.00222 ** log(Coeff_B) 8.925e-01 1.023e-02 87.245 < 2e-16 *** log(Coeff_C) -3.978e-01 7.695e-03 -51.689 < 2e-16 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 …

1
我如何解释lavaan输出?
我正在尝试使用进行验证性因素分析(CFA)lavaan。我很难解释产生的输出lavaan。 我有一个简单的模型-收集调查数据中的项目支持4个因素。这些因素与这些项目所测量的一致,在某种程度上看来它们可以用作有效的测量。 请帮我理解所产生的输出如下lavaan的cfa(): Number of observations 1730 Estimator ML Minimum Function Test Statistic 196.634 Degrees of freedom 21 P-value (Chi-square) 0.000 Model test baseline model: Minimum Function Test Statistic 3957.231 Degrees of freedom 36 P-value 0.000 User model versus baseline model: Comparative Fit Index (CFI) 0.955 Tucker-Lewis Index (TLI) 0.923 …


1
哪个收敛速度更快,平均值或中位数?
如果我从N(0,1)绘制iid变量,那么均值或中位数收敛得更快吗?快多少? 更具体地说,令是从N(0,1)提取的iid变量序列。定义和为。或哪个收敛到0更快?x1,x2,…x1,x2,…x_1, x_2, \ldots x¯n=1n∑ni=1xix¯n=1n∑i=1nxi\bar{x}_n = \frac{1}{n}\sum_{i=1}^n x_ix~nx~n\tilde{x}_n{x1,x2,…xn}{x1,x2,…xn}\{x_1, x_2, \ldots x_n\}{x¯n}{x¯n}\{\bar{x}_n\}{x~n}{x~n}\{\tilde{x}_n\} 为了具体说明更快收敛的含义:是否存在?如果是这样,那是什么?limn→∞Var(X¯n)/Var(X~n)limn→∞Var(X¯n)/Var(X~n)\lim_{n \to \infty} Var(\bar{X}_n)/Var(\tilde{X}_n)

2
Python中的QQ图
我使用以下代码生成了一个qq图。我知道qq图用于检查数据是否正常分布。我的问题是x和y轴标签在qq图中指示什么,r平方值指示什么? N = 1200 p = 0.53 q = 1000 obs = np.random.binomial(N, p, size = q)/N import scipy.stats as stats z = (obs-np.mean(obs))/np.std(obs) stats.probplot(z, dist="norm", plot=plt) plt.title("Normal Q-Q plot") plt.show() 我知道已经有关于qq图的讨论,但是尽管进行了讨论,但我无法理解的概念。

1
显示有序数据-均值,中位数和均值等级
我有一些顺序数据不是正态分布的,所以我决定使用Mann-Whitney U检验进行非参数检验。我正在寻找七个分数的组间差异-每个主题的分数分别为0、1、2或3。我很难弄清楚如何显示我的数据! 如果我使用中位数(和中位数的IQR)显示数据,那么根本就不清楚差异在哪里,因为在大多数情况下,中位数落在0或1上。因此,尽管Mann-Whitney U检验显示出显着差异,桌子看起来没意思。 我也可以使用手段呈现数据。那里有一些科学论文说,您可以使用具有序数数据的均值,但是不能对分数之间的差异做出相同类型的假设(例如0和1之间的差异与1和1之间的差异不相同) 2)。尽管表中的数字很好地说明了我使用它们时的故事,但使用方法会引起一些争议。 第三种选择是使用SPSS在曼恩·惠特尼(Mann-Whitney)输出中给我的平均排名。平均等级是各组之间正在比较的,所以也许我应该使用那些?我唯一遇到的问题是,平均排名对实际数据没有任何意义(例如,使用平均等级,我看不到对象更接近3,而控件更接近1。) 最后的选择是在将得分分为两组(低分为0和1,高分为2和3)后,比较受试者和对照者进行卡方分析。但是,当我这样做时,差异并不明显(可能是由于多种原因)。

2
通过逻辑回归和对数线性回归估计的系数何时有所不同?
在对连续比例建模时(例如,在调查样方上的比例植被覆盖,或从事某项活动的时间比例),逻辑回归被认为是不合适的(例如,Warton&Hui(2011)反正弦是精氨酸:生态学中比例的分析)。相反,对数转换比例后的OLS回归或beta回归更为合适。 使用R lm和时,在什么条件下对数线性回归和对数回归的系数估计不同glm? 以下面的模拟数据集为例,我们可以假定它们p是我们的原始数据(即连续比例,而不是表示):ñS ^ ü ç ç è 小号小号Ë 小号ñ吨ř 我一升小号ñsüCCËssËsñŤ[R一世一种升s{n_{successes}\over n_{trials}} set.seed(1) x <- rnorm(1000) a <- runif(1) b <- runif(1) logit.p <- a + b*x + rnorm(1000, 0, 0.2) p <- plogis(logit.p) plot(p ~ x, ylim=c(0, 1)) 拟合对数线性模型,我们获得: summary(lm(logit.p ~ x)) ## ## Call: ## lm(formula = …
11 r  regression  logistic 

2
巴特利特测试vs莱文测试
我目前正在尝试解决违反方差分析假设的问题。我曾用Shapiro-Wilk检验正态性,并涉猎了Levene检验和Bartlett检验方差相等。从那以后,我用对数转换了我的数据,以尝试纠正不平等的差异。我对经过对数转换的数据重新进行了Bartlett检验,但仍然收到了显着的p值,出于好奇,我也进行了Levene检验,得到了不重要的p值。我应该依靠哪个测试?

1
R-套索回归-每个回归者的Lambda不同
我要执行以下操作: 1)OLS回归(无惩罚项)以获得beta系数;代表用于回归的变量。我这样做 Ĵb∗jbj∗b_{j}^{*}jjj lm.model = lm(y~ 0 + x) betas = coefficients(lm.model) 2)带惩罚项的套索回归,选择标准应为贝叶斯信息标准(BIC),由 λj=log(T)T|b∗j|λj=log⁡(T)T|bj∗|\lambda _{j} = \frac{\log (T)}{T|b_{j}^{*}|} 其中代表变量/回归数,代表观察数,代表步骤1)中获得的初始beta。我想获得此特定值的回归结果,该值对于使用的每个回归变量都不同。因此,如果存在三个变量,则将存在三个不同的值。Ť b * Ĵ λ Ĵ λ ĴjjjTTTb∗jbj∗b_{j}^{*}λjλj\lambda_jλjλj\lambda_j 然后通过以下公式给出OLS-Lasso优化问题 中号我Ñb ε - [Rñ= { ∑t = 1Ť(yŤ− b⊤XŤ)2+ T∑j = 1米(λŤ| bĴ| ) }minbϵRn={∑t=1T(yt−b⊤Xt)2+T∑j=1m(λt|bj|)}\underset{b\epsilon \mathbb{R}^{n} }{min} = \left \{ \sum_{t=1}^{T}(y_{t}-b^{\top} X_{t} )^{2} …
11 r  regression  glmnet  lars 

1
负二项式/泊松回归中的过度分散和分散不足
我在SAS中执行Poisson回归,发现Pearson卡方值除以自由度约为5,表明存在明显的过度分散。因此,我使用proc genmod拟合了负二项式模型,发现皮尔逊卡方值除以自由度是0.80。现在认为这是分散的吗?如果是这样,该如何处理呢?我已经阅读了很多有关过度分散的知识,并且相信我知道如何处理此问题,但是关于如何处理或确定是否存在分散不足的信息很少。有人可以协助吗? 谢谢。

2
估计具有独立变量的标准偏差缩放的速率
我有在我以正态分布变量的测量实验,YYY Y∼N(μ,σ)Y∼N(μ,σ)Y \sim N(\mu,\sigma) 但是,先前的实验提供了一些证据,表明标准偏差是自变量的仿射函数,即Xσσ\sigmaXXX σ=a|X|+bσ=a|X|+b\sigma = a|X| + b Y∼N(μ,a|X|+b)Y∼N(μ,a|X|+b)Y \sim N(\mu,a|X| + b) 我想估计参数和通过取样在的多个值。此外,由于实验的限制,我只能采集有限数量(大约30-40)的样本,并且出于与实验无关的原因,我更愿意以X的多个值进行采样。给定这些约束,可以使用哪些方法来估计a和b?b Y XaaabbbYYYXXXYYYXXXaaabbb 实验说明 如果您对我为什么要问上述问题感兴趣,这是额外的信息。我的实验测量听觉和视觉空间知觉。我有一个实验设置,其中我可以显示来自不同位置X的听觉或视觉目标XXX,并且被摄对象指示目标Y的感知位置YYY。随着偏心率的增加(即| X |增大|X||X||X|),视觉*和听觉都变得不太精确,我在上面将其建模为σσ\sigma。最终,我想估计aaa和bbb对于视觉和听觉来说,所以我知道在空间中一系列位置上每种感觉的精度。这些估计值将用于预测同时显示的视觉和听觉目标的相对权重(类似于此处提出的多感官融合理论:http://www.ncbi.nlm.nih.gov/pubmed/12868643)。 *我知道,当比较中央凹与中央凹空间时,该模型的视觉不准确,但是我的测量仅限于中央凹空间,这是一个不错的近似值。

2
MANOVA的原假设是什么?
背景 为了分析不同组之间某个连续变量之间的差异(由类别变量给出),可以执行单向方差分析。如果存在多个解释性(分类)变量,则可以执行阶乘方差分析。如果要分析几个连续变量(即几个响应变量)之间的差异,则必须执行多元ANOVA(MANOVA)。 题 我几乎不了解如何对多个响应变量执行类似于ANOVA的测试,更重要的是,我不了解原假设是什么。是原假设: “对于每个响应变量,所有组的均值均相等”, 还是 “对于至少一个响应变量,所有组的均值相等”, 还是还有其他东西?H0H0H_0

3
I型和II型错误的概率是否负相关?
在我作为助教的基础统计课上,这位教授说,随着I型错误的概率增加,II型错误的概率降低,反之亦然。因此,这向我表明。αα\alphaββ\betaρα ,β&lt; 0ρα,β&lt;0\rho_{\alpha, \beta} < 0 但是对于一般的假设检验,如何证明这一点呢?总体而言,该说法是否正确? 我可以尝试一个特定的情况(例如和),但是显然,这不足以解决这个问题。H0:μ = μ0H0:μ=μ0H_0: \mu = \mu_0H1个:μ &lt; μ0H1个:μ&lt;μ0H_1: \mu < \mu_0

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.