统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
多类分类中的Scikit SVM输出始终给出相同的标签
我目前正在使用带有以下代码的Scikit学习: clf = svm.SVC(C=1.0, tol=1e-10, cache_size=600, kernel='rbf', gamma=0.0, class_weight='auto') 然后用7个不同的标签拟合并预测一组数据。我得到了一个奇怪的输出。无论我在验证集上使用预测的标签是哪种交叉验证技术,始终都是标签7。 我尝试了其他一些参数,包括完整的默认参数one(svm.SVC()),但是只要我使用的内核方法rbf代替,poly否则linear它将无法工作,而对于polyand 来说确实很好linear。 此外,我已经尝试对火车数据而不是验证数据进行预测,它非常适合。 有人以前见过这种问题,知道这里发生了什么吗? 我从不详细查看我的班级分布,但我知道应该有30%左右是7、14%是4。 我什至尝试手动进行1-vs-rest实施,但仍然没有帮助。

1
2SLS与二元内生变量的一致性
我已经读到2SLS估计器即使与二进制内生变量(http://www.stata.com/statalist/archive/2004-07/msg00699.html)仍然保持一致。在第一阶段,将运行概率处理模型,而不是线性模型。 有没有正式的证据表明即使第一阶段是概率模型或对数模型,2SLS仍然是一致的? 如果结果也是二进制,该怎么办?我知道如果我们有二进制结果和二进制内生变量(第一和第二阶段都是二进制概率/逻辑模型),则模仿2SLS方法将产生不一致的估计。是否有任何正式的证据?Wooldridge的计量经济学书进行了一些讨论,但我认为没有严格的证据来证明这种不一致。 data sim; do i=1 to 500000; iv=rand("normal",0,1); x2=rand("normal",0,1); x3=rand("normal",0,1); lp=0.5+0.8*iv+0.5*x2-0.2*x3; T=rand("bernoulli",exp(lp)/(1+exp(lp))); Y=-0.8+1.2*T-1.3*x2-0.8*x3+rand("normal",0,1); output; end; run; ****1st stage: logit model ****; ****get predicted values ****; proc logistic data=sim descending; model T=IV; output out=pred1 pred=p; run; ****2nd stage: ols model with predicted values****; proc reg data=pred1; model y=p; run; …

1
Bayesglm(手臂)与MCMCpack
双方bayesglm()(在手臂[R封装)和各种功能的MCMCpack包的目的是做广义线性模型的贝叶斯估计,但我不知道他们实际上是计算同样的事情。MCMCpack函数使用马尔可夫链蒙特卡罗方法从关节后部获得模型参数的(相关)样本。bayesglm()另一方面,产生。我不确定。 看起来像bayesglm()产生一个点估计,这将使其成为MAP(最大后验)估计,而不是完整的贝叶斯估计,但是sim()似乎有一个函数可用于获取后验绘制。 有人可以解释两者的预期用途的区别吗?可以bayesglm() + sim()产生真实的后验图,还是某种近似?

3
当您有大量N,离散数据和许多变量时,如何从散点图矩阵中提取信息?
我正在研究乳腺癌数据集,并创建了所有属性的散点图,以了解哪个属性对预测(红色)的类别malignant(蓝色)影响最大benign。 我知道该行代表x轴,而列代表y轴,但是我看不到我可以对散点图中的数据或属性进行哪些观察。 我正在寻找一些帮助来解释/观察来自此散点图的数据,或者是否应该使用其他可视化来可视化此数据。 我用的R代码 link <- "http://www.cs.iastate.edu/~cs573x/labs/lab1/breast-cancer-wisconsin.arff" breast <- read.arff(link) cols <- character(nrow(breast)) cols[] <- "black" cols[breast$class == 2] <- "red" cols[breast$class == 4] <- "blue" pairs(breast, col=cols)

2
具有逆自变量的回归
假设我有一个因变量的向量和一个自变量的向量当相对绘制时,我发现两者之间存在线性关系(上升趋势)。现在,这也意味着和之间存在线性下降趋势。Y N X Y 1ñNNÿYYñNNXXXÿYY YX1个X1X\frac{1}{X}ÿYYXXX 现在,如果我运行回归: 并获得拟合值ÿ = β Xÿ= β* X+ ϵY=β∗X+ϵY = \beta * X + \epsilonÿ^= β^XY^=β^X\hat{Y} = \hat{\beta}X 然后运行回归:并获得拟合值 〜Ŷ = α 1ÿ= α * 1X+ ϵY=α∗1X+ϵY = \alpha * \frac{1}{X} + \epsilonÿ〜= α^1个XY~=α^1X\tilde{Y} = \hat{\alpha} \frac{1}{X} 和这两个预测值大约相等吗? 〜ÿÿ^Y^\hat{Y}ÿ〜Y~\tilde{Y}

2
如何确定时间序列的可预测性?
预报员面临的重要问题之一是给定的序列是否 可以预报? 我偶然发现了彼得·卡特(Peter Catt)题为“ 熵作为可预测性的先验指标 ”的文章,该文章使用近似熵(ApEn) 作为确定给定时间序列的相对度量是可预测的。 文章说, “较小的ApEn值表示一组数据后面将跟随相似数据的可能性较大(规则性)。相反,较大的ApEn值表示重复相似数据的可能性较小(规则性)。因此,较大的ApEn值会带来更多混乱,随机性和系统复杂性。” 然后是用于计算ApEn的数学公式。这是一个有趣的方法,因为它提供了一个可用于相对意义上评估可预测性的数值。我不知道“近似熵”的含义,我正在阅读有关它的更多内容。 有一个叫包pracma中R,可以让你计算近似熵。为了说明目的,我使用了3个不同的时间序列并计算了ApEn数。 系列1:著名的AirPassenger时间序列-具有高度确定性,我们应该能够轻松进行预测。 系列2:黑子时间序列-定义明确,但比系列1更难预测。 系列3:随机数无法预测此系列。 因此,如果我们计算ApEn,则系列1应该小于系列2,而系列3应该非常非常少。 以下是为所有三个系列计算ApEn的R代码段。 library("pracma") > series1 <- approx_entropy(AirPassengers) > series1 [1] 0.5157758 > series2 <- approx_entropy(sunspot.year) > series2 [1] 0.762243 > series3 <- approx_entropy(rnorm(1:30)) > series3 [1] 0.1529609 这不是我所期望的。随机序列的数目比定义明确的AirPassenger序列的数目要少。即使将随机数增加到100,我仍然得到以下值,该值小于定义明确的2 / Sunspot.yealry系列。 > series3 <- approx_entropy(rnorm(1:100)) > series3 …

1
最小的指数分布的最大似然估计
我被困在如何解决这个问题上。 因此,对于,我们有两个随机变量序列和。现在,和是具有参数和独立指数分布。然而,而不是观察和,我们观察到,而不是和。ÿ 我我= 1 ,。。。,Ñ X ÿ λ μ X ÿ ž W¯¯XiXiX_iYiYiY_ii=1,...,ni=1,...,ni=1,...,nXXXYYYλλ\lambdaμμ\muXXXYYYZZZWWW Z=min(Xi,Yi)Z=min(Xi,Yi)Z=\min(X_i,Y_i),如果Z_i = X_i则W = 1,如果Z_i = Y_i则为 0 。我必须在Z和W的基础上找到\ lambda和\ mu的最大似然估计的封闭形式。此外,我们需要证明这些是全局最大值。W=1W=1W=1Zi=XiZi=XiZ_i=X_iZi=YiZi=YiZ_i=Y_iλλ\lambdaμμ\muZZZWWW 现在,我知道两个独立指数的最小值本身就是指数,比率等于比率之和,因此我们知道ZZZ是带参数\ lambda + \ mu的指数λ+μλ+μ\lambda+\mu。因此,我们的最大似然估计器为:λ^+μ^=Z¯λ^+μ^=Z¯\hat{\lambda}+\hat{\mu}=\bar{Z}。 但是我对从这里去的方向感到困惑。我知道WWW是参数p = P(Z_i = X_i)的伯努利分布p=P(Zi=Xi)p=P(Zi=Xi)p=P(Z_i=X_i),但我不知道如何将其转换为关于参数之一的语句。例如,根据\ lambda和/或\ mu,MLE W¯W¯\bar{W}将估算什么?我知道如果Z_i = X_i,则\ mu = 0,但是在这里我很难弄清楚如何提出任何代数语句。λλ\lambdaμμ\muZi=XiZi=XiZ_i=X_iμ=0μ=0\mu=0 更新1:所以我在评论中被告知要推导ZZZ和W的联合分布的可能性WWW。 因此f(Z,W)=f(Z|W=1)⋅p+f(Z|W=0)⋅(1−p)f(Z,W)=f(Z|W=1)⋅p+f(Z|W=0)⋅(1−p)f(Z,W)=f(Z|W=1)\cdot p+f(Z|W=0)\cdot (1-p)其中p=P(Zi=Xi)p=P(Zi=Xi)p=P(Z_i=X_i)。正确?由于ZZZ和WWW不是独立的,因此在这种情况下我不知道如何导出联合分布。 因此,根据上述W的定义,得出f(Z_i,W_i)= p \ lambda …

1
对特征向量的视觉解释感到困惑:视觉上不同的数据集如何具有相同的特征向量?
许多统计教科书提供了一个直观的说明协方差矩阵的特征向量是: 向量u和z形成本征向量(本征轴)。这是有道理的。但是令我困惑的一件事是,我们从相关矩阵中提取特征向量,而不是原始数据。此外,完全不同的原始数据集可以具有相同的相关矩阵。例如,以下两个都具有以下相关矩阵: [ 10.970.971个][10.970.971]\left[\begin{array}{} 1 & 0.97 \\ 0.97 &1\end{array}\right] 因此,它们的特征向量指向相同的方向: [ .71.71− .71.71][.71−.71.71.71]\left[\begin{array}{} .71 & -.71 \\ .71 & .71\end{array}\right] 但是,如果对特征向量在原始数据中的哪个方向应用相同的视觉解释,则会得到指向不同方向的向量。 有人可以告诉我我哪里出问题了吗? 第二次编辑:如果我这么大胆,下面给出了出色的答案,我就能够弄清混乱并作了说明。 视觉解释与以下事实相吻合:从协方差矩阵提取的特征向量是不同的。 协方差和特征向量(红色): [ 11个1个1个] [ .7.72− .72.7][1111][.7−.72.72.7]\left[\begin{array}{} 1 & 1 \\ 1 & 1\end{array}\right] \left[\begin{array}{} .7 & -.72 \\ .72 & .7\end{array}\right] 协方差和特征向量(蓝色): [ .25.5.51个] [ …

2
线性混合模型中方差的残差诊断和均质性
在问这个问题之前,我确实搜索了我们的网站并发现了很多类似的问题(例如here,here和here)。但是我觉得这些相关问题没有得到很好的回答或讨论,因此想再次提出这个问题。我觉得应该有很多观众希望对这些问题进行更清晰的解释。 对于我的问题,首先考虑线性混合效果模型y=Xβ+Zγ+ϵy=Xβ+Zγ+ϵ \mathbf{y = X\boldsymbol \beta + Z \boldsymbol \gamma + \boldsymbol \epsilon} 其中XβXβX\boldsymbol \beta是线性固定效果分量,ZZ\mathbf{Z}是对应的所述附加设计矩阵随机效应参数,γγ\boldsymbol \gamma。而ϵ ∼ N(0,σ2I)ϵ ∼ N(0,σ2I)\boldsymbol \epsilon \ \sim \ N(\mathbf{0, \sigma^2 I})是通常的误差项。 让我们假设唯一的固定影响因子是3个不同级别的分类变量Treatment。唯一的随机影响因素是变量Subject。也就是说,我们有一个具有固定治疗效果和随机受试者效应的混合效应模型。 因此,我的问题是: 线性混合模型设置中是否存在与传统线性回归模型类似的方差假设的同质性?如果是这样,那么在上述线性混合模型问题的背景下,假设的具体含义是什么?还有哪些其他重要假设需要评估? 我的想法:是的。假设(我的均值,零误差均值和均方差)仍来自此处:ϵ ∼ N(0,σ2I)ϵ ∼ N(0,σ2I)\boldsymbol \epsilon \ \sim \ N(\mathbf{0, \sigma^2 I})。在传统的线性回归模型设置中,我们可以说假设是“误差的方差(或只是因变量的方差)在所有3个治疗水平上都是恒定的”。但是我不知道如何在混合模型设置下解释这个假设。我们应该说:“在3种治疗水平上,方差是恒定的吗?是否取决于受试者?” 有关残差和影响诊断的SAS在线文档提出了两种不同的残留物,即边际残差,和有条件的残差, 我的问题是,两个残差分别用于什么?我们如何使用它们来检查同质性假设?对我而言,只有边际残差可用于解决同质性问题,因为它对应于模型的。我的理解对吗?rm=Y−Xβ^rm=Y−Xβ^ \mathbf{r_m = Y - X \hat{\boldsymbol …

1
随机斜率混合模型的类内相关系数
我为参与者()和项目()m_plot配备了以下lme4::lmer带有交叉随机效应的模型:lfdncontent Random effects: Groups Name Variance Std.Dev. Corr lfdn (Intercept) 172.173 13.121 role1 62.351 7.896 0.03 inference1 24.640 4.964 0.08 -0.30 inference2 52.366 7.236 -0.05 0.17 -0.83 inference3 21.295 4.615 -0.03 0.22 0.86 -0.77 content (Intercept) 23.872 4.886 role1 2.497 1.580 -1.00 inference1 18.929 4.351 0.52 -0.52 inference2 14.716 3.836 …

3
余弦相似度与欧几里得距离(LSA)的K均值
我正在使用潜在语义分析来表示较低维空间中的文档语料库。我想使用k均值将这些文档分为两组。 几年前,我使用Python的gensim并编写了自己的k-means算法来做到这一点。我使用欧几里得距离确定了聚类质心,但随后基于与质心的余弦相似度对每个文档聚类了。它似乎工作得很好。 现在,我正在尝试在更大的文档集上执行此操作。K-means没有收敛,我想知道这是否是我的代码中的错误。我最近读到您不应该使用余弦相似度进行聚类,因为k均值仅适用于欧几里得距离。即使正如我提到的那样,它在较小的测试用例中似乎也可以正常工作。 现在,我在LSA维基百科页面上发现了这一点: 可以使用传统的聚类算法(如k均值)和相似度(如余弦)对文档和术语向量表示进行聚类。 那是什么呢?是否可以使用余弦相似度?

2
两个*相关*正态变量的总和不正常的示例
我知道一些相关的随机变量对的很好的例子,它们在边际上是正常的,但在联合上不是正常的。见这个答案由迪利普Sarwate,和这一个由红衣主教。 我也知道两个总和不正常的普通随机变量的例子。见这个答案的宏。但是在这个例子中,两个随机变量是不相关的。 是否存在两个具有非零协方差且总和不正常的普通随机变量的示例?还是有可能证明任何两个相关正态随机变量的和(即使它们不是二元正态)也必须是正态的? [上下文:我有一个作业问题,要求的分布,其中和是具有相关标准法线。我认为该问题旨在说明它们是双变量正态的。但是我想知道,如果没有非零的额外假设,是否可以X ÿ ρ ρaX+bYaX+bYaX+bYXXXYYYρρ\rhoρρ\rho 谢谢!

1
从统计上可以证明汽车被用作谋杀武器吗?
最近我听到一个故事,有人说如果他们想杀死某人(并逃脱它),他们会用自己的车来做到这一点。他们引用了有关与汽车相关的死亡人数(包括行人通行者)的各种统计数据,以及有关实际被判犯有任何罪行的驾驶员人数的其他统计数据……等等,等等,等等。 我的问题是:从统计角度上证明汽车实际上被用作谋杀武器,在统计上是否可行? 换句话说,我意识到可能无法证明任何单人行车“事故”实际上都是企图/犯下的谋杀罪。相反,我想知道是否可以想象出一种方法,可以证明其中的某些“事故”实际上很可能根本不是事故。

3
MCMC和PyMC的2高斯混合模型推论
问题 我想拟合简单的2高斯混合总体的模型参数。考虑到围绕贝叶斯方法的所有炒作,我想了解贝叶斯推断是否比传统拟合方法更好。 到目前为止,MCMC在此玩具示例中的表现非常差,但也许我只是忽略了一些东西。因此,让我们看一下代码。 工具 我将使用python(2.7)+ scipy堆栈,lmfit 0.8和PyMC 2.3。 可以在此处找到重现分析的笔记本 产生数据 首先让我们生成数据: from scipy.stats import distributions # Sample parameters nsamples = 1000 mu1_true = 0.3 mu2_true = 0.55 sig1_true = 0.08 sig2_true = 0.12 a_true = 0.4 # Samples generation np.random.seed(3) # for repeatability s1 = distributions.norm.rvs(mu1_true, sig1_true, size=round(a_true*nsamples)) s2 = …

2
皮尔逊的卡方统计量如何近似于卡方分布
因此,如果为表给出了Pearson的卡方统计量,则其形式为:1×N1×N1 \times N ∑i=1n(Oi−Ei)2Ei∑i=1n(Oi−Ei)2Ei\sum_{i=1}^n\frac{(O_i - E_i)^2}{E_i} 然后,当样本量变大时,它近似,即具有个自由度的卡方分布。 χ2n−1χn−12\chi_{n-1}^2n−1n−1n-1NNN 我不明白的是这种渐近近似是如何工作的。我觉得分母中的应该替换为。因为那会给您,对于。但是,当然,这具有个自由度,而不是,因此显然正在发生其他事情。EiEiE_is2inisi2ni\frac{s_i^2}{n_i}χ2n=∑ni=1Z2iχn2=∑i=1nZi2\chi_n^2 = \sum_{i=1}^nZ_i^2Zi∼n(0,1)Zi∼n(0,1)Z_i\sim n(0,1)nnnn−1n−1n-1

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.