统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
解释LLE(局部线性嵌入)算法的步骤?
我了解LLE算法背后的基本原理包括三个步骤。 通过某种度量(例如k-nn)找到每个数据点的邻域。 找到每个邻居的权重,这些权重表示邻居对数据点的影响。 根据计算出的权重构造数据的低维嵌入。 但是,在我阅读的所有课本和在线资源中,步骤2和步骤3的数学解释令人困惑。我无法解释为什么使用这些公式。 在实践中如何执行这些步骤?有没有任何直观的方式来解释所使用的数学公式? 参考:http : //www.cs.nyu.edu/~roweis/lle/publications.html

4
有向无环图中的边是否代表因果关系?
我正在学习概率图形模型,这是一本用于自学的书。有向无环图(DAG)中的边是否代表因果关系? 如果我想构建贝叶斯网络,但不确定箭头的方向怎么办?所有数据将告诉我观察到的相关性,而不是它们之间的相互联系。我知道我要问的太多了,因为我确信接下来的章节将解决这些问题,但这只是我不能停止思考的原因。

3
设置图形格式:何时适合在折线图下使用填充?
这是一个数据可视化问题-我希望可以在这里提问。 何时适合使用线形图填充时间序列,例如下面的图?(显示一天的ping时间) 我想使用无填充线的普通线更为常见,但是可以使用填充线来实现视觉变化吗? 我对了解有关该主题的任何感知研究或任何样式指南特别感兴趣。

5
缺失值的多重插补
我想在某些约束下使用插补替换数据集中的缺失值。 例如,我希望估算的变量x1大于或等于我的另外两个变量,例如x2和x3。我也想x3通过或者被估算0或者>= 14,我想x2无论以任何打杀0或>= 16。 我尝试在SPSS中为多个插值定义这些约束,但是在SPSS中,我只能定义最大值和最小值。有什么方法可以在SPSS中定义进一步的约束,或者您知道任何R包可以让我为缺失值的插值定义此类约束吗? 我的数据如下: x1 =c(21, 50, 31, 15, 36, 82, 14, 14, 19, 18, 16, 36, 583, NA,NA,NA, 50, 52, 26, 24) x2 = c(0, NA, 18,0, 19, 0, NA, 0, 0, 0, 0, 0, 0,NA,NA, NA, 22, NA, 0, 0) x3 = c(0, 0, 0, 0, …

1
对数链接的Gamma GLM与对数链接的高斯GLM与对数转换的LM
从我的结果来看,GLM Gamma似乎可以满足大多数假设,但这是否是对数转换后的LM值得的改进?我发现的大多数文献都涉及泊松或二项式GLM。我发现使用随机化对广义线性模型假设进行评估非常有用,但是缺少用于做出决策的实际图。希望有经验的人可以为我指明正确的方向。 我想对响应变量T的分布进行建模,其分布如下图所示。如您所见,这是正偏度: 。 我要考虑两个类别因素:METH和CASEPART。 请注意,该研究主要是探索性的,本质上是在对模型进行理论化并围绕模型进行DoE之前作为试点研究。 我在R中具有以下模型及其诊断图: LM.LOG<-lm(log10(T)~factor(METH)+factor(CASEPART),data=tdat) GLM.GAMMA<-glm(T~factor(METH)*factor(CASEPART),data=tdat,family="Gamma"(link='log')) GLM.GAUS<-glm(T~factor(METH)*factor(CASEPART),data=tdat,family="gaussian"(link='log')) 我还通过Shapiro-Wilks残差检验获得了以下P值: LM.LOG: 2.347e-11 GLM.GAMMA: 0.6288 GLM.GAUS: 0.6288 我计算了AIC和BIC值,但是如果我是正确的话,由于GLM / LM中的族不同,它们并不能告诉我太多。 另外,我注意到了极端值,但是由于没有明确的“特殊原因”,因此无法将它们分类为异常值。

4
线性模型与非线性模型的区别
我已经阅读了有关线性模型与非线性模型的属性的一些解释,但是仍然有时我不确定手头的模型是线性模型还是非线性模型。例如,以下模型是线性的还是非线性的? yt=β0+β1B(L;θ)Xt+εtyt=β0+β1B(L;θ)Xt+εty_t=\beta_0 + \beta_1B(L;\theta)X_t+\varepsilon_t 带有: B(L;θ)=∑k=1Kb(k;θ)LkB(L;θ)=∑k=1Kb(k;θ)LkB(L;\theta)=\sum_{k=1}^{K}b(k;\theta)L^k LkXt=Xt−kLkXt=Xt−kL^kX_t=X_{t-k} 其中表示(衰减的)指数Almon多项式函数,其形式为:b(k;θ)b(k;θ)b(k;\theta) b(k;θ)=exp(θ1k+θ2k2)∑Kk=1exp(θ1k+θ2k2)b(k;θ)=exp⁡(θ1k+θ2k2)∑k=1Kexp⁡(θ1k+θ2k2)b(k;\theta)=\frac{\exp(\theta_1 k+\theta_2k^2)}{\sum_{k=1}^{K}\exp(\theta_1k+\theta_2k^2)} 在我看来,我的主要方程式(第一个方程式)相对于是线性的,因为该项只是乘以一个权重。但是我要说加权函数(最后一个方程)相对于参数 ans是非线性的。θ 1 θ 2XtXtX_tθ1θ1\theta_1θ2θ2\theta_2 有人可以向我解释我的主要函数是线性函数还是非线性函数,这对估计程序意味着什么-我必须应用线性或非线性最小二乘法吗?此外,可辨别的特征是什么,通过它我可以确定一个函数是非线性函数还是线性函数?

1
Fisher信息矩阵的存在条件
不同的教科书列举了Fisher信息矩阵存在的不同条件。下面列出了几种这样的条件,每种条件都出现在“ Fisher信息矩阵”的某些但不是全部定义中。 是否有一套标准的,最少的条件? 在以下5个条件中,可以消除哪些条件? 如果可以消除其中一个条件,那么您为什么认为它首先包含在其中? 如果不能消除其中一个条件,是否意味着那些未指定条件的教科书给出了错误的定义,或者至少是不完整的定义? Zacks,《统计推断理论》(1971年),第1页。194. 对于所有 ,矩阵是正定的。 I(θ)I(θ)\mathcal{I}\left(\theta\right)θ∈Θθ∈Θ\theta\in\Theta 谢尔维什,《统计理论》(1997年,第二版,更正),定义2.78,第2页。111 集合对于所有都是相同的。 C={x:f(x;θ)>0}C={x:f(x;θ)>0}C=\left\{x:f\left(x;\theta\right)>0\right\}θθ\theta Borovkov,《数学统计》(1998年)。p。147 wrt是连续可微的。 f(x;θ)f(x;θ)f\left(x;\theta\right)θiθi\theta_i Borovkov,《数学统计》(1998年)。p。147 是连续且可逆的。 I(θ)I(θ)\mathcal{I}\left(\theta\right) Gourieroux&Monfort,《统计与计量经济学模型》,第一卷(1995)。定义(a),第81-82页 存在 ∂2∂θi∂θjf(x;θ)∂2∂θi∂θjf(x;θ)\frac{\partial^2}{\partial\theta_i\partial\theta_j}f\left(x;\theta\right) 相比之下,这是雷曼兄弟(Lehman&Cassella)的条件的完整列表。点估计理论(1998)。p。124: ΘΘ\Theta是一个开放区间(有限,无限或半无限) 对于所有 ,集合是相同的。 C={x:f(x,θ)>0}C={x:f(x,θ)>0}C=\left\{x:f\left(x,\theta\right)>0\right\}θ∈Θθ∈Θ\theta\in\Theta ∂f(x;θ)∂θi∂f(x;θ)∂θi\frac{\partial f\left(x;\theta\right)}{\partial\theta_i}存在且是有限的。 这是Barra(1971年,数学的国家统计概念)中的条件的完整列表。第1页,定义1。35: 该得分为定义的所有,每个组件是平方可积,并且具有一体。 θ∈Θθ∈Θ\theta\in\Theta=0=0=0 有趣的是,雷曼兄弟(Lehman&Cassella)和巴拉(Barra)都没有规定在每个的整数符号下是可区分的。我调查过的大多数其他教科书中都出现这种情况。 ∫f(x;θ) μ(dx)∫f(x;θ) μ(dx)\int f\left(x;\theta\right)\space \mu\left(dx\right)θiθi\theta_i

4
如何为非线性最小二乘拟合选择初始值
上面的问题说明了一切。基本上,我的问题是针对一个通用的拟合函数(可能会任意复杂),该函数在我尝试估算的参数中是非线性的,如何选择初始值来初始化拟合?我正在尝试做非线性最小二乘法。有什么策略或方法吗?已经研究过了吗?有参考吗?除了临时猜测之外,还有什么吗?具体来说,现在正在使用的一种拟合形式是具有我要估计的五个参数的高斯加线性形式,例如 ÿ= A e- (x - BC)2+ D x + Ey=Ae−(x−BC)2+Dx+Ey=A e^{-\left(\frac{x-B}{C}\right)^2}+Dx+E 其中(横坐标数据)和y = log 10(纵坐标数据)意味着在对数对数空间中,我的数据看起来像一条直线加一个高斯近似的凸点。我没有任何理论,关于如何初始化非线性拟合的任何指导,除了可能像线的斜率和凹凸的中心/宽度之类的图形和眼球之外,都没有指导我。但是我有一百多种适合的方法,而不是图形和猜测,我更喜欢一些可以自动化的方法。x = 日志10x=log10x = \log_{10}ÿ= 日志10y=log10y = \log_{10} 我在图书馆或在线找不到任何参考。我唯一能想到的就是随机选择初始值。MATLAB提供了从[0,1]均匀分布的值中随机选择值的功能。因此,对于每个数据集,我都会运行随机初始化的拟合一千次,然后选择最高的那个。还有其他(更好的)想法吗?[R2r2r^2 附录1 首先,这是数据集的一些直观表示,目的是向大家展示我在谈论哪种数据。我要以原始形式发布数据,而无需进行任何形式的转换,然后将其以可视化的形式记录在日志-日志空间中,因为它阐明了某些数据的功能,同时扭曲了其他功能。我同时发布了好坏数据的样本。 每个图中的六个面板中的每个面板都显示四个数据集,它们分别绘制为红色,绿色,蓝色和青色,每个数据集恰好具有20个数据点。由于数据中出现的颠簸,我试图用直线加高斯拟合它们中的每一个。 第一个数字是一些好的数据。第二个图是与图一相同的好数据的对数-对数图。第三个数字是一些不良数据。第四个图是图三的对数-对数图。数据更多,这只是两个子集。大部分数据(大约3/4)都是好数据,类似于我在此处显示的好数据。 现在发表一些评论,请耐心等待,因为这可能会花费很长时间,但是我认为所有这些细节都是必要的。我会尽量简洁。 我原本期望一个简单的幂定律(意思是对数-对数空间中的直线)。当我在对数-对数空间中绘制所有图形时,我看到了4.8 mHz附近的意外凸起。对颠簸进行了彻底的调查,并在其他工作中也发现了颠簸,因此并不是我们搞砸了。它实际上在那儿,其他出版的作品也提到了这一点。因此,我只是在线性形式中添加了一个高斯项。请注意,此拟合将在对数-对数空间中完成(因此,我的两个问题包括此问题)。 现在,在阅读了Stumpy Joe Pete对我的另一个问题(根本与这些数据无关)的答案并阅读了这个,这个以及其中的引用(由Clauset逐句填充)之后,我意识到我不应该适合log-log空间。所以现在我想在预先转换的空间中做所有事情。 问题1:从好的数据来看,我仍然认为在预变换空间中线性加高斯仍然是一种好形式。我很想听听其他有更多数据经验的人的想法。高斯+线性合理吗?我应该只做高斯吗?还是完全不同的形式? 问题2:无论问题1的答案是什么,我仍然需要(最有可能)非线性最小二乘拟合,因此仍需要初始化方面的帮助。 在看到两组数据的情况下,我们非常希望捕获4-5 mHz附近的第一个凸起。因此,我不想添加更多的高斯项,而我们的高斯项应以第一个颠簸为中心,这几乎总是更大的颠簸。我们希望在0.8mHz至5mHz之间的“更高的精度”。我们不太关心较高的频率,但也不想完全忽略它们。那么也许是某种权衡?还是B总是可以在4.8mHz附近初始化? Fff大号LL L = A e− (f- 乙C)2+ D f+ E。L=Ae−(f−BC)2+Df+E.L=A e^{-\left(\frac{f-B}{C}\right)^2}+Df+E. Fff …

1
系数路径–岭,套索和弹性净回归的比较
我想比较使用脊线,套索和弹性网选择的模型。下图显示了使用所有三种方法的系数路径:山脊(图A,alpha = 0),套索(图B; alpha = 1)和弹性网(图C; alpha = 0.5)。最佳解决方案取决于所选的lambda值,该值是基于交叉验证选择的。 查看这些图时,我希望弹性网(图C)表现出分组效应。然而,目前情况尚不清楚。套索和弹性网的系数路径非常相似。这可能是什么原因?这仅仅是编码错误吗?我在R中使用了以下代码: library(glmnet) X<- as.matrix(mydata[,2:22]) Y<- mydata[,23] par(mfrow=c(1,3)) ans1<-cv.glmnet(X, Y, alpha=0) # ridge plot(ans1$glmnet.fit, "lambda", label=FALSE) text (6, 0.4, "A", cex=1.8, font=1) ans2<-cv.glmnet(X, Y, alpha=1) # lasso plot(ans2$glmnet.fit, "lambda", label=FALSE) text (-0.8, 0.48, "B", cex=1.8, font=1) ans3<-cv.glmnet(X, Y, alpha=0.5) # elastic net …

2
phi,Matthews和Pearson相关系数之间的关系
phi和Matthews相关系数是同一概念吗?它们如何与两个二元变量的皮尔逊相关系数相关或等效?我假设二进制值为0和1。 两个伯努利随机变量和y之间的皮尔逊相关性是:xxxyyy ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]−−−−−−−−−−√=E[xy]−E[x]E[y]Var[x]Var[y]−−−−−−−−−−√=n11n−n1∙n∙1n0∙n1∙n∙0n∙1−−−−−−−−−−√ρ=E[(x−E[x])(y−E[y])]Var[x]Var[y]=E[xy]−E[x]E[y]Var[x]Var[y]=n11n−n1∙n∙1n0∙n1∙n∙0n∙1 \rho = \frac{\mathbb{E} [(x - \mathbb{E}[x])(y - \mathbb{E}[y])]} {\sqrt{\text{Var}[x] \, \text{Var}[y]}} = \frac{\mathbb{E} [xy] - \mathbb{E}[x] \, \mathbb{E}[y]}{\sqrt{\text{Var}[x] \, \text{Var}[y]}} = \frac{n_{1 1} n - n_{1\bullet} n_{\bullet 1}}{\sqrt{n_{0\bullet}n_{1\bullet} n_{\bullet 0}n_{\bullet 1}}} 哪里 E[x]=n1∙nVar[x]=n0∙n1∙n2E[y]=n∙1nVar[y]=n∙0n∙1n2E[xy]=n11nE[x]=n1∙nVar[x]=n0∙n1∙n2E[y]=n∙1nVar[y]=n∙0n∙1n2E[xy]=n11n \mathbb{E}[x] = \frac{n_{1\bullet}}{n} \quad \text{Var}[x] = \frac{n_{0\bullet}n_{1\bullet}}{n^2} \quad \mathbb{E}[y] = \frac{n_{\bullet 1}}{n} \quad \text{Var}[y] …

1
只要模型基于相同的数据集,您可以比较AIC值吗?
我正在使用Rob Hyndman的预测包在R中进行一些预测。属于包装的纸张可以在这里找到。 在解释了自动预测算法后,作者在相同的数据集上实现了这些算法。但是,在估计了指数平滑和ARIMA模型后,他们做出了我不理解的声明(第17页): 请注意,信息标准不可比较。 我认为使用AIC进行模型选择的优势在于,只要使用相同数据集对AIC值进行估算,我们就可以比较它们。这不正确吗? 因为我计划使用所谓的Akaike权重来组合来自不同模型类(例如指数平滑和ARIMA)的预测(请参阅Burnham和Anderson,2002,有关Akaike权重的讨论),这对我来说尤其有意义。 参考文献 Burnham,KP和Anderson,DR(2002)。模型选择和多模型推理:一种实用的信息理论方法。施普林格出版社。


3
来自多个排名列表的总体排名
我浏览了很多在线文献,包括没有运气的这个论坛,希望有人可以帮助解决我目前面临的统计问题: 我有5个排名数据列表,每个列表包含从位置1(最佳)到位置10(最差)排名的10个项目。出于上下文考虑,每个列表中的10个项目都是相同的,但是由于用于确定其排名的技术不同,因此排名顺序不同。 示例数据: List 1 List 2 List 3 ... etc Item 1 Ranked 1 Ranked 2 Ranked 1 Item 2 Ranked 3 Ranked 1 Ranked 2 Item 3 Ranked 2 Ranked 3 Ranked 3 ... etc 我正在寻找一种方法来解释和分析上述数据,以便最终得出基于每个测试及其位置的每个项目的总体排名,例如 Result Rank 1 = Item 1 Rank 2 = Item 3 Rank …

1
了解MCMC和Metropolis-Hastings算法
在过去的几天里,我一直在试图了解Markov Chain Monte Carlo(MCMC)的工作方式。特别是,我一直在尝试理解和实现Metropolis-Hastings算法。到目前为止,我认为我对该算法有一个整体的了解,但是有些事情我还不清楚。我想使用MCMC使某些模型适合数据。因此,我将描述我对Metropolis-Hastings算法的理解,该算法用于将直线拟合到一些观测数据D:F(x )= a xf(x)=axf(x)=axdDD 1)制作为初始猜测。将此a设置为我们的当前a(a 0)。还要在马尔可夫链(C)的末尾添加a。一个aa一个aa一个aa一个0a0a_0一个aaCCC 2)重复以下步骤。 3)评估当前似然()给出一个0和d。大号0L0{\cal L_0}一个0a0a_0DDD 4)通过从正态分布取μ = a 0和σ = s t e p s i z e来提出新的(a 1)。现在,š 吨È p 小号我Ž ê是恒定的。aaaa1a1a_1μ=a0μ=a0\mu=a_0σ=stepsizeσ=stepsize\sigma=stepsizestepsizestepsizestepsize 5)评估新的可能性()给定的一个1和d。L1L1{\cal L_1}a1a1a_1DDD 6)如比更大大号0,接受一个1作为新的一个0,将其追加在年底Ç并转到步骤2。L1L1{\cal L_1}L0L0{\cal L_0}a1a1a_1a0a0a_0CCC 7)如果小于L 0,则从均匀分布生成范围[0,1] 的数字(U)L1L1{\cal L_1}L0L0{\cal L_0}UUU 8)如果比两个似然性(之间的差较小的大号1 - 大号0),接受一个1作为新的一个0,将其追加在年底Ç并转到步骤2。UUUL1L1{\cal L_1}L0L0{\cal L_0}a1a1a_1a0a0a_0CCC UUUL1L1{\cal L_1}L0L0{\cal L_0}a0a0a_0CCCa0a0a_0 10)重复结束。 CCC …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.