统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
动态因素分析与状态空间模型
R中的MARSS软件包提供了用于动态因子分析的功能。在此程序包中,动态因子模型被编写为状态空间模型的一种特殊形式,并且它们假定遵循AR(1)过程的共同趋势。由于我对这两种方法不太熟悉,因此我提出了两个问题: 动态因子分析是状态空间模型的一种特殊形式吗?这两种方法有什么区别? 此外,动态因素分析并不一定假定AR(1)过程具有共同趋势。是否有任何软件包可以使通用趋势作为季节性ARIMA(或其他)过程?

3
将神经网络数学建模为图形模型
我正在努力在神经网络和图形模型之间建立数学联系。 在图形模型中,这个想法很简单:概率分布根据图中的派系分解,势通常为指数族。 神经网络是否有等效的推理?能否用受限的玻尔兹曼机或CNN表示单位(变量)上单位(变量)随其能量或单位之间能量乘积的概率分布? 另外,概率分布是否由指数族的RBM或深度信仰网络(例如带有CNN)建模? 我希望找到一种文本,这些文本以约旦和温赖特(Jordan&Wainwright)的图形模型,图形族,指数族和变分推论对图形模型所做的相同方式,来形式化这些现代神经网络和统计之间的联系。任何指针都很棒。

1
逻辑回归模型操纵
我想了解以下代码在做什么。编写代码的人不再在这里工作,并且几乎完全没有文档记录。有人认为“ 这是贝叶斯逻辑回归模型 ” ,有人要求我进行调查 bglm <- function(Y,X) { # Y is a vector of binary responses # X is a design matrix fit <- glm.fit(X,Y, family = binomial(link = logit)) beta <- coef(fit) fs <- summary.glm(fit) M <- t(chol(fs$cov.unscaled)) betastar <- beta + M %*% rnorm(ncol(M)) p <- 1/(1 + …


1
无分布统计/方法与非参数统计有什么区别?
来自维基百科 非参数的第一个含义包括不依赖于属于任何特定分布的数据的技术。其中包括: 无分布的方法,它不依赖于假设数据是从给定的概率分布中得出的。因此,这与参数统计相反。它包括非参数统计模型,推断和统计检验。 非参数统计(在数据统计意义上,其定义为不依赖参数的样本函数),其解释不依赖于符合任何参数分布的总体。基于观察等级的统计数据就是此类统计数据的一个示例,它们在许多非参数方法中起着核心作用。 我看不到这两种情况之间的区别:无分布方法和非参数统计。他们俩都不假定数据来自某种分布吗?它们有何不同? 感谢致敬!

4
在这种情况下,泊松回归与线性回归相比有什么优势?
我获得了一个数据集,其中包含一所高中学生获得的奖励数量,其中预测的奖励数量包括该学生注册的课程类型以及他们的数学期末考试成绩。 我想知道是否有人可以告诉我为什么线性回归模型在这种情况下可能不合适,以及为什么使用泊松回归会更好?谢谢。

1
使用最小二乘法与广义线性模型与非线性最小二乘拟合指数函数
我有一个代表指数衰减的数据集。我想对这个数据拟合指数函数。我尝试对数转换响应变量,然后使用最小二乘法拟合一条线。使用具有对数链接函数和响应变量周围的伽马分布的广义线性模型;并使用非线性最小二乘法。尽管每种方法的两个系数都相似,但我得到的答案不同。我感到困惑的地方是我不确定哪种方法最适合使用以及为什么使用。有人可以比较和对比这些方法吗?谢谢。y=Beaxy=Beaxy = Be^{ax}

2
R中k均值聚类的解释结果
我正在使用kmeansR 的指令在Anderson的虹膜数据集上执行k-means算法。我对我得到的一些参数有疑问。结果是: Cluster means: Sepal.Length Sepal.Width Petal.Length Petal.Width 1 5.006000 3.428000 1.462000 0.246000 在这种情况下,“集群意味着”代表什么?它是集群中所有对象的距离的平均值吗? 在最后一部分中,我还有: Within cluster sum of squares by cluster: [1] 15.15100 39.82097 23.87947 (between_SS / total_SS = 88.4 %) 那个88.4%的值,可能是它的解释?

2
如何将逻辑回归和随机森林的结果结合起来?
我是机器学习的新手。我在同一数据集上应用了逻辑回归和随机森林。因此,我得到了可变的重要性(逻辑回归的绝对系数和随机森林的可变重要性)。我正在考虑将两者结合起来以获得最终可变的重要性。谁能分享他/她的经验?我已经检查了装袋,提升,合奏建模,但是这些不是我所需要的。他们更多地是在跨重复项合并同一模型的信息。我正在寻找的是结合多个模型的结果。

2
比较两个线性回归模型
我想比较两个线性回归模型,它们表示在两种不同条件下,mRNA随时间的降解速率。每个模型的数据都是独立收集的。 这是数据集。 时间(小时)日志(处理A)日志(处理B) 0 2.02 1.97 0 2.04 2.06 0 1.93 1.96 2 2.02 1.91 2 2.00 1.95 2 2.07 1.82 4 1.96 1.97 4 2.02 1.99 4 2.02 1.99 6 1.94 1.90 6 1.94 1.97 6 1.86 1.88 8 1.93 1.97 8 2.12 1.99 8 2.06 1.93 12 1.71 …

1
内核化的k最近邻居
我是内核的新手,在尝试将kNN内核化时遇到了障碍。 初赛 我使用多项式核: ķ(X,Ý)= (1 + ⟨ X,ÿ ⟩ )dķ(X,ÿ)=(1个+⟨X,ÿ⟩)dK(\mathbf{x},\mathbf{y}) = (1 + \langle \mathbf{x},\mathbf{y} \rangle)^d 典型的欧几里得kNN使用以下距离度量: d(x,y)= | | x − y | |d(X,ÿ)=||X-ÿ||d(\mathbf{x}, \mathbf{y}) = \vert\vert \mathbf{x} - \mathbf{y} \vert\vert 令将x映射到某些高维特征空间。然后,可以用内积表示上述距离度量在希尔伯特空间中的平方: d 2(f (x ),f (y ))= K (x,x)− 2 K (x,y)+ K (y,y)F(x)F(X)f(\mathbf{x})XX\mathbf{x}d2(f(x ),f(y))= K(x,x)− 2 K(x,y)+ …

1
Y的密度=伽玛分布的X的log(X)
这个问题与此帖子密切相关 假设我有一个随机变量,并且我定义ÿ = 日志(X )。我想找到Y的概率密度函数。X〜伽玛(k ,θ )X∼Gamma(k,θ)X \sim \text{Gamma}(k, \theta)ÿ= 日志(X)Y=log⁡(X)Y = \log(X)ÿYY 我原本以为我将只定义累积分布函数X,更改变量,然后将积分的“内部”作为我的密度,就像这样, P(X≤ Ç )P(是≤ 日志c )= ∫C01个θķ1个Γ (k )Xk − 1Ë− xθdX= ∫日志(c )日志(0 )1个θķ1个Γ (k )经验值(y)k − 1Ë− 经验(y)θ经验值(y)dÿP(X≤c)=∫0c1θk1Γ(k)xk−1e−xθdxP(Y≤log⁡c)=∫log⁡(0)log⁡(c)1θk1Γ(k)exp⁡(y)k−1e−exp⁡(y)θexp⁡(y)dy\begin{align} P(X \le c) & = \int_{0}^{c} \frac{1}{\theta^k} \frac{1}{\Gamma(k)} x^{k- 1} e^{-\frac{x}{\theta}} dx \\ P(Y \le \log c) …

1
预测R中的有序logit
我正在尝试进行有序的logit回归。我正在像这样运行模型(只是一个愚蠢的小模型,它根据收入和人口指标来估算市场中的公司数量)。我的问题是关于预测。 nfirm.opr<-polr(y~pop0+inc0, Hess = TRUE) pr_out<-predict(nfirm.opr) 当我运行预测(我试图使用它来获取预测的y)时,输出为0、3或27,这决不会反映基于我根据系数的人工预测应该看起来像是预测估计和截距。有谁知道如何为我订购的logit模型获得“准确”的预测? 编辑 为了澄清我的担忧,我的回答数据包含所有级别的观察结果 >head(table(y)) y 0 1 2 3 4 5 29 21 19 27 15 16 正如我的预测变量似乎在聚集 > head(table(pr_out)) pr_out 0 1 2 3 4 5 117 0 0 114 0 0

2
PCA解决方案是否独特?
在某些数据集上运行PCA时,给我的解决方案是否唯一? 即,我根据点间距离获得了一组二维坐标。是否有可能找到满足这些约束的至少另一种点排列方式? 如果答案是肯定的,我如何找到这种不同的解决方案?
12 pca 

2
随机森林的特征选择和带有尖号的参数调整
我有具有数千个功能的数据,并且我想进行递归功能选择(RFE)以删除无信息的功能。我使用插入符号和RFE 进行此操作。但是,我开始思考,如果我想获得最佳的回归拟合(例如,随机森林),什么时候应该执行参数调整(mtry针对RF)?也就是说,据我所知,插入符号使用固定的mtry在不同的特征子集上反复训练RF。我想mtry应该在特征选择完成后找到最佳mtry值,但是插入符号使用的值会影响特征的所选子集吗?使用插入符号低mtry的速度要快得多,当然。 希望有人可以向我解释。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.