统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何在R中同时使用数字/分类值进行有序Logistic回归分析?
基本数据:我约有1,000个人标有评估:“ 1,” [好],“ 2”,[中]或“ 3” [差] –这些是我将来要为人们预测的价值。除此之外,我还有一些人口统计信息:性别(分类:男/女),年龄(数字:17-80)和种族(分类:黑人/高加索人/拉丁裔)。 我主要有四个问题: 我最初试图将上述数据集作为多元回归分析来运行。但是我最近了解到,由于我的依存关系是有序因素,而不是连续变量,因此我应该对此类情况使用序数逻辑回归。我最初使用的是这样的东西mod <- lm(assessment ~ age + gender + race, data = dataset),有人能指出我正确的方向吗? 从那里开始,假设我对系数感到满意,就知道如何仅将数值插入x1,x2等。但是,例如在有多种响应的情况下,我将如何处理种族:黑人/高加索人/拉丁美洲人?因此,如果它告诉我白种人系数为0.289,而我要预测的某个人是白种人,那么由于值不是数字,我该如何重新插入? 我还缺少一些随机值-有些是种族的,有些是性别的,等等。我是否还需要做其他一些事情以确保它不会歪斜任何东西?(我注意到,当我的数据集被加载到R-Studio中时,当丢失的数据被加载为时NA,R表示类似(162 observations deleted due to missingness)-但如果它们被加载为空白,则它什么都不做。) 假设所有这些都可以解决,并且我有我要预测的具有性别,年龄和种族的新数据-R中有没有更简单的方法可以通过我的新系数公式通过所有这些方法来运行所有这些数据,而不是手动进行?(如果这个问题在这里不合适,我可以将其带回R论坛。)

4
术语“时间序列分析”和“纵向数据分析”之间有什么区别
在谈论纵向数据时,我们可能会重复引用从同一主题/研究单位随时间收集的数据,因此,同一主题内的观察存在相关性,即主题内相似度。 在谈论时间序列数据时,我们还引用了一系列时间收集的数据,这似乎与上述纵向设置非常相似。 我想知道是否有人可以在这两个术语之间提供清晰的说明,它们之间的关系是什么,区别是什么?

3
为什么我们需要自动编码器?
最近,我一直在研究自动编码器。如果我理解正确,那么自动编码器就是一个神经网络,其中输入层与输出层相同。因此,神经网络尝试使用输入作为黄金标准来预测输出。 此模型的用处是什么?尝试重构某些输出元素,使其尽可能与输入元素相等,会有什么好处?为什么要使用所有这些机器来达到相同的起点?



4
和F检验之间有什么关系?
我想知道R2R2R^2和F检验之间是否存在关系。 一般R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R2=∑(Y^t−Y¯)2/T−1∑(Yt−Y¯)2/T−1R^2=\frac {\sum (\hat Y_t - \bar Y)^2 / T-1} {\sum( Y_t - \bar Y)^2 / T-1}和它测量在回归的线性关系的强度。 F检验只是证明了一个假设。 R2R2R^2和F检验之间有关系吗?

1
我应该在精神上如何应对Borel的悖论?
对于在心理上如何处理Borel悖论和其他与条件概率有关的“悖论”,我感到不安。对于那些不熟悉它的人,请参阅此链接。到目前为止,我的精神反应主要是忽略它,因为似乎没有人谈论它,但是我觉得我应该纠正这一点。 我们知道这个悖论是存在的,但实际上在实践中(作为贝叶斯分析的一个极端例子),对于条件为事件,我们是完全可以的。如果是我的数据,我们条件对所有的时间,即使这是衡量一个事件时是连续的。而且,我们当然不花力气构造一系列事件,收敛到我们观察到的解决矛盾的事件,至少没有明确地。X X = x 0 X000XXXX=xX=xX = x000XXX 我认为这是可以的,因为在实验之前我们已经固定了随机变量(原则上),因此我们以为条件。也就是说,是自然的代数,因为信息将通过来使用-如果信息以其他方式传给我们,我们将以不同的 -代数。Borel的悖论之所以出现是因为(我猜)要适应的代数尚不清楚,但是贝叶斯方法已指定。因为我们指定的是先验信息σ (X )σ (X )σ X = X X σ σ σ (X )X = XXXXσ(X)σ(X)\sigma(X)σ(X)σ(X)\sigma(X)σσ\sigmaX=xX=xX = xXXXσσ\sigmaσσ\sigmaσ(X)σ(X)\sigma(X)X=xX=xX = x是通过测量XXX得出的。一旦指定了代数,一切都会好起来;我们使用Radon-Nikodym构造我们的条件期望,并且所有事物都是唯一的直至空集。σσ\sigma 这本质上是正确的,还是我离开了?如果我的路要走,什么是对行为,因为我们做的理由?[考虑到该站点的问与答性质,将其视为我的问题。]当我采用测度理论概率时,由于某种我不了解的原因,我们甚至从未触及过有条件的期望。结果,我担心我的想法很混乱。


3
回归中R平方和p值之间的关系是什么?
tl; dr-对于OLS回归,较高的R平方是否还意味着较高的P值?专门针对单个解释变量(Y = a + bX + e),但也有兴趣了解n个多个解释变量(Y = a + b1X + ... bnX + e)。 上下文-我正在对一系列变量执行OLS回归,并试图通过生成一个表格来开发最佳的解释函数形式,该表格包含线性,对数等之间的R平方值,每个解释(独立)变量的变换以及响应(因变量)。看起来有点像: 变量名-线性形式---ln(变量)--exp(变量)-...等 变量1 ------- R平方---- R平方---- R平方 -...等等... 我想知道R平方是否合适,或者P值是否更好。大概存在某种关系,因为更重要的关系意味着更高的解释力,但不确定是否严格地做到这一点。


3
在R中拟合t分布:缩放参数
我如何拟合t分布的参数,即与正态分布的“均值”和“标准偏差”相对应的参数。我假设它们被称为t分布的“均值”和“缩放/自由度”? 以下代码通常会导致“优化失败”错误。 library(MASS) fitdistr(x, "t") 我必须先缩放x还是转换成概率?如何做到最好?

5
为什么k-均值不给出全局最小值?
我读到k-means算法仅收敛到局部最小值,而不收敛到全局最小值。为什么是这样?我可以从逻辑上考虑初始化如何影响最终的聚类,并且存在次优聚类的可能性,但是我没有找到任何可以从数学上证明这一点的东西。 另外,为什么k-means是一个迭代过程?我们不能仅将目标函数wrt与质心进行部分区分,将其等于零以找到使该函数最小化的质心吗?为什么我们必须使用梯度下降来逐步达到最小?

1
如何解释predict.coxph的输出?
拟合coxmodel之后,可以进行预测并检索新数据的相对风险。我不了解的是如何计算一个人的相对风险,以及相对风险是什么(即人口的平均值)?有什么建议可以帮助您理解(我在生存分析方面不是很先进,所以越简单越好)?

1
力矩产生功能与特征功能之间的联系
我试图理解力矩产生函数和特征函数之间的联系。矩生成函数定义为: MX(t)=E(exp(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n!MX(t)=E(exp⁡(tX))=1+tE(X)1+t2E(X2)2!+⋯+tnE(Xn)n! M_X(t) = E(\exp(tX)) = 1 + \frac{t E(X)}{1} + \frac{t^2 E(X^2)}{2!} + \dots + \frac{t^n E(X^n)}{n!} 使用,我可以找到随机变量分布的所有时刻X。exp(tX)=∑∞0(t)n⋅Xnn!exp⁡(tX)=∑0∞(t)n⋅Xnn!\exp(tX) = \sum_0^{\infty} \frac{(t)^n \cdot X^n}{n!} 特征函数定义为: φX(t)=E(exp(itX))=1+itE(X)1−t2E(X2)2!+…+(it)nE(Xn)n!φX(t)=E(exp⁡(itX))=1+itE(X)1−t2E(X2)2!+…+(it)nE(Xn)n! \varphi_X(t) = E(\exp(itX)) = 1 + \frac{it E(X)}{1} - \frac{t^2 E(X^2)}{2!} + \ldots + \frac{(it)^n E(X^n)}{n!} 我不完全了解为我带来的虚数信息。我看到,因此特征函数中不只有,但是为什么我们需要在特征函数中减去矩?数学思想是什么?iiii2=−1i2=−1i^2 = -1+++

5
当我的t统计量如此之大时,为什么我的R平方这么低?
我跑了回归有4个变量,都非常统计学显著,带T值≈7,9,26≈7,9,26\approx 7,9,26和313131(我说≈≈\approx因为它似乎无关包括小数),这是非常高的,清晰显著。但是R2R2R^2只有0.2284。我在误解此处的t值意味着它们不是吗?我在看到的T值的第一反应是,R2R2R^2将是相当高的,但也许这是一个高R2R2R^2?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.