统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何获得WinBUGS中特定变量的预测?
我是WinBUGS的新用户,并且有一个问题需要您的帮助。运行下面的代码后,我获得了参数beta0through beta4(统计信息,密度),但是我不知道如何获得的最后一个值的预测h,我将NA在代码中对其进行建模。 有人可以给我提示吗?任何建议将不胜感激。 model { for(i in 1: N) { CF01[i] ~ dnorm(0, 20) CF02[i] ~ dnorm(0, 1) h[i] ~ dpois (lambda [i]) log(lambda [i]) <- beta0 + beta1*CF03[i] + beta2*CF02[i] + beta3*CF01[i] + beta4*IND[i] } beta0 ~ dnorm(0.0, 1.0E-6) beta1 ~ dnorm(0.0, 1.0E-6) beta2 ~ dnorm(0.0, 1.0E-6) beta3 ~ …

2
高维数据集的高斯过程回归
只是想看看是否有人对高维数据集应用高斯过程回归(GPR)有任何经验。我正在研究各种稀疏GPR方法(例如,稀疏伪输入GPR),以了解在特征选择是参数选择过程一部分的情况下,高维数据集可以使用的方法。 任何有关论文/代码/或各种尝试方法的建议都值得赞赏。 谢谢。

1
在同一个数据集上运行两个线性模型是否可以接受?
对于具有多个组(先验定义的自然组)的线性回归,是否可以在同一数据集上运行两个不同的模型来回答以下两个问题? 每个组是否具有非零的斜率和非零的截距,并且组回归中每个参数的参数是什么? 无论组成员身份如何,是否存在非零趋势和非零截距,并且跨组回归的参数有哪些? 在R中,第一个模型为lm(y ~ group + x:group - 1),因此估计的系数可以直接解释为每个组的截距和斜率lm(y ~ x + 1)。 备选方案将是lm(y ~ x + group + x:group + 1),这将导致复杂的系数汇总表,并且必须根据组中的斜率和截距来计算系数和截距,而斜率和截距必须来自某个参考。另外,您还必须重新排序组并再次运行模型,以获取最后一个组差异的p值(有时)。 这是否使用两个单独的模型以任何方式或这种标准惯例对推理产生了负面影响? 为了说明这一点,将x表示为药物剂量,将各组视为不同的种族。了解特定种族的医生的剂量反应关系可能很有趣,或者根本不知道药物对哪个种族起作用,但是有时了解整个(人类)人群的剂量反应关系也可能很有趣。不管竞选公共卫生官员。这只是一个例子,说明人们可能对组内和组间回归分别感兴趣。剂量反应关系是否应为线性并不重要。

2
什么是预测受(0,1)约束的百分比的时间序列模型?
这必定会发生-预测介于0和1之间的事物。 在我的系列文章中,我怀疑有一个自动回归的成分,也有一个均值回归的成分,所以我希望我可以像ARIMA那样解释一些东西,但是我不希望它将来会飙升到1000% 。 您是否仅将ARIMA模型用作逻辑回归中的参数以将结果限制在0和1之间? 或者我在这里了解到Beta回归更适合(0,1)数据。我如何将其应用于时间序列?是否有好的R软件包或Matlab函数使拟合和预测变得容易?

4
在R中的逻辑回归模型上缺乏拟合度时,如何计算Pearson的检验统计量?
对于R中的逻辑回归模型(使用函数进行拟合),获得似然比(aka偏差)统计和不拟合(或拟合优)检验非常简单。容易使某些单元格计数低到足以使测试不可靠的程度。验证似然比检验是否缺乏拟合的可靠性的一种方法是将其检验统计量和P值与Pearson的卡方检验(或)缺乏拟合的检验进行比较。G2G2G^2glm(..., family = binomial)χ2χ2\chi^2 该glm对象及其summary()方法均未报告缺少拟合的Pearson卡方检验的检验统计量。在搜索中,我唯一想到的就是chisq.test()功能(在stats包装中):其文档说“ chisq.test执行卡方列联表测试和拟合优度测试”。但是,该文档缺乏有关如何执行此类测试的信息: 如果x是具有一行或一列的矩阵,或者如果x是向量y且未给出,则执行拟合优度检验(x被视为一维列联表)。的条目x必须是非负整数。在这种情况下,检验的假设是总体概率是否等于中的概率p,如果p未给出,则全部等于。 我猜想您可以y将glm对象的组件用作的x参数chisq.test。但是,您不能fitted.values将glm对象的组件用作的p参数chisq.test,因为会出现错误:“ probabilities must sum to 1.” 如何(在R中)至少可以计算出缺乏拟合的Pearson测试统计量,而不必手动执行这些步骤?χ2χ2\chi^2

1
R线性回归分类变量“隐藏”值
这只是我多次遇到的示例,因此我没有任何示例数据。在R中运行线性回归模型: a.lm = lm(Y ~ x1 + x2) x1是一个连续变量。x2是分类的,具有三个值,例如“低”,“中”和“高”。但是,R给出的输出将类似于: summary(a.lm) Estimate Std. Error t value Pr(>|t|) (Intercept) 0.521 0.20 1.446 0.19 x1 -0.61 0.11 1.451 0.17 x2Low -0.78 0.22 -2.34 0.005 x2Medium -0.56 0.45 -2.34 0.005 我知道R在这种因素(x2是一个因素)上引入了某种虚拟编码。我只是想知道,如何解释x2“高”值?例如,x2在此处给出的示例中,“ High” 对响应变量有什么影响? 我在其他地方(例如这里)已经看到了这样的示例,但是还没有找到我能理解的解释。
10 r  regression  categorical-data  regression-coefficients  categorical-encoding  machine-learning  random-forest  anova  spss  r  self-study  bootstrap  monte-carlo  r  multiple-regression  partitioning  neural-networks  normalization  machine-learning  svm  kernel-trick  self-study  survival  cox-model  repeated-measures  survey  likert  correlation  variance  sampling  meta-analysis  anova  independence  sample  assumptions  bayesian  covariance  r  regression  time-series  mathematical-statistics  graphical-model  machine-learning  linear-model  kernel-trick  linear-algebra  self-study  moments  function  correlation  spss  probability  confidence-interval  sampling  mean  population  r  generalized-linear-model  prediction  offset  data-visualization  clustering  sas  cart  binning  sas  logistic  causality  regression  self-study  standard-error  r  distributions  r  regression  time-series  multiple-regression  python  chi-squared  independence  sample  clustering  data-mining  rapidminer  probability  stochastic-processes  clustering  binary-data  dimensionality-reduction  svd  correspondence-analysis  data-visualization  excel  c#  hypothesis-testing  econometrics  survey  rating  composite  regression  least-squares  mcmc  markov-process  kullback-leibler  convergence  predictive-models  r  regression  anova  confidence-interval  survival  cox-model  hazard  normal-distribution  autoregressive  mixed-model  r  mixed-model  sas  hypothesis-testing  mediation  interaction 

1
合并多个时间序列时应该注意哪些问题?
假设我有多个时间序列,例如某个地区各个站点的多个温度记录。我想获得整个区域的单个温度记录,可以用来描述区域气候的各个方面。直观的方法可能是简单地取每个时间步长上所有电台的平均值,但是我的统计蜘蛛感应(我肯定还不太了解)告诉我,这可能并不容易。尤其是,我认为对整个区域进行平均会消除一些有趣的极端温度,并且我可能会对附近站点之间的依赖性产生疑问。 如果我尝试这样的策略,还有其他方法可以克服这些问题,或者有更明智的组合此类数据的方法,还会遇到什么其他问题? 注意:答案可能比我提供的空间示例更为笼统。


2
物流增长数据的误差分布是什么?
在生态学中,我们经常使用逻辑增长方程: ñŤ=ķñ0Ë[R Ťķ+ñ0Ër t − 1Nt=KN0ertK+N0ert−1 N_t = \frac{ K N_0 e^{rt} }{K + N_0 e^{rt-1}} 要么 ñŤ=ķñ0ñ0+ (K-ñ0)Ë- - [R ŤNt=KN0N0+(K−N0)e−rt N_t = \frac{ K N_0}{N_0 + (K -N_0)e^{-rt}} 其中是承载能力(达到最大密度),是初始密度,是增长率,是从初始开始的时间。ķKKñ0N0N_0[RrrŤtt 的值具有一个的上限和一个下限,下限为。ñŤNtN_t(K)(K)(K)(ñ0)(N0)(N_0)000 此外,在我的特定上下文中,使用光密度或荧光进行测量,这两者均具有理论最大值,因此具有很强的上限。ñŤNtN_t 因此,围绕的误差最好用有界分布来描述。ñŤNtN_t 在值,该分布可能具有很强的正偏度,而在值接近K时,该分布可能具有很强的负偏度。因此,该分布可能具有可以链接到的形状参数。ñŤNtN_tñŤNtN_tñŤNtN_t 方差也可以随着增加。ñŤNtN_t 这是一个图形示例 与 K<-0.8 r<-1 N0<-0.01 t<-1:10 max<-1 可以用 library(devtools) source_url("https://raw.github.com/edielivon/Useful-R-functions/master/Growth%20curves/example%20plot.R") 考虑到模型和提供的经验信息,围绕的理论误差分布是?ñŤNtN_t 此分布的参数与或时间值关系(如果使用参数,则该模式不能与直接关联,例如logis正态)?ñŤNtN_tñŤNtN_t 这个分布是否具有在实现的密度函数?[RRR 到目前为止探索的方向: …
10 r  distributions  pdf  ecology 

2
如何正确对待每个主题的多个数据点
我目前正在与someoe争论如何正确处理每个对象的多次测量数据。在这种情况下,在短时间内针对每个受试者内的不同条件收集了每个受试者的数据。所有测量都完全收集相同的变量,只是多个变量。 现在的一种选择是仅按条件对数据进行分组,而不关心多个数据点来自一个主题。但是,每个主题的数据点可能并不完全独立。 另一种选择是,首先对每个受试者的每种状况进行所有测量的平均值,然后比较平均值。但是,这可能会影响重要性,因为在最终分析中未考虑到均值误差较小的问题。 您如何正确分析此类数据?SPSS是否以某种方式解决了这个问题?原则上,应该可以在计算平均值时计算误差容限,而不是在最终分析中考虑误差容限,但是我不认为SPSS会在背后进行某种计算。

3
具有条件转移概率的马尔可夫模型
首先,让我预先承认,我对统计和数学的了解不如我所希望的那样。有人可能会说只有足够的知识才有危险。:DI抱歉,如果我没有正确使用术语。 我正在尝试对系统从一种状态转换为另一种状态的概率进行建模。一个简单的马尔可夫模型是一个好的开始。(状态集,初始状态概率集,状态之间的转移概率集。) 但是,我正在建模的系统要复杂得多。导致在时间T进入状态的转移概率最有可能取决于除T-1处的状态以外的变量。例如,当阳光明媚时,S1-> S2的转换概率可能为40%,但是在下雨时,S1-> S2的转换概率为80%。 评论者问题的其他信息: 状态是可观察的。 只有5-10个州。 尽管最终模型肯定会少于这个,但目前我们大约要研究30个协变量。 一些协变量是连续的,其他是离散的。 三个问题: 如何将条件转移概率纳入我的马尔可夫模型中? 或者,是否有我应该完全从另一个角度来解决这个问题? 另外,我应该在线搜索哪些关键字/概念以了解更多信息? 我已经在网上搜索“带有条件转移概率的马尔可夫模型”之类的东西,但是到目前为止,没有任何东西让我打耳光,说:“这是你的答案,假人!” 感谢您的帮助和耐心等待。

3
线性多元回归方程中所有IV之间的共享方差在哪里?
在线性多元回归方程中,如果beta权重反映每个独立变量的贡献超过所有其他IV的贡献,那么在回归方程中,所有IV共享的预测DV的方差是什么? 例如,如果下面显示的维恩图(并取自CV的“关于”页面:https://stats.stackexchange.com/about)被重新标记为3 IV和1 DV,带有星号的区域将输入到哪里进入多元回归方程?

2
如何在R中模拟多元结果?
在大多数情况下,我们只处理一个结果/响应变量,例如 y=a+bx+ϵy=a+bx+ϵy = a + bx +\epsilon。但是,在某些情况下,尤其是在临床数据中,结果变量可能是高维/多元变量。如Y=βx+ϵY=βx+ϵ\mathsf{Y} = \beta{x} + \mathsf{\epsilon},在哪里 YY\mathsf{Y} 包含 Y1Y1Y_1, Y2Y2Y_2 和 Y3Y3Y_3变量与这些结果都相关。如果xxx 代表正在接受治疗(是/否),如何在R中模拟此类数据? 一个真实的例子,每个患者接受两种类型的搭桥手术中的一种,研究人员在搭桥手术后对每个患者进行疼痛,肿胀,疲劳等测量(每个症状的发生率从0到10)。我“假设”结局(症状严重程度)是多元正常的。希望这个真实的例子可以澄清我的问题。提前谢谢了。

3
通过PCA进行的Mahalanobis距离
我有一个 Ñ × pñ×pn\times p 矩阵,其中 ppp 是基因的数量, ññn是患者人数。任何使用过此类数据的人都知道ppp 总是大于 ññn。使用功能选择我已经ppp 下降到一个更合理的数字 ppp 仍然大于 ññn。 我想根据患者的遗传特征计算其相似度;我可以使用欧式距离,但是马哈拉诺比斯似乎更合适,因为它考虑了变量之间的相关性。问题(如在此说明的交)是Mahalanobis距离,特别是协方差矩阵,不工作时n &lt; pñ&lt;pn < p。当我在R中运行马氏距离时,得到的错误是: Error in solve.default(cov, ...) : system is computationally singular: reciprocal condition number = 2.81408e-21 到目前为止,为了解决这个问题,我使用了PCA,而不是使用基因,而是使用了成分,这似乎使我能够计算出马氏距离。5个分量代表方差的80%,所以现在Ñ &gt; pñ&gt;pn > p。 我的问题是:我可以使用PCA有意义地获取患者之间的马氏距离,还是不合适?是否有替代距离指标在以下情况下起作用n &lt; pñ&lt;pn < p 并且之间也有很大的相关性 ññn 变量?

3
如何创建同时集成了协作过滤和内容功能的推荐系统?
我正在创建一个推荐系统,并希望合并“相似”用户的等级和商品功能。输出是预测的等级[0-1]。我正在考虑使用神经网络(首先)。 因此,输入是项目特征和每个用户的评分的组合。对于项目A和用户1,可以在组合数据A1上训练系统。这将是一个培训示例。 如果用户1也对电影B评分,该怎么办?那么,数据B1也会成为训练示例吗?以这种方式用用户1的特征重复训练是否有问题? 您对解决问题的更好方法有何建议?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.