统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
隐马尔可夫模型用于事件预测
问题:在隐式马尔可夫模型的合理实现下进行设置吗? 我有一组108,000观察数据(在100天的时间内进行),并且2000在整个观察时间范围内大约都有事件发生。数据如下图所示,其中观察到的变量可以采用3个离散值,红色列突出显示事件时间,即:[ 1 , 2 ,3 ][1个,2,3][1,2,3]ŤËŤËt_E 如图中红色矩形所示,我对每个事件都剖析了{到 },将它们有效地视为“事件前窗口”。ŤËŤËt_EŤË− 5ŤË-5t_{E-5} HMM训练:我计划使用Pg上建议的多观察序列方法,基于所有“事前窗口” 训练隐马尔可夫模型(HMM)。Rabiner 论文 273 。希望这将使我能够训练HMM,以捕获导致事件的序列模式。 HMM预测:然后,我计划使用此HMM 预测 新一天的对,其中将是一个滑动窗口矢量,实时更新以包含当前时间至随着时间的推移。升Ò 克[ P(O b s e r v a t i o n s | H中号中号)]升ØG[P(ØbsË[Rv一个Ť一世Øñs|H中号中号)]log[P(Observations|HMM)]Øb 小号Ë - [R v 一个吨我ö Ñ 小号ØbsË[Rv一个Ť一世ØñsObservationsŤŤtŤ - 5Ť-5t-5 对于与“事前窗口”类似的,我希望看到增加。实际上,这应该使我能够在事件发生之前进行预测。升Ò 克[ P(O b s e r v …

3
了解贝叶斯预测分布
我正在参加贝叶斯入门课程,但在理解预测分布方面有些困难。我了解它们为什么有用,并且我对定义很熟悉,但是有些事情我不太了解。 1)如何获得新观测向量的正确预测分布 假设我们已经为数据和先前的建立了一个采样模型。假设观测值在给定条件下是独立的。p(yi|θ)p(yi|θ)p(y_i | \theta)p(θ)p(θ)p(\theta)yiyiy_iθθ\theta 我们已经观察到一些数据,并且将先前的更新为后验。D={y1,y2,...,yk}D={y1,y2,...,yk}\mathcal{D} = \{y_1, y_2, \, ... \, , y_k\}p(θ)p(θ)p(\theta)p(θ|D)p(θ|D)p(\theta | \mathcal{D}) 如果我们想预测新观测值的向量,我认为我们应该尝试使用此公式获得后验预测 不等于 所以预测的观测值不是独立的,对不对?N={y~1,y~2,...,y~n}N={y~1,y~2,...,y~n}\mathcal{N} = \{\tilde{y}_1, \tilde{y}_2, \, ... \, , \tilde{y}_n\}p(N|D)=∫p(θ|D)p(N|θ)dθ=∫p(θ|D)∏i=1np(y~i|θ)dθ,p(N|D)=∫p(θ|D)p(N|θ)dθ=∫p(θ|D)∏i=1np(y~i|θ)dθ, p(\mathcal{N} | \mathcal{D}) = \int p(\theta | \mathcal{D}) p ( \mathcal{N} | \theta) \, \mathrm{d} \theta = \int p(\theta | \mathcal{D}) \prod_{i=1}^n p(\tilde{y}_i …


1
评估时间序列预测性能
我有一个在几个时间变量上训练过的动态朴素贝叶斯模型。模型的输出是P(Event) @ t+1每个的预测t。 P(Event)vs 的曲线time如下图所示。在此图中,黑线代表P(Event)我的模型所预测的;的水平红线表示事件发生的先验概率; 和垂直虚线表示在时间序列中的(5个)的事件发生。 理想情况下,我希望P(Event)在观察任何事件之前先看到预测的峰值,并且在没有事件发生的希望时保持接近零。 我希望能够报告模型(黑线)在预测事件发生方面的表现。与我的模型进行比较的一个明显的候选对象是事件的先验概率(红线),如果将其用作预测因子,则将为所有对象预测相同的概率值t。 实现这种比较的最佳形式方法是什么? PS:我目前正在按照以下代码使用(直观)评分,其中总体评分较低表明预测性能更好。我发现用这个评分实际上很难超越以前的评分: # Get prediction performance model_score = 0; prior_score=0; for t in range(len(timeSeries)): if(timeSeries[t]== event): # event has happened cur_model_score = 1- prob_prediction[t]; cur_prior_score = 1 - prior else: # no event cur_model_score = prob_prediction[t] - 0; cur_prior_score = prior - …

1
通用加性模型:R的输出中的ref.df是什么?
嗨,我在R的输出屏幕中难以理解Ref.df: Approximate significance of smooth terms: edf Ref.df F p-value s(meangrain) 1.779 2.209 3.193 0.0451 * s(depth) 2.108 2.697 3.538 0.0254 * 这是什么意思,有必要在论文中包括此术语以表示GAM的结果吗?它给我们提供预测所需的信息吗?

1
解释RandomForestRegressor的实际误差估计
我在数据上使用RandomForest回归器,可以看到oob得分为0.83。我不确定是怎么回事。我的意思是我的目标是10 ^ 7范围内的较高值。因此,如果是MSE,则应该更高。我不明白0.83在这里表示什么。 我正在使用sklearn工具包的python的RandomForestRegressor。 我做 模型= RandomForestRegressor(max_depth = 7,n_estimators = 100,oob_score = True,n_jobs = -1)model.fit(trainX,trainY) 然后我看到了model.oob_score_,得到的值像0.83809026152005295

1
使用主成分分析与对应分析
我正在分析有关潮间带群落的数据集。数据是四方类动物(海藻,藤壶,贻贝等)的覆盖百分比。我习惯于根据物种计数来考虑对应分析(CA),而将主成分分析(PCA)视为对线性环境(而非物种)趋势更有用的方法。我真的没有运气来确定PCA或CA是否更适合百分比覆盖率(找不到任何论文),而且我什至不确定如何将封顶为100%的内容分发出去? 我熟悉粗略的指导原则,即如果第一个去趋势对应分析(DCA)轴的长度大于2,则可以放心地假定应该使用CA。DCA轴1的长度为2.17,这对我没有帮助。

3
为什么贝叶斯定理以图形方式工作?
从数学的角度来看,贝叶斯定理对我来说是完全有意义的(即推导和证明),但是我不知道是否有一个很好的几何或图形论证可以用来解释贝叶斯定理。我尝试了Googling以获得答案,但令人惊讶的是我找不到任何东西。

1
对3个样本的比例相等性进行假设检验
我有一个带有两个列的手机客户信息数据集。第一列包含某个帐户所属的特定类别(A,B或C),第二列包含该帐户是否已取消的二进制值。例如 A | cancelled C | active B | active A | cancelled 我想要做的是提出某种假设检验,以测试活动账户与已取消账户的类型A,B和C的账户比率是否不同-零假设是它们相同。因此,这就像是对比例的假设检验,只是我不知道如何对3个值进行此操作


3
有关统计生态学的书籍?
我知道之前曾问过这个问题:生态学参考书,但这不是我想要的。 我在寻找的是是否有人可以推荐一本关于统计生态学的好书(或规范的参考书)?我对统计数据有很好的理解,因此该书确实可以适用于任何水平。我会用这本书来教自己更多关于统计学在生态学中的应用,而不是其他任何东西,因此,即使是一本带有良好/有趣示例的入门书,也将不胜感激。另外,我的研究倾向于针对贝叶斯统计,因此结合贝叶斯统计的书甚至更好!

2
计算预测间隔
我在这里有以下数据。我正在尝试计算烃百分比为1.0时平均纯度的95%置信区间。在R中,输入以下内容。 > predict(purity.lm, newdata=list(hydro=1.0), interval="confidence", level=.95) fit lwr upr 1 89.66431 87.51017 91.81845 但是,如何自己得出这个结果?我试图使用以下方程式。 snew=s2(1+1N+(xnew−x¯)2∑(xi−x¯)2)−−−−−−−−−−−−−−−−−−−−−−√snew=s2(1+1N+(xnew−x¯)2∑(xi−x¯)2)s_{new}=\sqrt{s^2\left(1+\frac{1}{N}+\frac{(x_{new}-\bar x)^2}{\sum(x_i-\bar x)^2}\right)} 我在R中输入以下内容 > SSE_line = sum((purity - (77.863 + 11.801*hydro))^2) > MSE = SSE_line/18 > t.quantiles <- qt(c(.025, .975), 18) > prediction = B0 + B1*1 > SE_predict = sqrt(MSE)*sqrt(1+1/20+(mean(hydro)-1)^2/sum((hydro - mean(hydro))^2)) > prediction …

3
统计检验以查看关系是线性还是非线性
我有一个示例数据集,如下所示: Volume <- seq(1,20,0.1) var1 <- 100 x2 <- 1000000 x3 <- 30 x4 = sqrt(x2/pi) H = x3 - Volume r = (x4*H)/(H + Volume) Power = (var1*x2)/(100*(pi*Volume/3)*(x4*x4 + x4*r + r*r)) Power <- jitter(Power, factor = 1, amount = 0.1) plot(Volume,Power) 从图中可以看出,在“体积”和“功率”的特定范围之间,关系是线性的,然后,当“体积”变得相对小时,关系变为非线性。有统计检验可以说明这一点吗? 关于对《任择议定书》的答复中显示的一些建议: 此处显示的示例只是一个示例,尽管噪声较大,但我拥有的数据集看起来与此处看到的关系相似。到目前为止,我进行的分析表明,当我分析特定液体的体积时,当体积较小时,信号的功率会急剧增加。因此,可以说我只有一个音量在15到20之间的环境,几乎就像线性关系。但是,通过增加点的范围(即具有较小的体积),我们看到该关系完全不是线性的。我现在正在寻找有关如何统计显示这一点的统计建议。希望这是有道理的。

4
对连续因变量使用逻辑回归
我最近对研究论文进行了修订,以下是审稿人对我论文的评论: 从一个模型获得的结果并不令人信服,特别是线性回归通常在处理离群值方面存在缺陷。我建议作者还尝试进行逻辑回归,并将相应结果与当前结果进行比较。如果获得类似的观察结果,结果将更加可靠。 审稿人的评论正确吗?Logistic回归优于多元线性回归吗? 问题是我的因变量不是分类变量,而是比例变量。我现在能做什么?您建议使用什么其他回归方法评估模型? 得分是下表中的因变量。新近度,频率,任期和最后得分是独立变量。 我从一个站点中提取了这些变量,并假设这些自变量对得分有重大影响。因此,我代表以下模型: 顺便说一下,此线性模型的R平方值是0.316!审阅者也对此值发表了评论: 由于没有关于学习系数质量的指标,因此结果令人信服。小R ^ 2不能表示良好的性能,因为模型可能过拟合。 R平方的0.316非常低吗?在以前的论文中,我看到了很多类似的价值观。

1
小提琴情节解读
我正在使用小提琴图来比较不同组的分布,但是我发现的大多数在线资源都与如何制作图和结果的非常基本的解释有关(中位数变化,数据是否聚类)。 我正在寻找可以参考的详细示例,以正确解释小提琴图。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.