统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
R中的Fisher检验
假设我们有以下数据集: Men Women Dieting 10 30 Non-dieting 5 60 如果我在R中运行Fisher精确测试,那么alternative = greater(或更少)意味着什么?例如: mat = matrix(c(10,5,30,60), 2,2) fisher.test(mat, alternative="greater") 我得到的p-value = 0.01588和odds ratio = 3.943534。另外,当我像这样翻转列联表的行时: mat = matrix(c(5,10,60,30), 2, 2) fisher.test(mat, alternative="greater") 然后我得到p-value = 0.9967和odds ratio = 0.2535796。但是,当我在没有备用参数(即fisher.test(mat))的情况下运行两个列联表时,我得到了p-value = 0.02063。 你能告诉我原因吗? 此外,在上述情况下,原假设和替代假设是什么? 我可以在像这样的列联表上运行fisher测试: mat = matrix(c(5000,10000,69999,39999), 2, 2) PS:我不是统计学家。我正在尝试学习统计信息,以便您的帮助(用简单的英语回答)将受到高度赞赏。

2
分组数据上的随机森林
我在具有层次结构的高维分组数据(50个数字输入变量)上使用随机森林。在70个不同对象的30个位置上进行了6次复制,收集了数据,从而产生了12600个数据点,这些数据点不是独立的。 似乎随机森林正在过度拟合数据,因为oob误差远小于我们在训练期间将一个对象的数据遗漏掉然后用训练后的随机森林预测遗漏对象的结果时得到的误差。此外,我已经关联了残差。 我认为过度拟合是由于随机森林期望独立数据而引起的。是否可以告诉随机森林有关数据的层次结构?还是有另一种强大的集成或收缩方法可以处理具有强大交互结构的高维分组数据? 有什么提示我可以做得更好吗?

3
如何计算两个斜率之差?
有没有一种方法可以了解两条线(或多或少)是否平行?我有两条线是从线性回归生成的,我想了解它们是否平行。换句话说,我想得到这两条线的斜率的不同。 是否有R函数来计算? 编辑: ...,以及如何获得线性回归线的斜率(以度为单位)?


5
如何比较2个非平稳时间序列以确定相关性?
我有两个数据系列,绘制了随时间推移的死亡中位数。这两个系列都显示出随着时间的推移死亡年龄会增加,但比另一个低得多。我想确定较低样本的死亡年龄增加是否与较高样本的死亡年龄明显不同。 以下是按年份(从1972年到2009年,包括1972年)排序的数据,四舍五入到小数点后三位: Cohort A 70.257 70.424 70.650 70.938 71.207 71.263 71.467 71.763 71.982 72.270 72.617 72.798 72.964 73.397 73.518 73.606 73.905 74.343 74.330 74.565 74.558 74.813 74.773 75.178 75.406 75.708 75.900 76.152 76.312 76.558 76.796 77.057 77.125 77.328 77.431 77.656 77.884 77.983 Cohort B 5.139 8.261 6.094 12.353 11.974 11.364 …

1
使用时变协变量测试纵向混合模型中的同时和滞后效应
最近有人告诉我,如果不为这些协变量引入时滞,就不可能将时变协变量纳入纵向混合模型。您可以确认/否认吗?您对此情况有参考吗? 我提出一个简单的情况来澄清。假设我已经对40个受试者重复测量(说过30次)定量变量(y,x1,x2,x3)。通过问卷在每个受试者中对每个变量进行30次测量。在这里,最终数据将是嵌套在40个主题中的4 800个观察值(4个变量X 30场合X 40个主题)。 我想单独测试(不用于模型比较): 同时(同步)效果:时间t的x1,x2和x3对时间t的y的影响。 滞后效应:在时间t-1时x1,x2和x3对y的影响。 我希望一切都清楚(我不是说英语的人!)。 例如,在R lmer {lme4}中,具有滞后效应的公式为: lmer(y ~ lag1.x1 + lag1.x2 + lag1.x3 + (1|subject)) 其中y,在时间t处的因变量lag1.x1是,在各个级别上的滞后自变量x1,等等。 对于同时效果,公式为: lmer(y ~ x1 + x2 + x3 + (1|subject)) 一切运行良好,它给了我有趣的结果。但是,指定具有同步时变协变量的lmer模型是否正确,还是我错过了一些事情? 编辑: 此外,是否有可能同时测试同时和滞后效应?, 例如 : lmer(y ~ x1 + x2 + x3 + lag1.x1 + lag1.x2 + lag1.x3 …

4
按时间顺序解释什么?
到目前为止,到目前为止主要处理横截面数据,最近才进行浏览,扫描了大量的时间序列入门文献,我不知道解释变量在时间序列分析中将扮演什么角色。 我想解释一个趋势而不是趋势。作为引言,我所读的大部分内容都假定该系列文章源于某种随机过程。我了解了AR(p)和MA流程以及ARIMA建模。除了自动回归过程之外,我还想处理更多信息,所以我找到了VAR / VECM并运行了一些示例,但我仍然想知道是否存在某些案例与横截面上的解释更接近。 其背后的动机是我的系列分解表明趋势是主要的贡献者,而余数和季节性影响几乎没有作用。我想解释一下这种趋势。 我可以/应该将我的系列回归多个不同的系列吗?凭直觉,由于串行相关性,我会使用gls(我不太确定cor结构)。我听说过虚假回归,并且知道这是一个陷阱,但是我正在寻找一种解释趋势的方法。 这是完全错误还是不常见?还是我到目前为止错过了正确的章节?

6
如何减少序列中的数据点数量?
我已经十多年没有研究统计学(然后只是基础课程),所以也许我的问题有点难以理解。 无论如何,我想做的是减少一系列数据点的数量。x轴是自测量开始以来的毫秒数,y轴是该点的读数。 通常有数千个数据点,但我可能只需要几百个。所以我的问题是:如何准确减少数据点的数量? 这个过程叫什么?(所以我可以用谷歌搜索它)是否有任何首选的算法(我将在C#中实现它) 希望你有一些线索。对不起,我缺少适当的术语。 编辑:更多详细信息在这里: 我得到的原始数据是心率数据,并以自上次搏动以来的毫秒数形式显示。在绘制数据之前,我先计算第一个样本的毫秒数,以及每个数据点的bpm(每分钟心跳数)(60000 / timesincelastbeat)。 我想可视化数据,即将其绘制在折线图中。我想将图中的点数从数千减少到数百。 一种选择是计算系列中每秒的平均bpm,或者也许每5秒左右一次。如果我知道每个周期(5秒间隔的秒)至少要有一个样本,那将是非常容易的。

1
如何自动将U-Matrix聚类?
训练完自组织图后,可以计算U-Matrix。有一些工具可以手动对其进行可视化并识别集群,但是我想知道是否有任何算法可以自动执行此过程(即,无需人工观察图形即可识别集群)。 有什么办法吗?我正在用R编写代码。在Internet上找不到任何类似的东西,因此也许有人可以在这里为我提供帮助。



1
标准正态随机变量的PDF和CDF函数的凸性
请提供证明是凸。这里,和分别是标准的普通PDF和CDF。 ∀X>0φΦQ(x)=x2+xϕ(x)Φ(x)Q(x)=x2+xϕ(x)Φ(x)Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)}∀ X > 0∀X>0\forall x>0 ϕϕ\phiΦΦ\mathbf{\Phi} 尝试的步骤 1)计算方法 我已经尝试了演算方法,并为第二个导数提供了一个公式,但是无法证明它是正。如果您需要更多详细信息,请告诉我。∀ X > 0∀X>0\forall x > 0 最后, ∂Q(X)让 Q(x)=x2+ xϕ(x)Φ (x )Let Q(x)=x2+Xϕ(X)Φ(X)\begin{eqnarray*} \text{Let }Q\left(x\right)=x^{2}+x\frac{\phi\left(x\right)}{\Phi\left(x\right)} \end{eqnarray*} ∂ Q (X )∂Q(x)∂X=2 x + x [ -xϕ(x)Φ(x)− {ϕ(x)Φ(x)}2] +ϕ(x)Φ (x )∂Q(x)∂X=2X+X[-Xϕ(X)Φ(X)-{ϕ(X)Φ(X)}2]+ϕ(X)Φ(X)\begin{eqnarray*} \frac{\partial Q\left(x\right)}{\partial x} & = & 2x+x\left[-\frac{x\phi\left(x\right)}{\Phi\left(x\right)}-\left\{ \frac{\phi\left(x\right)}{\Phi\left(x\right)}\right\} ^{2}\right]+\frac{\phi\left(x\right)}{\Phi\left(x\right)} \end{eqnarray*} ∂ …


1
使用R预测包中的TBATS解释时间序列分解
我想将以下时间序列数据分解为季节性,趋势和残差组分网。数据是来自商业建筑的每小时冷却能源概况: TotalCoolingForDecompose.ts <- ts(TotalCoolingForDecompose, start=c(2012,3,18), freq=8765.81) plot(TotalCoolingForDecompose.ts) 因此,基于以下建议,每天和每周都有明显的季节性影响:如何分解具有多个季节性成分的时间序列?,我使用tbats了forecast软件包中的函数: TotalCooling.tbats <- tbats(TotalCoolingForDecompose.ts, seasonal.periods=c(24,168), use.trend=TRUE, use.parallel=TRUE) plot(TotalCooling.tbats) 结果是: 此模型的level和slope组件描述什么?如何获得trend与remainder该软件包所引用的论文相似的,和组件(De Livera,Hyndman和Snyder(JASA,2011年))?

1
指数和伽马之间的分布的名称?
密度F(š )α 小号s + αË− 秒,s > 0f(s)∝ss+αe−s,s>0f(s)\propto \frac{s}{s+\alpha}e^{-s},\quad s > 0,其中α ≥ 0α≥0\alpha \ge 0是一个参数,生命指数(之间α = 0α=0\alpha=0)和Γ (2 ,1 )Γ(2,1)\Gamma(2,1)(α → ∞α→∞\alpha \to \infty)分布。只是好奇这是否恰好是更广泛的发行系列的一个例子?我不这样认为。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.