统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
混合模型的交叉验证?
我和我的同事正在R中拟合一系列线性和非线性混合效应模型。我们被要求对拟合的模型进行交叉验证,以便人们可以验证观察到的效应是相对可推广的。这通常是一项琐碎的任务,但是在我们的案例中,我们必须将整个数据分为一个培训部分和一个测试部分(出于CV目的),它们没有共同的水平。例如, 训练数据可以基于组1,2,3,4;然后,对拟合的模型在组5上进行交叉验证。 因此,由于在训练数据上估计的基于组的随机效应不适用于测试数据,因此会产生问题。因此,我们无法对模型进行简历。 有没有相对简单的解决方案?还是有人编写了解决该问题的软件包?任何提示都欢迎! 谢谢!

3
GPS跟踪中的估计问题
问题:考虑两辆汽车(被称为点对象),分别命名为“领导者和“跟随者,它们都配备有相互通信的GPS设备。的目的是随着在平面上任意移动而尽可能接近假定所有GPS设备都具有规定的均值和规定的协方差矩阵的误差的圆形误差概率(CEP)分布。大号LLFFFFFF大号LLμ = (μX,μÿ)μ=(μx,μy)\mu = (\mu_x,\mu_y)Σ2 × 2Σ2×2\Sigma_{2\times 2} 假设遍历平面中的(分段平滑)曲线,则遍历的期望曲线是什么?此外,路径的分布是什么?LLLCCCFFFFFF 在一段时间内估算的最佳方法是什么?FFFLLL 背景:这是我在实验工作中遇到的实际问题,绝不是家庭作业。我知道诸如卡尔曼滤波之类的工具可以在面对白噪声时实现最佳状态估计,但不确定如何将其扩展到这种情况。我也想知道有关的研究文献。

4
缩放不同数量级的数据以进行绘图
查看以下数据集: Date Visits Carts carts Orders Created converted Created 2011-11-11 12277 161 9 36 2011-11-12 11871 93 5 19 2011-11-13 13072 107 8 8 2011-11-14 13594 112 4 34 2011-11-15 12741 129 8 43 2011-11-16 15491 261 16 57 2011-11-17 13418 186 17 42 我被要求将其绘制在图形上,因为Date具有X轴,其余数据位于Y轴上。问题在于数据规模大不相同。造访数以千计,创建的订单数以低数计,数据在图表上的绘制效果不佳。 我想知道统计学家在这种情况下会做什么,我可以将“访问次数”除以1000,然后放入描述中(访问数(K)),但是随后我对创建的购物车也遇到了同样的问题,因为数以百计,其他一切都在低数。 在这种情况下做什么工作?

2
最先进的方法来查找时间序列的零均值部分
我有嘈杂的时间序列,我需要将其细分为平均值为零的那些部分和平均值为零的那些部分。尽可能准确地找到边界很重要(显然边界的确切位置有点主观)。我认为可以修改cusum变体来实现此目的,但是因为cusum主要是要找到单个更改,从而使整个细分策略完全无法解决。 我敢肯定,已经对此问题进行了很多研究,但未能找到它。 PS这些时间序列中的数据量非常大,即多达数亿个样本,单个样本可以是具有数百个分量的向量,因此可以合理快速计算的方法是一个重要因素。 PPS没有细分标签,因此没有分类标签。

2
将范围数据视为连续数据时的最佳做法
我正在查看丰度是否与大小有关。大小(当然)是连续的,但是,以这样的规模记录了丰度: A = 0-10 B = 11-25 C = 26-50 D = 51-100 E = 101-250 F = 251-500 G = 501-1000 H = 1001-2500 I = 2501-5000 J = 5001-10,000 etc... A至Q ... 17级。我在想一种可能的方法是给每个字母分配一个数字:最小,最大或中位数(即A = 5,B = 18,C = 38,D = 75.5 ...)。 潜在的陷阱是什么?因此,将这些数据视为分类会更好吗? 我已经阅读了这个问题,提供了一些想法-但此数据集的关键之一是类别不均匀-因此将其视为类别将假定A和B之间的差异与A之间的差异相同B和C ...(可以通过使用对数进行纠正-感谢Anonymouse) 最终,在考虑其他环境因素之后,我想看看是否可以将大小用作丰度的预测指标。预测也将在一个范围内:给定大小X以及因子A,B和C,我们预测丰度Y会介于最小和最大之间(我想这可能跨越一个或多个尺度点:大于最小D而小于最大F ...虽然越精确越好)。

1
PACF手动计算
我正在尝试复制SAS和SPSS对部分自相关函数(PACF)的计算。在SAS中,它是通过Proc Arima生产的。PACF值是感兴趣序列在该序列的滞后值上的自回归系数。我感兴趣的变量是sales,所以我计算lag1,lag2 ... lag12并运行以下OLS回归: Yt=a0+a1Yt−1+a2Yt−2+a3Yt−3+…+a12Yt −12。Yt=a0+一个1个ÿŤ-1个+一个2ÿŤ-2+一个3ÿŤ-3+…+一个12ÿŤ-12。Y_t=a_0+a_1Y_{t-1}+a_2Y_{t-2}+a_3Y_{t-3}+\ldots+a_{12}Y_{t-12}. 不幸的是,我得到的系数甚至不接近SAS或SPSS提供的PACF(滞后1至12)。有什么建议么?有什么不对?我想到的是,此模型的最小二乘估计可能不合适,也许应该使用另一种估计技术。 提前致谢。

1
计算具有可变等级数的R中的等级间可靠性?
Wikipedia建议,查看评估者之间可靠性的一种方法是使用随机效应模型来计算类内相关性。类内相关的例子讨论了看 σ2ασ2α+σ2ϵσα2σα2+σϵ2\frac{\sigma_\alpha^2}{\sigma_\alpha^2+\sigma_\epsilon^2} 从模型 Yij=μ+αi+ϵijYij=μ+αi+ϵijY_{ij} = \mu + \alpha_i + \epsilon_{ij} “其中Y ij是第 i 组的第 j 个观测值,μ是未观察到的总体均值,αi是组i中所有值共享的未观察到的随机效应,而εij是未观察到的噪声项。” 这是一个有吸引力的模型,尤其是因为在我的数据中,没有任何评分者对所有事物进行了评分(尽管大多数人的评分为20+),并且事物的评分次数是可变的(通常为3-4)。 问题#0:在该示例中,“组i”(“组i”)是否是一组被评级的事物? 问题#1:如果我正在寻找评估者之间的可靠性,我是否不需要一个包含两个术语的随机效应模型,一个用于评估者,一个用于评估的事物?毕竟,两者都有可能发生变化。 问题2:如何最好地用R表达此模型? 这个问题似乎有一个不错的建议: lmer(measurement ~ 1 + (1 | subject) + (1 | site), mydata) 我看了几个 问题,而lme的“ random”参数的语法对我来说是不透明的。我阅读了lme的帮助页面,但是没有示例,我对“随机”的描述是难以理解的。 这个问题有点类似于一个长 名单的问题,与此最接近的一次。但是,大多数都没有详细介绍R。

4
查找概率密度区间
我有载体 x <- c(1,2,3,4,5,5,5,6,6,6,6, 7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7,7, 7,7,7,7,7,7,7,7,8,8,8,8,9,9,9,10) (我的实际向量的长度大于10,000),我想找到90%的密度所在的区间。是quantile(x, probs=c(0.05,0.95), type=5)最合适的还是还有其他方法?
9 r 

2
当前对哪些数据和统计技能有很高的需求,而在哪里又有何需求?
这篇文章与一个快速变化的事件有关。 我有一份从事财务数据分析的工作。我目前的工作是使我对其他行业或其他行业中发生的事情没有太多了解。我对贝叶斯统计资料了解很多。 我想让自己保持适销对路,所以我很好奇目前对哪些数据和统计技能有很高的需求,以及在哪里。软件世界充斥着数据,因此我希望他们真的非常需要统计学家,但我的印象是对它们的需求不高。 我的一个朋友建议,软件行业本质上需要“大数据”技能,而不是统计技能。 当前对哪些数据和统计技能有很高的需求,而在哪里又有何需求?
9 careers 



1
R中ACF图中的虚线
我正在阅读Cowpertwait和Metcalfe的《 R入门时间序列》这本书。在第36页上,其行位于:−1/n±2/n−−√−1/n±2/n-1/n \pm 2/\sqrt{n}。我在这里阅读过R论坛,其行位于。 ±1.96/n−−√±1.96/n\pm 1.96/\sqrt{n} 我运行了以下代码: b = c(3,1,4,1) acf(b) 并且我发现这些行看起来好像是。那么,显然这本书是错的吗?还是我误读了所写的内容?作者在谈论的内容略有不同吗?±1.96/4–√±1.96/4\pm 1.96/\sqrt{4} *请注意,我对1.96对2的次要细节差异不感兴趣。我假设这只是作者使用2 sd与实际1.96 sd的经验法则。 编辑:我运行了此模拟: acf1 = 0 acf2 = 0 acf3 = 0 for(i in 1:5000){ resids= runif(1000) residsacf = c(acf(resids,plot= FALSE)) acf1[i] = residsacf$acf[2,,1] acf2[i] = residsacf$acf[3,,1] acf3[i] = residsacf$acf[4,,1] } meanacf1 = mean(acf1) meanacf2 = …
9 r  time-series 

1
如何计算以获得均匀分布的阶次统计?
我正在尝试为自己的论文解决一个问题,但是我不知道该怎么做。我从均匀分布中随机抽取4个观察值。我想计算的概率。 是第i个顺序统计量(我采用该顺序统计量,以便我的观察结果从最小到最大排列)。我已经为一个简单的案例解决了它,但是在这里我迷失了如何去做。(0,1)(0,1)(0,1)3X(1)≥X(2)+X(3)3X(1)≥X(2)+X(3)3 X_{(1)}\ge X_{(2)}+X_{(3)}X(i)X(i)X_{(i)} 欢迎所有帮助。

2
评估细胞信号数据时间序列中的峰值
我正在测量细胞信号测量中是否存在响应。我要做的是首先对数据的时间序列应用平滑算法(Hanning),然后检测峰值。我得到的是: 如果我想使响应的检测比“是的,您看到连续下降的趋势有所提高”更加客观,那么最好的方法是什么?通过线性回归确定峰与基线之间的距离吗? (我是python编码人员,几乎不了解统计信息) 谢谢


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.