统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
是否有等效的ARMA用于等级关联?
我正在查看ARMA / ARIMA模型无法很好运行的极非线性数据。虽然,我看到了一些自相关,但我怀疑非线性自相关会有更好的结果。 1 /是否有与PACF相等的等级相关性?(在R中?) 2 /是否存在等效的ARMA模型用于非线性/秩相关(在R?中)


4
线性回归系数估计的解析解
我试图理解矩阵符号,并使用向量和矩阵。 现在,我想了解如何计算多元回归中的系数估计向量。β^β^\hat{\beta} 基本方程似乎是 ddβ(y−Xβ)′(y−Xβ)=0.ddβ(y−Xβ)′(y−Xβ)=0. \frac{d}{d\boldsymbol{\beta}} (\boldsymbol{y}-\boldsymbol{X\beta})'(\boldsymbol{y}-\boldsymbol{X\beta}) = 0 \>. 现在如何在这里求解向量ββ\beta? 编辑:等等,我被卡住了。我现在在这里,不知道如何继续: ddβ⎛⎝⎜(y1y2⋮yn)−⎛⎝⎜11⋮1x11x21xn1x12x22xn2………x1px2p⋮xnp⎞⎠⎟⎛⎝⎜β0β1⋮βp⎞⎠⎟⎞⎠⎟′⎛⎝⎜(y1y2⋮yn)−⎛⎝⎜11⋮1x11x21xn1x12x22xn2………x1px2p⋮xnp⎞⎠⎟⎛⎝⎜β0β1⋮βp⎞⎠⎟⎞⎠⎟ddβ((y1y2⋮yn)−(1x11x12…x1p1x21x22…x2p⋮⋮1xn1xn2…xnp)(β0β1⋮βp))′((y1y2⋮yn)−(1x11x12…x1p1x21x22…x2p⋮⋮1xn1xn2…xnp)(β0β1⋮βp)) \frac{d}{d{\beta}} \left( \left(\begin{smallmatrix} y_1 \\ y_2 \\ \vdots \\ y_n \end{smallmatrix}\right) - \left(\begin{smallmatrix} 1 & x_{11} & x_{12} & \dots & x_{1p} \\ 1 & x_{21} & x_{22} & \dots & x_{2p} \\ \vdots & & & & …


1
如何为频率差异很大的点过程构造四边形?
我想对几个点过程(或一个标记点​​过程)执行平方计数分析,然后应用一些降维技术。 这些标记分布不均,即某些标记经常出现,而有些则很少。因此,我不能简单地将2D空间划分为规则的网格,因为频率较高的标记将“淹没”频率较低的标记,从而掩盖了它们的外观。 因此,我尝试构建网格,以使每个像元中最多包含N个点(为此,我将每个像元简单地递归地划分为四个较小(大小相同)的像元,直到每个像元中不超过N个点为止。它)。 您如何看待这种“规范化”技术?有没有做这种事情的标准方法?

1
这种引导程序有名称吗?
考虑一个有多个人类参与者的实验,每个参与者在两种条件下进行了多次测量。可以将混合效果模型表示为(使用lme4语法): fit = lmer( formula = measure ~ (1|participant) + condition ) 现在,假设我要为该模型的预测生成自举置信区间。我想我已经想出了一种简单且计算效率高的方法,并且我确定我不是第一个想到这种方法的人,但是我很难找到任何以前的出版物来描述这种方法。这里是: 拟合模型(如上所述),将其称为“原始模型” 从原始模型中获得预测,将其称为“原始预测” 从与每个参与者的每个响应相关联的原始模型中获取残差 对残差重新采样,对参与者进行替换采样 将具有高斯误差的线性混合效应模型拟合到残差,将其称为“过渡模型” 根据每个条件计算临时模型的预测(这些预测将非常接近零),将其称为“临时预测” 将临时预测添加到原始预测中,将结果称为“重采样预测” 重复多次执行步骤4到7,为每个条件生成一次重采样预测分布,从中可以一次计算CI。 我已经在简单回归(即非混合模型)的背景下看到了“残差自举”程序,其中残差被采样为重采样的单位,然后将其添加到原始模型的预测中,然后在每次迭代的新模型上拟合一个新模型。引导程序,但这似乎与我描述的方法不同,我从未描述过残差永远不会被重新采样,人们只是在在原始模型预测起作用的情况下获得临时模型。最后一个功能有一个非常不错的附带好处,即不管原始模型的复杂性如何,过渡模型都可以始终拟合为高斯线性混合模型,在某些情况下可以更快地进行拟合。例如,我最近有二项式数据和3个预测变量,我怀疑其中之一会引起强烈的非线性影响,因此我不得不使用二项式链接函数来使用广义加性混合建模。在这种情况下,拟合原始模型花费了一个多小时,而在每次迭代中拟合高斯LMM仅需几秒钟。 如果它已经是一个已知的过程,我真的不想在此声明优先权,因此,如果任何人都可以提供有关以前可能在何处描述的信息,我将不胜感激。(此外,如果此方法有任何明显的问题,请告诉我!)

3
在执行Wilcoxon测试之前抖动是错误的吗?
我写了一个脚本,使用来测试数据wilcox.test,但是当我得到结果时,所有p值都等于1。我在一些网站上读到,在测试数据之前,您可能会使用抖动(以避免像他们所说的那样束缚),我做到了,现在我得到了可以接受的结果。这样做是错误的吗? test<- function(column,datacol){ library(ggplot2) t=read.table("data.txt", stringsAsFactors=FALSE) uni=unique(c(t$V9)) for (xp in uni) { for(yp in uni) { testx <- subset(t, V9==xp) testy <- subset(t, V9==yp) zz <- wilcox.test(testx[[datacol]],jitter(testy[[datacol]])) p.value <- zz$p.value } } } 这是输出 dput(head(t)) structure(list(V1 = c(0.268912, 0.314681, 0.347078, 0.286945, 0.39562, 0.282182), V2 = c(0.158921, 0.210526, 0.262024, 0.322006, 0.133417, …
9 r  nonparametric  ties 

3
Spearman或Pearson与李克特量表的相关性,可能会违反线性和均方差
我想在使用李克特量表的许多测量结果上进行相关性分析。从散点图来看,似乎已经违反了线性和均方差性的假设。 鉴于似乎有一些关于序数级别分级近似间隔级别缩放的争论,我应该安全地使用Spearman的Rho而不是Pearson的r? 如果我与Spearman的Rho一起使用,是否有可以引用的参考文献?

1
离散函数:置信区间覆盖范围?
如何计算离散间隔覆盖率? 我知道该怎么做: 如果我有一个连续模型,则可以为每个预测值定义一个95%的置信区间,然后查看实际值在该置信区间内的频率。我可能会发现,只有88%的时间我的95%置信区间覆盖了实际值。 我不知道该怎么办: 我如何针对离散模型(例如泊松或伽马泊松)执行此操作?我对此模型的了解如下,进行一次观察(我计划生成的100,000多个样本中:) 观察值#:(任意) 预测值:1.5 0的预测概率:.223 的预测概率为1:.335 2的预测概率:.251 3:3的预测概率 4的预测概率:.048 5的预测概率:.014 [且5或更大是.019] ...(等等) 预测的100的概率(或某个其他不现实的数字):. 000 实际值(例如“ 4”的整数) 请注意,尽管我在上面给出了泊松值,但在实际模型中,预测值1.5可能在各个观测值之间具有0.1,... 100的不同预测概率。 我对值的离散性感到困惑。“ 5”显然超出了95%的区间,因为在5以上,只有.019,小于.025。但是会有很多4-单独存在于其中,但是我如何共同评估4的数量呢? 我为什么在乎? 我正在查看的模型在总体水平上是准确的,但给出的个人预测却不佳。我想看看不良的个人预测比模型所预测的固有的宽置信区间差多少。我希望经验覆盖范围会更糟(例如,我可能会发现88%的值都在95%的置信区间内),但我希望只会稍微差一点。

4
统计员进行数值优化的参考
我正在寻找针对统计学家的数值优化技术的可靠参考,也就是将这些方法应用于某些标准推论性问题(例如,通用模型中的MAP / MLE)。诸如梯度下降(直线和随机),EM及其衍生/概括,模拟退火等。 我希望它会有一些有关实现的实用说明(因此常常缺少论文)。它不必完全明确,但至少应提供可靠的书目。 一些粗略的搜索出现了几篇文章:Ken Lange的《统计学家的数值分析》和John Monahan的《统计学的数值方法》。每个人的评论似乎是混杂的(稀疏的)。在这两个书中,对目录的细读表明兰格的书的第二版与我所追求的最接近。

2
可以使用内核PCA进行功能选择吗?
是否可以以与使用PCA相同的方式将内核主成分分析(kPCA)用于潜在语义索引(LSI)? 我使用prcompPCA功能在R中执行LSI,并从第一个中提取负载最大的功能ķkk组件。这样,我就可以最好地描述组件的功能。 我试图使用该kpca功能(从kernlib包装中获取),但看不到如何访问要素的权重。使用内核方法时,总体上可能吗?

2
如何找到不同类型事件之间的关系(由事件的2D位置定义)?
我有同一时间段内发生的事件的数据集。每个事件都有一个类型(很少有不同类型,少于十个)和一个位置,以2D点表示。 我想检查事件类型之间或类型与位置之间是否存在任何关联。例如,也许类型A的事件通常不会发生,而类型B的事件却不会发生。也许在某些地区,大多数是C型事件。 我可以使用哪种工具来执行此操作?作为统计分析的新手,我的第一个想法是在此数据集上使用某种PCA(主成分分析),以查看每种类型的事件是否具有自己的成分,或者某些事件是否共享相同的成分(即相关的成分)? 我不得不提到,我的数据集约为500'000点,因此使处理起来有些困难。(x ,y,吨ÿp ë )(x,y,type)(x, y, type) 编辑:如下面的答案和评论中所述,方法是将此模型建模为标记点过程,然后使用R来完成所有繁重的工作,如本研讨会报告中的详细说明:http:// /www.csiro.edu.au/resources/Spatial-Point-Patterns-in-R.html

4
什么是标准误差?
我正在使用找到的教程,并绘制平均值和标准误差以显示数据。但是我在讨论结果时遇到了问题。我的图如下所示:一些标准误差(显示为误差线)变化很大,其中一些非常接近零。

3
使用中值抛光进行特征选择
在最近阅读的一篇论文中,我在他们的数据分析部分遇到了以下内容: 然后将数据表拆分为组织和细胞系,然后将两个子表分别进行中值抛光(将行和列进行迭代调整以使中值0),然后再重新合并为单个表。然后,我们最终选择了至少三个测试样本中其表达与该样本集的中值相差至少4倍的基因子集 我不得不说我并不完全遵循这里的推理。我想知道您是否可以帮助我回答以下两个问题: 为什么在数据集中调整中位数期望/有帮助?为什么要对不同类型的样品分别进行处理? 如何不修改实验数据?这是从大量数据中选择许多基因/变量的已知方法吗?还是比较随意? 谢谢,

6
一天中事物图表的好通用名称是什么?
我们正在创建一个图表,显示给定时间段内每天的流量。因此,y轴是流量,x轴是午夜,凌晨1点,凌晨2点等。也可能是一周中的几天。这种图表的通用名称是什么?我想出了“周期图”。这是标准吗?有一个吗? 更新: 为了更加清楚起见,顶部图表中显示的不是一天,而是许多天的汇总。例如,在过去的一个月中,上午6点平均比中午低。同样,在去年的底部图表中,周六的流量有所下降。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.