统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
二项式分布的估计量
我们如何定义来自二项分布的数据的估计量?对于bernoulli,我可以想到一个估计器来估计参数p,但是对于二项式,当我们对分布进行特征化时,我看不到要估计哪些参数? 更新: 估计量是指观测数据的函数。估计器用于估计生成数据的分布的参数。

4
预测二进制时间序列
我有一个二进制时间序列,当汽车不动时为1,当汽车不动时为0。我想对未来36小时以及每个小时的时间范围进行预测。 我的第一种方法是通过以下输入使用朴素贝叶斯:t-24(每日季节性),t-48(每周季节性),一天中的小时。但是,结果不是很好。 您为该问题推荐哪些文章或软件?


2
如何为使用汽车的重复测量方差分析指定特定的对比?
我正在尝试在R中运行重复测量Anova,然后对该数据集进行一些特定的对比。我认为正确的方法是 Anova()从汽车包装中使用。 让我们用?Anova使用 OBrienKaiser数据的示例来说明我的问题(注意:我省略了示例中的性别因素): 我们设计了一个在受试者因素,治疗之间(3个级别:对照,A,B)和两个重复的因素-测量(在受试者内)因素,阶段(3个级别:测试前,测试后,随访)和小时(5个级别:1至5)。 标准ANOVA表的给出方式为(与example(Anova)不同,我切换到Type 3 Squares of Squares,这是我的领域想要的): require(car) phase <- factor(rep(c("pretest", "posttest", "followup"), c(5, 5, 5)), levels=c("pretest", "posttest", "followup")) hour <- ordered(rep(1:5, 3)) idata <- data.frame(phase, hour) mod.ok <- lm(cbind(pre.1, pre.2, pre.3, pre.4, pre.5, post.1, post.2, post.3, post.4, post.5, fup.1, fup.2, fup.3, fup.4, fup.5) ~ treatment, data=OBrienKaiser) …

1
通过对相关观测值进行自举计算置信区间
如果观测值是iid,则标准形式的引导程序可用于计算估计统计量的置信区间。I.Visser 等。在“ 隐藏的马尔可夫模型参数的置信区间 ”中,使用了参数引导程序来计算HMM参数的CI。但是,当我们在观察序列上拟合HMM时,我们已经假设观察是相关的(与混合模型相反)。 我有两个问题: iid假设与引导程序有什么关系? 我们可以忽略参数引导程序中的iid要求吗? Visser 等。方法简述如下: 假设我们有一个观察序列是通过对HMM进行采样得到的,该HMM具有一组真实的但未知的参数。Y=o1,o2,...,onY=o1,o2,...,onY=o_1,o_2,...,o_nθ=θ1,θ2,...,θlθ=θ1,θ2,...,θl\theta=\theta_1,\theta_2,...,\theta_l 可以使用EM算法估算参数:θ^=θ^1,θ^2,...,θ^lθ^=θ^1,θ^2,...,θ^l\hat{\theta}=\hat{\theta}_1,\hat{\theta}_2,...,\hat{\theta}_l 使用估计的HMM生成大小为的引导程序样本:nnnY∗=o∗1,o∗2,...,o∗nY∗=o1∗,o2∗,...,on∗Y^*=o^*_1,o^*_2,...,o^*_n 根据引导程序样本估计HMM的参数:θ^∗=θ^∗1,θ^∗2,...,θ^∗lθ^∗=θ^1∗,θ^2∗,...,θ^l∗\hat{\theta}^*=\hat{\theta}^*_1,\hat{\theta}^*_2,...,\hat{\theta}^*_l 重复步骤3和4次(例如 = 1000),得出引导估计:乙乙θ *(1 ),θ *(2 ),。。。,θ *(乙)BBBBBBBBBθ^∗(1),θ^∗(2),...,θ^∗(B)θ^∗(1),θ^∗(2),...,θ^∗(B)\hat{\theta}^*(1),\hat{\theta}^*(2),...,\hat{\theta}^*(B) 使用引导程序估计中的分布来计算每个估计参数的CI 。 θ * 我θ^iθ^i\hat{\theta}_iθ^∗iθ^i∗\hat{\theta}^*_i 笔记(我的发现): 为了具有正确的覆盖范围,应该使用百分位数方法来计算CI(正态性是一个错误的假设)。 自举分布的偏差应得到纠正。意味着的分布均值应移至θ我θ^∗iθ^i∗\hat{\theta}^*_iθ^iθ^i\hat{\theta}_i

2
在R中的图形上绘制多个条形图[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4年前关闭。 我想在R中的单个图形上绘制四个条形图。我使用了以下代码。在这里,如何将图例保持在图表顶部,特别是图例应介于2到3个条形图之间。我也尝试过,par(mar=c(4.1,4.1,8.1,4.1)但没有成功。而且,我也尝试legend()在第二个barplot之后运行,但是没有用。图例适用于所有四个木槌。请帮助我。 par(mfrow=c(1,4)) barplot(t(A), beside=T, ylim=c(-100,100),..) barplot(t(B), beside=T, ylim=c(-100,100),..) barplot(t(C), beside=T, ylim=c(-100,100),..) barplot(t(D), beside=T, ylim=c(-100,100),..) legend(...)

1
定义加权样本的分位数
我有一个加权样本,我希望为其计算分位数。1个 理想情况下,在权重相等的情况下(无论是否等于1),结果将与scipy.stats.scoreatpercentile()和的结果一致quantile(...,type=7)。 一种简单的方法是使用给定的权重“乘以”样本。这样可以有效地在权重> 1的区域中提供局部“平坦”的ecdf,这在样本实际上是次采样时在直觉上似乎是错误的方法。特别是,这意味着权重均等于1的样本与权重均等于2或3的样本具有不同的分位数。(但是,请注意,[1]中引用的论文确实使用了这种方法。) http://en.wikipedia.org/wiki/Percentile#Weighted_percentile提供了加权百分比的另一种表示方式。在此公式中尚不清楚是否应首先合并具有相同值的相邻样本并对其权重求和,无论如何quantile(),在未加权/相等加权的情况下,其结果似乎与R的默认类型7不一致。关于分位数的维基百科页面根本没有提到加权情况。 R的“类型7”分位数函数有加权概括吗? [使用Python,但实际上只是在寻找一种算法,因此任何语言都可以使用] 中号 [1]权重是整数;权重是在http://infolab.stanford.edu/~manku/papers/98sigmod-quantiles.pdf中描述的在“折叠”和“输出”操作中组合的缓冲区的权重。本质上,加权样本是整个未加权样本的子采样,子样本中的每个元素x(i)代表整个样本中的weight(i)元素。


2
因子分析中的前因子最大化了什么?
在主成分分析中,前主成分是具有最大方差的正交方向。换句话说,选择第一主成分为最大方差的方向,选择第二主成分为与最大方差正交的方向,依此类推。ķķkkķkk 因子分析有类似的解释吗?例如,我认为前因子是最能解释原始相关矩阵的非对角分量的因子(例如,原始相关矩阵与由相关系数定义的相关矩阵之间的平方误差)因素)。这是真的吗(或者我们可以说类似的话)?ķkk

9
本书提供了统计方法的广泛而概念性的概述
我对统计分析在模拟/预测/功能估计等方面的潜力非常感兴趣。 但是,我对此并不太了解,我的数学知识仍然非常有限-我是软件工程专业的一名本科生。 我正在寻找一本可以让我开始不断学习的东西的书:线性回归和其他类型的回归,贝叶斯方法,蒙特卡洛方法,机器学习等。我也想开始使用R,所以如果有一本书将两者结合在一起,真是太棒了。 最好是,我希望这本书从概念上而不是过多的技术细节上进行解释-我希望统计数据对我来说非常直观,因为我知道统计数据存在很多风险。 我当然愿意阅读更多书籍,以增进对我认为有价值的主题的理解。


3
如果我认为结果是顺序的而不是绝对的,我将获得什么?
有多种预测序数和分类变量的方法。 我不明白的是这种区别的重要性。是否有一个简单的示例可以弄清楚如果我下订单会出什么问题?在什么情况下没关系?例如,如果自变量也都是分类/有序的,是否会有区别? 这个相关问题集中在自变量的类型上。在这里,我要问结果变量。 编辑: 我知道使用订单结构可以减少模型参数的数量,但是我仍然没有真正确信。 这是一个示例(摘自有序逻辑回归的介绍,据我所知,序数逻辑回归的性能并不比多项式逻辑回归好: library(nnet) library(MASS) gradapply <- read.csv(url("http://www.ats.ucla.edu/stat/r/dae/ologit.csv"), colClasses=c("factor", "factor", "factor", "numeric")) ordered_result <- function() { train_rows <- sample(nrow(gradapply), round(nrow(gradapply)*0.9)) train_data <- gradapply[train_rows,] test_data <- gradapply[setdiff(1:nrow(gradapply), train_rows),] m <- polr(apply~pared+gpa, data=train_data) pred <- predict(m, test_data) return(sum(pred==test_data$apply)) } multinomial_result <- function() { train_rows <- sample(nrow(gradapply), round(nrow(gradapply)*0.9)) train_data <- …

1
F检验的样本量公式?
我想知道是否有像Lehr公式这样的样本量公式适用于F检验?Lehr的t检验公式为,其中是效果大小(例如)。可以将其推广为,其中是一个常数,取决于类型I速率,所需功率以及是执行单面测试还是双面测试。 Δ Δ = (μ 1 - μ 2)/ σ Ñ = c ^ / Δ 2 çn=16/Δ2n=16/Δ2n = 16 / \Delta^2ΔΔ\Delta Δ=(μ1−μ2)/σΔ=(μ1−μ2)/σ\Delta = (\mu_1 - \mu_2) / \sigman=c/Δ2n=c/Δ2n = c / \Delta^2ccc 我正在寻找F检验的类似公式。在替代方案中,我的测试统计量分布为具有个自由度和非中心性参数的非中心F ,其中仅取决于总体参数,该参数未知但假定具有一定价值。参数由实验确定,是样本大小。理想情况下,我正在寻找形式为的(最好是众所周知的)公式, 其中仅取决于类型I速率和功率。Ñ λ λ ķ Ñ Ñ = Çk,nk,nk,nnλnλn \lambdaλλ\lambdakkknnn cn=cg(k,λ)n=cg(k,λ)n = \frac{c}{g(k,\lambda)}ccc 样本大小应满足 其中是具有 dof和非中心性参数的非中心F的CDF …

2
在R中聚类空间数据
我有一套每月的海面温度(SST)数据,我想应用一些聚类方法来检测具有相似SST模式的区域。我有一组从1985年到2009年运行的每月数据文件,并希望将聚类应用到每个月作为第一步。 每个文件包含358416点的网格数据,其中约50%是陆地,并用99.99值标记为NA。数据格式为: lon lat sst -10.042 44.979 12.38 -9.998 44.979 12.69 -9.954 44.979 12.90 -9.910 44.979 12.90 -9.866 44.979 12.54 -9.822 44.979 12.37 -9.778 44.979 12.37 -9.734 44.979 12.51 -9.690 44.979 12.39 -9.646 44.979 12.36 我尝试了CLARA聚类方法,并得到了一些明显不错的结果,但在我看来,这也只是平滑(分组)等值线。那么我不确定这是分析空间数据的最佳聚类方法。 是否有其他专门用于此类数据集的聚类方法?一些参考将是开始阅读的好方法。 提前致谢。
12 r  clustering  spatial 


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.