统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
很好的时间序列介绍(带R)
我目前正在收集有关与疼痛经历相关的社会心理特征的实验数据。为此,我将从参与者的电子方式收集GSR和BP测量值,以及各种自我报告和隐式测量值。我有心理背景,并且对因子分析,线性模型和实验分析很满意。 我的问题是,有什么好的(最好是免费的)资源可用于学习时间序列分析。对于这个领域,我是一个新手,因此,我们将不胜感激。我有一些试验数据可以练习,但是想在完成收集数据之前详细制定我的分析计划。 如果提供的参考文献也与R有关,那就太好了。 编辑:更改语法并添加“自我报告和隐含措施”

3
如何优化我的R脚本以使用“多核”
我在具有4个CPU的Ubuntu-Lucid PC上使用GNUR。为了使用所有4个CPU,我安装了“ r-cran-multicore”软件包。由于该软件包的手册缺乏我能理解的实际示例,因此我需要有关如何优化脚本以使用所有4个CPU的建议。 我的数据集是一个data.frame(称为P1),具有50,000行和1600 cols。对于每一行,我想计算最大值,总和和均值。我的脚本如下所示: p1max <- 0 p1mean <- 0 p1sum <-0 plength <- length(P1[,1]) for(i in 1:plength){ p1max <- c(p1max, max(P1[i,])) p1mean <- c(p1mean, mean(P1[i,])) p1sum <- c(p1sum, sum(P1[i,])) } 谁能告诉我如何修改和运行脚本以使用所有4个CPU?
15 r 

2
指数加权移动偏度/峰度
有众所周知的在线公式,用于计算过程的指数加权移动平均值和标准偏差。意思是(xn)n=0,1,2,…(xn)n=0,1,2,…(x_n)_{n=0,1,2,\dots} μn=(1−α)μn−1+αxnμn=(1−α)μn−1+αxn\mu_n = (1-\alpha) \mu_{n-1} + \alpha x_n 对于差异 σ2n=(1−α)σ2n−1+α(xn−μn−1)(xn−μn)σn2=(1−α)σn−12+α(xn−μn−1)(xn−μn)\sigma_n^2 = (1-\alpha) \sigma_{n-1}^2 + \alpha(x_n - \mu_{n-1})(x_n - \mu_n) 从中可以计算标准偏差。 在线计算加权的第三和第四中心矩有相似的公式吗?我的直觉是,他们应该采取以下形式 M3,n=(1−α)M3,n−1+αf(xn,μn,μn−1,Sn,Sn−1)M3,n=(1−α)M3,n−1+αf(xn,μn,μn−1,Sn,Sn−1)M_{3,n} = (1-\alpha) M_{3,n-1} + \alpha f(x_n,\mu_n,\mu_{n-1},S_n,S_{n-1}) 和 M4,n=(1−α)M4,n−1+αf(xn,μn,μn−1,Sn,Sn−1,M3,n,M3,n−1)M4,n=(1−α)M4,n−1+αf(xn,μn,μn−1,Sn,Sn−1,M3,n,M3,n−1)M_{4,n} = (1-\alpha) M_{4,n-1} + \alpha f(x_n,\mu_n,\mu_{n-1},S_n,S_{n-1},M_{3,n},M_{3,n-1}) 从中可以计算出偏度和峰度但我无法找到简单的封闭式-函数f和g的形式表达式。 ķ Ñ = 中号4 ,Ñ / σ 4 Ñ ˚F 克γn=M3,n/σ3nγn=M3,n/σn3\gamma_n = M_{3,n} …

5
M估计量的经验式Hessian可以不确定吗?
Jeffrey Wooldridge在他的 “横截面和面板数据的计量经济学分析”(第357页)中说,经验Hessian“对于我们正在处理的特定样本,不能保证为正定,甚至正半定”。 对于我来说,这似乎是错误的,因为(由于数字问题)Hessian必须是正半定的,这是因为M估计量的定义是参数的值,该参数使给定样本的目标函数最小化,并且众所周知,在(局部)最小值处,Hessian为正半定值。 我的说法正确吗? [编辑:该语句已在第二版中删除。这本书。见评论。 背景技术假设θ Ñ是通过最小化所获得的估计 1θˆNθ^N\widehat \theta_N1N∑i=1Nq(wi,θ),1N∑i=1Nq(wi,θ),{1 \over N}\sum_{i=1}^N q(w_i,\theta), 其中wiwiw_i表示第iii个观测值。 让我们表示的海赛qqq通过HHH, H(q,θ)ij=∂2q∂θi∂θjH(q,θ)ij=∂2q∂θi∂θjH(q,\theta)_{ij}=\frac{\partial^2 q}{\partial \theta_i \partial \theta_j} 的渐近协方差θ Ñ涉及ë [ ħ (q ,θ 0)],其中θ 0θˆnθ^n\widehat \theta_nE[H(q,θ0)]E[H(q,θ0)]E[H(q,\theta_0)]θ0θ0\theta_0是真参数值。估计它的一种方法是使用经验式的Hessian Hˆ=1N∑i=1NH(wi,θˆn)H^=1N∑i=1NH(wi,θ^n)\widehat H=\frac{1}{N}\sum_{i=1}^N H(w_i,\widehat \theta_n) 它的确定性^ h这是个问题。HˆH^\widehat H

4
回归参数的置信区间:贝叶斯与经典
给定两个长度均为n的数组x和y,我拟合了模型y = a + b * x,并希望计算斜率的95%置信区间。这是(b-delta,b + delta),其中b是通常找到的, delta = qt(0.975,df=n-2)*se.slope se.slope是斜率的标准误差。从R获得斜率标准误差的一种方法是summary(lm(y~x))$coef[2,2]。 现在,假设我写出给定x和y的斜率的可能性,将其乘以“平坦”的先验,然后使用MCMC技术从后验分布中得出样本m。限定 lims = quantile(m,c(0.025,0.975)) 我的问题:(lims[[2]]-lims[[1]])/2大约等于上面定义的增量吗? 附录下面是一个简单的JAGS模型,这两个模型似乎有所不同。 model { for (i in 1:N) { y[i] ~ dnorm(mu[i], tau) mu[i] <- a + b * x[i] } a ~ dnorm(0, .00001) b ~ dnorm(0, .00001) tau <- pow(sigma, -2) …


5
如何模拟价格?
我在matemathics stackexchange网站上问了这个问题,建议在这里问。 我正在从事一个业余项目,需要解决以下问题。 一点背景 假设有一些商品,其中包含功能和价格的描述。想象一下汽车和价格的清单。所有汽车都具有功能列表,例如引擎尺寸,颜色,马力,型号,年份等。对于每个品牌,都应如下所示: Ford: V8, green, manual, 200hp, 2007, $200 V6, red, automatic, 140hp, 2010, $300 V6, blue, manual, 140hp, 2005, $100 ... 更进一步,带有价格的汽车列表以一定的时间间隔发布,这意味着我们可以访问历史价格数据。可能并不总是包括完全相同的汽车。 问题 我想了解如何根据此基本信息为任何汽车的价格建模,最重要的是不在初始清单中的汽车。 Ford, v6, red, automatic, 130hp, 2009 对于上述汽车,它与列表中的汽车几乎相同,但马力和年份略有不同。要为此定价,需要什么? 我正在寻找的是实用且简单的内容,但我也想听听有关如何对此类内容进行建模的更复杂方法。 我尝试过的 到目前为止,这是我一直在尝试的内容: 1)使用历史数据查找汽车X。如果找不到,则没有价格。当然这是非常有限的,并且只能将其与时间衰减结合使用,以随着时间的推移改变已知汽车的价格。 2)使用汽车功能加权方案和定价的样本汽车。基本上有一个基本价格,功能只是在某种程度上改变了价格。基于此得出任何汽车的价格。 事实证明,第一种方法不够用,第二种方法并不总是正确的,我可能没有使用权重的最佳方法。这似乎在保持权重上有些沉重,所以这就是为什么我认为也许有某种方法可以将历史数据用作统计信息,从而获得权重或获得其他收益。我只是不知道从哪里开始。 其他重要方面 集成到我拥有的一些软件项目中。通过使用现有的库或自己编写算法。 新的历史数据出现时快速重新计算。 有什么建议可以解决这样的问题吗?所有想法都值得欢迎。 在此先多谢,并期待阅读您的建议!

3
R中的面向对象编程的教程
关闭。这个问题是题外话。它当前不接受答案。 4年前关闭。 已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 在R中是否有关于面向对象编程的优秀教程? 如果它包含以下内容,那就太好了: 如何定义一个类; S3和S4类之间的差异; 运算符重载(我希望能写a+b在那里a,并b在课堂上,我心目中的情况下)。
15 r 

1
岭回归背景下的拉格朗日松弛
在“统计学习的要素”(第二版),p63中,作者给出了岭回归问题的以下两种表述: β^[R 我ðGË= 精氨酸β{ ∑我= 1ñ(y一世- β0− ∑j = 1pX我ĴβĴ)2+ λ Σj = 1pβ2Ĵ}β^[R一世dGË=精氨酸β{∑一世=1个ñ(ÿ一世-β0-∑Ĵ=1个pX一世ĴβĴ)2+λ∑Ĵ=1个pβĴ2} \hat{\beta}^{ridge} = \underset{\beta}{\operatorname{argmin}} \left\{ \sum_{i=1}^N(y_i-\beta_0-\sum_{j=1}^p x_{ij} \beta_j)^2 + \lambda \sum_{j=1}^p \beta_j^2 \right\} 和 β^[R 我ðGË= 精氨酸β∑我= 1ñ(y一世- β0− ∑j = 1pX我ĴβĴ)2,以∑为准 j = 1pβ2Ĵ≤ 牛逼。β^[R一世dGË=精氨酸β∑一世=1个ñ(ÿ一世-β0-∑Ĵ=1个pX一世ĴβĴ)2,受 ∑Ĵ=1个pβĴ2≤Ť。 \hat{\beta}^{ridge} = \underset{\beta}{\operatorname{argmin}} \sum_{i=1}^N(y_i-\beta_0-\sum_{j=1}^p x_{ij} \beta_j)^2 \text{, subject to } …

2
完整的条件从哪里来?
诸如Metropolis-Hastings和Gibbs采样之类的MCMC算法是从联合后验分布中采样的方法。 我想我理解并可以很轻松地实现城市改造-您只需以某种方式选择起点,并在后验密度和投标密度的指导下随机“遍历参数空间”。Gibbs采样看起来非常相似,但是效率更高,因为它一次只更新一个参数,而其他参数保持不变,从而以正交方式有效地遍历空间。 为此,您需要解析from *中每个参数的完整条件。但是这些全部条件从何而来? P(x1|x2, …, xn)=P(x1, …, xn)P(x2, …, xn)P(x1|x2, …, xn)=P(x1, …, xn)P(x2, …, xn) P(x_1 | x_2,\ \ldots,\ x_n) = \frac{P(x_1,\ \ldots,\ x_n)}{P(x_2,\ \ldots,\ x_n)} 要得到分母,您需要在上将关节边缘化x1x1x_1。如果有许多参数,这似乎需要大量工作来进行分析,如果联合分布不是很“好”,则可能很难处理。我意识到,如果在整个模型中使用共轭,则完整的条件可能很容易,但是对于更一般的情况,必须有一种更好的方法。 我在网上看到的所有吉布斯抽样示例都使用了玩具示例(例如从多变量法线抽样,条件变量本身就是法线),并且似乎可以避免这个问题。 *还是根本不需要分析形式的完整条件?像winBUGS这样的程序是如何做到的?
15 bayesian  mcmc  gibbs 

2
VIF,条件索引和特征值
我目前正在评估数据集中的多重共线性。 以下/上方的VIF和条件指数的阈值表示什么问题? VIF: 我听说VIF 是一个问题。≥ 10≥10\geq 10 除去两个问题变量后,VIF是为每个变量。变量是否需要更多处理,或者这个VIF看起来还好吗?≤ 3.96≤3.96\leq 3.96 条件指数: 我听说条件指数(CI)为30或更大是一个问题。我的最高CI为16.66。这有问题吗? 其他问题: 还有其他需要考虑的事项吗? 还有其他需要记住的事情吗?

2
在箱线图中显示平均值而不是中位数[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 4个月前关闭。 当使用python matplotblib绘制箱形图时,图中一半的线是分布的中位数。 是否有可能代替平均线。或者以其他样式将其绘制在其旁边。 另外,由于通常以中线为中位数,如果我将其设为平均值,会不会真的使我的读者感到困惑(当然,我会加注中间的线是什么)?

2
随机数和多核软件包
在R中编程时,我已经使用了多核软件包几次。但是,我从未见过有关如何处理随机数的声明。当我将openMP与C一起使用时,我会谨慎使用适当的并行RNG,但对于R,我假设发生了一些明智的事情。任何人都可以确认发生了明智的事情吗? 例 根据文档,我们有 x <- foreach(icount(1000), .combine = "+") %do% rnorm(4) 是如何rnorm产生的?


4
时间序列的统计相似性
假设一个人有一个时间序列,从中可以进行各种测量,例如周期,最大值,最小值,平均值等,然后使用它们来创建具有相同属性的模型正弦波,是否可以使用任何可以量化的统计方法实际数据与假设模型的拟合程度如何?该系列中的数据点数量将在10到50点之间。 我的一个非常简单的第一个想法是为正弦波的定向运动赋予一个值,即+1 +1 +1 +1 -1 -1 -1 -1 -1 -1 -1 -1 +1 +1 +1 +1 +1,对实际数据进行相同处理,然后以某种方式量化方向运动的相似度。 编辑:在考虑了我真正想对数据做些什么之后,并根据对原始问题的回答,我需要的是一种决策算法,可以在相互竞争的假设之间进行选择:即我的数据基本上是线性的(或趋势)带有可能包含循环元素的噪声;我的数据基本上是周期性的,没有方向性可言。数据本质上只是噪声;或正在这些状态之间转换。 我现在的想法是将贝叶斯分析和欧几里德/ LMS度量结合起来。这种方法的步骤将是 根据数据测量创建假定的正弦波 使LMS直线适合数据 推导一个欧几里德或LMS度量标准,以与上述各项的原始数据产生偏差 根据此指标为每个指标创建一个贝叶斯先验,即60%的合并偏离附加到一个,40%附加到另一个,因此有利于40% 沿数据滑动一个数据点并重复上述操作,以获取此稍有变化的数据集的新%指标-这是新证据-做贝叶斯分析以创建后验并更改有利于每个假设的概率 使用此滑动窗口(窗口长度为10-50个数据点)在整个数据集(3000个以上的数据点)中重复。希望/意图是确定数据集中任何时候的主要/偏爱的假设以及这种假设随时间的变化 对于这种潜在方法的任何评论都将受到欢迎,尤其是在如何实际实施贝叶斯分析部分方面。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.