统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
为单变量指数Hawkes过程寻找MLE
单变量指数霍克斯过程是一个自激点过程,事件到达率为: λ(t)=μ+∑ti&lt;tαe−β(t−ti)λ(t)=μ+∑ti&lt;tαe−β(t−ti) \lambda(t) = \mu + \sum\limits_{t_i<t}{\alpha e^{-\beta(t-t_i)}} 其中是事件的到达时间。t1,..tnt1,..tn t_1,..t_n 对数似然函数为 −tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln(μ+αe−β(tj−ti))−tnμ+αβ∑(e−β(tn−ti)−1)+∑i&lt;jln⁡(μ+αe−β(tj−ti)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum\limits_{i<j}{\ln(\mu+\alpha e^{-\beta(t_j-t_i)})} 可以递归计算: −tnμ+αβ∑(e−β(tn−ti)−1)+∑ln(μ+αR(i))−tnμ+αβ∑(e−β(tn−ti)−1)+∑ln⁡(μ+αR(i)) - t_n \mu + \frac{\alpha}{\beta} \sum{( e^{-\beta(t_n-t_i)}-1 )} + \sum{\ln(\mu+\alpha R(i))} R(i)=e−β(ti−ti−1)(1+R(i−1))R(i)=e−β(ti−ti−1)(1+R(i−1)) R(i) = e^{-\beta(t_i-t_{i-1})} (1+R(i-1)) R(1)=0R(1)=0 R(1) = 0 我可以使用什么数值方法找到最大似然法?最简单的实用方法是什么?

3
数据集更改后使用旧标准偏差计算新标准偏差
我的阵列nnn真实值,其具有平均μoldμold\mu_{old}和标准偏差σoldσold\sigma_{old}。如果将数组xixix_i元素替换为另一个元素xjxjx_j,则新的均值将为 μnew=μold+xj−xinμnew=μold+xj−xin\mu_{new}=\mu_{old}+\frac{x_j-x_i}{n} 这种方法的优点是,无论的值如何,都需要恒定的计算量。是否有任何的方法来计算σ Ñ Ë 瓦特使用σ ö 升d等的计算μ Ñ Ë 瓦特使用μ ö 升d?nnnσnewσnew\sigma_{new}σoldσold\sigma_{old}μnewμnew\mu_{new}μoldμold\mu_{old}

1
使用R和plm估算包含时间相互作用的固定效应模型
我plm()用来估计形式的固定效应模型 y ~ x + time + time:fixed_trait 其中fixed_trait,变量在个体之间会有所不同,但在个体内部却是恒定的。 与之互动time的目的fixed_trait是使效果fixed_trait随时间变化。(我从Paul Allison的最新固定效果手册中从事此工作。引文附后。) plm()毫不费力地估计此类模型的系数和标准误差。但是summary.plm()无法为这些模型计算R ^ 2。这是我要解决的问题。 这是一个最小的示例: library(plm) tmp &lt;- data.frame(ID=rep(1:3, 2), year=rep(0:1, each=3), y=rnorm(6), const=rep(1:3, 2)) fe1 &lt;- plm(y ~ year, index=c('ID', 'year'), data=tmp) fe2 &lt;- plm(y ~ year + year:const, index=c('ID', 'year'), data=tmp) summary(fe1) # works fine summary(fe2) # Error …
16 r 

1
预测短时间序列的最小愚蠢方法
我需要为第29个时间单位预测以下4个变量。我有大约2年的历史数据,其中1和14和27都是同一时期(或一年中的某个时间)。最后,我对w ^w ^W,w ^ dwdwd,w çwCwc和进行了Oaxaca-Blinder风格的分解ppp。 time W wd wc p 1 4.920725 4.684342 4.065288 .5962985 2 4.956172 4.73998 4.092179 .6151785 3 4.85532 4.725982 4.002519 .6028712 4 4.754887 4.674568 3.988028 .5943888 5 4.862039 4.758899 4.045568 .5925704 6 5.039032 4.791101 4.071131 .590314 7 4.612594 4.656253 4.136271 .529247 8 4.722339 4.631588 3.994956 …

3
根据残差的大小对数据集进行分层并进行两次样本比较,是否完全可以辩护?
我认为这是一种临时方法,对我来说似乎非常可疑,但也许我错过了一些东西。我已经在多元回归中看到了这一点,但让我们保持简单即可: yi=β0+β1xi+εiyi=β0+β1xi+εi y_{i} = \beta_{0} + \beta_{1} x_{i} + \varepsilon_{i} 现在从拟合模型中提取残差 ei=yi−(β^0+β^1xi)ei=yi−(β^0+β^1xi) e_{i} = y_{i} - \left( \hat{\beta}_{0} + \hat{\beta}_{1} x_{i} \right) 并根据残差的大小对样本进行分层。例如,假设第一个样本是残差的底部90%,第二个样本是残差的顶部10%,然后继续进行两个样本比较-我已经在模型xxx和不在模型中的变量上。所使用的非正式逻辑是,可能值远高于您在模型下期望值的点(即较大的残差)在某些方面有所不同,并以此方式调查了这种差异。 我对这个问题的想法是: 如果在模型中的预测变量上看到2个样本的差异,则存在模型未考虑其当前状态的预测变量的影响(即非线性影响)。 如果您看到模型中没有的变量存在2个样本的差异,那么也许它应该首先出现在模型中。 有一件事我经验发现(通过模拟)是,如果你是比较平均的预测模型中的xxx并以这种方式分层产生两个样本,x¯¯¯1x¯1\overline{x}_{1}和x¯¯¯2x¯2\overline{x}_{2},它们是彼此正相关。这是有意义的,因为这两个样品取决于y¯¯¯,x¯¯¯,σ^x,σ^yy¯,x¯,σ^x,σ^y\overline{y}, \overline{x}, \hat{\sigma}_{x}, \hat{\sigma}_{y}和ρ X ÿρ^xyρ^xy\hat{\rho}_{xy}。当您将截止值向下移动时,相关性会增加(即,您用于划分样本的百分比)。因此,至少,如果要进行两样本比较,则需要调整统计量分母中的标准误差以考虑相关性(尽管我尚未为协方差)。ttt 无论如何,我的基本问题是:这样做有任何理由吗?如果是这样,在什么情况下这可能是有用的事情?显然,我认为没有,但是有些事情我没有以正确的方式考虑。

6
最快的SVM实施
更多的是一个一般性的问题。我正在运行rbf SVM进行预测建模。我认为我当前的程序肯定需要加快速度。我使用scikit learning进行粗略到精细的网格搜索+交叉验证。 每次SVM运行大约需要一分钟,但是在所有迭代中,我仍然发现它太慢了。假设我最终在多个内核上对交叉验证部分进行了多线程处理,那么关于提高程序速度的建议是什么?是否有更快的SVM实现?我听说过一些GPU SVM,但并没有对其进行深入研究。任何用户,速度更快吗?

2
VC维度用于测量神经网络的复杂性的替代方法是什么?
我遇到了一些测量神经网络复杂性的基本方法: 幼稚和非正式:计算神经元,隐藏的神经元,层或隐藏层的数量 VC维度(Eduardo D. Sontag [1998]“神经网络的VC维数” [ pdf ]。) 等效于TC0dTCd0TC^0_d过程粒度和渐近计算复杂性度量。 还有其他选择吗? 首选: 如果复杂性度量可用于在相同规模上测量来自不同范式的神经网络(以测量反向传播,动力学神经网络,级联相关性等)。例如,VC维度可用于网络(甚至是神经网络以外的其他事物)上的不同类型,而神经元的数量仅在激活函数,信号(基本和尖峰)以及其他函数非常特定的模型之间有用。网络的属性是相同的。 如果它与网络可学习的功能复杂性的标准度量有很好的对应关系 如果很容易在特定网络上计算度量标准(尽管这不是必须的)。 笔记 该问题基于对CogSci.SE 的更一般的问题。

4
幂律分布背后的直觉
我知道幂律分布的pdf为p(x)=α−1xmin(xxmin)−αp(x)=α−1xmin(xxmin)−α p(x) = \frac{\alpha-1}{x_{\text{min}}} \left(\frac{x}{x_{\text{min}}} \right)^{-\alpha} 但是,例如,股价遵循幂定律分布,从直觉上意味着什么?这是否意味着损失可能很高但很少发生?

1
如何分析纵向计数数据:在GLMM中考虑时间自相关?
您好统计大师和R编程向导, 我对将动物捕获建模为环境条件和一年中的一天感兴趣。作为另一项研究的一部分,我统计了三年中约160天的捕获次数。在这几天的每一天,我都会获得温度,降雨,风速,相对湿度等信息。由于是从相同的5个地块重复收集数据,因此我将其用作随机效应。 我的理解是,nlme可以轻松解决残差中的时间自相关,但不能处理lme4这样的非高斯链接函数(无法处理自相关吗?)。目前,我认为在log(count)的R中使用nlme包可能会起作用。所以我现在的解决方案是运行类似的命令: m1 &lt;- lme(lcount ~ AirT + I(AirT^2) + RainAmt24 + I(RainAmt24^2) + RHpct + windspeed + sin(2*pi/360*DOY) + cos(2*pi/360*DOY), random = ~1|plot, correlation = corARMA(p = 1, q = 1, form = ~DOY|plot), data = Data) DOY =一年中的一天。最终模型中可能会有更多的交互,但这是我的基本想法。我也可能尝试用类似的方法进一步对方差结构建模 weights = v1Pow 我不确定Poisson混合模型回归或其他方法是否有更好的方法?我刚刚在Kedem和Fokianos的“时间序列分析的回归模型”的第4章中找到了数学讨论。目前,这超出了我一点,尤其是在应用程序中(用R编码)。我在Zuur等人中也看到了MCMC解决方案。BUGS语言的混合效果模型书(Chp 23)(使用winBUGS或JAG)。那是我最好的选择吗?R中是否有一个简单的MCMC软件包可以解决这个问题?我不太了解GAMM或GEE技术,但是如果人们认为他们可以提供更好的见解,我将愿意探索这些可能性。我的主要目标是创建一个模型,以在给定环境条件下预测动物的捕获量。其次,我想解释一下动物对它们活动的反应。 任何关于最佳处理方式(从哲学上),如何在R或BUGS中进行编码的想法都将受到赞赏。我是R和BUGS(winBUGS)的新手,但正在学习。这也是我第一次尝试解决时间自相关。 谢谢,丹

8
未配对t检验的最小样本量
是否有“规则”来确定t检验有效所需的最小样本量? 例如,需要在两个总体的均值之间进行比较。一个种群中有7个数据点,而另一种群中只有2个数据点。不幸的是,该实验非常昂贵且耗时,并且获取更多数据是不可行的。 可以使用t检验吗?为什么或者为什么不?请提供详细信息(人口方差和分布未知)。如果不能使用t检验,可以使用非参数检验(Mann Whitney)吗?为什么或者为什么不?

6
在哪里可以找到大型文本语料库?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 我正在寻找要下载的大型(&gt; 1000)文本语料库。最好是带有国际新闻或某种报道。我只找到一个拥有专利的产品。有什么建议么?
16 dataset 


2
插值的统计依据是什么?
假设我们有两个点(下图:黑色圆圈),并且我们想在它们之间找到第三个点的值(十字)。实际上,我们将根据实验结果(黑点)对其进行估算。最简单的情况是画一条线然后找到该值(即线性插值)。如果我们有支持点,例如,两侧都有棕色点,我们希望从中受益并拟合非线性曲线(绿色曲线)。 问题是,将红十字标记为解决方案的统计推理是什么?为什么其他十字架(例如黄色十字架)在可能的地方没有答案?什么样的推论或(?)促使我们接受红色的? 我将基于针对这个非常简单的问题的答案来提出我的原始问题。

5
自学概率论书籍
有什么好书可以解释概率论的重要概念,例如概率分布函数和累积分布函数吗? 请避免引用约翰·赖斯(John Rice)的“数学统计和数据分析”之类的书籍,这些书籍从简单的置换概念开始,然后突然(在第二章中)假设真实计算,多重和表面积分知识开始飞跃,并开始描述CDF和PDF并以3维图形进行说明。一个问题是如何连接一切。 我正在寻找自学书籍,任何与“实用人的微积分”类别相同的书籍都会有很大的帮助。

4
聚类一维数据
我有一个数据集,我想基于一个变量(没有缺失值)在该数据上创建聚类。我想基于该变量创建3个群集。 使用哪种聚类算法,k均值,EM,DBSCAN等? 我的主要问题是,在什么情况下我应该在EM上使用k-means还是在k-means上使用EM?
16 clustering 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.