统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
时间事件的长尾分布
假设您具有Web服务器的日志。在这些日志中,您具有以下类型的元组: user1, timestamp1 user1, timestamp2 user1, timestamp3 user2, timestamp4 user1, timestamp5 ... 这些时间戳表示例如用户的点击。现在,user1它将在一个月内多次访问该网站(会话),并且您在每个会话期间都会获得来自每个用户的点击次数激增(假设当用户访问您的网站时,他将点击多个页面)。 假设您希望在产生点击的会话中对这些点击次数进行分区,但是您没有任何其他信息源,只有时间戳列表。如果您计算来自同一用户的两次点击之间的间隔分布,则将获得长尾分布。直观地,您会寻找一个“剪切参数”,例如N秒,如果为timestamp_{i+1} - timestamp{i} > N,则您timestamp_{i+1}是新会话的开始。 问题在于,这种分布实际上是两个变量的混合:X =“同一会话中两次随之而来的点击之间的间隔”和Y =“上一次会话的最后点击与新会话中的第一次单击之间的间隔”。 问题是,仅通过查看点击次数,如何估算这个N,即可将两个分布(可能会有些重叠)分开?

2
“ Stata”或“ R”中回归不连续设计中的图形
Lee和Lemieux(p。31,2009)建议研究人员在进行回归不连续性设计分析(RDD)时呈现图表。他们建议执行以下步骤: “ ...对于某个带宽,以及分别对于截止值左侧和右侧的一定数量的仓和 ,想法是构造仓(, ],其中 +,其中 “ķ 0 ķ 1 b ķ b ķ + 1 ķ = 1 ,。。。,ķ = ķ 0 ķ 1 b ķ = Ç - (ķ 0 - ķ + 1 )⋅ ħ 。Hhhķ0K0K_0ķ1个K1K_1bķbkb_kbk + 1bk+1b_{k+1}ķ = 1 ,。。。,K= K0k=1,...,K=K0k = 1, . . . …

3
在因子分析中仅加载两个(或更少)项目(变量)是否可以接受?
我在SPSS中通过因子分析设置了一组20个变量。为了研究的目的,我需要发展6个因素。SPSS已显示8个变量(共20个)已被低权重加载或由于多个因素而均等地加载,因此我将其删除。剩下的12个变量已经在6个因子中成对装入了2个,这是完美的结构-就像我想要的那样,但是现在,一位与我合作的教授希望我找到理由(在什么条件下)每个因子仅保留2个项目是适当的,因为众所周知,因子分析对于每个因子加载3个或更多项目的结果很有用。 谁能帮我解决这个问题,最好还提供公开的参考资料?

3
与连续预测器相比,您如何形象地显示二进制结果?
我需要可视化一些数据,不确定如何做到最好。我有一些基础项目,频率分别为和结果 。现在,我需要绘制我的方法“发现”(即1结果)低频项的效果如何。最初,我的频率x轴和ay轴为0-1,具有点状图,但它看起来太可怕了(特别是在比较两种方法的数据时)。也就是说,每个项都有一个结果(0/1),并按其频率排序。F = { f 1,⋯ ,f n }Q = { q1个,⋯ ,qñ}问={q1个,⋯,qñ}Q = \{ q_1, \cdots, q_n \}F= { f1个,⋯ ,fñ}F={F1个,⋯,Fñ}F = \{f_1, \cdots, f_n \}Ø ∈ { 0 ,1 }ñØ∈{0,1个}ñO \in \{0,1\}^nq∈ Qq∈问q \in Q 这是单个方法结果的示例: 我的下一个想法是将数据划分为多个区间,并在区间上计算局部灵敏度,但是该想法的问题是频率分布不一定均匀。那么我该如何最好地选择时间间隔? 有谁知道一种更好/更有用的方式来可视化此类数据,以描绘发现稀有(即,非常低频率)的物品的有效性? 编辑:更具体地讲,我正在展示某种方法来重建特定种群的生物序列的能力。为了使用模拟数据进行验证,我需要展示重建变异体的能力,而无论其丰度(频率)如何。因此,在这种情况下,我将可视化丢失和找到的物品,并按其频率排序。此图将不包括不在重构变体。问问Q

3
浓度参数具有超先验分布的多项式-Dirichlet模型
我将尝试尽可能概括地描述当前的问题。我正在将观察建模为具有参数概率向量theta 的分类分布。 然后,我假设参数向量theta遵循Dirichlet先验分布,参数为。α1个,α2,… ,αķα1,α2,…,αk\alpha_1,\alpha_2,\ldots,\alpha_k 那么是否可以对参数施加超先验分布呢?它必须是多元分布,例如分类分布和狄利克雷分布吗?在我看来,alpha总是为正,因此应优先使用gamma hyperprior。α1个,α2,… ,αķα1,α2,…,αk\alpha_1,\alpha_2,\ldots,\alpha_k 不知道是否有人尝试拟合这种(可能)过参数化的模型,但对我而言,认为阿尔法不应该是固定的而是来自伽马分布的,似乎是合理的。 请尝试为我提供一些参考,以及在实践中如何尝试这种方法的见解。

3
选择要保留的主要成分数量
向我建议的一种方法是查看碎石图并检查“弯头”以确定要使用的正确PC数。但是,如果情节不清楚,R是否可以通过计算来确定数字? fit <- princomp(mydata, cor=TRUE)
10 r  pca 


2
当变量表现出完美的同时依赖时,多元中心极限定理(CLT)是否成立?
标题总结了我的问题,但为清楚起见,请考虑以下简单示例。令,i = 1,...,n。定义: \ begin {equation} S_n = \ frac {1} {n} \ sum_ {i = 1} ^ n X_i \ end {equation} 和 \ begin {equation} T_n = \ frac {1} {n} \ sum_ {i = 1} ^ n(X_i ^ 2-1-1)\ end {equation} 我的问题:即使当n = 1时S_n和T_n完全相关,\ sqrt {n} S_n和\ …

1
给定二维空间中的一组点,如何为SVM设计决策功能?
有人可以解释一下如何设计SVM决策功能吗?或指向我讨论具体示例的资源。 编辑 对于下面的示例,我可以看到等式分离了具有最大边距的类。但是,如何以以下形式调整权重并编写超平面方程式。X2=1.5X2=1.5X_2 = 1.5 H1:w0+w1x1+w2x2≥1H2:w0+w1x1+w2x2≤−1forYi=+1forYi=−1.H1:w0+w1x1+w2x2≥1forYi=+1H2:w0+w1x1+w2x2≤−1forYi=−1.\begin{array}{ll} H_1 : w_0+w_1x_1+w_2x_2 \ge 1 & \text{for}\; Y_i = +1 \\ H_2 : w_0+w_1x_1+w_2x_2 \le -1 & \text{for}\; Y_i = -1.\end{array} 在考虑更高的维度之前,我试图在二维空间中正确理解基础理论(因为它更易于可视化)。 我已经为此解决方案,可以请有人确认这是否正确吗? 权重向量是(0,-2)并且W_0是3 H1:3+0x1−2x2≥1H2:3+0x1−2x2≤−1forYi=+1forYi=−1.H1:3+0x1−2x2≥1forYi=+1H2:3+0x1−2x2≤−1forYi=−1.\begin{array}{ll} H_1 : 3+0x_1-2x_2 \ge 1 & \text{for}\; Y_i = +1 \\ H_2 : 3+0x_1 -2x_2 \le -1 & \text{for}\; …
10 svm 

1
R和EViews AR(1)估算值的差异
主要问题是:我无法使用EViews和R获得类似的参数估计。 由于我自己不了解的原因,我需要使用EViews估算某些数据的参数。这是通过选择NLS(非线性最小二乘)选项并使用以下公式来完成的:indep_var c dep_var ar(1) 的EViews 权利要求:它们估计线性AR(1)处理,诸如 其中错误被定义为: 通过使用等效等式(带有一些代数替换): 此外,该线程在EViews论坛上,建议他们的NLS估计值是由Marquardt算法生成的。ÿŤ= α + βXŤ+ 你ŤÿŤ=α+βXŤ+üŤ Y_t = \alpha + \beta X_t + u_t üŤüŤu_tüŤ= ρ ·&ùt − 1+εut=ρ⋅ut−1+ε u_t = \rho \cdot u_{t-1} + \varepsilon Yt= (1 -ρ)α+ρYt−1+βXt−ρβXt−1+εŤYt=(1-ρ)α+ρÿŤ-1个+βXŤ-ρβXŤ-1个+εŤ Y_t = (1 - \rho) \alpha + \rho Y_{t - 1} + \beta …

1
如何在lme4中解释多元混合模型的系数而无需整体拦截?
我正在尝试在中拟合多变量(即多响应)混合模型R。除了ASReml-r和SabreR软件包(需要外部软件)之外,似乎只有在中才有可能MCMCglmm。Jarrod Hadfield 在包装随附的论文MCMCglmm(pp.6)中描述了拟合模型的过程,例如将多个响应变量重塑为一个长格式变量,然后抑制总体截距。我的理解是,抑制截距会使响应变量每个级别的系数解释变为该级别的平均值。鉴于以上所述,因此是否可以使用来拟合多元混合模型lme4?例如: data(mtcars) library(reshape2) mtcars <- melt(mtcars, measure.vars = c("drat", "mpg", "hp")) library(lme4) m1 <- lmer(value ~ -1 + variable:gear + variable:carb + (1 | factor(carb)), data = mtcars) summary(m1) # Linear mixed model fit by REML # Formula: value ~ -1 + variable:gear + variable:carb + (1 | …

3
变量匹配和统计控制等方法之间的联系是什么?
您经常会在研究文章中看到研究人员已经控制了某些变量。这可以通过诸如匹配,阻止等方法来完成。 但是我一直认为,控制变量是通过测量几个可能具有影响力的变量并对其进行一些统计分析而在统计上完成的,这可以在真实和准实验中完成。因此,例如,您将进行一项调查或其他测试,在其中您将测量自变量和一些可能混淆的变量并进行一些分析。 在准实验中可以控制变量吗? 变量匹配和统计控制等方法之间的联系是什么?

3
具有时间相关协变量的Cox回归的模型建议
我正在模拟怀孕对疾病后果(死活)的影响。诊断后,大约40%的患者确实怀孕了-但时间不同。到目前为止,我已经完成了KM图,显示了妊娠对生存的明显保护作用,并且还建立了常规的Cox模型-但是仅使用二等分的妊娠变量对它们进行了建模,并假设从诊断开始就存在这种影响,这显然是不现实的因为从诊断到怀孕的平均时间为4年。 哪种模型可以在诊断后的不同时间点吸收多次怀孕的影响?对与时间交互作用的怀孕进行建模是否正确(这将需要进行一些认真的数据重建—是否有任何自动化软件可以对此进行帮助?)还是针对这些问题是否存在另一种首选的建模策略?这些问题的首选绘图策略是什么?
10 survival 

3
何时在Poisson回归中使用可靠的标准误差?
我将Poisson回归模型用于计数数据,并且想知道是否有理由不对参数估计使用健壮的标准误差?我特别担心,因为我的一些估计值没有显着性(例如,p = 0.13)不显着(例如,p = 0.13),但是具有显着性(p <0.01)。 在SAS中,可以通过使用proc genmod(例如repeated subject=patid;)中的重复语句来实现。我一直以http://www.ats.ucla.edu/stat/sas/dae/poissonreg.htm为例,引用了Cameron和Trivedi(2009)的一篇论文,以支持使用可靠的标准错误。

2
多重比较的层次模型-多重结果上下文
我刚刚(重新)阅读了格尔曼的《为什么我们(通常)不必担心多重比较》。特别是 “多重结果和其他挑战”部分提到在不同时间/条件下同一个人/单位有多个相关度量的情况下使用分层模型。它似乎具有许多理想的特性。 我了解这不一定是贝叶斯方法。有人可以告诉我如何使用rjags和/或lmer(常规JAGS和BUGS以及其他混合模型库,例如MCMCglmm)也可以正确地构建多变量多级模型,以便我可以进行比较和比较。对比结果?我想要模型的情况类型反映在下面的玩具数据中(多变量,重复测量): set.seed(69) id <- factor(rep(1:20, 2)) # subject identifier dv1 <- c(rnorm(20), rnorm(20, 0.8, 0.3)) # dependent variable 1 data for 2 conditions dv2 <- c(rnorm(20), rnorm(20, 0.3, 0.6)) dv3 <- c(rnorm(20), rnorm(20, -0.3, 0.8)) dv4 <- c(rnorm(20), rnorm(20, 0.2, 1 )) dv5 <- c(rnorm(20), rnorm(20, 0.5, 4 …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.