统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


7
用于数据可视化示例,教学和研究的数据集
我正在搜索可用于测试正在研究的多种datavis技术的现有数据集。 我知道一些资源,例如R中包含的资源(请尝试plot(Orange)或在此处查看)。 但我想向前迈出一步: 哪些是测试可视化工具的最佳现实数据集? 您在有关datavis的学术论文或教学幻灯片中使用了哪些数据集? 在现实世界中,哪一个是最好的例子来展示制图的优势?

6
如何在R中对变量进行分组居中/标准化?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我熟悉的功能包括R的缩放比例和ARM的缩放比例。 也许最好的方法是使用apply的某种变体,指定一个或多个变量用作分组变量。

1
如何解释0或1的p值?
我进行了一项方差分析,例如,性别和年级之间的相互作用比我想知道的男孩和女孩的年级有所不同,但是在很多情况下,我发现(调整后的)p值为0和1。为什么/为什么会这样?似乎不正确... as.factor(gender) 1 16 16.2 2.6377 0.104396 as.factor(grade) 7 50077 7153.9 1165.4184 < 2.2e-16 *** as.factor(gender):as.factor(grade) 7 132 18.9 3.0795 0.003056 ** Residuals 7747 47555 6.1 --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 Tukey multiple comparisons of means 95% family-wise confidence level …
9 r 

3
随机效应可以仅应用于分类变量吗?
这个问题听起来可能很愚蠢,但是... 随机效应仅适用于分类变量(例如个体ID,人口ID等)是正确的吗,例如说是分类变量:X一世X一世x_i ÿ一世ÿ一世y_i〜βX一世βX一世\beta_{x_i} βX一世βX一世\beta_{x_i}〜ñø ř 米(μ ,δ2)ñØ[R米(μ,δ2)Norm(\mu, \delta^2) 但是根据原理,随机效应不能应用于连续变量(例如高度,质量...),例如:ž一世ž一世z_i ÿ一世ÿ一世y_i〜α + β⋅ž一世α+β⋅ž一世\alpha + \beta \cdot z_{i} 因为只有一个系数不能约束?听起来合乎逻辑,但我想知道为什么统计文献中从未提及它!谢谢!ββ\beta 编辑:但是如果我约束像〜?那是随机效应吗?但这与我对施加的约束不同-在这里,我约束变量,而在前面的示例中,我约束了系数!对我来说,它开始看起来像是一团糟。。。不管怎么说,放这个约束没有多大意义,因为是已知值,所以也许这个想法很奇怪:-)ž一世ž一世z_iž一世ž一世z_iñø ř 米(μ ,δ2)ñØ[R米(μ,δ2)Norm(\mu, \delta^2)βX一世βX一世\beta_{x_i}ž一世ž一世z_i

2
了解重复测量方差分析假设以正确解释SPSS输出
我正在调查不同的奖励条件是否会影响任务绩效。我有一个小型研究的数据,该研究分为两组,每组n = 20。我收集了一项涉及在3种不同“奖励”条件下的性能的任务的数据。这项任务涉及在3种情况下的两次表现,但以随机顺序进行。我想看看在每个不同的“奖励”条件下,每个小组的任务绩效是否存在平均差异。 IV =组类型 DV = 3种条件下任务绩效的平均值 我从重复测量方差分析中获得了输出,并可以访问SPSS中的原始数据集,但是不确定如何进行。由于Pallant的文字有些局限,因此我无法找到这种解释的分步指南。我的特殊问题包括以下几个方面: 我应该单独检查每个变量的正常性还是在IV的每个级别的组合中检查其正常性?如果组合使用,如何检查? 我要先检查莫赫利测验吗?如果违反,那是什么意思?如果没有违反,那意味着什么? 什么时候可以查看多元测试表或受试者内部效应的测试?我不确定何时使用这两个(或两者兼而有之)? 看看成对比较总是可以吗?如果多变量或受试者内效应未显示显着性(即P <0.05),则这样做似乎是违反直觉的,但我再次不确定。

3
如何使用1%的微数据样本大规模地模拟小区域的人口普查微数据,以及如何在小区域尺度上进行汇总统计?
我想在较小的地理汇总水平(澳大利亚人口普查收集区)中执行个人级别的多元分析。显然,出于隐私原因,无法在这些较小的汇总级别进行人口普查,因此我正在研究其他替代方案。几乎所有感兴趣的变量都是分类变量。我有两个数据集可供使用: 1%的人口普查样本可用于更高级别的空间聚集(一个人口约为190,000且人口统计学的空间分隔较大的区域)。 我在小区域级别上感兴趣的变量的频率表(500个小区域,平均pop = 385,sd = 319,中位数= 355)。 如何使用这两个数据集在小面积级别模拟尽可能接近小面积实际人口的人口分布? 我很欣赏可能有常规的方法来执行此操作;如果是这样,将非常感谢您提供教科书或相关期刊文章的指针。

1
控制和治疗之间的差异应该显式还是隐式建模?
给出以下实验设置: 从受试者中采集多个样品,并对每个样品进行多种处理(包括对照治疗)。主要有趣的是对照和每种处理之间的差异。 我可以为这个数据想到两个简单的模型。以样本,处理,处理0为对照,令为数据,为样本的基线,为处理的差。第一个模型同时考虑了控制和差异:一世iiĴjjÿ我ĴYijY_{ij}γ一世γi\gamma_i一世iiδĴδj\delta_jĴjj ÿ我Ĵ=γ一世+δĴ+ϵ我ĴYij=γi+δj+ϵij Y_{ij}=\gamma_i+\delta_j+\epsilon_{ij} δ0= 0δ0=0 \delta_0=0 虽然第二种模型仅着眼于差异。如果我们预先计算预先 然后 d我Ĵdijd_{ij}d我Ĵ=ÿ我Ĵ-ÿ我0dij=Yij−Yi0 d_{ij}=Y_{ij}-Y_{i0} d我Ĵ=δĴ+ε我Ĵdij=δj+εij d_{ij}=\delta_j+\varepsilon_{ij} 我的问题是这两种设置之间的根本区别是什么?尤其是,如果这些级别本身没有意义,而只有差异很重要,那么第一个模型是否做得太多并且动力不足?

2
使用Fisher变换对三个或更多相关性进行显着性检验
据我所知,在我之前的文章中,如果我具有三个相关系数,则必须成对测试它们,以查看它们之间是否存在显着差异。 这意味着我将不得不使用Fishers变换来计算r的z得分,然后计算z的p值(谢天谢地,在先前的文章中推荐的计算器可以做到这一点),然后确定p值是高于还是低于p每对我的alpha值(0.05)。 例如,如果21至30岁的年龄段为1岁,而31至40岁的年龄段为2岁,而41至50岁的年龄段为2岁,那么他们的购物习惯和减肥之间的相关性比较如下: 第一组vs第二组 第一组vs第三组 第2组与第3组 除了执行三个单独的计算,还有没有办法在一个步骤中完成所有这些计算?

1
有关方差分析,t检验和非参数检验的独立性假设的问题
我是统计学的新手,对于统计测试的独立性假设有些困惑。 我在互联网上搜索时,有一些信息说,对于t检验,两组中的观察值应该是独立的(也就是说,样本1中的测量值和样本2中的测量值应该不同)。其他一些信息表明,所有观察结果(即使在同一组中)也应该是独立的。哪一个是正确的? ANOVA的独立性假设与t检验的独立性假设是否相同? 非参数检验,例如Wilcoxon有符号秩检验,是否也需要满足独立性假设?

1
有条件异方差的线性模型的推论
假设我观察到独立变量向量和以及因变量y。我想拟合以下形式的模型: y = \ vec {x} ^ {\ top} \ vec {\ beta_1} + \ sigma g \ left(\ vec {z} ^ {\ top} \ vec {\ beta_2} \ right)\ epsilon, 其中g是某个正值二次可微函数,\ sigma是未知的缩放参数,\ epsilon是零均值,单位方差高斯随机变量(假定独立于\ vec {x}和\ vec {z})。这实质上是Koenker异方差检验的设置(至少据我所知)。x⃗ x→\vec{x}z⃗ z→\vec{z}yyyy=x⃗ ⊤β1→+σg(z⃗ ⊤β2→)ϵ,y=x→⊤β1→+σg(z→⊤β2→)ϵ,y = \vec{x}^{\top}\vec{\beta_1} + \sigma g\left(\vec{z}^{\top} \vec{\beta_2}\right) \epsilon,gggσσ\sigmaϵϵ\epsilonx⃗ x→\vec{x}z⃗ …


2
案例加权逻辑回归
我正在研究一些逻辑回归问题。(“常规”和“有条件”)。 理想情况下,我想对每个输入案例进行加权,以便glm将更多的精力放在正确预测较高加权案例上,而可能会误分类较低加权案例。 当然这已经完成了。谁能指出我一些相关的文献(或者可能建议修改的似然函数。) 谢谢!
9 logistic 

2
此发行版有名称吗?或什么可能会产生随机过程?
具有质量函数的离散分布 p (x ; k )=ķ(x + k )(x + k − 1 ),X = 1 ,2 ,...p(X;ķ)=ķ(X+ķ)(X+ķ-1个),X=1个,2,…p(x;k) = \frac{k}{(x+k)(x+k-1)},\quad x = 1,2,\ldots 出现第9页本文。 对于它是带有的Yule-Simon分布,但是我没有找到其他示例。k = 1ķ=1个k=1ρ = 1ρ=1个\rho=1 它有名字吗?它是否出现在其他任何上下文中?是否有可能会产生一个简单的随机过程?

2
标准差分布
这个问题涉及正态分布,但我想知道从任意分布中得出的大小为n的样本的标准偏差的分布情况如何。特别是标准偏差的标准偏差是多少? 对于正态分布,sd的sd为。对于的任意分布,这近似正确吗?σ2n√σ2n\sigma \over{\sqrt{2n}}n→∞n→∞n \rightarrow \infty

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.