统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
MANOVA与因变量之间的相关性:太强有多强?
MANOVA中的因变量不应“过强地相关”。但是相关性有多强呢?得到人们对此问题的看法将是很有趣的。例如,在以下情况下,您会继续使用MANOVA吗? Y1和Y2与和p &lt; 0.005r = 0.3r=0.3r=0.3p &lt; 0.005p&lt;0.005p<0.005 Y1和Y2与和p = 0.049r = 0.7r=0.7r=0.7p = 0.049p=0.049p=0.049 更新资料 回应@onestop的一些代表性报价: “ MANOVA在DV之间存在适度相关性的情况下效果很好”(来自旧金山州立大学的课程注释) “相关变量适用于Manova”(美国EPA Stats Primer) “因变量应该在概念上相关,并且应该在低到中等水平上相互关联。” (北亚利桑那大学的课程笔记) “相关的DV从大约0.3到大约0.7是合格的”(Maxwell,2001年,消费者心理学杂志) nb我不是指这样的假设,即Y1和Y2之间的互相关在所有自变量级别上都应该相同,只是关于互相关的实际大小的这个明显的灰色区域。

5
测试重复测量方差分析的正态假设?(在R中)
因此,假设有必要测试方差分析的正态性假设(请参见1和2) 如何在R中对其进行测试? 我希望做这样的事情: ## From Venables and Ripley (2002) p.165. utils::data(npk, package="MASS") npk.aovE &lt;- aov(yield ~ N*P*K + Error(block), npk) residuals(npk.aovE) qqnorm(residuals(npk.aov)) 这是行不通的,因为“残差”没有针对重复测量方差分析的方法(对此也无法预测)。 那么在这种情况下应该怎么做? 是否可以从没有误差项的情况下简单地从同一拟合模型中提取残差?我对文献还不够熟悉,无法知道这是否有效,在此先感谢您的任何建议。

3
比较计数数据上的回归模型
我最近将4个多元回归模型用于相同的预测因子/响应数据。我适合泊松回归的两个模型。 model.pois &lt;- glm(Response ~ P1 + P2 +...+ P5, family=poisson(), ...) model.pois.inter &lt;- glm(Response ~ (P1 + P2 +...+ P5)^2, family=poisson(), ...) 我使用负二项式回归拟合的两个模型。 library(MASS) model.nb &lt;- glm.nb(Response ~ P1 + P2 +...+ P5, ...) model.nb.inter &lt;- glm.nb(Response ~ (P1 + P2 +...+ P5)^2, ...) 我可以使用统计检验来比较这些模型吗?我一直在使用AIC来衡量合身程度,但AFAIK并不代表实际测试。

4
套索通过坐标下降进行拟合:开源实现?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 去年关闭。 那里有什么开源实现-无论哪种语言-都可以通过坐标下降来计算套索正则化路径以进行线性回归? 到目前为止,我知道: 全球网 scikits.learn 还有其他东西吗?

6
是否有一个站点可以将我的调查发布到该站点,以便我可以得到该人群的样本代表?
这仅适用于我的高中高级项目,因此它不一定是完美的。我正在做一个有关全球变暖的项目,我想调查人们的意见。我知道,如果我使用方便的同学样本,就会有很多偏见。我想知道互联网上是否有一个网站可以发布我的调查问卷,让随机人回答,这样我就可以尽可能地接近SRS。如果没有,我会对进行调查的其他建议感兴趣。
11 survey  internet 

3
估计动态线性模型的参数
我要实现(在R中)以下非常简单的动态线性模型,对于该模型,我有2个未知的时变参数(观察误差的方差和状态误差的方差\ epsilon ^ 2_t)。ϵ1tϵt1\epsilon^1_tϵ2tϵt2\epsilon^2_t ÿŤθt + 1==θŤ+ ϵ1个ŤθŤ+ ϵ2ŤYt=θt+ϵt1θt+1=θt+ϵt2 \begin{matrix} Y_t & = & \theta_t + \epsilon^1_t\\ \theta_{t+1} & = & \theta_{t}+\epsilon^2_t \end{matrix} 我想在每个时间点估计这些参数,而不会产生任何前瞻性偏差。据我了解,我可以使用MCMC(在滚动窗口上避免向前看的偏差),也可以使用粒子滤波器(或顺序蒙特卡洛-SMC)。 哪种方法你使用,和 什么是这两种方法的利弊? 奖励问题:在这些方法中,如何选择参数的变化速度?我猜我们必须在这里输入信息,因为在使用大量数据估算参数与使用较少数据对参数更改做出更快反应之间存在讨价还价?
11 r  mcmc  dlm  particle-filter 

14
您可以从一个名字中挖掘多少信息?
名称:首先,可能是中间名和姓。 我很好奇您可以使用公开可用的数据集从名字中挖掘出多少信息。我知道,使用美国人口普查数据,您可以在低高概率(取决于输入)之间的任意位置获得以下信息:1)性别。2)比赛。 例如,Facebook正是利用这一点准确地找到了其网站用户的种族分布(https://www.facebook.com/note.php?note_id=205925658858)。 还有什么可以开采的?我没有在寻找任何具体的问题,这是一个非常开放的问题,可以缓解我的好奇心。 我的示例是特定于美国的,因此我们假设该名称是位于美国的某人的名字;但是,如果有人知道其他国家/地区的公开数据集,那么我对他们也很开放。 我不太确定这是否是正确的地方,否则,如果有人可以将我指向一个更合适的地方,我将不胜感激。 我希望这是一个有趣的问题,并且这是合适的地方!

3
后期治疗控制设计中相互作用效应的效应大小
如果您选择使用混合方差分析来分析具有连续因变量的前后治疗控制设计,则有多种方法可以量化出现在治疗组中的影响。交互作用是一种主要选择。 通常,我特别喜欢Cohen的d型度量(即)。我不喜欢用方差解释的量度,因为结果会根据不相关的因素(例如组的相对样本大小)而有所不同。μ1个- μ2σμ1个-μ2σ{\frac{\mu_1 - \mu_2}{\sigma}} 因此,我想我可以量化如下效果 Δ μC= μc ^ 2- μç 1ΔμC=μC2-μC1个\Delta\mu_c = \mu_{c2} - \mu_{c1} Δ μŤ= μ第2- μŤ 1ΔμŤ=μŤ2-μŤ1个\Delta\mu_t = \mu_{t2} - \mu_{t1} 因此,效果大小可以定义为Δ μŤ- Δ μCσΔμŤ-ΔμCσ\frac{\Delta\mu_t - \Delta\mu_c}{\sigma} 其中表示对照,t表示治疗,1和2分别表示之前和之后。 σ可以是时间1的合并标准偏差。CCcŤŤtσσ\sigma 问题: 标记此效应大小度量是否合适d? 这种方法看起来合理吗? 这种设计的效果大小度量的标准做法是什么?

2
通过R中的因子变量自动生成汇总
我有一个如下数据框: case simulation temp plank oxygen 1 1 1 8 7 11 2 2 1 16 10 15 ... 17 17 2 26 12 17 18 18 2 15 8 12 19 19 2 28 11 21 20 20 2 24 6 14 我想按仿真变量的级别划分摘要。例如,我想要temp模拟== 1和模拟== 2 的平均值,以及标准偏差的平均值。 目前,我正在使用以下代码,这非常可怕: df &lt;- …
11 r 

3
多维时间序列的干预分析
我想进行一次干预分析,以量化关于一段时间内酒精销售的政策决定的结果。但是,我对时间序列分析还很陌生,所以我有一些初学者的问题。 对文献的检查表明,其他研究人员已使用ARIMA来模拟酒精的时间序列销售,并使用虚拟变量作为回归因子来模拟干预效果。尽管这似乎是一种合理的方法,但是我的数据集比文献中介绍的数据集要稍微丰富一些。首先,我的数据集按饮料类型(即啤酒,葡萄酒,烈酒)分类,然后再按地理区域分类。 虽然我可以为每个分类的组分别创建ARIMA分析,然后比较结果,但我怀疑这里有更好的方法。谁能更熟悉多维时间序列数据,有人可以提出建议或建议吗?


4
是否可以有效地减少已发布的李克特量表中的项目数?
[根据反馈进行的编辑-谢谢:-)] h!更多编辑!抱歉! 你好- 我正在进行一些相当粗略和现成的数据收集,并使用已发布的有关士气和其他此类问题的量表发送给医护人员的调查。 唯一的问题是,与调查中的所有其他内容相比,该比例尺相当长,我想通过将每个子比例尺切成一半并且仅使用一半的项目来减小其尺寸。我的直觉是,这很好,因为子量表是相互关联的,虽然对于出版标准的研究不是理想的选择,但对于组织内部的一些事实调查也可以。 我想知道是否有人对这样做的有效性,陷阱或其他事情有任何想法。特别感谢您提供参考,因为我的同事们需要说服力! 非常感谢Chris B 编辑- 是的,它是经过验证的具有已知心理特征的量表。 如果这是正确的放置方式,则它是一维的并且具有子刻度。 我将在子级别和总级别(而不是项目级别)进行工作。 30个项目,大约40-60个人。 干杯!

6
关于为什么从20,000次扔掉10,000个头部的统计论点表明数据无效
假设我们反复抛硬币,而且知道正面和反面的数量应该大致相等。当我们看到10个正面和10个反面的结果,总共进行20次抛掷时,我们相信结果,并倾向于认为硬币是公平的。 好吧,当您看到10000个头和10000个尾巴等总共20,000次抛掷的结果时,我实际上会质疑结果的有效性(实验者是否伪造了数据),因为我知道这比说结果更不可能10093头和9907头。 我的直觉背后的统计论据是什么?


2
某人会喜欢图像的可能性
我遇到以下问题: -我们设置了N个人 -我们设置了K张图片 -每个人都对一定数量的图片进行评分。一个人可能喜欢或不喜欢图像(这是仅有的两个可能性)。-问题是如何计算某些人喜欢特定图像的可能性。 我将举例说明我的直觉。 N = 4 K = 5 +表示该人喜欢该图像 -表示该人不喜欢该图像 0表示尚未向该人询问该图像,并且应该预测该值 x 1 2 3 4 5 1 + - 0 0 + 2 + - + 0 + 3 - - + + 0 4 - 0 - - - 人1可能喜欢图像3,因为人2具有相似的偏好,人2喜欢图像3。 人4可能不喜欢图像2,因为没有人喜欢它,另外人4不喜欢大多数图像。 有没有众所周知的方法可以用来计算这种可能性?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.