统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
随着尺寸增加,正态分布的密度
我要问的问题是:正态分布均值的1个标准差内的样本比例如何随着变量数量的增加而变化? (几乎)所有人都知道,在一维正态分布中,可以在平均值的1个标准偏差内找到68%的样本。那么在2、3、4,...尺寸上呢?我知道它变少了……但是多少(精确地)呢?拥有一张显示1、2、3 ... 10尺寸以及1、2、3 ... 10 SD尺寸的数字的表格会很方便。谁能指出这样的桌子? 还有一点背景-我有一个传感器,可以提供多达128个通道的数据。每个通道都受到(独立)电噪声的影响。当我感觉到校准对象时,我可以对足够多的测量求平均值,并获得128个通道的平均值以及128个单独的标准偏差。 但是...就单个瞬时读数而言,数据的响应不像128个单个读数那样,而是像一个(最多)128维矢量量的单个读数一样。当然,这是处理我们获取的一些关键读数的最佳方法(通常是128个中的4-6个)。 我想了解一下此向量空间中的什么是“正常”变化以及什么是“离群值”。我确定我已经见过一张我所描述的表格,该表格适用于这种情况-有人可以指向一张吗?

4
如果一个变量的标准偏差为0,则相关性如何?
据我了解,我们可以通过使用等式对协方差进行归一化来获得相关性 ρi,j=cov(Xi,Xj)σiσjρi,j=cov(Xi,Xj)σiσj\rho_{i,j}=\frac{cov(X_i, X_j)}{\sigma_i \sigma_j} 其中是的标准偏差。 X我σi=E[(Xi−μi)2]−−−−−−−−−−−√σi=E[(Xi−μi)2]\sigma_i=\sqrt{E[(X_i-\mu_i)^2]}XiXiX_i 我担心的是标准偏差等于零怎么办?是否有任何条件可以保证它不能为零? 谢谢。

2
功能数量的增加会导致准确性下降,但prec / recall会增加
我是机器学习的新手。目前,我正在使用Naive Bayes(NB)分类器,通过NLTK和python将小文本分为正,负或中性3类。 在进行了一些测试之后,使用由300,000个实例(16,924个正值,7,477个负值和275,599个中性值)组成的数据集,我发现当我增加特征数量时,精度下降,但是正负类的精度/召回率却上升。这是NB分类器的正常行为吗?我们可以说使用更多功能会更好吗? 一些数据: Features: 50 Accuracy: 0.88199 F_Measure Class Neutral 0.938299 F_Measure Class Positive 0.195742 F_Measure Class Negative 0.065596 Features: 500 Accuracy: 0.822573 F_Measure Class Neutral 0.904684 F_Measure Class Positive 0.223353 F_Measure Class Negative 0.134942 提前致谢... 编辑2011/11/26 我已经使用朴素贝叶斯分类器测试了3种不同的特征选择策略(MAXFREQ,FREQENT,MAXINFOGAIN)。首先是每类的准确性和F1度量: 然后,在将MAXINFOGAIN与前100个和前1000个功能一起使用时,我用增量训练集绘制了火车误差和测试误差: 因此,在我看来,尽管使用FREQENT可以获得最高的准确性,但是最好的分类器是使用MAXINFOGAIN的分类器,对吗?吗?使用前100个功能时,我们会产生偏差(测试错误接近训练错误),添加更多训练示例将无济于事。为了改善这一点,我们将需要更多功能。具有1000个功能,偏差会减少,但误差会增加...这样可以吗?我是否需要添加更多功能?我真的不知道该怎么解释... 再次感谢...

6
如何检测由于“政策”变更而导致的时间序列数据的重大变更?
我希望这是张贴此文章的正确地点,我考虑过将其张贴在怀疑论者身上,但我认为他们只是说这项研究在统计上是错误的。我对这个问题的另一面感到好奇,那就是如何正确地做到这一点。 作者在网站Quantified Self上发布了一项实验结果,该实验是对一段时间内自己测量的一些输出指标进行比较,并比较了突然停止喝咖啡前后的比较。对结果进行了主观评估,作者认为他有证据表明时间序列有变化,并且与政策的变化有关(饮用咖啡) 这让我想起了经济模型。我们只有一个经济体(目前正在关注),因此经济学家通常基本上在进行n = 1个实验。因此,几乎可以肯定的是,随着时间的推移数据是自相关的。美联储表示,经济学家通常在观察其启动一项政策的过程,并试图确定时间序列是否发生变化,这有可能是由于该政策造成的。 根据数据确定时间序列是增加还是减少的适当测试是什么?我需要多少数据?存在哪些工具?我最初的谷歌搜索建议使用马尔可夫切换时间序列模型,但并不是我的谷歌搜索技能让我无法使用该技术的名称来做任何事情。

9
非负数据的标准偏差可以超过平均值吗?
我有一些三角3D网格。三角形区域的统计信息是: 最低0.000 最高2341.141 均值56.317 标准开发98.720 那么,当数字像上面那样工作时,这是否意味着对于标准偏差特别有用或表明在计算标准偏差时存在错误?这些区域肯定远非正常分布。 就像某人在以下他们的回应之一中提到的那样,令我感到非常惊讶的是,数字均值仅用一个标准差就能得出负数,从而超出了法律范围。 谢谢

5
有什么好资源可以比较不同分类器的优缺点?
最好的现成2类分类器是什么?是的,我想这是一百万美元的问题,是的,我知道没有免费的午餐定理,而且我还阅读了前面的问题: 什么是最适合您的应用程序的现成2类分类器? 和最差的分类 不过,我仍然有兴趣阅读有关该主题的更多信息。 什么是良好的信息来源,包括对不同分类器的特征,优势和特征的一般比较?

1
如何使用ggplot绘制楼梯台阶功能?
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我有这样的图: 用于生成它的R代码是: DF <- data.frame(date = as.Date(runif(100, 0, 800),origin="2005-01-01"), outcome = rbinom(100, 1, 0.1)) DF <- DF[order(DF$DateVariable),] #Sort by date DF$x <- seq(length=nrow(DF)) #Add case numbers (in order, since sorted) DF$y <- cumsum(DF$outcome) library(ggplot2) ggplot(DF, aes(x,y)) + geom_path() + #Ploting scale_y_continuous(name= "Number of failures") + scale_x_continuous(name= "Operations performed") 我想要这样的东西: …

1
时间序列邻接矩阵的本征函数?
考虑一个简单的时间序列: > tp <- seq_len(10) > tp [1] 1 2 3 4 5 6 7 8 9 10 我们可以为此时间序列计算一个邻接矩阵,该矩阵表示样本之间的时间链接。在计算此矩阵时,我们在时间0处添加了一个虚构位置,该观测值与时间1处的第一个实际观测值之间的链接称为链接0。在时间1和时间2之间,链接为链接1,依此类推。因为时间是定向过程,所以站点连接到站点“上游”的链接(受其影响)。因此,每个站点都连接到链接0,但链接9仅连接到站点10;它临时发生在除站点10之外的每个站点之后。这样定义的邻接矩阵如下创建: > adjmat <- matrix(0, ncol = length(tp), nrow = length(tp)) > adjmat[lower.tri(adjmat, diag = TRUE)] <- 1 > rownames(adjmat) <- paste("Site", seq_along(tp)) > colnames(adjmat) <- paste("Link", seq_along(tp)-1) > adjmat Link 0 …

3
如何估计一个总体中的随机成员比另一个总体中的随机成员“更好”的概率?
假设我从两个不同的人群中取样。如果我测量每个成员完成一项任务需要多长时间,则可以轻松估算每个总体的均值和方差。 如果我现在假设与每个人口中的一个人进行随机配对,我是否可以估计第一个比第二个更快的概率? 我确实有一个具体的例子:这些测量值是我从A骑自行车到B的时间,这些人群代表我可以采取的不同路线;我正在尝试找出下一个循环的拾取路线A的速度比拾取路线B更快的概率。当我实际执行该循环时,我为我的样品组设置了另一个数据点:)。 我知道这是尝试解决此问题的一种极其简单的方法,尤其是因为在任何一天,风比其他任何时间都更可能影响我的时间,所以请告诉我您是否认为我在问错误的问题...

2
什么是“消息传递方法”?
我对什么是消息传递方法有一个模糊的认识:一种算法,该算法通过在所有其他因子的所有近似值的基础上迭代构建分布的每个因子的近似值来构建分布的近似值。 我相信这两个都是变体消息传递和期望传播的示例。什么是更明确/正确的消息传递算法?欢迎参考。

1
如何设置和解释ANOVA与R中的汽车包装的对比?
假设我有一个想要进行ANOVA的简单2x2阶乘实验。像这样: d <- data.frame(a=factor(sample(c('a1','a2'), 100, rep=T)), b=factor(sample(c('b1','b2'), 100, rep=T))); d$y <- as.numeric(d$a)*rnorm(100, mean=.75, sd=1) + as.numeric(d$b)*rnorm(100, mean=1.2, sd=1) + as.numeric(d$a)*as.numeric(d$b)*rnorm(100, mean=.5, sd=1) + rnorm(100); 在没有重大交互作用的情况下,默认情况下(即contr.treatment)的输出Anova()是的a所有级别b和的b所有级别的总体重要性a,对吗? 我应该如何指定一个对比,让我来测试效果的意义a与b在B1水平保持恒定,效果a与b被关押在B2水平不变,并相互作用的a:b?
15 r  anova  contrasts 


2
R中内核密度估计中“ pdf”下的区域
我正在尝试在R中使用' density '函数进行内核密度估计。我有一些困难,解释结果和比较不同的数据集,因为它似乎在曲线下面积不一定1.对于任何概率密度函数(PDF) ,我们需要有区域∫ ∞ - ∞ φ (x )d x = 1。我假设内核密度估计报告pdf。我使用integrate.xy从sfsmisc估计曲线下面积。ϕ(x)ϕ(x)\phi(x)∫∞−∞ϕ(x)dx=1∫−∞∞ϕ(x)dx=1\int_{-\infty}^\infty \phi(x) dx = 1 > # generate some data > xx<-rnorm(10000) > # get density > xy <- density(xx) > # plot it > plot(xy) > # load the library > library(sfsmisc) > integrate.xy(xy$x,xy$y) [1] 1.000978 > …

4
如何改善对声誉对投票的影响的分析?
最近,我对声誉对投票的影响进行了一些分析(请参阅博客文章),随后我对可能更具启发性(或更合适)的分析和图表提出了一些问题。 所以有几个问题(可以随意回答任何人,而忽略其他人): 在当前的化身中,我并不是说要居中。我认为这样做是为了使散点图中出现负相关的错误外观,因为有更多的帖子发布到帖子数的较低端(您会在Jon Skeet面板中看到这种情况,仅在凡人用户中不会发生面板)。不以帖子的平均数为中心是否不合适(因为我的意思是以每位用户的平均分数为中心)? 从图中可以明显看出,分数高度偏右(并且平均居中没有任何改变)。在拟合回归线时,我同时拟合了线性模型和使用Huber-White砂纸的模型,该模型存在误差(通过rlmMASS R软件包提供),并且对斜率估计没有任何影响。我是否应该考虑对数据进行转换而不是进行稳健的回归?注意,任何转换都必须考虑0和负分数的可能性。还是应该使用其他类型的模型代替OLS来计数数据? 我相信一般而言,可以改进最后两个图形(并且也与改进的建模策略有关)。以我(厌倦的)观点,我怀疑声誉影响是否是真实的,它们会在海报的历史中很早就实现(我想如果是真的,这些可能会被重新考虑:“您给出了很好的答案,所以现在我将投票支持您所有的职位”而不是“以总分获得声誉”效果)。考虑到过度绘图,如何创建图形以证明这是否正确?我认为可能要证明这一点的一个好方法是适合表格的模型。 Y=β0+β1(X1)+α1(Z1)+α2(Z2)⋯αk(Zk)+γ1(Z1∗X1)⋯γk(Zk∗X1)+ϵY=β0+β1(X1)+α1(Z1)+α2(Z2)⋯αk(Zk)+γ1(Z1∗X1)⋯γk(Zk∗X1)+ϵY = \beta_0 + \beta_1(X_1) + \alpha_1(Z_1) + \alpha_2(Z_2) \cdots \alpha_k(Z_k) + \gamma_1(Z_1*X_1) \cdots \gamma_k(Z_k*X_1) + \epsilon 其中YYY是score - (mean score per user)(与当前散点图相同),X1X1X_1是post number,并且Z1⋯ZkZ1⋯ZkZ_1 \cdots Z_k是表示某个任意范围的帖子编号的虚拟变量(例如,如果帖子编号为,则Z1Z1Z_1等于Z如果帖子号为etc,则等于2。β 0和ε分别为隆重截距和误差项。然后,我会观察一下估计γ11 through 25Z2Z2Z_2126 through 50β0β0\beta_0ϵϵ\epsilonγγ\gamma确定是否在海报历史的早期(或以图形方式显示)声誉效应。这是合理(且适当)的方法吗? 像这样的散点图(例如黄土或样条线)适合使用某种类型的非参数平滑线,但是我对样条线的实验没有发现任何启发性的内容(在张贴者历史的早期,任何关于阳性效果的证据都是轻微而温和的)到我包含的样条线数量)。由于我有一个假设,即影响会在较早发生,因此我上面的建模方法是否比样条线更合理? 还要注意,尽管我已经疏通了所有这些数据,但是仍然有很多其他社区需要检查(还有一些类似的超级用户和serverfault可以借鉴类似的样本),因此在将来提出建议是很合理的我使用保留样本分析任何关系的分析。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.