统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
简单线性回归的报告结果:要包括哪些信息?
我刚刚在Genstat中执行了一些(非常简单的)线性回归,并希望在报告中包含输出的简要且有意义的摘要。我不确定我应该包括哪些信息或多少信息。 Genstat输出的主要部分如下所示: Summary of analysis Source d.f. s.s. m.s. v.r. F pr. Regression 1 8128935. 8128935. 814.41 <.001 Residual 53 529015. 9981. Total 54 8657950. 160332. Percentage variance accounted for 93.8 Standard error of observations is estimated to be 99.9. Estimates of parameters Parameter estimate s.e. t(53) t pr. Constant …


1
人们为什么使用“证据权重”一词,它与“逐点相互信息”有何区别?
在这里,“证据权重”(WOE)是已发表的科学和政策制定文献中的常用术语,在风险评估的背景下最常见,其定义如下: w(e:h)=logp(e|h)p(e|h¯¯¯)w(e:h)=log⁡p(e|h)p(e|h¯)w(e : h) = \log\frac{p(e|h)}{p(e|\overline{h})} 其中是证据,是假设。eeehhh 现在,我想知道PMI(逐点相互信息)的主要区别是什么 pmi(e,h)=logp(e,h)p(e)∗p(h)pmi(e,h)=log⁡p(e,h)p(e)∗p(h)pmi(e,h)=\log\frac{p(e,h)}{p(e)*p(h)}

2
在R中从因子转换为数值变量时遇到问题[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 7年前关闭。 我想将因子变量转换为数字变量,但as.numeric没有达到我期望的效果。 下面,我将基于原始变量获取该变量的数字版本的摘要统计信息。均值以1递增。...(他推测)因子的水平同时具有名称和数字,并且我希望新变量的值来自于何时as.numeric使用该数字的名称? > describe.by(as.numeric(df$sch), df$sch) group: var n mean sd median trimmed mad min max range skew kurtosis se 1 1 5389 1 0 1 1 0 1 1 0 NaN NaN 0 --------------------------------------------------------- group: 001 var n mean sd median trimmed mad min max range …

2
比较相关系数
我有两组数据,其中78个和35个样本的值约为250.000。一些样本是一个家庭的成员,这可能会影响数据。我已经计算了成对相关性,它在0.7到0.95之间变化,但是我想知道家庭内部和家庭之间的相关系数是否存在显着差异?做这个的最好方式是什么?谢谢

1
置信区间和可信区间何时重合的示例
在有关可信间隔的Wikipedia文章中,它说: 对于单个参数和可以在单个足够统计量中汇总的数据的情况,可以证明,如果未知参数是位置参数(即,前向概率函数具有以下形式),则可信区间和置信区间将重合Pr(x |μ)= f(x −μ)),先验是均匀的平坦分布; [5]并且如果未知参数是比例参数(即,前向概率函数的形式为Pr(x) | s)= f(x / s)),并带有Jeffreys的先验[5]-后者是后继的,因为采用这种比例参数的对数会将其转换为具有均匀分布的位置参数。但是,这些情况显然是特殊的(尽管很重要)。一般而言,不能做到等价。” 人们可以举一些具体的例子吗?95%CI何时真正对应于“ 95%机会”,从而“违反” CI的一般定义?


1
GLM使用哪种残差和库克距离?
有人知道库克距离的公式是什么吗?最初的库克距离公式使用学生化残差,但是为什么R使用std。计算GLM的库克距离图时的皮尔逊残差。我知道没有为GLM定义学生化残差,但是用于计算Cook距离的公式如何? 假设以下示例: numberofdrugs <- rcauchy(84, 10) healthvalue <- rpois(84,75) test <- glm(healthvalue ~ numberofdrugs, family=poisson) plot(test, which=5) 库克距离的公式是什么?换句话说,计算红色虚线的公式是什么?标准化皮尔逊残差的公式从何而来?

2
通过名称在R中查找列索引[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 在数据框中,我想按名称获取列的索引。例如: x <- data.frame(foo=c('a','b','c'),bar=c(4,5,6),quux=c(4,5,6)) 我想知道“酒吧”的列索引。 我想出了以下内容,但看起来不太雅致。我缺少更直接的内置函数吗? seq(1,length(names(x)))[names(x) == "bar"] [1] 2
11 r 


1
向下拖动公式时如何阻止excel更改范围?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 7年前关闭。 我正在尝试规范化Excel电子表格中的一组数据列。 我需要获取值,以便一列中的最大值是= 1,最小值是=到0,因此我想出了以下公式: =(A1-MIN(A1:A30))/(MAX(A1:A30)-MIN(A1:A30)) 这似乎工作正常,但是当我向下拖动公式以填充其下方的单元格时,现在只会A1增加,但A1:A30也会增加。 有没有一种方法可以在更新我感兴趣的数字时锁定范围? 我尝试将Max和min放在另一个单元格中并对其进行引用,但它仅引用Max和min所在的单元格下的单元格,并且由于除零之外我得到了除零错误。
11 excel 

1
ARIMA(1,1,0)系列的仿真
我已经将ARIMA模型拟合到原始时间序列,并且最佳模型是ARIMA(1,1,0)。现在,我想从该模型中模拟系列。我编写了简单的AR(1)模型,但是我不明白如何在ARI(1,1,0)模型中调整差异。以下用于AR(1)系列的R代码是: phi= -0.7048 z=rep(0,100) e=rnorm(n=100,0,0.345) cons=2.1 z[1]=4.1 for (i in 2:100) z[i]=cons+phi*z[i-1]+e[i] plot(ts(Y)) 我如何在上面的代码中包括差异项ARI(1,1)。在这方面,任何人都可以帮助我。
11 r  time-series  arima 

2
两个加权随机变量的方差
让: 随机变量的标准偏差A = σ1个= 5A=σ1=5A =\sigma_{1}=5 随机变量的标准偏差B = σ2= 4B=σ2=4B=\sigma_{2}=4 那么A + B的方差为: V一个[R (W ^1个A + w2B )= w21个σ21个+ w22σ22+ 2 瓦1个w2p1 ,2σ1个σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2p1,2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}p_{1,2}\sigma_{1}\sigma_{2} 哪里: 是两个随机变量之间的相关性。p1 ,2p1,2p_{1,2} 是随机变量A的权重w1个w1w_{1} 是随机变量B的权重w2w2w_{2} w1个+ w2= 1w1+w2=1w_{1}+w_{2}=1 下图绘制了A和B的方差,其中A的权重从0变为1,相关性为-1(黄色),0(蓝色)和1(红色)。 当相关为1时,公式如何得出直线(红色)?据我所知,当,公式简化为:p1 ,2= 1p1,2=1p_{1,2}=1 Var(w1A+w2B)=w21σ21+w22σ22+2w1w2σ1σ2Var(w1A+w2B)=w12σ12+w22σ22+2w1w2σ1σ2Var(w_{1}A+w_{2}B)= w_{1}^{2}\sigma_{1}^{2}+w_{2}^{2}\sigma_{2}^{2} +2w_{1}w_{2}\sigma_{1}\sigma_{2} y=mx+cy=mx+cy=mx+c 谢谢。

4
您如何测试k均值的实现?
免责声明:我在Stackoverflow上发布了此问题,但我认为这可能更适合此平台。 您如何测试自己的多维数据集的k-means实现? 我正在考虑对数据运行一个已经存在的实现(即Matlab),并将结果与​​我的算法进行比较。但这将要求两种算法的工作原理大致相同,并且两种结果之间的映射可能并非易事。 你有更好的主意吗?

3
如何对大量样本进行t检验?
我有两个人口,一个人口N = 38,704(观察数),另一个人口N = 1,313,662。这些数据集有约25个变量,所有变量都是连续的。我考虑了每个数据集中的每个平均值,并使用公式计算了测试统计量 t =平均差/标准差 问题在于自由度。通过df = N1 + N2-2的公式,我们将拥有表无法处理的更多自由度。有什么建议吗?如何在此处检查t统计量。我知道t检验用于处理样品,但是如果我们将其应用于大样品该怎么办。
11 t-test 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.