统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
置信区间与样本量?
我是统计和置信区间领域的新手。因此,这可能非常琐碎,甚至听起来很愚蠢。如果您能帮助我理解或指出一些可以更好地说明这一点的文献/文字/博客,我将不胜感激。 我在美国有线电视新闻网(CNN),福克斯新闻(Fox news),政治新闻(Poliitico)等各种新闻网站上看到了有关2012年美国总统大选的民意调查。每个机构都进行一些民意调查,并以以下形式报告一些统计数据: CNN:奥巴马的人气为X%,误差幅度为+/- x1%。样本数量600。FOX:奥巴马的受欢迎程度为Y%,误差幅度为+/- y1%。样本数量800。XYZ:Obama的受欢迎程度为Z%,误差范围为+/- z1%。样本数量300。 这是我的疑问: 我该如何决定信任哪一个?应该基于置信区间,还是应该假设由于Fox样本量较大,因此估计更为可靠吗?置信度迭代次数和样本数量之间是否存在隐式关系,以至于指定一个样本就不必指定另一个样本了? 我可以确定置信区间的标准偏差吗?如果是这样,它始终有效还是仅对某些分布有效(如高斯分布)? 有什么方法可以“合并”或“合并”以上三个估计,并获得我自己的估计以及置信区间?在这种情况下,我应主张多少样本数量? 我提到CNN / Fox只是为了更好地说明我的示例。我无意在这里开始民主党与共和党的辩论。 请帮助我理解我提出的问题。

1
线性回归模型的置信度和预测区间
好吧,所以我试图理解线性回归。我有一个数据集,看起来还不错,但是我很困惑。这是我的线性模型摘要: Coefficients: Estimate Std. Error t value Pr(>|t|) (Intercept) 0.2068621 0.0247002 8.375 4.13e-09 *** temp 0.0031074 0.0004779 6.502 4.79e-07 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ 0.01 ‘*’ 0.05 ‘.’ 0.1 ‘ ’ 1 Residual standard error: 0.04226 on 28 degrees of freedom Multiple R-squared: 0.6016, Adjusted R-squared: 0.5874 …
9 r  regression 

3
比较发生率
我想比较两组之间的发生率(一组没有疾病,一组有疾病)。 我打算计算发病率比率(IRR),即发病率组B /发病率组A,然后测试该比率是否等于1,最后计算IRR的95%CI间隔。 我在书中找到了一种计算95%CI的方法(Rosner's Fundamentals of Biostatistics): exp[log(IRR)±1.96(1/a1)+(1/a2)−−−−−−−−−−−−√]exp⁡[log⁡(IRR)±1.96(1/a1)+(1/a2)]\exp\left[\log(\text{IRR}) \pm 1.96\sqrt{(1/a_1)+(1/a_2)}\right] 其中,和是事件数。但是,这种近似值仅适用于足够大的样本量,我认为事件的数量很小(也许对于总体比较来说还可以)。a1a1a_1a2a2a_2 所以我认为我应该使用另一种方法。 我使用R和extraci包,发现可以使用poisson.test()。但是此函数有3种方法来定义两个侧面的p值:中心,minlike和blaker。 所以我的问题是: 使用比较泊松率的检验比较两个发生率比率im是否正确? 在使用来自确切代码包的R中的poisson.test函数时,哪种方法最好? 该小品的exactci说: 中心:是上面由1限定的单侧p值的最小值的2倍。名称“中心”是由相关的反转条件间隔(即中心间隔)引起的,即,它们保证真实参数小于小于(大于)100(1-)%置信区间的下(上)尾的概率。这被Hirji(2006)称为TST(较小尾法的两倍)。α/2α/2\alpha/2αα\alpha minlike:是可能性小于或等于观察到的可能性的结果概率之和。这被Hirji(2006)称为PB(基于概率)方法。 blaker:将观察到的较小尾巴的概率与相对尾巴的最小概率(不超过观察到的尾巴概率)相结合。Blaker(2000)提出了“ blaker”这个名字,该名字全面研究了有关置信区间的相关方法。这被Hirji(2006)称为CT(组合尾巴)方法。 我的数据是: Group A: Age group 1: 3 cases in 10459 person yrs. Incidence rate: 0.29 Age group 2: 7 cases in 2279 person yrs. Incidence rate: 3.07 Age group …

1
线性和逻辑回归的误差分布
对于连续数据,线性回归假设误差项分布为N(0,)Y=β1+β2X2+uY=β1+β2X2+uY=\beta_1+\beta_2X_2+uσ2σ2\sigma^2 1)我们是否假设Var(Y | x)同样是〜N(0,)?σ2σ2\sigma^2 2)Logistic回归中的这种误差分布是什么?当数据为每种情况下1条记录的形式,其中“ Y”为1或0时,误差项为分布的Bernoulli(即方差为p(1-p)),并且数据的形式为#从#次试验中获得成功,是否假设是二项式的(即方差为np(1-p)),其中p是Y为1的概率?

2
确定组中最大的贡献者
我对统计信息了解不多,请多多包涵。假设我有一组1000名工人。我想弄清楚谁是最努力的人,但我只能以一个小时的工作量为一组,以1-100人为单位来衡量完成的工作量。假设每个工人总是做相同数量的工作,那么在大量的试验和组合中,我能按谁最努力的方式对工人进行排名吗? 注意:这只是一个隐喻,因此不必担心实际运行测试,只需假设我已经有大量数据即可。 编辑: 当我说“假设每个工人总是做相同数量的工作”时,我的意思是每个人每天都做相同数量的工作。因此,乔伊每天将做大约100个工作单元,格雷格将做大约50个工作单元。问题是我只能观察小组完成的工作单元数。 更多编辑: 关于一次工作的工人数量及其工作频率。可能有许多工人同时工作。一些工人可能最终会比其他工人工作更多,也就是说,我们可以假设一些工人将近90%的时间在工作,而其他工人几乎永远不会。 我知道这很困难,但是我将拥有一个非常大的数据集,因此希望这会使它变得容易一些。 对于每个小时,我们知道哪些工人在工作以及完成了多少工作。从这些信息中,我想找出谁做得最多。 如果数据为JSON格式,则将如下所示: [ { "work_done": 12345, "Workers": [ "andy", "bob", "cameron", "david" ] }, { "work_done": 432, "Workers": [ "steve", "joe", "andy"] }, { "work_done": 59042, "Workers": [ "bob", "aaron", "michelle", "scott", "henry" ] }, ... ]

2
问题计算,解释子集和有关模型选择过程的一般问题
我想使用选择模型regsubsets()。我有一个名为olympiadaten的数据框(上传的数据:http : //www.sendspace.com/file/8e27d0)。我首先附加此数据框,然后开始分析,我的代码是: attach(olympiadaten) library(leaps) a<-regsubsets(Gesamt ~ CommunistSocialist + CountrySize + GNI + Lifeexp + Schoolyears + ExpMilitary + Mortality + PopPoverty + PopTotal + ExpEdu + ExpHealth, data=olympiadaten, nbest=2) summary(a) plot(a,scale="adjr2") summary(lm(Gesamt~ExpHealth)) 情节的屏幕截图: 现在的问题是,我想再次“手动”拟合最佳模型并进行查看,但是调整后的R平方的值与regsubsets输出中的值不同吗?其他模型也是如此,例如,当我在图形中执行最简单的模型时: summary(lm(Gesamt~ExpHealth)) 该图表示,它的调整后R平方应约为0.14,但是当我查看输出时,得到的值为0.06435。 这是输出summary(lm(Gesamt~ExpHealth)): Call: lm(formula = Gesamt ~ ExpHealth) Residuals: Min 1Q Median 3Q Max …


3
随机分配:为什么要打扰?
随机分配很有价值,因为它可以确保治疗与潜在结果的独立性。这就是如何导致对平均治疗效果的无偏估计。但是其他分配方案也可以系统地确保治疗与潜在结果的独立性。那么为什么我们需要随机分配呢?换句话说,与非随机分配方案相比,随机分配又有什么优点呢? 令为治疗分配的向量,其中每个元素为0(未分配给治疗的单位)或1(分配给治疗的单位)。在一个JASA制品,安格里斯特,Imbens,和Rubin(1996,446-47)说治疗分配是随机的,如果表示所有\ mathbf {c}和\ mathbf {c'},使得\ iota ^ T \ mathbf {c} = \ iota ^ T \ mathbf {c'},其中\ iota是一个所有元素等于1的列向量。ZZ\mathbf{Z}ZiZiZ_iPr(Z=c)=Pr(Z=c′)Pr(Z=c)=Pr(Z=c′)\Pr(\mathbf{Z} = \mathbf{c}) = \Pr(\mathbf{Z} = \mathbf{c'})cc\mathbf{c}c′c′\mathbf{c'}ιTc=ιTc′ιTc=ιTc′\iota^T\mathbf{c} = \iota^T\mathbf{c'}ιι\iota 换句话说,如果包括m个治疗分配的任何分配向量与包括m个治疗分配的任何其他向量一样有可能,则分配ZiZiZ_i是随机的。mmmmmm 但是,为了确保潜在结果与治疗分配的独立性,足以确保研究中的每个单元都具有相等的分配给治疗的可能性。即使大多数治疗分配向量的选择概率为零,也很容易发生这种情况。即,即使在非随机分配下也可能发生。 这是一个例子。我们想用四个单元运行一个实验,其中两个单元将被正确处理。有六个可能的分配向量: 1100 1010 1001 0110 0101 0011 每个数字中的第一个数字表示是否已治疗第一个单元,第二个数字表示是否已治疗第二个单元,依此类推。 假设我们进行了一个实验,其中排除了赋值向量3和4的可能性,但是其中每个其他向量的选择机会均等(25%)。从AIR的意义上讲,该方案不是随机分配。但可以预料的是,这将导致平均治疗效果的无偏估计。那绝不是偶然的。任何给予受试者相等分配给治疗可能性的分配方案,将允许对ATE进行无偏估计。 那么:为什么我们需要AIR的随机分配?我的论点植根于随机推理。如果有人以基于模型的推理来思考,那么AIR的定义似乎更可辩护吗?

1
分阶段控制错误发现率
我有一个尺寸为三维表。表格中的每个单元格都是假设检验。在第三维上对表进行切片会产生组假设检验,这些检验在各组之间独立但在组内相关。最初,我以为可以同时使用Benjamini-Hochberg过程控​​制所有假设检验的错误发现率。这是解决这个问题的合理方法吗?我的第二个想法是控制表格第三个维度中每个切片内的错误发现率,然后在此之后进行其他某种校正。有人有关于这种程序的更多信息吗?6 × 6 × 816×6×816\times6\times81818181

4
何时使用非参数回归?
我在SAS中使用PROC GLM来拟合以下形式的回归方程 ÿ=b0+b1个X1个+b2X2+b3X3+b4Ťÿ=b0+b1个X1个+b2X2+b3X3+b4Ť Y = b_0 + b_1X_1 + b_2X_2 + b_3X_3 + b_4t 产生的残差的QQ图表示偏离正常值。任何变换都无法使残差正常。ÿÿY 此时,我可以安全地切换到非参数方法,例如PROC LOESS。 我已经使用过PROC LOESS,并且看起来比PROC GLM更好。但是我对非参数回归没有太多的了解。我不知道何时选择非参数回归而不是参数回归。 有人可以帮我弄这个吗? 我将继续添加另一个问题。以下是模型中我的变量的描述。 有时我得到负的预测成本。这根本不符合逻辑。我该如何解决这个问题?ÿ= 医疗费用X1个= 注射次数X2= 手术数量X3= 物理疗法的数量t = 时间ÿ=医疗费用X1个=注射次数X2=手术数量X3=物理疗法的数量Ť=时间 Y =\text{cost of medical care}\\ X_1 =\text{number of injections}\\ X_2 =\text{number of surgeries}\\ X_3 =\text{number of physical therapies}\\ t =\text{time}

3
如何使用R gbm和distribution =“ adaboost”?
文档指出具有分布=“ adaboost”的R gbm可以用于0-1分类问题。考虑以下代码片段: gbm_algorithm <- gbm(y ~ ., data = train_dataset, distribution = "adaboost", n.trees = 5000) gbm_predicted <- predict(gbm_algorithm, test_dataset, n.trees = 5000) 可以在predict.gbm文档中找到 返回预测向量。默认情况下,预测的尺度为f(x)。 但是,对于分配=“ adaboost”的情况,具体比例尚不清楚。 任何人都可以帮助解释predict.gbm返回值并提供转换为0-1输出的想法吗?
9 r  gbm 

2
为什么我的第一台PC解释的方差量如此接近平均成对相关性?
第一主成分和相关矩阵中的平均相关之间是什么关系? 例如,在经验应用中,我观察到平均相关性几乎与第一主成分(第一特征值)的方差与总方差(所有特征值之和)之比相同。 有数学关系吗? 以下是实证结果图表。其中,相关性是在15天滚动窗口中计算的DAX股指成分收益之间的平均相关性,而解释的方差是在15天滚动窗口中计算的第一主成分所解释的方差的份额。 可以用CAPM之类的常见风险因素模型来解释吗?

1
“以来
简短的问题:为什么如此? 长问题: 很简单,我试图找出第一个方程式的理由。我正在阅读的书的作者(如果需要,请在此处提供,但不是必需的)声称以下内容: 由于存在近似高斯的假设,我们可以这样写: p0(ξ)= Aϕ (ξ)e x p (一个n + 1ξ+ (一个n + 2+1个2)ξ2+∑我= 1ñ一个一世G一世(ξ))p0(ξ)=Aϕ(ξ)exp(an+1ξ+(an+2+12)ξ2+∑i=1naiGi(ξ)) p_0(\xi) = A \; \phi(\xi) \; exp( a_{n+1}\xi + (a_{n+2} + \frac{1}{2})\xi^2 + \sum_{i=1}^{n} a_i G_i(\xi)) 其中是具有最大熵的观测数据的PDF,假设您仅观测到一系列期望(简单数),其中和是标准化高斯变量的PDF,即0个均值和单位方差。p0(ξ)p0(ξ)p_0(\xi)C一世,我= 1 。。。ñci,i=1...nc_i, i = 1 ... nC一世= E {G一世(ξ)}ci=E{Gi(ξ)}c_i = \mathbb{E}\{G_i(\xi)\}ϕ (ξ)ϕ(ξ)\phi(\xi) 所有这些都是他将上述方程式作为简化PDF的出发点,我知道他是怎么做的,但我没有得到他如何证明上述方程式的正当性,即,起点。p0(ξ)p0(ξ)p_0(\xi) 我试图保持简短,以免混淆任何人,但是如果您需要其他详细信息,请在评论中让我知道。谢谢!

1
如何比较观察到的事件与预期的事件?
假设我有一个频率为4个可能的事件的样本: Event1 - 5 E2 - 1 E3 - 0 E4 - 12 并且我具有发生事件的预期概率: p1 - 0.2 p2 - 0.1 p3 - 0.1 p4 - 0.6 利用我四个事件的观测频率之和(18),我可以计算事件的预期频率,对吗? expectedE1 - 18 * 0.2 = 3.6 expectedE2 - 18 * 0.1 = 1.8 expectedE1 - 18 * 0.1 = 1.8 expectedE1 - …
9 r  statistical-significance  chi-squared  multivariate-analysis  exponential  joint-distribution  statistical-significance  self-study  standard-deviation  probability  normal-distribution  spss  interpretation  assumptions  cox-model  reporting  cox-model  statistical-significance  reliability  method-comparison  classification  boosting  ensemble  adaboost  confidence-interval  cross-validation  prediction  prediction-interval  regression  machine-learning  svm  regularization  regression  sampling  survey  probit  matlab  feature-selection  information-theory  mutual-information  time-series  forecasting  simulation  classification  boosting  ensemble  adaboost  normal-distribution  multivariate-analysis  covariance  gini  clustering  text-mining  distance-functions  information-retrieval  similarities  regression  logistic  stata  group-differences  r  anova  confidence-interval  repeated-measures  r  logistic  lme4-nlme  inference  fiducial  kalman-filter  classification  discriminant-analysis  linear-algebra  computing  statistical-significance  time-series  panel-data  missing-data  uncertainty  probability  multivariate-analysis  r  classification  spss  k-means  discriminant-analysis  poisson-distribution  average  r  random-forest  importance  probability  conditional-probability  distributions  standard-deviation  time-series  machine-learning  online  forecasting  r  pca  dataset  data-visualization  bayes  distributions  mathematical-statistics  degrees-of-freedom 

1
参数化Behrens-Fisher分布
Seock-Ho Kim和艾伦·科恩(Allen S. Cohen)撰写的“关于贝伦斯-费舍尔问题:评论” 教育与行为统计杂志,第23卷,第4期,1998年冬季,第356-377页 我正在看这个东西,它说: Fisher(1935,1939)选择统计量 [其中是通常的单样本统计量],其中位于第一象限中,而 [。。。]的分布是Behrens-Fisher分布,由三个参数,和,τ=δ−(x¯2−x¯1)s21/n1+s22/n2−−−−−−−−−−−√=t2cosθ−t1sinθτ=δ−(x¯2−x¯1)s12/n1+s22/n2=t2cos⁡θ−t1sin⁡θ \tau = \frac{\delta-(\bar x_2 - \bar x_1)}{\sqrt{s_1^2/n_1+s_2^2/n_2}} = t_2\cos\theta - t_1\sin\theta titit_ittti=1,2i=1,2i=1,2θθ\thetatanθ=s1/n1−−√s2/n2−−√.(13)(13)tan⁡θ=s1/n1s2/n2. \tan\theta = \frac{s_1/\sqrt{n_1}}{s_2/\sqrt{n_2}}.\tag{13} ττ\tauν1ν1\nu_1ν2ν2\nu_2θθ\theta 对于,参数先前已定义为。νiνi\nu_ini−1ni−1n_i-1i=1,2i=1,2i=1,2 现在,这里看不到的是,这两个总体的平均值是,,它们的差是,因此是和两个统计量。样本SD和是可观察的,并用于定义,因此是可观察的统计信息,而不是不可观察的总体参数。但是我们看到它被用作这个分布族的参数之一!δδ\deltaμ1μ1\mu_1μ2μ2\mu_2δδ\deltaττ\tauttts1s1s_1s2s2s_2θθ\thetaθθ\theta 可能是他们应该说参数是的反正切值,而不是的反正切值?σ1/n1−−√σ2/n2−−√σ1/n1σ2/n2\dfrac{\sigma_1/\sqrt{n_1}}{\sigma_2/\sqrt{n_2}}s1/n1−−√s2/n2−−√s1/n1s2/n2\dfrac{s_1/\sqrt{n_1}}{s_2/\sqrt{n_2}}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.