统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何处理固定效应模型中遗漏的虚拟变量?
我使用的是固定效应模型为我的面板数据(9岁,1000+ OBS),由于我的豪斯曼测试指示的值。当我为公司所包括的行业添加虚拟变量时,它们总是被忽略。我知道不同行业群体之间的DV(披露指数)差异很大。但是在使用Stata时,我无法在模型中使用它们。(Pr &gt; χ2)&lt; 0.05(P[R&gt;χ2)&lt;0.05(Pr>\chi^2)<0.05 有什么建议如何解决这个问题?又为什么省略它们?

4
在R中动画化更改内核宽度的效果
我在R中有一些数据,存储在列表中。认为 d &lt;- c(1,2,3,4) 尽管这不是我的数据。如果我输入命令 plot(density(d, kernel="gaussian", width=1)) 然后我得到核概率密度估计,其中核是标准法线。如果我将1替换为其他数字,则图片当然会改变。 我想做的是创建一个视频或动画,其中每个帧都是这样的图,但是内核的带宽随帧的不同而变化,从而显示出改变带宽的效果。我怎样才能做到这一点? (如果不能在此问关于R的问题,我深表歉意。)

1
显着性检验在基线时比较随机分组是否有意义?
许多随机对照试验(RCT)论文报告了在随机分配之后/之前对基准参数进行的显着性测试,以显示各组确实相似。这通常是“基线特征”表的一部分。但是,重要性检验可以衡量偶然发现观察到的(或更强的)差异的可能性,不是吗?而如果测试显著我们的结论是有真正的区别,因为范围的随机差异不太可能。当我们知道任何差异都必须归因于偶然性时,重要性检验在随机化后是否有意义?



1
模型似然不显着高于null时(GAM)回归系数的意义
我正在使用R包gamlss运行基于GAM的回归,并假设数据的beta分布为零。我只有一个解释变量在我的模型,所以它基本上是:mymodel = gamlss(response ~ input, family=BEZI)。 该算法给了我系数 ķkk 对于解释变量对平均值的影响(μμ\mu)和相关的p值 k (输入)= 0k(input)=0k(\text{input})=0, 就像是: Mu link function: logit Mu Coefficients: Estimate Std. Error t value Pr(&gt;|t|) (Intercept) -2.58051 0.03766 -68.521 0.000e+00 input -0.09134 0.01683 -5.428 6.118e-08 如上例所示, k (输入)= 0k(input)=0k(\text{input})=0 被高信心地拒绝了。 然后,我运行空模型:null = gamlss(response ~ 1, family=BEZI)并使用似然比检验比较似然: p=1-pchisq(-2*(logLik(null)[1]-logLik(mymodel)[1]), df(mymodel)-df(null)). 在很多情况下,我得到 p …

4
什么测试可以比较社区组成?
希望这个新手问题是该网站的正确问题: 假设我想比较两个地点A,B的生态群落组成。我知道这三个地点都有狗,猫,牛和鸟,因此我在每个地点都采样了它们的丰度(我实际上没有“每个位置的每个动物的预期“数量”)。 如果我算一下,每个位置的每只动物有五只,那么A和B非常“相似”(实际上,它们是“相同”)。 但是,如果我在A站点发现100条狗,5只猫,2头牛和3只鸟。在B站点发现5条狗,3只猫,75头牛和2只鸟。那么我会说A和B站点“不同” ,即使它们具有完全相同的物种组成。 (我阅读了Sorensen's和Bray-Curtis指数,但看起来他们只考虑狗,猫等的不在/在场,而不考虑它们的丰度。) 是否有统计检验确定这一点?

8
图形百科全书
我必须构建一个有关流量测量,预测等的多用户Web应用程序。在这一点上,我知道我将使用条形图和饼图。 不幸的是,这些图表类型在表达我收集和计算的所有数据方面并不丰富。 我正在寻找图形图表的集合。如果我必须买书或其他任何东西,也可以。我需要找到一些带有说明的图形样本来启发我。 您知道这样的资源吗?您对我有什么建议吗?

1
是否可以对
首先,我的意思是说,通过分析积分,可以解决积分问题,而不是像数值分析(例如梯形,Gauss-Legendre或Simpson规则)来解决这个问题? 我有一个函数F(x )= x g(x ; μ ,σ)f(x)=xg(x;μ,σ)\newcommand{\rd}{\mathrm{d}}f(x) = x g(x; \mu, \sigma)其中 G(x ; μ ,σ)= 1σx2π−−√e−12σ2(log(x)−μ)2g(x;μ,σ)=1σx2πe−12σ2(log⁡(x)−μ)2 g(x; \mu, \sigma) = \frac{1}{\sigma x \sqrt{2\pi}} e^{-\frac{1}{2\sigma^2}(\log(x) - \mu)^2} 是对数正态分布的概率密度函数,其中参数μμ\mu和σσ\sigma。在下面,我将把符号缩写为g(x)g(x)g(x)并将G(x)G(x)G(x)用作累积分布函数。 我需要计算积分 ∫baf(x)dx.∫abf(x)dx. \int_{a}^{b} f(x) \,\rd x \>. 目前,我正在使用Gauss-Legendre方法进行数值积分。因为我需要多次运行,所以性能很重要。在研究优化数值分析/其他部分之前,我想知道是否有任何积分规则可以解决这个问题。 我尝试应用“按部分积分”规则,然后我又陷入了困境, ∫udv=uv−∫vdu∫udv=uv−∫vdu\int u \,\mathrm{d}v = u v - \int v \mathrm{d}u。 u=x⟹d u …


1
有关使用Quantreg识别曲线形状的建议
我正在使用quantreg程序包使用数据集中我值的第99个百分位数来建立回归模型。根据我之前提出的stackoverflow 问题的建议,我使用了以下代码结构。 mod &lt;- rq(y ~ log(x), data=df, tau=.99) pDF &lt;- data.frame(x = seq(1,10000, length=1000) ) pDF &lt;- within(pDF, y &lt;- predict(mod, newdata = pDF) ) 我将其显示在数据之上。我已经使用ggplot2绘制了此图像,并使用了点的alpha值。我认为在我的分析中并未充分考虑我分布的尾巴。也许这是由于以下事实:百分位类型测量忽略了一些单独的点。 其中一项评论建议 包小插图包括有关非线性分位数回归的部分,以及带有平滑样条线的模型等。 根据我之前的问题,我假设对数关系,但是我不确定这是否正确。我以为我可以在第99个百分位间隔处提取所有点,然后分别检查它们,但是我不确定该怎么做,或者这是否是一个好方法。我将不胜感激有关如何改善识别这种关系的任何建议。

3
如何显示缺少条目的相关矩阵?
我想在到目前为止收集的文章中获得相关性的图形表示,以方便地探索变量之间的关系。我曾经画过一个(混乱的)图,但是现在数据太多了。 基本上,我有一张桌子,上面有: [0]:变量1的名称 [1]:变量2的名称 [2]:相关值 “总体”矩阵不完整(例如,我具有V1 * V2,V2 * V3,但没有V1 * V3的相关性)。 有没有办法以图形方式表示这一点?

3
零膨胀连续数据的假设检验
非常感谢您对以下问题的建议: 我有一个很大的连续数据集,其中有很多零(〜95%),我需要找到最佳方法来测试它的某些子集是否“有趣”,即,似乎不是从与其余的部分。零膨胀来自以下事实:每个数据点均基于具有零和真实零的计数测量值,但是结果是连续的,因为它考虑了由计数加权的其他一些参数(因此,如果计数为零,则结果为也是零)。 最好的方法是什么?我觉得Wilcoxon甚至蛮力置换测试都不足够,因为它们被这些零值所扭曲。专注于非零测量也会删除非常重要的真实零。计数数据的零膨胀模型已经很好地开发,但是不适合我的情况。 我考虑过将Tweedie分布拟合到数据,然后在response = f(subset_label)上拟合glm。从理论上讲,这似乎是可行的,但我想知道(a)这是否过大,以及(b)是否仍隐含地假设所有零均为样本零,即是否以与排列相同的方式(最多)被偏置? 直观地讲,听起来好像有某种层次结构设计,该结构结合了基于零比例的二项式统计量,例如,基于非零值(或者更好的是,非零值再加上零的一部分)计算出的Wilcoxon统计量零)。听起来像贝叶斯网络... 希望我不是第一个遇到这个问题的人,所以如果您能向我指出合适的现有技术,将不胜感激。 非常感谢!

2
使用doSMP并行化插入符号包
更新:插入符现在在foreach内部使用,因此此问题不再真正相关。如果您可以为其注册一个工作的并行后端foreach,则插入符号将使用它。 我有用于R 的插入符号包,使用该train函数交叉验证我的模型很有趣。但是,我想加快处理速度,看来插入符号为并行处理提供了支持。在Windows计算机上访问此功能的最佳方法是什么?我有doSMP软件包,但是我不知道如何将foreach函数转换为lapply函数,因此可以将其传递给train函数。 这是train文档中我想要执行的示例:这正是我想要执行的操作,但使用的是doSMP包而不是doMPI包。 ## A function to emulate lapply in parallel mpiCalcs &lt;- function(X, FUN, ...) } theDots &lt;- list(...) parLapply(theDots$cl, X, FUN) { library(snow) cl &lt;- makeCluster(5, "MPI") ## 50 bootstrap models distributed across 5 workers mpiControl &lt;- trainControl(workers = 5, number = 50, computeFunction = mpiCalcs, computeArgs …

2
如何从数据确定韦布尔参数?
我有风速数据的直方图,通常使用韦伯分布来表示。我想计算出最适合直方图的weibull形状和比例因子。 我需要一个数值解决方案(与图形解决方案相对),因为目标是通过编程确定weibull形式。 编辑: 每10分钟收集一次样本,风速在10分钟内取平均值。样本还包括每个时间间隔内记录的最大和最小风速,目前暂时忽略,但我想稍后介绍。料斗宽度为0.5 m / s

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.