统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
神经网络隐藏激活函数的选择
我在其他地方读过,NN中隐藏层激活功能的选择应基于自己的需要,即,如果您需要-1到1范围内的值,请使用tanh并使用Sigmoid来表示0到1的范围。 我的问题是如何知道自己的需求?是否基于输入层的范围,例如使用可以包含输入层的整个值范围的函数,还是以某种方式反映输入层的分布(高斯函数)?还是选择特定的需求问题/领域,并需要一个人的经验/判断才能做出选择?还是仅仅是“使用能够提供最佳交叉验证的最小训练误差的东西?”

2
在选举中,我们如何确定候选人将成为赢家?
我昨天住的地方是大选,而电视网络在所有选票都开通之前就开始召集获奖者。 他们在所有帐户上都没事,我真的不感到惊讶。我知道统计数据绝对可行。不过,我很好奇。假设: 我们已经打开出Ĵ选票;iiijjj 我们有候选人在其当前分数Ç 1,c ^ 2,Ç 3,。。。c n ;nnnc1,c2,c3,...cnc1,c2,c3,...cnc_1, c_2, c_3, ... c_n 我们如何计算领先候选人是获胜者的确定性?
14 elections 

5
为什么使用AIC应用模型选择会给我变量的不重要的p值
我对AIC有一些疑问,希望您能为我提供帮助。我根据数据对AIC应用了模型选择(向后或向前)。并且某些选定变量的p值> 0.05。我知道有人说我们应该选择基于AIC而不是p值的模型,因此看来AIC和p值是两个不同的概念。有人可以告诉我有什么区别吗?到目前为止,我的理解是: 对于使用AIC的向后选择,假设我们有3个变量(var1,var2,var3),并且此模型的AIC为AIC *。如果排除这三个变量中的任何一个不会导致AIC明显低于AIC *(就df = 1的方差分布而言),那么我们可以说这三个变量是最终结果。 在三变量模型中,变量(例如var1)的有效p值表示该变量的标准化效应量显着不同于0(根据Wald或t检验)。 这两种方法之间的根本区别是什么?如果在我的最佳模型中(通过AIC获得)某些变量的p值不显着,该如何解释?

2
MCMC Geweke诊断
我正在运行Metropolis采样器(C ++),并希望使用以前的示例来估计收敛速度。 我发现一种易于实施的诊断程序是Geweke诊断程序,它可以计算两个样本平均值之间的差除以其估计的标准误差。由零处的光谱密度估计标准误差。 Zn=θ¯A−θ¯B1nASAθ^(0)+1nBSBθ^(0)−−−−−−−−−−−−−−−−√,Zn=θ¯A−θ¯B1nASθA^(0)+1nBSθB^(0),Z_n=\frac{\bar{\theta}_A-\bar{\theta}_B}{\sqrt{\frac{1}{n_A}\hat{S_{\theta}^A}(0)+\frac{1}{n_B}\hat{S_{\theta}^B}(0)}}, 其中,B是马尔可夫链中的两个窗口。我做了什么有一些研究^ 小号一个θ(0 )和^ 小号乙θ(0 ),但进入文学的能量谱密度和功率一塌糊涂谱密度,但我不会在这些议题的专家; 我只需要一个简单的答案:这些数量是否与样本方差相同?如果没有,计算它们的公式是什么?AAABBB小号一种θ^(0 )小号θ一种^(0)\hat{S_{\theta}^A}(0)SBθ^(0)SθB^(0)\hat{S_{\theta}^B}(0) 对Geweke诊断的另一个疑问是如何选择?上述文献所述,这是一些功能θ (X )和应该意味着频谱密度的存在^ 小号甲θ(0 ),但为了方便起见,我想的最简单的方法是使用恒等函数(使用样品本身)。它是否正确?θθ\thetaθ(X)θ(X)\theta(X)SAθ^(0)SθA^(0)\hat{S_{\theta}^A}(0) R coda程序包有描述,但也没有指定如何计算值。S小号S
14 mcmc  diagnostic 

1
导数的核密度估计量是否有最佳带宽?
我需要使用内核密度估计器基于一组观察值来估计密度函数。基于同一组观察,我还需要使用核密度估计器的导数来估计密度的一阶和二阶导数。带宽肯定会对最终结果产生很大影响。 首先,我知道有两个R函数可以提供KDE带宽。我不确定哪一个更受欢迎。谁能推荐这些R函数中的一种来获得KDE带宽? 其次,对于KDE的派生,我应该选择相同的带宽吗?

3
固定/随机效应模型背后的概念
有人可以帮助我了解固定/随机效应模型吗?如果您已经消化了这些概念,则可以自己解释,也可以将我定向到具有特定地址(页码,章节等)的资源(书,笔记,网站),以便我可以毫无困惑地学习它们。 这是真的吗:“一般来说,我们有固定的影响,而具体情况是随机的”?如果描述从一般模型到具有固定和随机影响的特定模型,我将特别感谢您的帮助。

5
移除QQ图中心附近的多余点
我正在尝试在R中绘制一个带有两个约120万个点的数据集的QQ图(使用qqplot,并将数据输入到ggplot2中)。计算很容易,但是由于有很多点,因此生成的图形加载起来非常缓慢。我尝试了线性逼近以将点的数量减少到10000(无论如何,如果您的数据集之一大于另一个,这就是qqplot函数所做的事情),但是您会损失很多细节。 指向中心的大多数数据点基本上是无用的-它们重叠得太多,以致每个像素大概有100个。是否有任何简单的方法可以删除过于紧密的数据,而又不会使稀疏的数据流向尾部呢?

1
当包含分类变量之间的交互时,解释混合模型的回归输出
我对使用混合模型/ lmer有疑问。基本模型是这样的: lmer(DV ~ group * condition + (1|pptid), data= df) 组和条件都是两个因素:组具有两个级别(组A,组B),条件具有三个级别(条件1,条件2,条件3)。它是来自人类受试者的数据,因此pptid对每个人都是随机效应。 该模型找到以下带有p值的输出: Estimate MCMCmean HPD95lower HPD95upper pMCMC Pr(>|t|) (Intercept) 6.1372 6.1367 6.0418 6.2299 0.0005 0.0000 groupB -0.0614 -0.0602 -0.1941 0.0706 0.3820 0.3880 condition2 0.1150 0.1151 0.0800 0.1497 0.0005 0.0000 condition3 0.1000 0.1004 0.0633 0.1337 0.0005 0.0000 groupB:condition2 -0.1055 -0.1058 …

2
贝叶斯分析的最佳软件包
我想知道你们推荐哪种软件统计软件包来执行贝叶斯推理。 例如,我知道您可以独立运行openBUGS或winBUGS,也可以从R调用它们。但是R也有几个自己的软件包(MCMCPack,BACCO)可以进行贝叶斯分析。 是否有人对R中的哪个贝叶斯统计软件包最好或其他替代方案(Matlab或Mathematica)有任何建议? 我要比较的主要功能是性能,易用性,稳定性和灵活性

2
检查具有统计意义的峰值
我有一组数据yyy和。我想检验以下假设:有一个峰值。也就是说,随着增加,首先增加,然后减少。xxxyyyxxxyyy 我的第一个想法是将和在SLR中。也就是说,如果我发现之前的系数显着为正,而之前的系数显着为负,那么我支持该假设。但是,这仅检查一种关系(二次关系),并不一定捕获峰值的存在。xxxx2x2x^2xxxx2x2x^2 然后我想到了找到,即一个区域(排序值),在和之间,另外两个区域至少包含与一样多的点,并且 \ bar {y_b}> \ bar {y_a}和\ bar {y_b}> \ bar {y_c}。如果假设是正确的,那么我们应该期望有很多这样的区域b。因此,如果b的数量足够大,则应该支持该假设。bbbxxxbbbaaacccxxxbbbyb¯>ya¯yb¯>ya¯\bar{y_b}>\bar{y_a}yb¯>yc¯yb¯>yc¯\bar{y_b}>\bar{y_c}bbbbbb 您是否认为我在为我的假设找到合适的检验的正确道路上?还是我发明了轮子,并且有解决此问题的方法?非常感谢您的投入。 更新。我的因变量是count(非负整数)。yyy

3
GAM模型的置信区间
阅读 mgcv::gam的帮助页面: 使用拟合模型预测的任何数量的置信度/可信区间都可轻松获得 但是我想不出一种方法来真正得到一个。我以为predict.gam会有一个type=confidence和level参数,但没有。您能帮助我如何创建它吗?

3
为什么这个摘录说标准偏差的无偏估计通常不相关?
我正在阅读标准偏差的无偏估计的计算方法以及我所阅读的资料 (...)除非在某些重要情况下,否则该任务与统计的应用几乎没有关系,因为通过标准程序(例如,使用显着性检验和置信区间或使用贝叶斯分析)可以避免执行此任务。 我想知道是否有人可以阐明该语句背后的原因,例如,置信区间不是将标准差用作计算的一部分吗?因此,置信区间不会受到标准偏差的影响吗? 编辑: 到目前为止,谢谢您的回答,但是我不确定我是否遵循它们的某些推理,因此我将添加一个非常简单的示例。关键是,如果源是正确的,那么从我的结论到示例,都出了点问题,我希望有人指出p值如何不依赖于标准偏差。 假设研究人员希望测试他或她所在城市的五年级学生的平均分数是否与全国平均值76分(显着性水平为0.05)不同。研究人员随机抽取了20名学生的分数。样本平均值为80.85,样本标准偏差为8.87。这意味着:t =(80.85-76)/(8.87 / sqrt(20))= 2.44。然后使用t表计算以19 df在2.44时的2尾概率值为0.025。这低于我们的显着性水平0.05,因此我们拒绝零假设。 因此,在此示例中,p值(也许还有您的结论)是否会根据您估计样本标准偏差的方式而改变?

1
如何处理神经网络中二进制和连续输入的混合?
我正在R中使用nnet软件包来尝试构建ANN以预测公寓(个人项目)的房地产价格。我是新来的,没有数学背景,所以请和我一起裸露。 我有二进制和连续输入变量。例如,对于神经网络,一些最初为是/否的二进制变量被转换为1/0。其他变量是连续的,如Sqft。 输入数据样本 我已将所有值标准化为0-1比例。也许Bedrooms并且Bathrooms不应该归一化,因为它们的范围仅为0-4? 这些混合输入是否给ANN带来了问题?我已经取得了不错的结果,但是仔细检查一下ANN为某些变量选择的权重似乎没有任何意义。我的代码在下面,有什么建议吗? ANN <- nnet(Price ~ Sqft + Bedrooms + Bathrooms + Parking2 + Elevator + Central.AC + Terrace + Washer.Dryer + Doorman + Exercise.Room + New.York.View,data[1:700,], size=3, maxit=5000, linout=TRUE, decay=.0001) 更新: 基于以下有关将二进制输入分成每个值类的单独字段的注释,我的代码现在看起来像: ANN <- nnet(Price ~ Sqft + Studio + X1BR + X2BR + X3BR + …

1
零膨胀泊松回归
假设是独立的并且Y = (Y 1,… ,Y n )'Y=(Y1,…,Yn)′ \textbf{Y} = (Y_1, \dots, Y_n)' ÿ 我 = 0 的概率为p 我 + (1 - p 我)ë - λ 我 ÿ 我 = ķ 以概率(1 - p 我)ë - λ 我 λ达ķ 我 / ķ ! Yi=0Yi=kwith probability pi+(1−pi)e−λiwith probability (1−pi)e−λiλki/k!\eqalign{ Y_i = 0 …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.