统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
统计是一台机器……报价
我将需要在即将举行的会议上向非统计人员提出一个项目,并且我想引用我曾经读过的一句话,以使统计数据与处理矿石的机器之间进行比较。原因是我想强调统计能力与受众目标之间的某种联系。 我找不到报价,希望有人能为我提供参考。它遵循以下内容: 考虑从矿石中提取金的情况。好的采金机的期望是它可以将矿石中的金干净地分离出来,而不会浪费。我们不会批评这台机器如果原本就没有矿石,就不会提取金,如果它无法从微量的矿石中提取金,我们也不会做出过分严厉的判断。同样,统计信息是从数据中提取信息的机器。统计信息无法创建信息,数据必须包含该信息。 我相信这是费舍尔的话,他继续指出自己和机器操作员之间的相似之处。我认为他的意思是,只要他的统计机制很聪明,他就不需要变得特别聪明就能获得良好的结果。 任何帮助,将不胜感激。如果可能,请提供完整报价。 报价位置的详细信息(找到答案后添加): 跟随所选答案的线索后,我找到了带有引号的论文。它是: 费舍尔,RA(1947)。实验设计理论的发展。程序 的 统计员。华盛顿,Conf.3,434-439。 它可以免费找到这里,在费舍尔文集的数字档案。这似乎是他在1947年发表的一次会议演讲。

3
IV分位数回归文献
在过去的几个月里,我为阅读今年夏天的硕士论文集中阅读了分位数回归。具体来说,我已经阅读了罗杰·科恩克(Roger Koenker)2005年有关该主题的大部分书籍。现在,我想将现有知识扩展到允许工具变量(IV)的分位数回归技术。这似乎是一个活跃的研究领域,并且正在迅速发展。 也许有人可以建议我: 有关IV分位数回归的论文或其他文献 这些不同的统计技术的简要概述 不同技术的利弊 我主要是在寻找文学知识,以使我入门并全面了解现有知识。因此,第一点很重要。第二和第三将是很好!我的兴趣主要在于横截面方法,但也欢迎使用面板方法。 提前致谢。

2
时间序列预测中的随机与确定性趋势/季节关系
我在时间序列预测方面有中等背景。我看了几本预测书,但在其中任何一本中都没有看到以下问题。 我有两个问题: 如果给定的时间序列具有以下特征,我将如何客观地确定(通过统计检验): 随机季节性或确定性季节性 随机趋势或确定性趋势 如果当时间序列具有明显的随机成分时,将我的时间序列建模为确定性趋势/季节,将会发生什么? 解决这些问题的任何帮助将不胜感激。 趋势的示例数据: 7,657 5,451 10,883 9,554 9,519 10,047 10,663 10,864 11,447 12,710 15,169 16,205 14,507 15,400 16,800 19,000 20,198 18,573 19,375 21,032 23,250 25,219 28,549 29,759 28,262 28,506 33,885 34,776 35,347 34,628 33,043 30,214 31,013 31,496 34,115 33,433 34,198 35,863 37,789 34,561 36,434 34,371 …

1
R中的多元时间序列。如何找到滞后相关性并建立预测模型
我是该页面的新手,而统计学和R则是新手。我正在为一个大学项目,目的是发现河流中的雨水和水位之间的相关性。一旦证明了相关性,我便要对其进行预测/预测。 数据 我有一组数年的数据(每隔5分钟)包含特定的河流: 毫米降水 河流流量,立方米每秒 这条河没有积雪,因此该模型仅基于降雨和时间。有时会有冻结的温度,但是我正在考虑将这些时间段从异常数据中删除,因为这种情况超出了我项目的范围。 示例 在这里,您有几个示例数据图,这些数据来自几个小时后的降雨和水位上升。 红线是河流流量。橙色是雨。您可以看到总是下雨,然后河里的水上升。在时间序列结束时会再次下雨,但稍后会影响河流流量。 相关性在那里。这是我在R中所做的,以证明在R中使用ccf的相关性: 互相关 前导变量 滞后 这是我的R线用于第二个示例(一个降雨期): ccf(arnoiaex1$Caudal, arnoiaex1$Precip, lag.max=1000, plot=TRUE, main="Flow & Rain") 我的解释是: 降雨导致(首先发生), 有一个显着的相关性,其峰值为(我可以检查确切的数字,我知道该部分)。≈ 450≈450\approx 450 我不知道如何找出相关性影响河流流量的时间,我认为这个名称是“保留”。我看到的是,雨后河水流失时,该图遵循第一个图的相同形状。我不能以此为依据说保留时间从持续到(我可以在返回的数据框中创建的对象中检查此值,看看水位何时恢复到该值)。是“下雨前”吗?有没有更好的方法来找到保留物?≈ 450≈450\approx 450≈ 800≈800\approx 800ccf 我对吗? 关于时间序列。此时间序列没有周期性或季节性。随时可能下雨并造成影响。夏季确实会减少,但仍然会发生,这是一个常年下雨的地区。 模型和预测。 我不知道如何创建一个模型来进行预测,该预测告诉我在下雨后河流会增加多少流量。我一直在尝试一些arima,auto arima但是还没有很成功。我应该使用Arima,vars或其他不同的多变量模型?任何指向示例的链接都会有很大帮助。 请让我知道,如果您知道创建此预测的最佳方法,则应使用哪种模型。我正在考虑做其他一些事情,但是为了简单起见,将它们从解释中删除。如果需要,我可以共享一些数据。

1
glmer中收敛警告的含义
我正在使用R中包中的glmer函数lme4,并且正在使用bobyqa优化器(即我的默认设置)。我收到警告,我很好奇这意味着什么。 Warning message: In optwrap(optimizer, devfun, start, rho$lower, control = control, : convergence code 3 from bobyqa: bobyqa -- a trust region step failed to reduce q 我搜索“信任区域步骤无法减少q”。在minqa程序包中找到了一些信息,上面写着 “请咨询Powell进行解释”。我做到了(如果需要,您也可以!请参见下面的参考资料和指向它们的链接),但是我不明白。实际上,我没有找到关于减少q的任何信息。 MJD Powell(2007)“ NEWUOA在无导数的无约束最小化方面的发展”,剑桥大学,应用数学和理论物理系,数值分析组,报告NA2007 / 05,http: //www.damtp.cam.ac.uk/ user / na / NA_papers / NA2007_05.pdf。 MJD Powell(2009),“没有导数的有界约束优化的BOBYQA算法”,报告号DAMTP 2009 / NA06,英国剑桥大学数学科学中心。http://www.damtp.cam.ac.uk/user/na/NA_papers/NA2009_06.pdf。 附言:我知道我可以更改优化器,并且我将查看是否可以得到没有警告或错误的输出。根据Ben Bolker的评论/答案,我还将检查渐变和粗麻布。我使用的是glmer内dredge从MuMIn,我不知道,如果本的答案没有一些额外的工作,修修补补,但我会在上面工作,一旦我的电脑上完成它在做什么,反正我离题了。 更新资料 …

3
对于不平衡数据,ROC曲线下的面积还是PR曲线下的面积?
我对使用哪种性能指标,ROC曲线下的面积(TPR与FPR的函数)或精确召回曲线下的面积(精度与召回的函数)之间的使用存在疑问。 我的数据不平衡,即,否定实例的数量比肯定实例大得多。 我正在使用weka的输出预测,示例是: inst#,actual,predicted,prediction 1,2:0,2:0,0.873 2,2:0,2:0,0.972 3,2:0,2:0,0.97 4,2:0,2:0,0.97 5,2:0,2:0,0.97 6,2:0,2:0,0.896 7,2:0,2:0,0.973 我正在使用pROC和ROCR r库。

1
训练基本的马尔可夫随机场以对图像中的像素进行分类
我正在尝试学习如何使用马尔可夫随机场来分割图像中的区域。我不了解MRF中的某些参数,或者为什么我执行的期望最大化有时无法收敛到解决方案。 从贝叶斯定理开始,我有,其中是像素的灰度值,是类标签。我选择对使用高斯分布,而是使用MRF建模的。y x p (y | x )p (x )p(x|y)=p(y|x)p(x)/p(y)p(x|y)=p(y|x)p(x)/p(y)p(x|y) = p(y|x) p(x) / p(y)yyyxXxp (ÿ| X)p(ÿ|X)p(y|x)p (x )p(X)p(x) 我为MRF使用了一个电位函数,该函数既具有成对的集团电位,又具有被分类像素的类别标签的电位值。单个像素电势值是某个常数,取决于类标签。对成对连接的4个邻居评估成对势函数,如果邻居具有与此像素相同的类别标签,则返回正如果标签不同则返回。X β - βαα\alphaXXxββ\beta- β-β-\beta 在期望最大化的点上,我必须找到最大化对数似然期望值的和的值,我使用了数值优化方法(尝试了共轭梯度,BFGS,鲍威尔方法),但是总是会发现的值将变为负值, s将会急剧增加,并且一两次或之后的迭代,整个图像将仅分配给一个标签(背景:使用ICM完成给定MRF参数的类标签的分配) 。如果我删除了alpha,即仅使用成对的集团势,那么期望最大化就可以了。β β αα (x )α(X)\alpha(x)ββ\betaββ\betaαα\alpha 请说明每个课程的Alpha用途是什么?我以为它们与图像中存在的该类的数量有关,但似乎无关。一旦我使MRF仅以成对电位工作,我便将其与简单的高斯混合模型进行了比较,发现它们产生的结果几乎相同。我期望成对的电位能使课程顺利一些,但这并没有发生。请告知我哪里出了问题。

7
再谈两个信封问题
我在想这个问题。 http://en.wikipedia.org/wiki/Two_envelopes_problem 我相信该解决方案,并且我认为我理解它,但是如果采用以下方法,我将感到完全困惑。 问题1: 我将为您提供以下游戏。您付给我10 美元,我会掷一枚公平的硬币。头部给我5 美元,尾巴给我20 美元。 期望是12.5 美元,因此您将始终可以玩游戏。 问题2: 我会给你一个10 美元的信封,信封已经打开,你可以检查一下。那么我告诉你一个信封,关闭,这个时候,告诉你:这个信封或者具有$ 5或以相同的概率$ 20吧。您要交换吗? 我觉得这与问题1完全一样,您放弃了$ 10换了$ 5或$ 20,所以再次您总是会切换。 问题三: 我做与上述相同,但是请关闭信封。因此,您不知道有10美元,但有多少X。我告诉您另一个信封有两倍或一半。现在,如果您遵循相同的逻辑,则要切换。这就是信封悖论。 我打开信封后发生了什么变化? 编辑: 有些人认为问题3并不是信封问题,我将尝试通过分析每个人对游戏的看法,在下面提供我认为为什么的问题。而且,它为游戏提供了更好的设置。 为问题3提供一些澄清: 从组织游戏的人的角度来看: 我拿着两个信封。我合上了一张10 美元的货币,将其交给玩家。然后我告诉他,我还有一个信封,是我刚给你的信封的两倍或一半。您要切换吗?然后,我继续掷出一枚公平的硬币,往正面扔了5 美元,向尾摆放了 20 美元,然后递给他信封。然后我问他。您刚给我的信封是您所持信封的两倍或一半。您要切换吗? 从玩家的角度来看: 我得到一个信封,并告诉我还有另一个信封,信封的数量是其概率的两倍或一半。我要切换吗?我认为我有XXX,因此12(12X+2X)>X12(12X+2X)>X\frac{1}{2}(\frac{1}{2}X + 2X) > X所以我想切换。我得到了信封,突然之间我面临着完全相同的情况。我想再次切换,因为另一个信封的数量是原来的两倍或一半。

4
相信哪个:Kolmogorov-Smirnov测试或QQ情节?
我试图确定我的连续数据数据集是否遵循参数shape 1.7和rate 0.000063 的伽马分布。====== 问题是,当我使用R来创建数据集对于理论分布伽玛(1.7,0.000063)的QQ图时,我得到了一个图,该图表明经验数据与伽玛分布大致相符。ECDF图也会发生相同的情况。xxx 但是,当我运行Kolmogorov-Smirnov检验时,它给了我&lt; 1 %的不合理的值。ppp&lt; 1 %&lt;1个%<1\% 我应该选择相信哪个?图形输出还是KS测试的结果?

1
足够的统计,细节/直觉问题
我在自学一些有趣的统计数据,并且对足够的统计数据有些困惑。我将以列表格式列出我的困惑: 如果分布具有nnn参数,那么它将具有nnn足够的统计量吗? 足够的统计量和参数之间是否存在某种直接对应关系?还是将足够的统计信息用作“信息”库,以便我们可以重新创建设置,以便可以为基础分布的参数计算相同的估计值。 所有发行版都有足够的统计信息吗?即。分解定理会失败吗? 使用我们的数据样本,我们假设数据最有可能来自该分布,然后可以为该分布的参数计算估计值(例如MLE)。足够的统计数据是一种能够对参数计算相同估计值而不必依赖数据本身的方法,对吗? 所有足够的统计信息集都会具有最小的统计信息吗? 这是我用来尝试理解主题的材料:https : //onlinecourses.science.psu.edu/stat414/node/283 据我了解,我们有一个分解定理,它将联合分布分解为两个函数,但是我不明白在将分布分解为函数后,我们如何能够提取足够的统计量。 本例中给出的泊松问题具有明确的因式分解,但随后指出,足够的统计量是样本均值和样本和。仅通过看第一个方程的形式,我们怎么知道这些才足够? 如果因式分解结果的第二个方程有时取决于数据值XiXiX_i本身,那么如何使用足够的统计量进行相同的MLE估计呢?例如在泊松案例中,第二个函数取决于数据阶乘乘积的倒数,因此我们将不再拥有数据! 相对于网页上的Poisson示例,为什么样本量nnn不够统计?我们将要求n重构第一个函数的某些部分,所以为什么它也不足够统计呢?nnn

4
给定样本平均值,样本中位数的期望值
让ÿYY表示中值,并让ˉ XX¯\bar{X}表示平均值,大小的随机样本的Ñ = 2 ķ + 1n=2k+1n=2k+1从分发即Ñ (μ ,σ 2)N(μ,σ2)N(\mu,\sigma^2)。我该如何计算ê (Ÿ | ˉ X = ˉ X)E(Y|X¯=x¯)E(Y|\bar{X}=\bar{x})? 直观地说,因为态假设的,是有意义的要求是Ë (Ÿ | ˉ X = ˉ X)= ˉ XE(Y|X¯=x¯)=x¯E(Y|\bar{X}=\bar{x})=\bar{x}的确是正确的答案。可以严格显示吗? 我最初的想法是使用条件正态分布来解决此问题,这通常是已知的结果。那里的问题是,由于我不知道期望值,因此也不知道中位数的方差,因此我将不得不使用k + 1k+1k+1阶统计量来计算那些值。但这非常复杂,除非绝对必要,否则我不愿去那里。

1
定义ARIMA订单时遇到问题
这是一篇很长的文章,所以希望您能忍受,并请纠正我错的地方。 我的目标是根据3或4周的历史数据生成每日预测。 该数据是变压器线路之一的局部负载的15分钟数据。我在查找季节性ARIMA过程的模型顺序时遇到麻烦。考虑用电时间序列: 原始时间序列http://i.share.pho.to/80d86574_l.png 当将前三周作为子集并进行差分时,将计算以下ACF / PACF图: 子集http://i.share.pho.to/5c165aef_l.png 第一个区别http://i.share.pho.to/b7300cc2_l.png 季节性和第一次差异http://i.share.pho.to/570c5397_l.png 看起来该系列有点固定。但是季节性也可以是每周一次(请参阅季节性差异周和二阶差异[在这里] http://share.pho.to/3owoq,您怎么看?) 一[R 我中号A (p ,1 ,q)(P,1 ,Q )96一种[R一世中号一种(p,1个,q)(P,1个,问)96 ARIMA(p,1,q)(P,1,Q)_{96} 一[R 我中号甲(0 ,1 ,4 )(0 ,1 ,1 )96一种[R一世中号一种(0,1个,4)(0,1个,1个)96 ARIMA(0,1,4)(0,1,1)_{96} Series: x ARIMA(0,1,4)(0,1,1)[96] Coefficients: ma1 ma2 ma3 ma4 sma1 -0.2187 -0.2233 -0.0996 -0.0983 -0.9796 s.e. 0.0231 0.0234 0.0257 0.0251 0.0804 sigma^2 …

2
随机森林的特征选择
我有一个主要包含财务变量(120个特征,4k个示例)的数据集,这些变量大多具有高度相关性且非常嘈杂(例如技术指标),因此我想选择最多约20-30个模型,供以后用于模型训练(二进制分类) - 增加减少)。 我当时正在考虑使用随机森林进行特征排名。递归使用它们是一个好主意吗?例如,假设在第一轮中,我丢掉最差的20%,第二次也丢掉,依此类推,直到获得所需数量的功能。我应该对RF使用交叉验证吗?(对我来说,不使用CV是很直观的,因为那已经是RF所做的事情了。) 另外,如果我使用随机森林,是否应该将它们用作二进制的分类器或实际增加/减少的回归变量,以获得功能的重要性? 顺便说一下,在特征选择之后,我想尝试的模型是:SVM,神经网络,局部加权回归和随机森林。我主要在Python中工作。

1
了解lmer()模型中随机效应的方差
我无法理解lmer()模型的输出。它是结果变量(支持)的简单模型,具有不同的状态截距/状态随机效应: mlm1 &lt;- lmer(Support ~ (1 | State)) 结果为summary(mlm1): Linear mixed model fit by REML Formula: Support ~ (1 | State) AIC BIC logLik deviance REMLdev 12088 12107 -6041 12076 12082 Random effects: Groups Name Variance Std.Dev. State (Intercept) 0.0063695 0.079809 Residual 1.1114756 1.054265 Number of obs: 4097, groups: State, …

2
在地图上显示时空相关性
我有整个美国气象站网络的数据。这给了我一个包含日期,纬度,经度和一些测量值的数据框。假设每天收集一次数据,并且受区域范围天气的驱动(不,我们将不进行讨论)。 我想以图形方式显示跨时间和空间的同时测量值如何关联。我的目标是显示正在调查的值的区域同质性(或缺乏同质性)。 资料集 首先,我带了一组在马萨诸塞州和缅因州的车站。我从NOAA的FTP站点上可用的索引文件中按纬度和经度选择了站点。 马上您就会看到一个问题:许多站点具有相似的标识符或非常接近。FWIW,我同时使用USAF和WBAN代码识别它们。深入了解元数据,我发现它们具有不同的坐标和高程,数据从一个站点停止,然后从另一个站点开始。因此,因为我不知道更好,所以必须将它们视为独立的站。这意味着数据包含彼此非常接近的站点对。 初步分析 我尝试按日历月对数据进行分组,然后计算不同对数据之间的普通最小二乘回归。然后,我将所有线对之间的相关性绘制为一条连接测站的线(下图)。线条颜色显示了来自OLS拟合的R2值。然后,该图显示了感兴趣区域中不同站点之间从一月,二月等开始的30多个数据点如何关联。 我已经编写了基础代码,以便仅在每6小时内有数据点时才计算每日平均值,因此数据在各个站点之间应该是可比较的。 问题 不幸的是,在一个绘图上根本没有太多数据可以理解。无法通过减小行的大小来解决。 ķķk 网络似乎太复杂了,所以我认为我需要找到一种降低复杂性或应用某种空间内核的方法。 我也不确定什么是最合适的指标来显示相关性,但是对于目标受众(非技术人员),OLS的相关系数可能只是最简单的解释。我可能还需要提供其他一些信息,例如梯度或标准误差。 问题 我正在学习同时进入该领域和R的方法,并希望就以下方面提出建议: 我要做什么的更正式的名字是什么?有一些有用的术语可以让我找到更多的文献吗?我的搜索正在为必不可少的应用程序绘制空白。 有没有更合适的方法来显示空间上分隔的多个数据集之间的相关性? ...尤其是易于从视觉上显示结果的方法? 这些是否在R中实现? 这些方法是否适合自动化?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.