统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
什么是对数赔率分布?
我正在阅读一本关于机器学习的教科书(Witten等人的《数据挖掘》,2011年),并且遇到了这段话: ...此外,可以使用不同的分布。尽管通常对于数字属性来说,正态分布是一个不错的选择,但它不适用于具有预定最小值但没有上限的属性;在这种情况下,“对数正态”分布更为合适。可以通过“对数奇数”分布来模拟上下边界的数值属性。 我从未听说过这种分布。我在Google上搜索了“对数分布”,但找不到任何相关的完全匹配项。有人可以帮我吗?这种分布是什么,为什么对上下有界的数字有帮助? PS:我是软件工程师,而不是统计学家。

1
在伪随机数生成中设置种子的参考和最佳实践
在这份与“设置种子”命令有关的文档中,Stata员工讨论了在生成伪随机数时与种子设置有关的问题。 一个显着的“不”是“不连续使用自然数作为种子的顺序,因为这有一个模式,危害伪随机性”。 一个四分之一的开玩笑的“做”是在您的一生中只设置一个种子,然后在每个实验结束时记录所生成过程的“状态”,以便下一个实验在该点继续进行该进程已停止的位置。 显然,以上建议取决于一个人在其研究生命中将产生的伪随机数的预期数目。也许梅森捻线机可以满足许多研究人员的终生需求。 现在,我对PRNG的理论或实践经验并不丰富,因此我无法争论这些建议- 应该从理论基础和严格的数学统计证明它们是有效的还是无效的。 所以,我的问题是 1)您能否帮助解释或使以上给出的建议无效,或指向涉及此类问题的参考? 2)您可以提供提供“最佳做法”的参考资料吗? 3)您如何在自己的工作中进行这项工作,为什么? 作为问题3)的示例,假设对于Monte Carlo研究,您想要生成样本,每个样本的大小为,并且的周期足够大于。您会使用一个种子生成所有伪随机数,还是习惯每个样本更改种子?(但这仅是示例-我认为这里更一般的答案是值得的)。 米米mññn液化天然气液化天然气\text{PRNG}米ñ米ñmn米ñ米ñmn 一个相关的线程(尽管更加集中)是 在每个代码块之前还是每个项目一次设置种子? 我觉得这也许应该是社区Wiki,请对此做出决定。

2
卷积为何起作用?
所以我知道,如果我们要查找独立随机变量X+YX+YX + Y和的概率分布,可以通过说XXX和的概率分布来计算它YYY fX+Y(a)=∫∞x=−∞fX,Y(X=x,Y=a−x) dx=∫∞x=−∞fX(x)fY(a−x) dxfX+Y(a)=∫x=−∞∞fX,Y(X=x,Y=a−x) dx=∫x=−∞∞fX(x)fY(a−x) dxf_{X + Y}(a) = \int_{x = -\infty}^{\infty} f_{X, Y}(X = x, Y = a - x)~dx = \int_{x = -\infty}^{\infty} f_X(x) f_Y(a - x)~dx 从直觉上讲,这是有道理的,因为如果我们要找到两个随机变量求和为aaa的概率,则基本上就是所有导致这些变量求和为的事件的概率之和aaa。但是,我怎样才能正式证明这一说法呢?

2
如果时间序列是二阶平稳的,这是否意味着它严格是平稳的?
如果X t 1,X t 2,...的联合分布,则过程XŤXŤX_t严格地是平稳的。。。,X t m与X t 1 + k,X t 2 + k,...的联合分布相同。。。,X t m + k对于所有m,对于所有k以及对于所有t 1,t 2,XŤ1个,XŤ2,。。。,XŤ米XŤ1个,XŤ2,。。。,XŤ米X_{t_1},X_{t_2},...,X_{t_m}XŤ1个+ k,XŤ2+ k,。。。,XŤ米+ kXŤ1个+ķ,XŤ2+ķ,。。。,XŤ米+ķX_{t_1+k},X_{t_2+k},...,X_{t_m+k}米米mķķk。Ť1个,Ť2,。。。,Ť米Ť1个,Ť2,。。。,Ť米t_1,t_2,...,t_m 如果过程的均值是常数且其自协方差函数仅取决于滞后,则该过程为二阶平稳过程。 因此二阶平稳意味着严格平稳吗? 同样在二阶平稳条件下,它说没有假设比一阶和二阶更高的力矩。第一个矩对应于均值,第二个矩对应于自协方差吗?

2
如何在线性回归中对二元/二分法独立预测变量执行残差分析?
我正在下面的R中执行多元线性回归,以预测所管理基金的回报。 reg <- lm(formula=RET~GRI+SAT+MBA+AGE+TEN, data=rawdata) 在这里,只有GRI和MBA是二元/二分法预测因子;其余的预测变量是连续的。 我正在使用此代码生成二进制变量的残差图。 plot(rawdata$GRI, reg$residuals) abline(lm(reg$residuals~rawdata$GRI, data=rawdata), col="red") # regression line (y~x) plot(rawdata$MBA, reg$residuals) abline(lm(reg$residuals~rawdata$MBA, data=rawdata), col="red") # regression line (y~x) 我的问题: 我知道如何检查残差图是否为连续的预测变量,但是当自变量为二进制时,如何测试线性回归的假设,例如均方差? 残留图:

3
什么是精确召回曲线的良好AUC?
因为我的数据集非常不平衡(9%的积极结果),所以我决定精确召回曲线比ROC曲线更合适。我获得了PR曲线下面积的类似汇总度量值(如果您有兴趣,则为.49),但是不确定如何解释它。我听说.8或以上才是ROC的一个好AUC,但是对于精确召回曲线而言,AUC的一般截止点会是一样的吗?

2
是否可以接受替代假设?
我在这里知道几个相关的问题(例如,关于null的假设测试术语,是否可以证明一个null假设?),但是我不知道下面我的问题的确切答案。 假设我们要检验一个硬币是否公平的假设检验。我们有两个假设: H0:p(head)=0.5H0:p(head)=0.5H_0: p(head)=0.5 H1:p(head)≠0.5H1:p(head)≠0.5H_1: p(head)\neq0.5 假设我们使用5%的显着性水平,有两种可能的情况: 当我们获得数据并发现p值小于0.05时,我们说“显着性水平为5%,我们拒绝。H0H0H_0 p值大于0.05,那么我们说“显着性水平为5%,我们不能拒绝。H0H0H_0 我的问题是: 在情况1中,说“我们接受 ”是否正确?H1H1H_1 凭直觉,并且根据我过去的经验,我认为假设检验的结果“接受”总是错误的。在另一方面,在这种情况下,由于对工会的覆盖整个“空间”,“拒绝 ”和“接受 ”外观一模一样的给我。另一方面,我还可以想到以下想法,即说“我们接受 ” 是不正确的:H 1 H 0 H 1 H 1H0H0H_0H1H1H_1H0H0H_0H1H1H_1H1H1H_1 我们有足够的证据证明不正确,但我们可能没有足够的证据证明是正确的。因此,“拒绝 ”并不自动表示“接受 ”H 1 H 0 H 1H0H0H_0H1H1H_1H0H0H_0H1H1H_1 那么,正确的答案是什么?


1
角度/圆形数据的回归
我指导目标是角度的学习问题。如果我进行简单回归,则模型中的数字360和1会相距很远,但是实际上它们很接近,因此预测x和y坐标感觉不对,因为我试图在此处预测一个数字。解决此问题的正确方法是什么?

1
格兰杰因果关系检验的延迟订单
假设我正在考虑几个可能包含在我正在开发的ARIMAX模型中的自变量。在拟合不同的变量之前,我想使用Granger检验来筛选出具有反向因果关系的变量(我使用R中程序包中的granger.test函数MSBVAR,尽管我相信其他实现方式也是如此)。如何确定应测试多少个滞后? R函数为:granger.test(y, p),其中y为数据帧或矩阵,p为滞后。 零假设是的过去值无助于预测的值。X ÿpppXXXYYY 有什么理由不在这里选择很高的滞后(除了丢失观测值之外)? 请注意,根据相关时间序列的积分顺序,我已经在数据框中的每个时间序列有所不同。(例如,对我的依赖时间序列进行一次差分使它变得平稳。因此,我也对所有“独立”时间序列进行了一次差分。)

2
使用回归检测异常值
可以将回归用于异常检测。我了解可以通过消除异常值来改进回归模型的方法。但是这里的主要目的不是拟合回归模型,而是使用回归找出谎言

1
Jeffries Matusita距离的优点
根据我正在阅读的一些论文,Jeffries和Matusita距离是常用的。但是除了下面的公式,我找不到更多的信息 JMD(x,y)=∑(xi−−√2−yi−−√2)2−−−−−−−−−−−−−√2∑(xi2−yi2)22\sqrt[2]{\sum(\sqrt[2]{x_i}-\sqrt[2]{y_i})^2} 除平方根外,它与欧几里得距离相似 E(x,y)=∑(xi−yi)2−−−−−−−−−−√2∑(xi−yi)22\sqrt[2]{\sum(x_i-y_i)^2} 在分类方面,据称JM距离比欧几里得距离更可靠。谁能解释为什么这种差异使JM距离更好?

4
如何处理缺失值,以便为使用LASSO进行特征选择准备数据?
我的情况: 小样本数量:116 二元结果变量 解释变量的长列表:44 解释变量并非来自我的头上;他们的选择基于文献。 样本中的大多数情况和大多数变量的值都缺失。 选择特征的方法:LASSO R的glmnet程序包不允许我运行glmnet例程,这显然是由于我的数据集中缺少值。似乎有多种方法可以处理丢失的数据,所以我想知道: LASSO是否对我可以使用的估算方法施加任何限制? 插补方法的最佳选择是什么?理想情况下,我需要一种可以在SPSS(最好)或R上运行的方法。 UPDATE1:从下面的一些答案中可以明显看出,在考虑插补方法之前,我确实处理了一些更基本的问题。我想在此添加新的问题。在回答中建议将其编码为常数值并创建一个新变量,以处理“不适用”值和组套索的用法: 您是否可以说,如果我使用组LASSO,我将能够对连续预测变量和分类预测变量使用建议的方法?如果是这样,我认为这相当于创建一个新类别-我很警惕这可能会带来偏差。 有人知道R的glmnet软件包是否支持组LASSO吗?如果没有,有人会建议将逻辑回归与之结合的另一种方法吗?在CRAN资料库中可以找到提及LASSO组的几个选项,最适合我的情况的建议是什么?也许是SGL? 这是我的上一个问题(如何从我的原始长列表中选择变量的子集以执行逻辑回归分析?)的后续文章。 OBS:我不是统计学家。

2
百分损失函数
解决问题的方法: minmE[|m−X|]minmE[|m−X|] \min_{m} \; E[|m-X|] 众所周知,它是X的中值XXX,但是其他百分位数的损失函数看起来如何?例如:X的第25个百分位数是解决以下问题的方法: minmE[L(m,X)]minmE[L(m,X)] \min_{m} \; E[ L(m,X) ] 什么是LLL在这种情况下?

5
Metropolis Hastings算法
我需要研究马尔可夫链蒙特卡罗方法,更具体地说,我需要研究Metropolis Hastings算法及其所有类似收敛准则的算法。 谁能给我开一本书,一本论文或一个网站,用简单的术语解释这一论点,却又不琐碎?
11 references  mcmc 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.