统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
使用布朗桥模拟布朗旅行?
我想以模拟布朗偏移处理(即空调总是正的一个布朗运动时到在)。由于Brownian偏移过程是一个条件为始终为正的Brownian桥,因此我希望使用Brownian桥来模拟Brownian偏移的运动。0 t = 10<t<10<t<10 \lt t \lt 1000t=1t=1t=1 在R中,我正在使用“ e1017”包来模拟布朗桥过程。如何使用该布朗桥过程创建布朗漂移?

2
使用R的glmnet的Ridge回归和Python的scikit-learn有什么区别?
我正在阅读James,Witten,Hastie,Tibshirani(2013)写的《 R语言中的统计学习及其应用入门》一书中关于Ridge回归/套索的LAB部分§6.6 。 更具体地说,我尝试将scikit-learn Ridge模型应用于R包“ ISLR”中的“ Hitters”数据集。我已经创建了与R代码所示相同的一组功能。但是,我无法接近glmnet()模型的结果。我选择了一个L2调整参数进行比较。(scikit-learn中的“ alpha”参数)。 蟒蛇: regr = Ridge(alpha=11498) regr.fit(X, y) http://nbviewer.ipython.org/github/JWarmenhoven/ISL-python/blob/master/Notebooks/Chapter%206.ipynb R: 请注意,alpha=0in 参数glmnet()表示应采用L2惩罚(Ridge回归)。文档警告不要为输入单个值lambda,但结果与使用向量的ISL中的结果相同。 ridge.mod <- glmnet(x,y,alpha=0,lambda=11498) 是什么导致差异? 编辑:从R中的惩罚包 使用时penalized(),系数与scikit-learn相同。 ridge.mod2 <- penalized(y,x,lambda2=11498) 也许问题可能还会是:“ 进行Ridge回归glmnet()与penalized()进行回归时有什么区别? 用于R包glmnet中的实际Fortran代码的新python包装器 https://github.com/civisanalytics/python-glmnet

1
整体p值和成对p值?
我已经拟合了通用线性模型 其对数似然为。大号ùy=β0+β1x1+β2x2+β3x3,y=β0+β1x1+β2x2+β3x3,y=\beta_0+\beta_1x_1+\beta_2x_2+\beta_3x_3,LuLuL_u 现在,我想测试系数是否相同。 首先,整体测试:简化模型对数似然为。通过似然比检验,完整模型明显优于简化模型(。大号- [R p = 0.02y=β0+β1⋅(x1+x2+x3)y=β0+β1⋅(x1+x2+x3)y=\beta_0+\beta_1\cdot(x_1+x_2+x_3)LrLrL_rp=0.02p=0.02p=0.02 接下来,β1=β2β1=β2\beta_1=\beta_2?简化模型为y=β0+β1⋅(x1+x2)+β2x3y=β0+β1⋅(x1+x2)+β2x3y=\beta_0+\beta_1\cdot(x_1+x_2)+\beta_2x_3。其结果是,β1β1\beta_1不是从不同β2β2\beta_2与p=0.15p=0.15p=0.15。 同样,β1=β3β1=β3\beta_1=\beta_3吗?它们与p = 0.007不同p=0.007p=0.007p=0.007。 最后,β2=β3β2=β3\beta_2=\beta_3吗?它们与p=0.12p=0.12p=0.12。 这让我很困惑,因为我希望总体ppp小于0.0070.0070.007,因为显然β1=β2=β3β1=β2=β3\beta_1=\beta_2=\beta_3比β1=β3β1=β3\beta_1=\beta_3(生成p=0.007p=0.007p=0.007)要严格得多。 也就是说,由于我已经“ 0.0070.0070.007确信” β1=β3β1=β3\beta_1=\beta_3不成立,因此我应该“更加确信” β1=β2=β3β1=β2=β3\beta_1=\beta_2=\beta_3不成立。所以我的ppp应该下降。 我测试不正确吗?否则,我在上述推理中哪里错了?

2
偏向引导程序:是否可以将CI置于观察到的统计数据的中心?
这类似于Bootstrap:估算值超出置信区间 我有一些数据可以代表人群中基因型的数量。我想使用Shannon指数来估算遗传多样性,并且还要使用自举法生成一个置信区间。但是,我已经注意到,通过自举进行的估算往往会产生极大的偏差,并导致置信区间超出我观察到的统计数据。 下面是一个例子。 # Shannon's index H <- function(x){ x <- x/sum(x) x <- -x * log(x, exp(1)) return(sum(x, na.rm = TRUE)) } # The version for bootstrapping H.boot <- function(x, i){ H(tabulate(x[i])) } 资料产生 set.seed(5000) X <- rmultinom(1, 100, prob = rep(1, 50))[, 1] 计算方式 H(X) ## [1] 3.67948 …

1
卡方测试可用于哪种特征选择?
在这里,我问其他人在监督学习中通常使用卡方检验来进行特征选择和结果选择的做法。如果我理解正确,他们是否测试每个功能和结果之间的独立性,并比较每个功能的测试之间的p值? 在http://en.wikipedia.org/wiki/Pearson%27s_chi-squared_test中, 皮尔逊卡方检验是一种统计检验,应用于分类数据集,以评估两组之间观察到的差异是偶然产生的可能性。 ... 独立性测试评估列联表中表示的关于两个变量的成对观测值是否彼此独立(例如,轮询来自不同国籍的人的答复,以查看其国籍是否与答复相关)。 那么,由测试测试其独立性的两个变量是否应该是分类的或离散的(除分类之外允许排序),而不是连续的? 从http://scikit-learn.org/stable/modules/feature_selection.html,他们 执行χ2χ2\chi^2测试到虹膜数据集到只检索最佳的两个特征。 在虹膜数据集中,所有特征都是数字值和连续值,结果是类标签(分类)。卡方独立性检验如何应用于连续要素? 要将卡方独立性检验应用于数据集,我们是否首先通过装仓(即先将要素的连续域离散化为仓,然后将其替换为仓中的要素值)来将连续要素转换为离散要素)? 几个容器中的出现形成多项式特征(每个容器中都发生或不发生),因此卡方独立性检验可以应用于它们,对吗? 顺便说一句,我们可以将卡方独立性检验应用于任何特征和结果吗? 对于结果部分,我们不仅可以通过卡方独立性检验,通过对连续结果进行分箱来选择用于分类的特征,还可以为回归选择特征,对吗? scikit学习网站还说 计算每个非负要素与类之间的卡方统计量。 此分数可用于从X中选择测试卡方统计量具有最高值的n_features特征,该特征必须仅包含非负特征,例如布尔值或频率 (例如,文档分类中的术语计数),相对于类。 为什么测试需要非阴性功能? 如果这些特征没有符号,但是是分类的或离散的,则测试仍然可以应用到它们吗?(请参阅我的第1部分) 如果特征是负的,我们总是可以对它们的域进行归类,并用它们的出现替换它们(就像我对将测试应用于虹膜数据集所猜测的那样,请参阅第2部分),对吗? 注意:我猜Scikit Learn遵循一般原则,这就是我在这里要的。如果没有,那还是可以的。

2
为什么限制最大似然会产生更好的(无偏的)方差估计?
我正在阅读道格·贝茨(Doug Bates)关于R的lme4程序包的理论论文,以更好地理解混合模型的本质,并遇到了一个我想更好理解的有趣结果,即使用受限最大似然(REML)估计方差。 在关于REML标准的第3.3节中,他指出,在拟合线性模型中根据残差估计方差时,在方差估计中使用REML与使用自由度校正紧密相关。特别是,“尽管通常不是这样得出的”,但可以通过优化“ REML准则”估算方差来推导自由度校正(公式(28))。REML标准基本上只是可​​能性,但是线性拟合参数已通过边缘化来消除(而不是将其设置为等于拟合估计值,这会产生有偏差的样本方差)。 我进行了数学运算,并验证了仅具有固定效果的简单线性模型所声称的结果。我正在努力的是解释。是否存在某种观点,可以通过优化拟合参数被边缘化的可能性来自然地推导方差估计?感觉有点像贝叶斯,好像我认为似然性是后验的,将拟合参数边缘化,就好像它们是随机变量一样。 还是说辩护主要只是数学上的-它在线性情况下有效,但也可以推广?

2
为什么报告中位数的置信区间如此罕见?
为什么发现应用科学论文中报道的置信区间如此罕见?我主要从事计算机科学方面的工作,但经常阅读(社会)心理学,社会学和城市规划方面的论文。我不记得曾经看到过报告中位数的CI。 同时,在研究置信区间等时,对我来说很明显,在所有情况下,中位数是一个人的数据的更好描述者,这是应该给出的估计值。 是否有任何理论上的原因导致为什么不常见中位数的CI?

2
关于给定响应变量的最佳分箱
我正在寻找相对于给定响应(目标)二进制变量并以最大间隔数为参数的连续变量的最佳合并方法(离散化)。 示例:我对“身高”(数字连续)和“ has_back_pains”(二进制)变量的人有一组观察。我想将高低离散化为最多3个间隔(组),以不同比例的背部疼痛患者来做,这样算法就可以最大程度地使各组之间的差异最大化(例如,在给定限制的情况下,每个间隔至少有x个观察值)。 解决此问题的明显方法是使用决策树(一个简单的单变量模型),但我在R中找不到任何将“最大分支数”作为参数的函数-它们全部将变量除分成2块(<= x和> x)。SAS矿工具有“最大分支”参数,但我正在寻找非商业解决方案。 我的一些变量只有几个唯一值(可以视为离散变量),但我想将它们离散化为较小的间隔。 与我的问题最接近的解决方案是在R中的smbinning包中实现的(依赖于party包中的ctree函数),但是它有两个缺点:无法设置间隔数(但是,您可以通过更改间隔找到解决方法p参数),并且当数据向量的唯一值少于10个时无效。无论如何,您可以在此处看到示例输出(Cutpoint和Odds列至关重要): Cutpoint CntRec CntGood CntBad CntCumRec CntCumGood CntCumBad PctRec BadRate Odds LnOdds WoE IV 1 <= 272 9081 169 8912 9081 169 8912 0.1874 0.9814 0.0190 -3.9653 -0.6527 0.0596 2 <= 311 8541 246 8295 17622 415 17207 0.1762 0.9712 0.0297 -3.5181 -0.2055 …


2
从lmer获得自由度
我已经将lmer模型与以下内容配合在一起(尽管已完成输出): Random effects: Groups Name Std.Dev. day:sample (Intercept) 0.09 sample (Intercept) 0.42 Residual 0.023 我真的很想使用以下公式为每种效果建立一个置信区间: (n − 1 )s2χ2α / 2 ,n − 1,(n − 1 )s2χ21 - α / 2 ,Ñ - 1(ñ-1个)s2χα/2,ñ-1个2,(ñ-1个)s2χ1个-α/2,ñ-1个2 \frac{(n-1)s^2}{\chi^2_{\alpha/2, n-1}},\frac{(n-1)s^2}{\chi^2_{1-\alpha/2,n-1}} 有没有一种方法可以方便地摆脱自由度?

3
当协方差矩阵不是正定时,如何进行因子分析?
我有一个数据集,其中包含717个观测值(行),这些观测值由33个变量(列)描述。通过对所有变量进行z评分来标准化数据。没有两个变量是线性相关的()。我还删除了所有方差很小(小于)的变量。下图显示了相应的相关矩阵(以绝对值表示)。0.1r = 1r=1r=10.10.10.1 当我尝试factoran在Matlab中使用以下方法运行因子分析时: [Loadings1,specVar1,T,stats] = factoran(Z2,1); 我收到以下错误: The data X must have a covariance matrix that is positive definite. 你能告诉我问题出在哪里吗?是否由于使用的变量之间相互依存性较低?另外,我该怎么办? 我的相关矩阵:

1
最小风险分类器的计算阈值?
假设两个类和具有属性并具有分布和。如果我们对于以下成本矩阵具有相等的先验:C1C1C_1C2C2C_2xxxN(0,0.5)N(0,0.5) \cal{N} (0, 0.5)N(1,0.5)N(1,0.5) \cal{N} (1, 0.5)P(C1)=P(C2)=0.5P(C1)=P(C2)=0.5P(C_1)=P(C_2)=0.5 L=[010.50]L=[00.510]L= \begin{bmatrix} 0 & 0.5 \\ 1 & 0 \end{bmatrix} 为什么是最低风险(成本)分类器的阈值?x0&lt;0.5x0&lt;0.5x_0 < 0.5 这是我误会的注释示例(即,如何达到此阈值?) 编辑1:我认为对于似然比的阈值,我们可以使用P(C1)/ P(C2)。 编辑2:我从Duda Book on Pattern上添加了一些有关阈值的文本。

1
具有采样变量的混合效应模型设计
我正在尝试lme4为实验设计指定线性混合效果模型(带有)的公式,但是不确定执行是否正确。 设计:基本上,我正在测量植物的响应参数。我有4种治疗水平和2种灌溉水平。将植物分为16个地块,在每个地块中,我对4个子图进行采样。在每个子图中,我进行15到30次观察(取决于发现的植物数量)。即,总共有1500行。 最初,子图级别只是出于采样目的,但是我想在模型中将其考虑在内(作为64级变量),因为我看到从一个子图到另一个子图有很多可变性,即使在同一图内(大于整个图之间的差异)。 我的第一个想法是写: library(lme4) fit &lt;- lmer(y ~ treatment*irrigation + (1|subplot/plot), data=mydata) 要么 fit &lt;- lmer(y ~ treatment*irrigation + (1|subplot) + (1|plot), data=mydata) 那是对的吗?我不确定是否必须在公式中同时保留两个图/子图级别。没有固定的影响是重要的,但随机的影响是非常重要的。


3
“反转”的夏皮罗-威尔克
根据维基百科,Sharipo-Wilk检验测试零假设()“总体呈正态分布”。H0H0H_0 我正在寻找类似的正态性检验,其 “总体不是正态分布”。H0H0H_0 具有这样的试验中,我要计算一个 -值拒绝ħ 0在显着性水平α IFF p &lt; α ; 证明我的人口呈正态分布。pppH0H0H_0αα\alphap &lt; αp&lt;αp < \alpha 请注意,使用Sharipo-Wilk检验并接受 iff p &gt; α是不正确的方法,因为这从字面上意味着“我们没有足够的证据证明H0不成立”。H0H0H_0p &gt; αp&gt;αp > \alpha 相关线程-p -value的含义ppp,正常性测试没用吗?,但看不到我的问题的解决方案。 问题:我应该使用哪种测试?它在R中实现吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.