统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
将混合模型(作为随机效应)与简单的线性模型(作为固定效应)进行比较
我正在完成对大量数据的一些分析。我想采用在工作的第一部分中使用的线性模型,并使用线性混合模型(LME)重新拟合它。除了将模型中使用的变量之一用作随机效应外,LME非常相似。该数据来自一小群受试者(约10个)中的许多观察值(> 1000),我知道,将受试者的效果建模为随机效果更好(这是我要转移的变量)。R代码如下所示: my_modelB <- lm(formula = A ~ B + C + D) lme_model <- lme(fixed=A ~ B + C, random=~1|D, data=my_data, method='REML') 一切运行正常,结果极为相似。如果我可以使用RLRsim或AIC / BIC之类的东西来比较这两种模型并确定最合适的模型,那就太好了。我的同事们不想举报LME,因为尽管我认为LME是更合适的模型,但是没有一种容易获得的选择“更好”的方法。有什么建议么?

1
在R中的lm()中选择因子级别作为虚拟基准
可以说我正在X1和X2上回归Y,其中X1是一个数字变量,X2是一个具有四个级别(A:D)的因数。有什么方法可以编写线性回归函数,lm(Y ~ X1 + as.factor(X2))以便我可以选择特定级别的X2(例如B)作为基线?
10 r 

2
检测点云数据中的圆形图案
对于我正在研究的一些体积重建算法,我需要检测3d点数据中的任意数量的圆形图案(来自LIDAR设备)。这些图案可以在空间中任意定向,并且可以假定(尽管不是很完美)位于薄的2d平面中。这是在同一平面上有两个圆的示例(尽管请记住,这是一个3d空间): 我尝试了许多方法。.最简单的方法(但到目前为止效果最好的方法)是基于最近邻图的不相交集进行聚类。当模式相距较远时,这可以很好地工作,但对于示例中的彼此非常靠近的圆圈,效果则较小。 我尝试了K-means,但效果不佳:我怀疑圆点排列可能不太适合。另外,我还有另一个问题,就是事先不知道K的值。 根据最近邻图中的循环检测,我尝试了更复杂的方法,但是我得到的结果太脆弱或计算量太大。 我还阅读了很多相关主题(霍夫变换等),但似乎没有什么东西可以在这种特定情况下完美地适用。任何想法或灵感将不胜感激。

3
使用MCMC评估高维函数的期望值
我正在从事与优化相关的研究项目,最近有了一个在此环境中使用MCMC的想法。不幸的是,我对MCMC方法还很陌生,所以我有几个问题。我将从描述问题开始,然后问我的问题。 我们的问题归结为估算成本函数其中是密度为的维随机变量。。c(ω)c(ω)c(\omega)ω=(ω1,ω2,...ωh)ω=(ω1,ω2,...ωh)\omega = (\omega_1,\omega_2,...\omega_h)hhhf(ω)f(ω)f(\omega) 在我们的情况下,不存在的封闭形式版本。这意味着我们必须使用蒙特卡洛方法来近似期望值。不幸的是,事实证明,使用MC或QMC方法生成的E [ c (ω )]估计值差异太大,无法在实际环境中使用。c(ω)c(ω)c(\omega)E[c(ω)]E[c(ω)]E[c(\omega)] 一个想法是,我们必须使用重要性采样分布来生成采样点,该采样点将产生的低方差估计E[c(ω)]E[c(ω)]E[c(\omega)]。在我们的案例中,理想重要性抽样分布g(ω)g(ω)g(\omega)必须与大致成比例c(ω)f(ω)c(ω)f(ω)c(\omega)f(\omega)。看看如何知道g(ω)g(ω)g(\omega)直到常数,我想知道是否可以将MCMC与提案分布c(ω)f(ω)c(ω)f(ω)c(\omega)f(\omega)最终从产生样本g(ω)g(ω)g(\omega)。 我的问题是: 可以在此设置中使用MCMC吗?如果是这样,哪种MCMC方法合适?我在MATLAB中工作,因此我偏爱已经具有MATLAB实现的任何内容。 有什么我可以用来加速MCMC老化时间的技术。我怎么知道已经达到平稳分布?在这种情况下,对于给定的ω实际上需要花费相当多的时间来计算。c(ω)c(ω)c(\omega)ωω\omega

1
如何使矩阵为正定?
我正在尝试为以下因素分析模型实现EM算法; w ^Ĵ= μ + B aĴ+ eĴ对于j = 1 ,… ,nWj=μ+Baj+ejforj=1,…,nW_j = \mu+B a_j+e_j \quad\text{for}\quad j=1,\ldots,n 其中是p维随机向量,是潜变量的q维向量,是参数的pxq矩阵。一个Ĵ乙w ^ĴWjW_j一个Ĵaja_j乙BB 由于该模型使用了其他假设,因此我知道,其中是误差项的方差协方差矩阵, = diag(,,...,)。d È Ĵ d σ 2 1 σ 2 2 σ 2 pw ^Ĵ〜ñ(μ ,B B′+ D )Wj∼N(μ,BB′+D)W_j\sim N(\mu, BB'+D)dDDËĴeje_jdDDσ21个σ12\sigma_1^2σ22σ22\sigma_2^2σ2pσp2\sigma_p^2 为了使EM算法正常工作,我正在进行涉及和矩阵估计的圆顶迭代,并且在这些迭代过程中,我在每次迭代中使用和新估计来计算的逆。不幸的是,在迭代过程中,失去了正定性(但不应该这样做,因为它是一个方差-协方差矩阵),这种情况破坏了算法的收敛性。我的问题是:D B B ' + D B D B …

1
产生有约束的随机向量
我需要创建满足以下约束的实数a_i的随机向量: abs(a_i) < c_i; sum(a_i)< A; # sum of elements smaller than A sum(b_i * a_i) < B; # weighted sum is smaller than B aT*A*a < D # quadratic multiplication with A smaller than D where c_i, b_i, A, B, D are constants. 有效生成这种向量的典型算法是什么?

3
您如何判断良好的表现是否连胜?
我将Rubik的多维数据集作为爱好解决。我记录了使用某些软件解决多维数据集所花费的时间,因此现在我有了来自数千个解决方案的数据。数据基本上是一长串数字,代表每个顺序求解所花费的时间(例如22.11、20.66、21.00、18.74等) 自然,我求解多维数据集所需的时间因求解的不同而有所不同,因此有好的求解和不好的求解。 我想知道我是否“变热”-好的解决方案是否会出现条纹。例如,如果我连续有几个好的解决方案,那么下一个解决方案是否更有可能变得更好? 哪种分析比较合适?我可以想到一些具体的事情,例如将解决方案视为马尔可夫过程,查看一个解决方案对下一个解决方案的预测程度,并与随机数据进行比较,查看连续解决方案的最长条纹在最后一个解决方案中位数以下的时间100并与随机数据等中的预期值进行比较。我不确定这些测试的洞察力如何,并想知道是否存在一些针对此类问题的完善方法。


1
处理峰度产生的异常值
我想知道是否有人可以帮助我了解有关峰度的信息(即,是否有任何方法可以转换您的数据以减少它?) 我有一个包含大量案例和变量的问卷数据集。对于我的一些变量,数据显示出相当高的峰度值(即瘦小体分布),这是由于许多参与者对该变量给出的分数完全相同。我确实有一个特别大的样本量,因此根据中心极限定理,违反正态性仍然可以。 但是,问题在于,峰度特别高的事实在我的数据集中产生了许多单变量离群值。这样,即使我转换数据或除去/调整异常值,峰度的高水平也意味着下一个最高分会自动变为异常值。我打算使用(判别函数分析)。如果违规是由偏斜而不是异常值引起的,则据说DFA可以很好地抵制偏离正常状态的情况。此外,据说DFA特别受数据中异常值的影响(Tabachnick&Fidel)。 关于如何解决这个问题的任何想法?(我最初的想法是某种控制峰度的方法,但是如果我的大多数样本都给出类似的评分,那不是一件好事吗?)

4
核事故的综合概率
日本最近发生的事件使我思考以下问题。 通常,核电厂的设计目的是将严重事故的风险限制在“设计基准概率”之内,例如10E-6 /年。这是单个工厂的标准。但是,当有数百个反应堆时,我们该如何结合发生严重事故的单个概率?我知道自己可能会对此进行研究,但是找到该站点后,我确信可以有人很容易回答这个问题。谢谢

2
使用趋势线公式通过Excel获取任何给定X的值
是否有一种简单的方法可以将图表中的趋势线公式应用于Excel中的任何给定X值? 例如,我要获得给定X = $ 2,006.00的Y值。我已经采用了公式并将其重新输入为: =-0.000000000008*X^3 - 0.00000001*X^2 + 0.0003*X - 0.0029 我不断通过添加更多数据来对趋势线进行调整,并且不想每次都重新输入公式。
10 regression  excel 

1
使用metafor包在R中进行荟萃分析
在下面的小型荟萃分析的真实示例中,如何rma从metafor包中对函数进行语法化处理才能获得结果?(随机效应,摘要统计SMD) study, mean1, sd1, n1, mean2, sd2, n2 Foo2000, 0.78, 0.05, 20, 0.82, 0.07, 25 Sun2003, 0.74, 0.08, 30, 0.72, 0.05, 19 Pric2005, 0.75, 0.12, 20, 0.74, 0.09, 29 Rota2008, 0.62, 0.05, 24, 0.66, 0.03, 24 Pete2008, 0.68, 0.03, 10, 0.68, 0.02, 10
10 r  meta-analysis 

2
非参数回归的最佳特征选择方法
这里有一个新手问题。我目前正在使用R中的np包执行非参数回归。我有7个功能,并使用蛮力方法确定了最好的3个。但是,很快我将拥有7个以上的功能! 我的问题是,当前用于非参数回归的特征选择的最佳方法是什么?以及哪些程序包实现了这些方法。谢谢。


1
如何将两个时间序列与间隔和不同的时基相关联?
我在StackOverflow上提出了这个问题,建议在这里提出。 我有两个时间序列的3D加速度计数据,它们具有不同的时基(时钟在不同的时间开始,在采样时间中有一些非常小的蠕变),并且包含许多不同大小的间隙(由于与写入分开相关的延迟)闪存设备)。 我使用的加速度计是便宜的GCDC X250-2。我正在以最高增益运行加速度计,因此数据的本底噪声很大。 每个时间序列都有大约200万个数据点(以512个样本/秒的速度在一小时内),并且包含大约500个感兴趣的事件,其中典型事件跨越100-150个样本(每个200-300 ms)。这些事件中的许多事件都受到闪存写入期间数据中断的影响。 因此,数据不是原始的,甚至不是非常漂亮。但是我的眼球检查表明它清楚地包含了我感兴趣的信息。(如果需要,我可以发布图表。) 加速度计处于类似的环境中,但耦合程度适中,这意味着我可以通过肉眼分辨出每个加速度计匹配了哪些事件,但是到目前为止,我在软件中还是没有成功。由于物理限制,这些设备还以不同的方向安装,这些位置的轴不匹配,但它们尽可能接近正交。因此,例如,对于3轴加速度计A和B,+ Ax映射到-By(上下),+ Az映射到-Bx(左右),而+ Ay映射到-Bz(前后) 。 我的最初目标是关联垂直轴上的震动事件,尽管我最终希望a)自动发现轴映射,b)关联映射的ace上的活动,以及c)提取两个加速度计之间的行为差​​异(例如扭曲)或弯曲)。 时间序列数据的性质使Python的numpy.correlate()无法使用。我也看过R's Zoo套件,但是并没有取得进展。我曾在信号分析的不同领域寻求帮助,但没有取得任何进展。 有人对我可以做什么或应该研究的方法有任何线索吗? 2011年2月28日更新:此处添加了一些显示数据示例的图表。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.