统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
低阶线性系统的快速计算/估计
方程的线性系统普遍存在于计算统计中。我遇到的一种特殊系统(例如,在因子分析中)是 Ax=b一个X=bAx=b 其中 这里d是Ñ × Ñ对角线矩阵具有严格为正对角,Ω是米× 米(具有米« Ñ)对称半正定矩阵,乙是任意Ñ × 米矩阵。我们被要求解决一个被低秩矩阵扰动的对角线性系统(简单)。解决上述问题的幼稚方法是使用伍德伯里公式将A求逆A=D+BΩBT一个=d+乙Ω乙ŤA=D+ B \Omega B^TDdDn×nñ×ñn\times nΩΩ\Omegam×m米×米m\times mm≪n米≪ñm\ll nB乙Bn×mñ×米n\times mAAA。但是,这并不对劲,因为Cholesky和QR因式分解通常可以大大加快线性系统(和法向方程式)的求解速度。我最近提出了以下论文,该论文似乎采用了Cholesky方法,并提到了伍德伯里反演的数值不稳定性。但是,该论文似乎是草稿形式,我找不到数值实验或支持性研究。解决我描述的问题的最新技术水平是什么?


2
我可以测试先前给定数据的有效性吗?
问题 我正在编写一个R函数,该函数执行贝叶斯分析以在已知先验和数据的情况下估计后验密度。我希望该功能在用户需要重新考虑之前发出警告。 在这个问题上,我有兴趣学习如何评估先验。先前的问题涵盖了陈述知情先验的机制(此处和此处)。 在以下情况下,可能需要重新评估先验值: 数据代表了一个极端的情况,在陈述之前 数据中的错误(例如,如果先验单位为kg,则数据单位为g) 由于代码中的错误,因此从一组可用的优先级中选择了错误的优先级 在第一种情况下,先验通常仍然足够分散,除非数据值在不受支持的范围内(例如,logN或Gamma <0),否则数据通常会使它们不堪重负。其他情况是错误或错误。 问题 关于使用数据评估先验的有效性是否存在任何问题? 是否有任何特定测试最适合此问题? 例子 这是两个与较差的数据集,因为它们来自具有(红色)或(蓝色)的。升Ò 克ñ(0 ,1 )升ØGñ(0,1个)logN(0,1)ñ(0 ,5 )ñ(0,5)N(0,5)ñ( 8 ,0.5 )ñ(8,0.5)N(8,0.5) 蓝色数据可能是有效的先验+数据组合,而红色数据将需要先验分布,该分布支持负值。 set.seed(1) x<- seq(0.01,15,by=0.1) plot(x, dlnorm(x), type = 'l', xlim = c(-15,15),xlab='',ylab='') points(rnorm(50,0,5),jitter(rep(0,50),factor =0.2), cex = 0.3, col = 'red') points(rnorm(50,8,0.5),jitter(rep(0,50),factor =0.4), cex = 0.3, col = 'blue')

2
如何估算卡尔曼滤波器的参数
在上一个问题中,我询问了一些非高斯经验数据的拟合分布。 有人建议我离线,我可以尝试假设数据是高斯的,并且首先适合卡尔曼滤波器。然后,根据错误,确定是否值得开发更新颖的产品。这就说得通了。 因此,利用一组不错的时间序列数据,我需要估算几个变量才能使卡尔曼滤波器运行。 (当然,某处可能有一个R包,但我想亲自学习如何做。)

3
ITT和ATE有什么区别?
我很难理解可以在影响评估中使用的不同估计量。我知道意向性(ITT)估算器会比较没有该计划的合格个人与有该计划的合格个人之间的差异,而不管其遵守情况如何。但是,我认为平均治疗效果(ATE)也能测量出相同的结果。但是,ATE似乎考虑了合规性。因此,它比较了符合条件和接受治疗的患者与不符合条件的患者的结局。它是否正确?

3
随机跟踪技术
我在M. Seeger(加利福尼亚大学伯克利分校,Cholesky分解的低秩更新)中遇到了以下随机跟踪技术。Rep,2007年。 tr(A)=E[xTAx]tr⁡(A)=E[xTAx]\operatorname{tr}(\mathbf{A}) = {E[\mathbf{x}^T \mathbf{A} \mathbf{x}]} 其中x∼N(0,I)x∼N(0,I)\mathbf{x} \sim N(\mathbf{0},\mathbf{I})。 作为一个没有深厚的数学背景的人,我想知道如何实现这种平等。此外,我们如何例如以几何方式解释xTAxxTAx\mathbf{x}^T \mathbf{A} \mathbf{x}?为了理解向量的内积及其范围值的含义,应该看哪儿?为什么平均值等于特征值之和?除理论性质外,它的实际意义是什么? 我已经编写了一个MATLAB代码片段以查看它是否有效 #% tr(A) == E[x'Ax], x ~ N(0,I) N = 100000; n = 3; x = randn([n N]); % samples A = magic(n); % any n by n matrix A y = zeros(1, N); for i = …

2
使用AUC的理由?
特别是在机器学习文献的面向计算机科学的方面,AUC(接收方操作员特征曲线下的区域)是评估分类器的常用标准。使用AUC有什么理由?例如,是否存在一个特定的损失函数,其最佳决策是具有最佳AUC的分类器?

6
与云中运行的R会话进行交互的最佳方法
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我有R于亚马逊EC2上运行,使用的修改版本Bioconductor的AMI。当前,我正在使用腻子将ssh放入服务器,从命令行启动R,然后将脚本从notepad ++复制并粘贴到我的腻子会话中。 事情是,我讨厌剪切和粘贴。感觉很困难,有时我会遇到奇怪的缓冲问题,这些问题使我的代码搞砸了。我不能使用RStudio,因为它不支持我严重依赖的多核。 有什么更优雅的方式做到这一点? /编辑:感谢所有的伟大建议。现在,我已经切换到将doeach与doRedis后端一起使用foreach,它在Mac,PC以及通过RStudio的Amazon上都可以很好地工作。一旦我学会了如何使用“ foreach” 编写一个模拟“ lapply”的函数,此切换就非常容易。(此外,doRedis很棒!)
10 r 

2
R中的Markowitz投资组合均值方差优化
我有5个新兴市场外汇总收益系列,我正为它们预测单期未来收益(1年)。我想使用历史方差和协方差(1)和我自己的预测预期收益来构建5个系列的Markowitz平均均值优化组合。R是否有(简便)方法/库来做到这一点?另外,我将如何计算(1)是否有内置函数? 为了利息,我的货币为USDTRY,USDZAR,USDRUB,USDHUF和USDPLN。
10 r 


2
使用R对二分数据进行因子分析的推荐程序
我必须对由二分变量(0 =是,1 =否)组成的数据集进行因子分析,我不知道自己是否走对了。 使用tetrachoric()我创建一个相关矩阵,并在其上运行fa(data,factors=1)。结果与使用MixFactor时收到的结果非常接近,但事实并非如此。 可以吗?还是您建议其他程序? 为什么会fa()工作并factanal()产生错误?(Fehler in solve.default(cv) : System ist für den Rechner singulär: reziproke Konditionszahl = 4.22612e-18)

3
不同国家的儿童统计教育?
我很想知道孩子们在世界各地学习的统计数据水平。您能否建议可以说明这方面正在发生什么的数据/链接? 我开始 以色列:参加高级数学学习的学生或多或少-均值,标准差,直方图,正态分布,非常基本的概率。
10 dataset  teaching 

2
纵向数据:时间序列,重复测量或其他?
用简单的英语来说: 我有一个多元回归或ANOVA模型,但是每个人的响应变量都是时间的曲线函数。 如何确定哪个右侧变量导致曲线的形状或垂直偏移的显着差异? 这是时间序列问题,重复测量问题还是其他所有问题? 分析此类数据的最佳实践是什么(最好在中R,但我愿意使用其他软件)? 确切地说: 假设我有一个模型但实际上是从收集的一系列数据点在许多时间点,相同的个体被记录为数值变量。绘制数据表明,对于每个个体是时间的二次函数或周期性函数,其垂直偏移,形状或频率(在周期性情况下)可能极大地取决于协变量。协变量不会随时间变化-即,在数据收集期间,个体具有恒定的体重或治疗组。ÿ我Ĵ ķ= β0+ β1个X一世+ β2XĴ+ β3X一世XĴ+ ϵķÿ一世Ĵķ=β0+β1个X一世+β2XĴ+β3X一世XĴ+ϵķy_{ijk} = \beta_0 + \beta_1 x_i + \beta_2 x_j + \beta_3 x_i x_j + \epsilon_kÿ我Ĵ ķÿ一世Ĵķy_{ijk}ķķkŤŤtÿ我Ĵ ķ 吨ÿ一世ĴķŤy_{ijkt} 到目前为止,我已经尝试了以下R方法: 马诺娃 Anova(lm(YT~A*B,mydata),idata=data.frame(TIME=factor(c(1:10))),idesign=~TIME); ...这里YT是一个矩阵,其列为时间点,在此示例中为10个,但在实际数据中则更多。 问题:这将时间视为一个因素,但是每个人的时间点并不完全匹配。此外,其中有许多是与样本大小相关的,因此模型变得饱和。似乎随时间变化的响应变量的形状被忽略了。 混合模型(如Pinheiro和Bates,S和S-Plus中的混合效应模型) lme(fixed=Y~ A*B*TIME + sin(2*pi*TIME) + cos(2*pi*TIME), data=mydata, random=~(TIME + sin(2*pi*TIME) + cos(2*pi*TIME))|ID), method='ML') ...其中ID一个因素是按个人分组数据。在此示例中,响应随时间变化是周期性的,但是可以替代地存在二次项或其他时间函数。 …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.