统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
二元数据的因子分析
一位匿名读者在我的博客上发布了以下问题。 内容: 读者希望通过问卷对量表进行因子分析-但数据来自成对的丈夫和妻子。 题: 可以对二元数据进行因子分析吗?如果是这样,怎么办? 独立性假设是否适用于因子分析?

2
计算带漂移的随机游走最大回撤的累积分布
我对随机游走的最大跌幅的分布感兴趣:令,其中。周期后的最大为。由A纸张Magdon-伊斯梅尔等。等 给出具有漂移的布朗运动的最大衰减的分布。该表达式涉及一个无限和,其中包括一些仅隐式定义的术语。我在编写收敛的实现时遇到问题。有谁知道CDF的替代表达或代码中的参考实现?X0=0,Xi+1=Xi+Yi+1X0=0,Xi+1=Xi+Yi+1X_0 = 0, X_{i+1} = X_i + Y_{i+1}Yi∼N(μ,1)Yi∼N(μ,1)Y_i \sim \mathcal{N}(\mu,1)nnnmax0≤i≤j≤n(Xi−Xj)max0≤i≤j≤n(Xi−Xj)\max_{0 \le i \le j \le n} (X_i - X_j)

2
动态计算估计均值所需的样本数量
我正在尝试通过抽样估计高斯分布的均值。我尚无关于其均值或方差的知识。每个样品的获取都很昂贵。如何动态确定要获得一定水平的置信度/准确性所需的样本数量?另外,我如何知道何时可以停止采样? 我能找到的所有类似问题的答案似乎都是对方差的一些了解,但我也需要一路发现这一点。其他人则适合进行民意调查,但我(初学者是我)还不清楚这种说法的普遍性-我的意思不是[[0,1]等)。 我认为这可能是一个答案很简单的简单问题,但是我的Google-fu令我失望。即使只是告诉我要搜索的内容也会很有帮助。

2
预先结合以进行Gamma分配
我需要基于同一系统的新故障率来更新故障率(确定性)(也是确定性的)。我读到了关于共轭先验和伽马分布的Poisson过程的共轭信息。 另外,我可以将Gamma dist的平均值等同。(β/ αβ/α\beta/\alpha)到新的比率(作为平均值),但我没有其他任何信息,例如标准差,变异系数,第90个百分位数等。有没有一种神奇的方法来操纵它并为先前的Gamma查找参数,因此我也能获得哪个Gamma的后验?
9 bayesian 


3
关于PCA术后斜转
几个统计软件包(例如SAS,SPSS和R)使您可以在PCA之后执行某种因子轮换。 为什么要在PCA之后进行轮换? 考虑到PCA的目的是产生正交尺寸,为什么要在PCA之后进行倾斜旋转?

1
实验中拉丁方的理想和不良特性?
粗略的搜索表明,拉丁方格在实验设计中被广泛使用。在攻读博士学位期间,我研究了拉丁方格的各种理论特性(从组合角度出发),但是对拉丁方格的特长没有深入的了解,这使得拉丁方格特别适合于实验设计。 我知道拉丁方格擅长让统计学家有效地研究存在两个因素在不同“方向”上有所不同的情况。但是,我也相当有信心可以使用许多其他技术。 拉丁方格特别适合使实验设计适合其他设计所没有的拉丁方格呢? 此外,还有成千上万的拉丁广场可供选择,那么您选择哪个拉丁广场呢?我知道随机选择一个很重要,但是仍然会有一些拉丁方比其他方格不适合进行实验(例如,循环组的Cayley表)。这就提出了以下问题。 对于实验设计,拉丁方格的哪些属性是理想的,而拉丁方格的哪些属性则是不良的?

2
在结合了两个分布的模型中测量拟合优度
我有要建模的双峰数据,并且峰之间有足够的重叠,因此无法独立对待它们。数据的直方图可能看起来像这样: 为此,我创建了两个模型:一个模型使用两个Poisson分布,另一个模型使用两个负二项式分布(以解决过度分散问题)。哪种模型可以更准确地确定适合数据的合适方法是什么? 我最初的想法是,我可以使用Kolmogorov-Smirnov检验将每个模型与数据进行比较,然后进行似然比检验,看是否一个模型更合适。这有意义吗?如果是这样,我不确定如何执行似然比测试。卡方是否合适,我有多少自由度? 如果有帮助,这些模型的一些(非常简化的)R代码可能看起来像这样: ## inital data points a <- read.table("data") #create model data model.pois = c(rpois(1000000,200),rpois(500000,250)) model.nb = c(rnbinom(1000000,200,0.5),rnbinom(500000,275,0.5) #Kolmogorov-Smirnov test #use ks.boot, since it's count data that may contain duplicate values kpois = ks.boot(model.pois,a) knb = ks.boot(model.nb,a) #here's where I'd do some sort of likelihood ratio test # …

3
我们如何为置换测试的参数创建置信区间?
置换检验是基于从原始数据中随机抽取的置换重采样进行的显着性检验。引导重采样是在没有替换的情况下绘制的,而引导程序样本是在替换后绘制的。这是我在R中进行的简单置换测试的示例。(欢迎您发表评论) 置换测试具有很大的优势。他们不需要特定的总体形状,例如正态分布。它们适用于各种统计数据,而不仅适用于在零假设下具有简单分布的统计数据。无论总体的形状和大小如何,它们都可以给出非常准确的p值(如果使用了足够的排列)。 我还读到,给出一个置信区间和一个测试通常很有用,该测试是使用引导重采样而不是置换重采样创建的。 您能否解释(或仅给出R代码)如何构建置信区间(即,上述示例中两个样本的均值之间的差异)? 编辑 经过一番谷歌搜索,我发现了这有趣的读物。

3
计算最佳的预测变量子集以进行线性回归
为了在具有合适的预测变量的多元线性回归中选择预测变量,有哪些方法可以找到预测变量的“最佳”子集而无需明确测试所有个子集?在“应用的生存分析”中,Hosmer&Lemeshow引用了Kuk的方法,但是我找不到原始论文。谁能描述这种方法,或者甚至更好的一种更现代的技术?可以假设正态分布的错误。ppp2p2p2^p

3
使用转换变量时的线性回归效应大小
执行线性回归时,对因变量进行对数转换(例如对数转换)以获得更好的正态分布构型通常很有用。通常,从回归检查beta值也很有用,以更好地评估结果的效果大小/实际相关性。 这就产生了一个问题,即在使用例如对数转换时,效果大小将为对数刻度,并且有人告诉我,由于所用刻度的非线性,对这些beta进行反向转换将导致无意义的值,没有任何现实世界的用法。 到目前为止,我们通常使用转换变量进行线性回归以检查显着性,然后使用原始非转换变量进行线性回归以确定效果大小。 有正确/更好的方法吗?在大多数情况下,我们使用临床数据,因此,一个现实生活中的例子将是确定某种暴露如何影响持续的变量,例如身高,体重或某些实验室测量值,然后我们得出结论,例如“暴露A产生了影响”。重量增加2公斤”。

2
比较两种遗传算法
我有两种遗传算法的实现方式,它们应该表现相同。但是,由于无法解决的技术限制,在给定相同输入的情况下,它们的输出并不完全相同。 我仍然想证明没有明显的性能差异。 对于两种算法,我使用相同的配置进行了20次运行,并使用了不同的初始随机数种子。对于每次运行和每一代,记录总体中最佳个体的最小误差 适用度。该算法采用了精英保留机制,因此最佳个人的适合度单调下降。一次运行包含1000代,因此每次运行我都有1000个值。我无法获得更多数据,因为计算非常昂贵。 我应该使用哪种测试?一种简单的方法可能是只比较最后几代中的错误(再次,我将在此处使用哪种测试)?但人们可能还会考虑比较一般的收敛行为。




By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.