统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
对数正态生存函数的平均生存时间
我发现了大量公式可以显示如何找到指数分布或Weibull分布的平均生存时间,但对数正态生存函数的运气却要差得多。 给定以下生存函数: 小号(t )= 1 − ϕ [ ln(吨)- μσ]S(t)=1−ϕ[ln⁡(t)−μσ]S(t) = 1 - \phi \left[ {{{\ln (t) - \mu } \over \sigma }} \right] 如何找到平均生存时间。据我了解,是估计的比例参数,而参数生存模型的exp(\ beta)是\ mu。虽然我觉得我可以操纵它象征性地获得牛逼全部由自己设定S(T)= 0.5后,有什么特别绊倒我是如何处理\披的东西如R时,它实际上归结为输入所有的估计和获得与此同时。β μσσ\sigmaββ\betaμμ\muϕϕ\phi 到目前为止,我一直在生成生存函数(及相关曲线),如下所示: beta0 <- 2.00 beta1 <- 0.80 scale <- 1.10 exposure <- c(0, 1) t <- seq(0, 180) linmod <- beta0 …
10 survival 

3
如何用时变偏差建模偏差硬币?
偏向硬币模型通常具有一个参数。从一系列平局中估计一种方法是使用Beta先验并以二项式似然计算后验分布。θθ=P(Head|θ)θ=P(Head|θ)\theta = P(\text{Head} | \theta)θθ\theta 在我的环境中,由于一些奇怪的物理过程,我的硬币特性正在缓慢变化,成为时间的函数。我的数据是一组有序抽奖,即。我可以认为我在离散且规则的时间网格上每仅获得一个抽奖。吨{ ħ ,Ť ,ħ ,ħ ,ħ ,Ť ,。。。} tθθ\thetattt{H,T,H,H,H,T,...}{H,T,H,H,H,T,...}\{H,T,H,H,H,T,...\}ttt 您将如何建模?我正在考虑类似卡尔曼滤波器的事情,以适应隐藏变量为并保持二项式可能性的事实。我可以使用什么来建模P(\ theta(t + 1)| \ theta(t))以保持推理的可操纵性?P (θ (吨+ 1 )| θ (吨))θθ\thetaP(θ(t+1)|θ(t))P(θ(t+1)|θ(t))P(\theta(t+1)|\theta(t)) 编辑以下答案(谢谢!):我想将\ theta(t)建模θ(t)θ(t)\theta(t)为1级马尔可夫链,就像在HMM或Kalman滤波器中所做的那样。我可以做出的唯一假设是θ(t)θ(t)\theta(t)是平滑的。我可以将P(θ(t+1)|θ(t))=θ(t)+ϵP(θ(t+1)|θ(t))=θ(t)+ϵP(\theta(t+1)|\theta(t)) = \theta(t) + \epsilon与\ epsilon一起写成ϵϵ\epsilon一个小高斯噪声(卡尔曼滤波器的思想),但这会破坏\ theta的要求θθ\theta必须保留在[0,1][0,1][0,1]。遵循@J Dav的想法,我可以使用probit函数将实线映射到[0,1][0,1][0,1],但是我有直觉,这将提供非分析性的解决方案。均值\ theta(t)的 beta分布θ(t)θ(t)\theta(t) 而更大的差异可以解决问题。 我问这个问题是因为我觉得这个问题是如此简单,以至于必须先进行研究。

4
在R与SciPy中拟合对数正态分布
我已经使用R与一组数据拟合了对数正态模型。结果参数为: meanlog = 4.2991610 sdlog = 0.5511349 我想将此模型转移到Scipy,这是我以前从未使用过的模型。使用Scipy,我可以得到1和3.1626716539637488488 + 90的形状和比例-非常不同的数字。我也尝试过使用meanlog和sdlog的exp,但是继续得到奇怪的图形。 我已经阅读了所有关于scipy的文档,但是对于这种情况下的形状和比例参数仍然感到困惑。自己编写该函数是否有意义?不过,这似乎容易出错,因为我是scipy的新手。 SCIPY对数正态(BLUE)与R对数正态(RED): 对采取什么方向有任何想法吗?顺便说一下,这些数据非常适合R模型,因此,如果看起来像Python中的其他内容,请随时共享。 谢谢! 更新: 我正在运行Scipy 0.11 这是数据的子集。实际样本为38k +,平均值为81.53627: 子集: x [60,170,137,138,81,140,78,46,1,168,138,148,145,35,82,126,66,147,88,106,80,54,83,13, 102、54、134、34 ] numpy.mean(x) 99.071428571428569 或者: 我正在研究捕获pdf的功能: def lognoral(x, mu, sigma): a = 1 / (x * sigma * numpy.sqrt(2 * numpy.pi) ) b = - (numpy.log(x) - mu) …
10 r  python  numpy  scipy 

2
结合二进制和连续响应的最佳方法
我正在尝试提出预测收款公司付款金额的最佳方法。付款后,因变量仅为非零。可以理解的是,由于绝大多数人无法联系到或无法偿还债务,因此存在大量的零。 债务金额和还款可能性之间也存在非常强烈的负相关关系。通常,我会创建一个逻辑模型来预测支付/不支付的可能性,但这不幸的结果是找到了余额最低的人。 有没有一种方法可以将后勤支付/非支付模型与预测支付金额的单独模型结合起来?

2
R中的Wilcoxon-Mann-Whitney临界值
我注意到,当我尝试使用R查找Mann-Whitney U的临界值时,该值始终为1+临界值。例如,对于α = .05 ,n = 10 ,m = 5α=.05,n=10,m=5\alpha=.05, n = 10, m = 5,(两尾)临界值是8;而对于α = .05 ,n = 12 ,m = 8α=.05,n=12,m=8\alpha=.05, n=12, m=8,(两尾)临界值值是22(请检查表格),但是: > qwilcox(.05/2,10,5) [1] 9 > qwilcox(.05/2,12,8) [1] 23 我当然不在考虑什么,但是...谁能解释我为什么?


2
如何解释这些自定义对比?
我正在使用自定义对比度进行单因素方差分析(每个物种)。 [,1] [,2] [,3] [,4] 0.5 -1 0 0 0 5 1 -1 0 0 12.5 0 1 -1 0 25 0 0 1 -1 50 0 0 0 1 我将强度0.5与5、5与12.5进行比较,依此类推。这些是我正在处理的数据 具有以下结果 Generalized least squares fit by REML Model: dark ~ intensity Data: skofijski.diurnal[skofijski.diurnal$species == "niphargus", ] AIC BIC logLik …

2
检测“相似”源代码的簇
假设我有400名学生(在一所大大学中)必须执行计算机科学项目,并且他们必须独自工作(没有一组学生)。一个项目的例子可以是“在fortran中实现快速傅立叶变换算法”(我知道,这听起来并不性感,但是这使我的问题更简单了)。我是纠正者,我想发送例程以检查是否有提议实施的学生群体“过于相似,无法真正独立编写”。 这是对集群的无监督搜索。我认为问题更多是关于使用哪些属性,而不是使用哪种聚类算法。我要做的第一件事是一个字母一个字母的直方图。理想情况下,由于作弊者比这更聪明,因此我最终将尝试选择较好的字母随机排列,以查看是否存在字母直方图(带有排列)的良好匹配。那些没有探究代码结构,只探究字母的边际分布的人……您有什么解决方案?是否有专门用于解决此问题的软件或软件包?(实际上,在过去,计算机科学老师声称他们拥有这种工具,但现在我怀疑他们的工具非常简单) 我猜软件开发的律师也有这类问题(不是有1000名学生,而是有2个大代码...这使事情变得更难了)?

3
使用最少的内存来训练数据的最有效方法是什么?
这是我的训练数据:200,000个示例x 10,000个功能。所以我的训练数据矩阵是-200,000 x 10,000。 当我为每个示例生成功能时,我设法将每个数据集一个接一个地保存(一个示例一个接一个),从而将其保存到一个平面文件中而没有内存问题。 但是,现在当我使用Milk,SVM light或任何其他机器学习算法时,一切都会尝试将整个训练数据加载到内存中,而不是一一训练。但是,我只有8 GB的RAM,因此无法进行这种方式。 您是否知道我可以逐个训练一个数据集的算法?也就是说,在训练时,我随时都可以将一个数据集加载到内存中。

1
您如何使用EM算法为零膨胀泊松模型的潜在变量公式计算MLE?
通过 为样本定义零膨胀的Poisson回归模型 ,并进一步假设参数和满足(y1,…,yn)(y1,…,yn)(y_1,\ldots,y_n)ÿ一世= { 0ķ概率为p 一世+ (1 − p一世)e- λ一世概率(1 − p 一世)e- λ一世λķ一世/ k!Yi={0with probability pi+(1−pi)e−λikwith probability (1−pi)e−λiλik/k! Y_i = \begin{cases} 0 & \text{with probability} \ p_i+(1-p_i)e^{-\lambda_i}\\ k & \text{with probability} \ (1-p_i)e^{-\lambda_i} \lambda_{i}^{k}/k! \end{cases}λ =( λ1个,… ,λñ)λ=(λ1,…,λn)\mathbf{\lambda} = (\lambda_1, \dots, \lambda_n)p =( p1个,… ,pñ)p=(p1,…,pn)\textbf{p} = (p_1, \dots, p_n) …

1
异步(不规则)时间序列分析
我正在尝试分析两个股票价格的时间序列之间的提前期。在定期的时间序列分析中,我们可以进行VECM(格兰杰因果关系)的Cross Correlaton。但是,如何在不规则间隔的时间序列中处理相同的内容。 假设是其中一种工具领先于另一种。 我的两个符号的数据都以微秒为单位。 我查看了RTAQ软件包,并尝试应用VECM。RTAQ在单变量时间序列上更多,而VECM在这些时间尺度上不重要。 > dput(STOCKS[,])) structure(c(29979, 29980, 29980, 29980, 29981, 29981, 29991, 29992, 29993, 29991, 29990, 29992), .Dim = c(6L, 2L), .Dimnames = list(NULL, c("Pair_Bid", "Calc_Bid" )), index = structure(c(1340686178.55163, 1340686181.40801, 1340686187.2642, 1340686187.52668, 1340686187.78777, 1340686189.36693), class = c("POSIXct", "POSIXt"), tzone = ""), class = "zoo")

1
为什么对poly(raw = T)与poly()会得到截然不同的结果?
我想对两个不同的时间变量建模,其中一些在我的数据中高度共线性(年龄+同​​类=周期)。这样做会给lmer和的相互作用带来麻烦poly(),但可能不限于lmer与nlmeIIRC 取得相同的结果。 显然,我对poly()函数的功能缺乏了解。我了解是什么poly(x,d,raw=T),我认为没有raw=T它就可以构成正交多项式(我不能说我真的很明白这是什么意思),这使拟合更容易,但不能让您直接解释系数。 我读到这是因为我使用的是预测函数,所以预测应该相同。 但是,即使模型正常收敛,它们也不是。我正在使用居中变量,我首先想到,正交多项式可能会导致与共线交互作用项有更高的固定效应相关性,但似乎具有可比性。我在这里粘贴了两个模型摘要。 这些图有望说明差异的程度。我使用了仅在开发人员中可用的预测功能。版本是lme4的版本(在这里听说过),但是固定效果在CRAN版本中是相同的(并且它们本身也看起来不一样,例如,当我的DV的范围为0-4时,交互作用约为5)。 lmer电话是 cohort2_age =lmer(churchattendance ~ poly(cohort_c,2,raw=T) * age_c + ctd_c + dropoutalive + obs_c + (1+ age_c |PERSNR), data=long.kg) 该预测仅是对假数据(所有其他预测变量= 0)的固定影响,其中我将原始数据中存在的范围标记为外推=F。 predict(cohort2_age,REform=NA,newdata=cohort.moderates.age) 如果需要的话,我可以提供更多背景信息(我无法轻松地产生一个可复制的示例,但是当然可以更加努力地尝试),但是我认为这是一个更基本的要求:poly()请向我解释该功能。 原始多项式 正交多项式(在Imgur处为修剪的,未修剪的)

1
观察到的等位基因频率是否明显低于预期?
问题:如何构建测试以确定中部至南部山区观察到的“山”-等位基因频率(图1)是否明显低于生态选择模型所预测的(图2)(请参见下文)? 问题:我最初的想法是使模型残差相对于纬度:经度和海拔高度回归(这仅导致纬度和经度之间的相互作用显着)。问题在于,残基(图3)可能反映了模型无法解释的变异和/或它们是生物学上正在发生的事情,例如,等位基因没有时间向南扩散至其潜能,或者基因流存在一定障碍。如果将观察到的(图1)与预期的(图2)山等位基因频率进行比较,则存在明显的差异,尤其是在瑞典和挪威的中南部山脉。我接受该模型可能无法解释所有变化,但是我可以提出一个合理的检验来探索山等位基因尚未在中部至南部山区发挥其潜力的想法吗? 背景:我有一个双等位基因AFLP标记,其频率分布似乎与斯堪的纳维亚半岛的山地(和纬度:经度)与低地栖息地有关(图1)。“山”等位基因几乎固定在多山的北部。南部缺少山脉的“低地”等位基因几乎不存在或固定。当一个人从山上向南移动时,“山”等位基因的发生频率较低。从北到南的“山脉”等位基因频率的差异可能仅是由于系统地理学或历史过程造成的,因为该地区是从北部和南部开始殖民的。例如,如果高山等位基因起源于北部人口,那么也许它还没有时间完全扩展到南部人口, 我的工作假设是“山”等位基因频率是生态选择的结果(无效假设是中性选择)。 对于我的生态选择模型,我使用了以二项式等位基因频率作为响应变量的广义加性模型(GAM)(在Fennoscandinavia上采样了129个站点,每个站点通常采样了10至20个个体),并在以下几个气候和生长季节变量中:预测变量。模型结果如下(TMAX04-06 = 4月至6月的最高温度,Phen_NPPMN =平均生长期植被生产力,PET_HE_YR =年潜在蒸散量,Dist_Coast =到海岸的距离): Family: binomial Link function: logit Formula: Binomial_WW1 ~ s(TMAX_04) + s(TMAX_05) + s(TMAX_06) + s(Phen_NPPMN) + s(PET_HE_YR) + s(Dist_Coast) Parametric coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) -0.74372 0.04736 -15.7 <2e-16 *** --- Signif. codes: 0 ‘***’ 0.001 ‘**’ …

1
逆协方差矩阵的假设检验
假设我观察到iid ,并希望测试 vech for a整合矩阵和向量。在这个问题上有已知的工作吗?xi∼N(μ,Σ)xi∼N(μ,Σ)x_i \sim \mathcal{N}\left(\mu,\Sigma\right)H0:A H0:A H_0: A\ (Σ−1)=a(Σ−1)=a\left(\Sigma^{-1}\right) = aAAAaaa (对我而言)显而易见的尝试是通过似然比测试,但是似乎要在受到约束的情况下最大化似然率将需要SDP求解器,并且可能非常麻烦。H0H0H_0

2
多类逻辑回归
我得到了用于多类逻辑回归的模型,由 P(Y=j|X(i))=exp(θTjX(i))1+∑km=1exp(θTmX(i))P(Y=j|X(i))=exp⁡(θjTX(i))1+∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^TX^{(i)})}{1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)})} 其中k是类数theta是要估计的参数j是第j类Xi是训练数据 好吧,我没有得到的是分母部分 对模型进行归一化。我的意思是使概率保持在0到1之间。1 + ∑m = 1ķ经验值(θŤ米X(我))1+∑m=1kexp⁡(θmTX(i)) 1+ \sum_{m=1}^{k}\exp(\theta_m^T X^{(i)}) 我的意思是我习惯逻辑回归 P(是= 1 | X(我))= 1 /(1 + 经验(- θŤX(我)))P(Y=1|X(i))=1/(1+exp⁡(−θTX(i))) P(Y=1|X^{(i)}) = 1/ (1 + \exp(-\theta^T X^{(i)})) 实际上,我对标准化的东西感到困惑。在这种情况下,由于它是一个S型函数,因此永远不会让该值小于0或大于1。但是在多类情况下,我感到困惑。为什么会这样呢? 这是我的参考https://list.scms.waikato.ac.nz/pipermail/wekalist/2005-February/029738.html。我认为它应该是被归一化 P(是= j | X(我))= exp(θŤĴX(我))∑ķm = 1经验值(θŤ米X(我))P(Y=j|X(i))=exp⁡(θjTX(i))∑m=1kexp⁡(θmTX(i)) P(Y=j|X^{(i)}) = \frac{\exp(\theta_j^T X^{(i)})}{\sum_{m=1}^{k} \exp(\theta_m^T X^{(i)})}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.