统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
ML指数分布的估计值(带有检查数据)
在生存分析中,假设rv的生存时间呈指数分布。现在考虑我有i_1 rv的 “结果” 。这些结果中只有一部分实际上是“完全实现”的,即其余观察结果仍然是“有效的”。XiXiX_ix1,…,xnx1,…,xnx_1,\dots,x_nXiXiX_i 如果我想对分布的速率参数进行ML估计,该如何以连贯/适当的方式利用未实现的观测值?我相信它们仍然包含有用的信息以供估算。λλ\lambda 有人可以指导我阅读有关该主题的文献吗?我确定它存在。但是,我很难找到适合该主题的关键字/搜索字词。

1
如何计算似然函数
3个电子元件的使用寿命是 X1个= 3 ,X2= 1.5 ,X1个=3,X2=1.5,X_{1} = 3, X_{2} = 1.5, 和 X3= 2.1X3=2.1X_{3} = 2.1。根据参数的指数分布,已将随机变量建模为大小为3的随机样本θθ\theta。似然函数为θ > 0θ>0\theta > 0 F3(x | θ )=θ3È X p (- 6.6 θ )F3(X|θ)=θ3ËXp(-6.6θ)f_{3}(x|\theta) = \theta^{3} exp(-6.6\theta),在哪里 X = (2 ,1.5 ,2.1 )X=(2,1.5,2.1)x = (2, 1.5, 2.1)。 然后问题继续进行,通过找到的值确定MLE。 θθ\theta 最大化 升Ò 克F3(x | θ …

1
对正态分布的高阶产品的期望
我有两个正态分布的变量和,均值零,协方差矩阵。我有兴趣尝试根据的条目来计算的值。X1X1X_1X2X2X_2ΣΣ\SigmaE[X21X22]E[X12X22]E[X_1^2 X_2^2]ΣΣ\Sigma 我用总概率定律得到 但我不确定内部期望会降低到什么。这里还有其他方法吗?E[X21X22]=E[X21E[X22|X1]]E[X12X22]=E[X12E[X22|X1]]E[X_1^2 X_2^2] = E[X_1^2 E[X_2^2 | X_1]] 谢谢。 编辑:变量也是多元正态分布。


1
拟合二项响应的异方差广义线性模型
我从以下实验设计中获得了数据:我的观察结果是对K相应治疗次数()中成功次数()的计数,对N两组分别由I个体组成的两组进行了测量,这些结果来自T治疗,其中每个这样的因子组合中都有R重复项。因此,共我有2 * I * T * R ķ的和对应Ñ的。 数据来自生物学。每个人都是一个基因,我通过它测量两种替代形式的表达水平(由于一种称为替代剪接的现象)。因此,K是其中一种形式的表达水平,而N是这两种形式的表达水平的总和。在一个单一的表达拷贝的两种形式之间的选择被假定为一个伯努利试验,因此ķ出Ñ副本遵循二项式。每个组由约20个不同的基因组成,并且每个组中的基因具有某些共同的功能,这在两组之间是不同的。对于每组中的每个基因,我从三个不同的组织(治疗)中分别进行了约30次这样的测量。我想估计组和治疗对K / N方差的影响。 已知基因表达过度分散,因此在下面的代码中使用负二项式。 例如,R模拟数据的代码: library(MASS) set.seed(1) I = 20 # individuals in each group G = 2 # groups T = 3 # treatments R = 30 # replicates of each individual, in each group, in each treatment groups = letters[1:G] …

1
倾向得分加权对平均治疗效果的置信区间?
我试图使用倾向评分权重(特别是IPTW)从观察数据中估计平均治疗效果。我想我正在正确计算ATE,但是我不知道如何在考虑逆倾向得分权重的同时计算ATE的置信区间。 这是我用来计算平均治疗效果的方程式(参考Stat Med。2010年9月10日; 29(20):2137–2148。): 其中受试者总数,治疗状态,结果状态,倾向得分。ATE=1N∑1NZiYipi−1N∑1N(1−Zi)Yi1−piATE=1N∑1NZiYipi−1N∑1N(1−Zi)Yi1−piATE=\frac1N\sum_1^N\frac{Z_iY_i}{p_i}-\frac1N\sum_1^N\frac{(1-Z_i)Y_i}{1-p_i}N=N=N=Zi=Zi=Z_i=Yi=Yi=Y_i=pi=pi=p_i= 有人知道R包会考虑权重来计算平均治疗效果的置信区间吗?可以在survey这里包帮助吗?我想知道这是否行得通: library(survey) sampsvy=svydesign(id=~1,weights=~iptw,data=df) svyby(~surgery=='lump',~treatment,design=sampsvy,svyciprop,vartype='ci',method='beta') #which produces this result: treatment surgery == "lump" ci_l ci_u No 0.1644043 0.1480568 0.1817876 Yes 0.2433215 0.2262039 0.2610724 我不知道从哪里可以找到比例之间的差异的置信区间(即平均治疗效果)。


1
“稳健统计:基于影响函数的方法”练习2.2a.16的解决方案
在“ 稳健统计:基于影响函数的方法”的第180页上,找到以下问题: 16:表明对于位置不变的估计量,总是 。在为奇数或为偶数的情况下,在有限样本击穿点上找到相应的上限。ε∗≤12ε∗≤12\varepsilon^*\leq\frac{1}{2}ε∗nεn∗\varepsilon^*_nnnnnnn 第二部分(句号之后)实际上是微不足道的(鉴于第一部分),但是我找不到方法来证明问题的第一部分(句子)。 在本书中与该问题有关的部分中,发现(p98): 定义2:样本(x_1,\ ldots,x_n)上估计量的有限样本分解点由下式给出:\ varepsilon ^ * _ n(T_n; x_i,\ ldots,x_n):= \ frac {1} {n} \ max \ {m:\ max_ {i_1,\ ldots,i_m} \ sup_ {y_1,\ ldots,y_m} \; || T_n(z_1,\ ldots,z_n)| &lt;\ infty \}ε∗nεn∗\varepsilon^*_nTnTnT_n(xl,…,xn)(xl,…,xn)(x_l,\ldots, x_n) ε∗n(Tn;xi,…,xn):=1nmax{m:maxi1,…,imsupy1,…,ym|Tn(z1,…,zn)|&lt;∞}εn∗(Tn;xi,…,xn):=1nmax{m:maxi1,…,imsupy1,…,ym|Tn(z1,…,zn)|&lt;∞}\varepsilon^*_n(T_n;x_i,\ldots,x_n):=\frac{1}{n}\max\{m:\max_{i_1,\ldots,i_m}\sup_{y_1,\ldots,y_m}\;|T_n(z_1,\ldots,z_n)|<\infty\} 其中通过将m个数据点 x_ {i_1},\ ldots,x_ {i_m}替换为任意值 y_1,\ ldots,y_m来获得样本(z_1,\ ldots,z_n)。(z1,…,zn)(z1,…,zn)(z_1,\ldots,z_n)mmmxi1,…,ximxi1,…,ximx_{i_1},\ldots,x_{i_m}y1,…,ym.y1,…,ym.y_1,\ldots,y_m. \ varepsilon ^ …

1
如何测试人口中位数?
我有250个单位的样本。分布是不对称的。我想检验一个假设,即人口中位数不同于3.5,因此我认为单样本检验是合适的。我知道Wilcoxon等级检验不适合,因为分布不对称。是否适合使用符号测试?如果不是,任何人都可以推荐其他测试吗?

3
仅根据相关总数估算一袋水果的质量?
我大学的一位老师提出了一个这样的问题(由于上课已经结束,所以我不参加家庭作业,所以不打算做作业)。我不知道该怎么办。 问题涉及2个袋子,每个袋子中包含各种不同种类的水果: 第一个袋子包含以下随机选择的水果: + ------------- + -------- + --------- + | 直径厘米| 质量g | 烂?| + ------------- + -------- + --------- + | 17.28 | 139.08 | 0 | | 6.57 | 91.48 | 1 | | 7.12 | 74.23 | 1 | | 16.52 | 129.8 | 0 | …

1
如何在广义线性混合模型中解释随机效应的方差
在逻辑广义线性混合模型(家庭=二项式)中,我不知道如何解释随机效应方差: Random effects: Groups Name Variance Std.Dev. HOSPITAL (Intercept) 0.4295 0.6554 Number of obs: 2275, groups: HOSPITAL, 14 我如何解释这个数值结果? 我在一项多中心研究中有一个肾移植患者的样本。我正在测试各中心接受特定抗高血压治疗的患者的机率是否相同。各中心之间接受治疗的患者比例差异很大,但这可能是由于患者基础特征的差异所致。因此,我估算了一个广义线性混合模型(逻辑模型),并调整了患者的主要特征。结果如下: Generalized linear mixed model fit by maximum likelihood ['glmerMod'] Family: binomial ( logit ) Formula: HTATTO ~ AGE + SEX + BMI + INMUNOTTO + log(SCR) + log(PROTEINUR) + (1 …
9 r  lme4-nlme 

1
R平方的有趣推导
多年前,我通过试验数据和转换发现了这种身份。在向我的统计教授解释了这一点之后,他进入下一堂课,使用了矢量和矩阵符号作为一页证明。不幸的是我丢了他给我的纸。(那是在2007年) 有人能够重建证明吗? 让 (X一世,ÿ一世)(X一世,ÿ一世)(x_i,y_i)是您的原始数据点。通过旋转角度定义一组新的数据点;称这些点。θθ\theta(X′一世,ÿ′一世)(X一世′,ÿ一世′)(x'_i,y'_i) 原始点集的R平方值等于导数相对于新点集每个坐标的标准偏差自然对数的的负乘积,每个点在求θθ\thetaθ = 0θ=0\theta=0 [R2= - (ddθln(σX′)∣∣θ = 0)(ddθln(σÿ′)∣∣θ = 0)[R2=-(ddθln⁡(σX′)|θ=0)(ddθln⁡(σÿ′)|θ=0)r^2= - \left(\left.\frac{d}{d\theta}\ln(\sigma_{x'})\right|_{\theta=0} \right) \left(\left.\frac{d}{d\theta}\ln(\sigma_{y'})\right|_{\theta=0} \right)

2
生成具有预定稀疏模式的对称正定矩阵
我正在尝试生成相关矩阵 p×pp×pp\times p(对称psd)具有预先指定的稀疏结构(由节点上的图形指定)。图中连接的节点具有相关性,其余全部为0,对角线全部为1。pppρ∼U(0,1)ρ〜ü(0,1个)\rho \sim U(0,1) 我曾尝试多次生成此矩阵,但很少能获得有效的相关矩阵。 有什么方法可以确保相关矩阵whp吗?请注意,我只能具有正相关,因此等不是一个选择。ρ∼U(−1,1)ρ〜ü(-1个,1个)\rho \sim U(-1,1) 任何帮助是极大的赞赏!

3
矩形的VC尺寸
EthemAlpaydın撰写的《机器学习入门》一书指出,与轴对齐的矩形的VC维数为4。但是,矩形如何破碎由四个共线点组成的正负交集? 有人可以解释和证明矩形的VC尺寸吗?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.