统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
成对的重复测量方差分析还是混合模型?
我被要求分析来自临床试验的一些数据,以寻找两种测量血压的方法。我有来自50个主题的数据,每个主题使用每种方法的测量范围介于2到57个之间。 我想知道如何最好地进行。 显然,我需要一个解决方案,该解决方案应考虑以下事实:血压测量值是成对的(两种方法同时测量),还需要时变协变量(每个患者的观察次数不同),以及患者可变性。 我曾想过以某种方式将其纳入重复测量方差分析中,但我想可能需要采用混合模型方法。 我会很感激您能提供的任何有用的建议。 我是R的新手,但是对开发技能感到非常兴奋,并且我在Stata拥有一定的经验,因此可以随时依靠。
9 r  anova  mixed-model  stata 


2
如何为相关数据建模伯努利随机变量的总和?
我有几乎相同的问题,例如: 如何有效地建模伯努利随机变量的总和? 但是设置却大不相同: S=∑i=1,NXiS=∑i=1,NXiS=\sum_{i=1,N}{X_i},,〜20,〜0.1P(Xi=1)=piP(Xi=1)=piP(X_{i}=1)=p_iNNNpipip_i 我们有伯努利随机变量结果的数据:,Xi,jXi,jX_{i,j}Sj=∑i=1,NXi,jSj=∑i=1,NXi,jS_j=\sum_{i=1,N}{X_{i,j}} 如果我们用最大似然估计来估计(并得到),那么则要大得多,由其他条件期望:pipip_ip^MLEip^iMLE\hat p^{MLE}_iP^{S=3}(p^MLEi)P^{S=3}(p^iMLE)\hat P\{S=3\} (\hat p^{MLE}_i)P^{S=3}(p^MLEi)−P^expected{S=3}≈0.05P^{S=3}(p^iMLE)−P^expected{S=3}≈0.05\hat P\{S=3\} (\hat p^{MLE}_i) - \hat P^{expected} \{S=3\}\approx 0.05 因此,和不能被视为独立的(它们具有较小的依赖性)。XiXiX_{i}XjXjX_{j} (j&gt;k)(j&gt;k)(j>k) 有一些这样的约束:和(已知),这应该有助于估计。pi+1≥pipi+1≥pip_{i+1} \ge p_i∑s≤2P^{S=s}=A∑s≤2P^{S=s}=A\sum_{s \le 2}\hat P\{S=s\}=AP{S}P{S}P\{S\} 在这种情况下,我们如何尝试对伯努利随机变量的总和建模? 哪些文献可能对解决任务有用? 更新 还有一些进一步的想法: (1)可以假设之间的未知依赖关系是在连续1次或更多次成功之后开始的。因此,当,和。XiXi{X_i}∑i=1,KXi&gt;0∑i=1,KXi&gt;0\sum_{i=1,K}{X_i} > 0pK+1→p′K+1pK+1→pK+1′p_{K+1} \to p'_{K+1}p′K+1&lt;pK+1pK+1′&lt;pK+1p'_{K+1} < p_{K+1} (2)为了使用MLE,我们需要最少可疑的模型。这是一个变体: P{X1,...,Xk}=(1−p1)...(1−pk)P{X1,...,Xk}=(1−p1)...(1−pk)P\{X_1,...,X_k\}= (1-p_1) ... (1-p_k)如果对于任何k个,则 如果且,并且对于任意k。∑i=1,kXi=0∑i=1,kXi=0\sum_{i=1,k}{X_i} = 0P{X1,...,Xk,Xk+1,...,XN}=(1−p1)...pkP′{Xk+1,...,XN}P{X1,...,Xk,Xk+1,...,XN}=(1−p1)...pkP′{Xk+1,...,XN}P\{X_1,...,X_k,X_{k+1},...,X_N\}= (1-p_1) ... p_k P'\{X_{k+1},...,X_N\}∑i=1,k−1Xi=0∑i=1,k−1Xi=0\sum_{i=1,k-1}{X_i} = …


3
候选人分布均匀的都市空港大学的录取率
当使用均一的候选分布运行Metropolis-Hastings算法时,接受率大约为20%的原理是什么? 我的想法是:一旦找到了真实的(或接近真实的)参数值,那么就不会有来自相同均匀间隔的任何新的候选参数值集会增加似然函数的值。因此,我运行的迭代次数越多,我应该得到的接受率就越低。 我的想法在哪里错了?非常感谢! 这是我的计算的说明: Acceptance_rate=exp{l(θc|y)+log(p(θc))−[l(θ∗|y)+log(p(θ∗)]},Acceptance_rate=exp⁡{l(θc|y)+log⁡(p(θc))−[l(θ∗|y)+log⁡(p(θ∗)]},Acceptance\_rate = \exp \{l(\theta_c|y) + \log(p(\theta_c)) - [l(\theta^*|y) + \log(p(\theta^*) ]\}, 其中是对数似然。lll 由于候选对象始终取自相同的均匀间隔,θθ\theta p(θc)=p(θ∗).p(θc)=p(θ∗).p(\theta_c) = p(\theta^*). 因此,接受率的计算可缩减至: Acceptance_rate=exp{l(θc|y)−[l(θ∗|y)]}Acceptance_rate=exp⁡{l(θc|y)−[l(θ∗|y)]}Acceptance\_rate = \exp \{l(\theta_c | y) - [l(\theta^* | y) ]\} 的接受规则如下:θcθc\theta_c 如果,其中是从区间均匀分布得出的,则U≤Acceptance_rateU≤Acceptance_rateU \le Acceptance\_rate UUU[0,1][0,1][0,1] θ∗=θc,θ∗=θc,\theta^* = \theta_c, 否则从间隔均匀分布中θcθc\theta_c[θmin,θmax][θmin,θmax][\theta_{min}, \theta_{max}]

1
多元正交多项式回归?
作为激励问题的一种方法,请考虑一个回归问题,我们试图使用观察到的变量来估计ÿÿY{ a ,b }{一个,b}\{ a, b \} 在进行多元多项式回归时,我尝试找到函数的最佳拟似化 F(y)=C1个一个+C2b +C3一个2+C4a b +C5b2+ ⋯F(ÿ)=C1个一个+C2b+C3一个2+C4一个b+C5b2+⋯f(y)=c_{1}a+c_{2}b+c_{3}a^{2}+c_{4}ab+c_{5}b^{2}+\cdots 在最小二乘意义上最适合数据。 然而,与此有关的问题是参数不是独立的。有没有办法对正交的不同“基本”向量集进行回归?这样做有很多明显的优势C一世C一世c_i 1)系数不再相关。2)本身的值不再取决于系数的程度。3)这也具有计算上的优势,即能够舍弃高阶项,从而对数据进行更粗略但仍准确的近似。C一世C一世c_i 这在使用正交多项式的单变量情况下,以及经过深入研究的集合(如Chebyshev多项式)很容易实现。然而(无论如何对我来说)如何概括这一点并不明显!我想到我可以成对地切比雪夫多项式,但是我不确定这在数学上是否正确。 感谢您的帮助

1
泊松/对数线性模型的似然比检验是否需要调整零计数?
如果列联表中的数字为0,并且我们正在对嵌套的泊松/对数线性模型(使用R glm函数)进行似然比检验,那么在拟合glm模型之前是否需要调整数据(例如,将1/2加到所有计数)?显然,如果不进行一些调整就无法估计某些参数,但是调整/缺少调整对LR测试有何影响?


6
按时间序列测试稳定性
给定时间序列稳定后,是否有标准(或最佳)测试方法? 一些动机 我有一个随机动态系统,在每个时间步中输出一个值。该系统具有一定的瞬态行为,直到时间步长为止,然后稳定在某个平均值并带有一些误差。没有,,或错误都在我的面前。我愿意做一些假设(例如围绕高斯误差)XŤxtx_tt∈Nt∈Nt \in \mathbb{N}t∗t∗t^*x∗x∗x^*t∗t∗t^*x∗x∗x^*x∗x∗x^*例如),但我需要的先验假设越少越好。我唯一可以肯定的是,系统只会收敛到一个稳定点,并且稳定点周围的波动要比瞬变期间的波动小得多。这个过程也是单调的,我可以假设在附近开始并朝着爬升(在稳定在之前可能会有点过冲)。x0x0x_0000x∗x∗x^*x∗x∗x^* 该数据将从模拟来来了,我需要的稳定性试验,作为我的模拟静止状态(因为我只在过渡周期内感兴趣)。xtxtx_t 精确的问题 如果仅访问某个有限的时间值,那么是否有一种方法可以以合理的精度说出随机动态系统已经稳定在某个点?如果测试还返回,和附近的错误,则奖励点。但是,这不是必需的,因为有简单的方法可以在仿真完成后弄清楚这一点。x0...xTx0...xTx_0 ... x_TTTTx∗x∗x^*x∗x∗x^*t∗t∗t^*x∗x∗x^* 天真的方法 首先浮现在脑海中的幼稚方法(例如,我曾将其用作某些神经网络的获胜条件)是选择参数和,那么如果在最后的时间步长中没有和两点使得然后我们得出结论,我们已经稳定下来。这种方法很简单,但并不十分严格。这也迫使我猜测和应该是什么好值。TTTEEETTTxxxx′x′x'x′−x&gt;Ex′−x&gt;Ex' - x > ETTTEEE 似乎应该有一种更好的方法来回顾过去的某些步骤(或以某种方式对旧数据进行折价),从该数据中计算标准误差,然后测试是否需要其他步骤(或其他步骤)折扣方案)时间序列未超出此误差范围。我提供了一个稍微不太天真但仍然很简单的策略作为答案。 任何帮助,或对标准技术的引用,不胜感激。 笔记 我还将这个问题按原样交叉发布到MetaOptimize上,并在更具有仿真风格的计算科学中进行了描述。

2
R中基于噪声的应用程序基于密度的空间聚类(DBSCAN)聚类
这个问题开始于“ 在R中聚集空间数据 ”,现在移到了DBSCAN问题。 正如对第一个问题的回答所建议的那样,我搜索了有关DBSCAN的信息并阅读了一些有关的文档。出现了新的问题。 DBSCAN需要一些参数,其中之一是“距离”。由于我的数据是三维,经度,纬度和温度,我应该使用哪个“距离”?哪个尺寸与该距离有关?我想应该是温度。如何找到R的最小距离? 另一个参数是形成聚类的最小点数。有没有找到该号码的方法?不幸的是我没有找到。 我在类似我的数据集中找不到使用dbscan的R示例,您知道有这样的示例的网站吗?因此,我可以阅读并尝试适应我的情况。 最后一个问题是我对DBSCAN的第一次R尝试(没有对先前问题的正确回答)导致内存问题。R说它不能分配向量。我从一个4 km的网格开始,该网格具有779191个点,在删除无效的SST点时,该点以大约300000行x 3列(纬度,经度和温度)结束。解决此内存问题的任何提示。它取决于我的计算机还是DBSCAN本身? 感谢您耐心阅读冗长且可能很无聊的消息以及您的帮助。
9 r  clustering  spatial 

2
带R的Tobit模型
有谁知道在哪里使用带有AER软件包的tobit模型在哪里找到好的应用程序和示例(除了手册和书籍,其中包括R的计量经济学)? 编辑 我正在寻找一个命令来计算y的边际效应(而不是潜在变量y *)。它似乎是,其中是标准正态累积分布函数。但是我如何用R计算这些影响呢?φ (X β/ σ)βϕ(Xβ/σ)β\phi(x\beta/\sigma)\betaϕϕ\phi


4
线性回归中变量阶重要吗
我正在研究两个变量(和)之间的相互作用。这些变量之间存在很大的线性相关,其中。从问题的本质上,我无法说出因果关系(是否导致或相反)。我想研究与回归线的偏差,以发现异常值。为了做到这一点,我可以建立作为的函数的线性回归,或者。我选择的可变顺序会影响我的结果吗?X1个X1个x_1X2X2x_2r &gt; 0.9[R&gt;0.9r>0.9X1个X1个x_1X2X2x_2X1个X1个x_1X2X2x_2

3
如何在R的数据框中更改列名?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 names(mydat)[c(name)]&lt;-c("newname") 由此,我知道数据框mydat的列/变量名称“名称”已替换为“ newname”。 我的问题是,是否要通过循环执行此操作,以便获得诸如以下的信息: newname1 newname2 newname3 newname4等等,我该怎么做? 这是起作用的,但没有起作用: for(i in 1:4){ names(mydat)[c(name)]&lt;-c("newname"i) } 有没有办法对此进行编码?非常感谢所有可以提供帮助的人。奥乌苏·以撒
9 r 


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.