统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
统计学习要素练习2.2
教科书首先通过以下方式生成一些2类数据: 这使: 然后它问: 我尝试通过首先使用此图形模型对此模型进行建模来解决此问题: 其中是标签,是所选均值的索引,是数据点。这将给ccch(1≤h≤10)h(1≤h≤10)h\,(1\le h \le 10)mchmhcm_h^cxxx PR (X |米CH)=镨(米CH∣ h ,c = b l u e)=镨(米CH| ħ ,Ç = ö ř 一个Ñ 克ë)=PR (ħ )=PR (C ^ )=ñ(米CH,我/ 5 )ñ((1 ,0)Ť,我)ñ((0 ,1)Ť,我)1个101个2镨(X∣米HC)=ñ(米HC,一世/5)镨(米HC∣H,C=b升üË)=ñ((1个,0)Ť,一世)镨(米HC∣H,C=Ø[R一个ñGË)=ñ((0,1个)Ť,一世)镨(H)=1个10镨(C)=1个2 \begin{align*} \Pr(x\mid m_h^c) =& \mathcal{N}(m_h^c,\mathbf{I}/5)\\ \Pr(m_h^c\mid h,c=\mathrm{blue}) =& \mathcal{N}((1,0)^T,\mathbf{I})\\ \Pr(m_h^c\mid h,c=\mathrm{orange}) =& \mathcal{N}((0,1)^T,\mathbf{I})\\ \Pr(h) =& \frac{1}{10}\\ …

1
使用置换测试的好处是什么?
当通过检验统计量检验某些零假设与替代假设时,其中,对进行置换,对置换集进行置换检验,我们有了一个新的统计量 ü(X)U(X)U(X)X= {X一世,。。。,Xñ}X={xi,...,xn}X = \{ x_i, ..., x_n\}GGGXXXŤ(X):=#{ π∈ ģ :ù(πX)≥ ü(X)}| G |。T(X):=#{π∈G:U(πX)≥U(X)}|G|. T(X) := \frac{\# \{\pi \in G: U(\pi X) \geq U(X)\}}{|G|}. 与不使用置换测试相比,使用置换测试有什么好处?即,排列测试工作时是什么样的? 什么条件可以实现?例如关于检验统计量和/或原假设的某些条件?üUU 例如, 是否应 是等于基于p值,用于样品?如果是,为什么?(也值得参考)Ť(X)T(X)T(X)ü(X)U(X)U(X)XXX 的p值定义为。如果置换检验是为了估计U(X)的置换分布| X = x,T(X)等于X = x处U(X)的p值吗?特别是,在零H中可能存在多个分布,并且T(X)不会一一考虑零分布,然后取\ sup_ {F \ in H}和\ inf_ {c:U(x) \ geq c}。ü(X)U(X)U(X)信息Ç ∈ [R :ù(X )≥ ÇSUPF∈ …

2
这个单一值与该分布相符吗?
这似乎是一个非常幼稚的问题,但我很难看到答案。 我有一组30个值。我独立地获得了第31个值。空假设是第31个值是同一分布的一部分。另一种选择是,它与众不同。我想要某种p值或可能性度量。 我有一些想法: 这类似于想要进行两个样本的t检验-除了对于第二个样本,我只有一个值,并且30个值不一定呈正态分布。 如果我有30个测量值而不是30个测量值,则单个测量值的等级可以提供一些有用的信息。 如何计算这种可能性或p值? 谢谢!亚尼克

1
Logistic回归的最大似然估计器的偏差
我想了解有关Logistic回归的最大似然估计器(MLE)的几个事实。 总的来说,逻辑回归的MLE是否存在偏见?我会说“是”。我知道,例如,样本维数与MLE的渐近偏差有关。 您知道这种现象的基本例子吗? 如果MLE有偏差,那么MLE的协方差矩阵是否是最大似然函数的Hessian的逆是真的吗? 编辑:我经常遇到这个公式,没有任何证据;在我看来,这是一个相当随意的选择。

1
分类数据的惩罚方法:将级别合并为一个因子
惩罚模型可用于估计参数数量等于或大于样本大小的模型。在大型稀疏分类或计数数据表的对数线性模型中可能会出现这种情况。在这些情况下,通常还希望通过组合某个因子的级别来折叠表格,而这些因子的级别在它们与其他因子的交互方式方面是无法区分的。两个问题: 有没有办法使用诸如LASSO或弹性网之类的惩罚模型来测试每个因素中各个级别的可折叠性? 如果第一个问题的答案是肯定的,那么是否可以而且应该以这样的方式进行设置:水平崩溃和模型系数的估计可以一步完成?

1
我应该选择哪种自举回归模型?
我有一个具有DV(疾病:是/否)和5个预测变量(人口统计学[年龄,性别,吸烟(是/否)),医学指标(常规)和一种随机治疗方法(是/否)的二元logistic回归模型])。我还为所有双向交互条件建模。主要变量居中,没有多重共线性的迹象(所有VIF <2.5)。 我有一些疑问: 引导程序是否比我的单一模型有利?如果是这样的话, 我应该选择哪种引导模式?我只是想看看引导算法是否遵循随机方法来创建新样本,或者它们是否具有严格的算法。因此,我每次尝试都重新采样了1000次(所以我有几个自举模型,每个模型都有1000次试验)。但是,每次引导模型的系数都不同(尽管试验次数始终为1000)。所以我想知道应该为我的报告选择哪一个?有些变化很小,并且不会影响我的系数的显着性,但是有些变化会使我的某些系数不显着(例如,只有那些在原始模型中P值接近0.05且变为0.06的系数)。 我应该选择更高的数字,例如10,000吗?如何确定此限制? 我还是应该首先重新引导吗?如果每次的结果都不同,我可以依靠它的结果吗? 您还有其他想法可以帮助我解决我的问题吗? 非常感谢。

3
多次测量某些患者
我正在进行一项临床研究,以确定患者的人体测量指标。我知道如何处理每个患者只有一个指标的情况:建立模型并随机抽样X1,…,XñX1个,…,XñX_1,\dots,X_n 从某种密度 FθFθf_\theta,然后我做平常的工作:写出样本的可能性,估计参数,确定置信度集并检验假设,甚至在老板不注意的情况下进行一些贝叶斯分析。;-) 我的问题是,对于某些患者,我们有不止一种措施,因为我们认为,在可能的情况下,由多名研究人员来操纵测量设备是一个好主意(有时我们只有一名研究人员在诊所工作) )。因此,对于某些患者,我们由一名研究人员进行一项测量,对于其他样本单位,我们由两名不同研究人员进行两项测量,依此类推。所讨论的度量是特定皮肤褶皱的厚度。 我的问题:哪种统计模型足以解决我的问题?
10 inference 

1
替换图纸时的预期重复数(三倍等)
我有以下问题: 我有100个独特的商品(n),我一次选择了43个(m)一件(有替换商品)。 我需要解决唯一性的预期数量(仅选择一次,k = 1),双打(恰好选择两次k = 2),三重(恰好k = 3),四边形等。 我已经找到了很多关于至少有一个双倍(生日悖论)的概率的结果,但是没有关于总体中预期的对数。

4
R中的离散时间事件历史(生存)模型
我正在尝试在R中拟合离散时间模型,但不确定如何执行。 我读过您可以将因变量组织在不同的行中,每个时间观察行一个,并将该glm函数与logit或cloglog链接一起使用。从这个意义上讲,我有三列:ID,Event(在每个时间范围内为1或0)和Time Elapsed(自观察开始以来)以及其他协变量。 如何编写适合模型的代码?哪个因变量?我想我可以将其Event用作因变量,并将其包括Time Elapsed在协变量中。但是,会发生什么ID呢?我需要吗? 谢谢。
10 r  survival  pca  sas  matlab  neural-networks  r  logistic  spatial  spatial-interaction-model  r  time-series  econometrics  var  statistical-significance  t-test  cross-validation  sample-size  r  regression  optimization  least-squares  constrained-regression  nonparametric  ordinal-data  wilcoxon-signed-rank  references  neural-networks  jags  bugs  hierarchical-bayesian  gaussian-mixture  r  regression  svm  predictive-models  libsvm  scikit-learn  probability  self-study  stata  sample-size  spss  wilcoxon-mann-whitney  survey  ordinal-data  likert  group-differences  r  regression  anova  mathematical-statistics  normal-distribution  random-generation  truncation  repeated-measures  variance  variability  distributions  random-generation  uniform  regression  r  generalized-linear-model  goodness-of-fit  data-visualization  r  time-series  arima  autoregressive  confidence-interval  r  time-series  arima  autocorrelation  seasonality  hypothesis-testing  bayesian  frequentist  uninformative-prior  correlation  matlab  cross-correlation 

1
关于样本自协方差函数的问题
我正在阅读时间序列分析书,样本自协方差的公式在书中定义为: γˆ(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)γ^(h)=n−1∑t=1n−h(xt+h−x¯)(xt−x¯)\widehat{\gamma}(h) = n^{-1}\displaystyle\sum_{t=1}^{n-h}(x_{t+h}-\bar{x})(x_t-\bar{x}) 与对于。是平均值。γˆ(−h)=γˆ(h)γ^(−h)=γ^(h)\widehat{\gamma}(-h) = \widehat{\gamma}(h)\;h=0,1,...,n−1h=0,1,...,n−1\;h = 0,1, ..., n-1x¯x¯\bar{x} 有人可以直观地解释为什么我们将总和除以而不是吗?这本书解释说,这是因为上面的公式是一个非负的确定函数,因此最好除以,但这对我来说还不清楚。有人可以证明这一点,还是可以举例说明?nnnn−hn−hn-hnnn 对我而言,起初直观的事情就是除以。这是对自协方差的无偏估计吗?n−hn−hn-h

2
时间序列分析的历史有哪些好的资源?
我已经在stats.stackexchange上检查了这个问题的答案:什么是提供统计历史的优质资源? 确实,斯蒂格勒的书“桌子上的统计数据”看起来很棒,我很期待阅读。但是我对现代ARIMA模型的开发更感兴趣。 我想我记得曾经听说过,在尝试用二战前后的大炮预测随机误差时,已经取得了很大的进步。而且,当然,在整个千年的后半段,天文学家在某种程度上都在利用某种时间序列来理解天体的运动。但是,我不记得我听说过时间序列在炮兵中的应用,并且我有物理学背景,而且我真的不知道天文学家正在使用哪种统计方法。 因此,我想听听您认为对时间序列方法的发展影响最大的历史影响是什么,例如,它们主要是受到金融,国防,地质/地球物理学的刺激,还是所有这些以及更多因素的结合?是否有关于ARIMA历史的资料丰富的书籍或网站?


1
在R中的重复测量方差分析中指定Error()项
我在定义R中的双向重复测量方差分析的误差项时遇到问题。我的数据包括沿从树中提取的芯线的三个径向位​​置(内部,中间和外部)的木材密度估计。一共有20种树,每种树有6个个体,每个树有两个核心。 为了测试径向位置对木材密度的影响,我使用以下两种方差分析模型,其中的误差项解释了个体之间的差异: radpos.aov <- aov(WD ~ Species*Radialposition + Error(Individual), data=Radpos) 但是,我不确定我对错误术语的说明是否足够。我还应该考虑核心内的可变性吗?对我来说,这种可变性与径向位置是相同的,而径向位置是我感兴趣的主要因素。 尽管我花了一些时间阅读有关在“重复测量ANOVA”中指定错误项的信息,但是在实际指定错误项方面仍然存在问题。我将对此有所帮助。


3
机器学习排名算法
我有一组元素,我可以根据特征来描述它们。从而:XXXññn X一世:{C我1,C我2,… ,C我ñ} |X一世∈ XX一世:{C一世1个,C一世2,…,C一世ñ}∣X一世∈Xx_i: \{c_{i1}, c_{i2}, \ldots, c_{in}\} \mid x_i \in X 其中是根据特性对元素的(数值)评估。因此,我的元素可以视为维空间中的点。C我ĴC一世Ĵc_{ij}一世一世iĴĴjññn 根据我的阅读,存在诸如“贝叶斯分类器”之类的算法,可以对我的集合中的任何元素提供“是”或“否”类型的答案,但前提是我确实使用了由一些我的集合中的元素以及算法的预期结果。基于该数据,该算法应该能够采用任何其他元素,而不是训练集的一部分,并根据从训练集中学到的知识提供“是”或“否”的答案。如果您对期望的内容(训练集)有某种想法,但不确定如何产生此结果的特定规则,那么这很好。 我想对数据进行的处理不会得到“是”或“否”类型的答案,但是我想在元素中引入一个排名。其中一些比其他“更好”。就像贝叶斯过滤器一样,我对期望值有一个大致的了解。因此,我可以从元素的子集中生成一个“培训排名”,并将其输入到MLA中。根据该训练,我可以对我的整个作品进行排名。 为此,我看到两种方法: MLA将为每个元素评分,然后根据该评分对元素进行排名。 MLA可以采用两个元素和并确定其中一个更好(成对比较)。使用该比较操作使用quicksort。X一世X一世x_iXĴXĴx_j 注意:基于分数,成对函数很容易实现,而基于成对函数,生成分数很简单,因此这只是两个产生相同结果的方法。 是否有MLA可以提供评分功能或成对比较功能的示例? 编辑:为了添加更多上下文:当前,我的项目是根据一种算法进行排名的,该算法通过对进行计算来生成每个项目的得分(实数)。尽管生成的排名非常正确,但是我经常必须修改算法以某种方式对其进行调整,因为我可以清楚地看到一些未按我期望的排名的项目。C一世ĴC一世Ĵc_{ij} 所以目前我的设计过程是: 了解什么是完美的排名 尝试(手动)派生一个算法来对此类项目进行排名 观察结果 调整算法 所以我考虑了MLA,因为我的过程的起点就是可以用作训练数据。我可能会以当前的排名开始,根据我的需求交换项目并将其提供。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.