统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
累积量由
是否存在有关给出第个累积量的分布的任何信息?累积量生成函数的形式为 我已经将其作为某些随机变量的极限分布来进行研究,但是我无法找到有关它的任何信息。nnn1n1n\frac 1 nκ(t)=∫10etx−1x dx.κ(t)=∫01etx−1x dx. \kappa(t) = \int_0 ^ 1 \frac{e^{tx} - 1}{x} \ dx.

2
在CART中选择复杂度参数
在用于创建CART模型的rpart()例程中,指定要将树修剪到的复杂度参数。对于选择复杂度参数,我看到了两种不同的建议: 选择与最小可能的交叉验证错误关联的复杂性参数。Quick-R和HSAUR 建议使用此方法。 选择最大复杂度参数,其估计的交叉验证误差仍在最小可能交叉验证误差的SE之内。这是我的包文档的解释,它说:“为修剪一个很好的选择CP往往是最左边的值,其平均谎言低于水平线”中提到此情节。 cp的两个选择在我的数据集中产生了完全不同的树。 似乎第一种方法将始终生成更复杂的,可能过度拟合的树。在文献中还存在其他优点,缺点和建议等。在决定使用哪种方法时应考虑在内?如果可以的话,我可以提供有关我的特定建模问题的更多信息,但是我试图将这个问题范围扩大到与其他问题相关。
16 r  cart  rpart 

2
当平均方差受到关注时,可以/应该将哪些先验分布用于分层贝叶斯模型中的方差?
在他被广泛引用的论文中,层次模型中方差参数的先验分布 (到目前为止,在Google学术搜索中已有916次引用)Gelman提出,对于贝叶斯分层模型,方差的良好非信息性先验分布是均匀分布和Half t分布。如果我理解正确的话,那么当主要关注位置参数(例如均值)时,这将很好地工作。有时,方差参数是主要关注的问题,例如,当分析来自计时任务的人的响应数据时,意味着计时的可变性通常是关注的度量。在那些情况下,我不清楚如何用例如均匀分布的分层方法对可变性进行建模,因为我在分析后想获得参与者水平和小组水平的平均方差的可信度。 然后我的问题是:在主要考虑数据方差的情况下,建立分层贝叶斯模型时,建议采用哪种分布? 我知道伽马分布可以重新设定为均值和标准差。例如,下面的层次模型来自Kruschke的书《做贝叶斯数据分析》。但是,盖尔曼(Gelman)在他的文章中概述了伽玛分布的一些问题,我很感谢提出替代方案的建议,最好是不难在BUGS / JAGS中工作的替代方案。

3
可选的停止规则不在教科书中
停止规则会影响P值与决策相关的错误率之间的关系。Simmons等人的最新论文。2011年创造了一个术语“ 研究人员自由度”来描述一系列行为,他们认为这些行为是造成心理学文献中许多报告不可重复的报告的原因。 在这些行为中,我当前感兴趣的是可选的停止规则或未声明的临时分析。我向学生描述了它们对错误率的影响,但似乎在我的学生所使用的教科书中没有描述(或不描述)采用!)。在我大学的主书店中,有十四本针对生物科学,商业,工程等各个学科的入门级学生的统计教科书。这些教科书中只有一本包含索引项“顺序测试”,而没有一个索引项“停止规则”。 是否有入门级的统计教科书来说明可选的停止规则的问题? 西蒙斯(JP),尼尔森(LD)和西蒙索恩(U)(2011)。错误正面心理学:数据收集和分析中未公开的灵活性允许提出任何有意义的内容。心理科学,22(11),1359–1366。doi:10.1177 / 0956797611417632

2
观察到的信息矩阵是否是预期信息矩阵的一致估计?
我试图证明在弱一致性最大似然估计器(MLE)处评估的观测信息矩阵是预期信息矩阵的弱一致性估计器。这是被广泛引用的结果,但没有人提供参考或证明(我已经用尽我认为Google搜索结果的前20页和我的统计资料教科书)! 使用MLE的弱一致序列,我可以使用大数弱定律(WLLN)和连续映射定理来获得所需的结果。但是,我相信不能使用连续映射定理。相反,我认为需要使用统一的大数定律(ULLN)。有人知道有证明这一点的参考文献吗?我尝试了ULLN,但为简洁起见,现在省略。 对于这个问题的冗长,我深表歉意,但必须引入一些符号。表示法如下(我的证明在结尾)。 假设我们有随机变量的IID样本{Y1,…,YN}\{Y_1,\ldots,Y_N\}与密度f(Y~|θ)f(\tilde{Y}|\theta),其中θ∈Θ⊆Rk\theta\in\Theta\subseteq\mathbb{R}^{k}(这里Y~\tilde{Y}是具有相同密度的只是一般随机变量作为样本的任何成员)。向量Y=(Y1,…,YN)TY=(Y_1,\ldots,Y_N)^{T}是所有样本向量的向量,其中Yi∈RnY_{i}\in\mathbb{R}^{n}所有i=1,…,Ni=1,\ldots,N。密度的真实参数值是θ0\theta_{0}和 θ Ñ(Ý)是的弱一致最大似然估计(MLE) θ 0。根据规律性条件,Fisher信息矩阵可以写为θ^N(Y)\hat{\theta}_{N}(Y)θ0\theta_{0} I(θ)=−Eθ[Hθ(logf(Y~|θ)]I(\theta)=-E_\theta \left[H_{\theta}(\log f(\tilde{Y}|\theta)\right] 其中Hθ{H}_{\theta}是Hessian矩阵。等效样本为 IN(θ)=∑i=1NIyi(θ),I_N(\theta)=\sum_{i=1}^N I_{y_i}(\theta), 其中Iyi=−Eθ[Hθ(logf(Yi|θ)]I_{y_i}=-E_\theta \left[H_{\theta}(\log f(Y_{i}|\theta)\right]。所观察到的信息矩阵是; J(θ)=−Hθ(logf(y|θ)J(\theta) = -H_\theta(\log f(y|\theta), (有些人的需求矩阵在评估θ,但有些却没有)。样本观察信息矩阵为:θ^\hat{\theta} JN(θ)=∑Ni=1Jyi(θ)J_N(\theta)=\sum_{i=1}^N J_{y_i}(\theta) 其中Jyi(θ)=−Hθ(logf(yi|θ)J_{y_i}(\theta)=-H_\theta(\log f(y_{i}|\theta)。 我可以证明在所述估计的概率收敛到我(θ ),但不ñ - 1 Ĵ Ñ(θ Ñ(Ý ))到我(θ 0)N−1JN(θ)N^{-1}J_N(\theta)I(θ)I(\theta)N−1JN(θ^N(Y))N^{-1}J_{N}(\hat{\theta}_N(Y))I(θ0)I(\theta_{0})。到目前为止,这是我的证明; Now (JN(θ))rs=−∑Ni=1(Hθ(logf(Yi|θ))rs(J_{N}(\theta))_{rs}=-\sum_{i=1}^N (H_\theta(\log f(Y_i|\theta))_{rs} is element (r,s)(r,s) of JN(θ)J_N(\theta), for any r,s=1,…,kr,s=1,\ldots,k. If the sample …

4
分类精度低,下一步该怎么办?
因此,我是ML领域的新手,因此尝试进行一些分类。我的目标是预测体育赛事的结果。我收集了一些历史数据,现在尝试训练分类器。我得到了大约1200个样本,其中有0.2个样本出于测试目的而拆分,其他样本则使用不同的分类器进行了网格搜索(包括交叉验证)。到目前为止,我已经尝试过使用线性,rbf和多项式内核以及随机森林的SVM。不幸的是,我无法获得显着大于0.5的精度(与随机选择类相同)。这是否意味着我无法预测如此复杂事件的结果?或者我可以获得至少0.7-0.8的精度?如果可行,那么接下来我应该考虑什么? 获取更多数据?(我最多可以将数据集放大5倍) 尝试其他分类器?(逻辑回归,kNN等) 重新评估我的功能集?有没有要分析的机器学习工具,哪些功能有意义,哪些没有?也许我应该减少功能集(目前我有12个功能)?

2
哪些进程可以生成拉普拉斯分布的(双指数)数据或参数?
许多发行版都有“起源神话”,或者它们很好地描述了物理过程的示例: 您可以通过中央极限定理从不相关错误的总和中获得正态分布的数据 您可以从独立硬币翻转中获得二项分布的数据,也可以从该过程的限制中获得泊松分布的变量 您可以在恒定衰减率下从等待时间获得指数分布的数据。 等等。 但是拉普拉斯分布呢?它对L1正则化和LAD回归很有用,但是对于我来说,很难想到一个人应该自然期望看到的情况。扩散将是高斯的,我能想到的所有具有指数分布(例如等待时间)的示例都包含非负值。

4
为DNA测序确定负二项分布
负二项式分布已成为生物信息学中计数数据(特别是来自给定实验的基因组给定区域内预期的测序读数预期数量)的流行模型。解释各不相同: 一些人将其解释为类似于Poisson分布的工作原理,但具有附加参数,可以为真实分布建模提供更多自由,方差不一定等于均值 一些人将其解释为泊松分布的加权混合(在泊松参数上具有伽玛混合分布) 有没有办法将这些原理与负二项式分布的传统定义相吻合,即在看到一定数量的失败之前先对伯努利试验的成功次数进行建模?还是我应该将它作为泊松分布与伽玛混合分布的加权混合具有与负二项式相同的概率质量函数的快乐巧合?

1
如何从高斯copula模拟?
假设我有两个单变量边际分布,即FFF和GGG,可以从中进行模拟。现在,使用表示为C (F ,G ; Σ )的高斯copula构造它们的联合分布。所有参数都是已知的。C(F,G;Σ)C(F,G;Σ)C(F,G;\Sigma) 是否有非MCMC方法可以从此系动中模拟出来?

3
中位数的无偏估计
假设我们在上支持一个随机变量,我们可以从中抽取样本。我们如何得出的中位数的无偏估计?XXX[0,1][0,1][0,1]XXX 当然,我们可以生成一些样本并取样本中值,但是我知道这通常不会产生偏差。 注意:这个问题与我的上一个问题有关,但并不完全相同,在这种情况下,只能近似采样。XXX
16 sampling 

3
泊松是指数级的,就像伽玛泊松是什么一样?
泊松分布可以测量单位时间内的事件,参数为。指数分布使用参数度量直到下一个事件的时间。一个可以将一个分布转换为另一个分布,这取决于对事件或时间进行建模更容易。λλ\lambda1λ1λ\frac{1}{\lambda} 现在,伽马-泊松是具有较大差异的“拉伸”泊松。威布尔分布是具有较大方差的“拉伸”指数。但是,可以像将Poisson转换成指数一样,轻松地将二者转换为彼此吗? 还是有一些其他分布更适合与伽马-泊松分布结合使用? 伽马泊松也称为负二项分布或NBD。

3
从序列数据估计马尔可夫转移概率
我有4个状态的全套序列(准确地说是432个观察值)A−DA−DA-D:例如 Y=⎛⎝⎜⎜⎜⎜AB⋮BCA⋮CDA⋮ADC⋮DBA⋮AA−⋮BC−⋮A⎞⎠⎟⎟⎟⎟Y=(ACDDBACBAACA−−⋮⋮⋮⋮⋮⋮⋮BCADABA)Y=\left(\begin{array}{c c c c c c c} A& C& D&D & B & A &C\\ B& A& A&C & A&- &-\\ \vdots&\vdots&\vdots&\vdots&\vdots&\vdots&\vdots\\ B& C& A&D & A & B & A\\ \end{array}\right) 编辑:观察序列的长度不相等!这会改变什么吗? 有没有一种方法可以在Matlab或R或类似程序中计算转换矩阵?我认为HMM软件包可能会有所帮助。有什么想法吗?Pij(Yt=j|Yt−1=i)Pij(Yt=j|Yt−1=i)P_{ij}(Y_{t}=j|Y_{t-1}=i) 例如:估计马尔可夫链概率

1
多站点研究的混合模型vs.合并标准误差-为什么混合模型效率更高?
我有一个数据集,其中包含来自多个站点的一系列“断棍”月度病例计数。我正在尝试从两种不同的技术中获得一个汇总估算值: 技术1:将Poisson GLM的“折断棒”安装到指标变量0/1上,并使用时间和时间^ 2变量来控制时间趋势。该0/1指标变量的估计值和SE是使用相当精确的矩量法向上或向下合并的,或者使用R中的tlnise包来合并以获得“贝叶斯”估计值。这类似于Peng和Dominici处理空气污染数据的方法,但站点数量较少(约十二个)。 技术2:放弃一些针对特定地点的时间趋势控件,并使用线性混合模型。尤其: lmer(cases ~ indicator + (1+month+I(month^2) + offset(log(p)), family="poisson", data=data) 我的问题涉及这些估计得出的标准误差。技术1的标准误差实际上使用的是每周一次而不是每月的时间设置,因此应该具有更高的精度。对于矩量法,估计的标准误差为〜0.206,对于tise的估计值则为〜0.306。 lmer方法给出的标准误差约为0.09。效果估计值是相当接近的,因此似乎并不是因为混合模型的效率大大提高,它们只是在不同的摘要估计值上归零。 这是合理的期望吗?如果是这样,为什么混合模型效率更高?这是普遍现象,还是该模型的特定结果?

1
迭代加权最小二乘的定义和收敛性
我一直在使用迭代加权最小二乘(IRLS)来最小化以下形式的函数, J(m)=∑Ni=1ρ(|xi−m|)J(m)=∑i=1Nρ(|xi−m|)J(m) = \sum_{i=1}^{N} \rho \left(\left| x_i - m \right|\right) 其中NNN是实例数xi∈Rxi∈Rx_i \in \mathbb{R},m∈Rm∈Rm \in \mathbb{R}是鲁棒估计,我想,并且ρρ\rho是一个合适的健壮罚函数。假设它是凸的(尽管不一定严格)并且目前是可区分的。这种一个很好的例子ρρ\rho是Huber损失函数。 我一直在做的是区分J(m)J(m)J(m)相对于mmm(和操作)来获得, dJdm=∑Ni=1ρ′(|xi−m|)|xi−m|(xi−m)dJdm=∑i=1Nρ′(|xi−m|)|xi−m|(xi−m)\frac{dJ}{dm}= \sum_{i=1}^{N} \frac{\rho'\left( \left|x_i-m\right|\right) }{\left|x_i-m\right|} \left( x_i-m \right) 并通过将其设置为0并将迭代权重固定kkk为w i(k )= ρ ' (| x i − m (k )|)来迭代求解wi(k)=ρ′(|xi−m(k)|)|xi−m(k)|wi(k)=ρ′(|xi−m(k)|)|xi−m(k)|w_i(k) = \frac{\rho'\left( \left|x_i-m{(k)}\right|\right) }{\left|x_i-m{(k)}\right|}(请注意,在处感知到的奇点xi=m(k)xi=m(k)x_i=m{(k)}实际上是我可能关心的所有的可移动奇点ρρ\rho)。然后我得到 ∑Ni=1wi(k)(xi−m(k+1))=0∑i=1Nwi(k)(xi−m(k+1))=0\sum_{i=1}^{N} w_i(k) \left( x_i-m{(k+1)} \right)=0 我求解得到m(k+1)=∑Ni=1wi(k)xi∑Ni=1wi(k)m(k+1)=∑i=1Nwi(k)xi∑i=1Nwi(k)m(k+1) = \frac{\sum_{i=1}^{N} w_i(k) x_i}{ …

3
Theta是什么意思?
我是统计学的新手,发现了这一点。 在统计中,θ(小写希腊字母“ theta”)是某些一般概率分布的(一个或多个)参数的(向量)的常用名称。一个常见的问题是找到theta的值。注意,以这种方式命名参数没有任何意义。我们不妨称之为其他任何事情。实际上,许多发行版的参数通常使用其他名称。例如,通常分别命名正态分布的均值和偏差μ(读为“ mu”)和偏差σ(“σ”)。 但是我仍然不知道用简单的英语意味着什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.