统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
随机重叠间隔
如何在以下问题中找到解析表达式?D(n,l,L)D(n,l,L)D(n,l,L) 我将长度为 “小节” 随机放入间隔。“条”可以重叠。我想找到间隔的平均总长度,该平均长度至少被一个“小节”占据。nnnlll[0,L][0,L][0,L]DDD[0,L][0,L][0,L] 在“低密度”限制中,重叠应该可以忽略,并且。在“高密度”的限制,接近。但是如何获得的一般表达式?那应该是一个非常基本的统计问题,但是我在论坛上找不到解释性的解决方案。D=n⋅lD=n⋅lD = n\cdot lDDDLLLDDD 任何帮助将不胜感激。 请注意,这些小节彼此之间是真正随机(统计独立)的。

2
这两个布劳希-帕根检验之间有什么区别?
在某些数据上使用R并尝试查看我的数据是否为异方差,我发现了Breusch-Pagan测试的两个实现,即bptest(包lmtest)和ncvTest(包车)。但是,这些产生不同的结果。两者有什么区别?您何时应该选择使用其中一个? > model <- lm(y ~ x) > bp <- bptest(model) > bp studentized Breusch-Pagan test data: model BP = 3.3596, df = 1, p-value = 0.06681 > ncvTest(model) Non-constant Variance Score Test Variance formula: ~ fitted.values Chisquare = 3.858704 Df = 1 p = 0.04948855 这些示例表明,根据测试,我的数据在一种情况下是异方差的,在另一种情况下是同方的。我确实在这里找到了这个问题,所以bptest可能是学生化的,而ncvTest可能不是,但是,那意味着什么呢?

2
从纸上帮助期望最大化:如何包括事先分配?
该问题基于题为:使用耦合的辐射传输-扩散模型的漫射光学层析成像中的图像重建 下载链接 作者应用具有未知向量稀疏正则化的EM算法来估计图像的像素。该模型由 μl1升1个l_1μμ\mu y=Aμ+e(1)(1)ÿ=一个μ+Ëy=A\mu + e \tag{1} 估算值在等式(8)中给出为 μ^=argmaxlnp(y|μ)+γlnp(μ)(2)(2)μ^=精氨酸⁡米一个Xln⁡p(ÿ|μ)+γln⁡p(μ)\hat{\mu} = \arg max {\ln p(y|\mu) + \gamma \ln p(\mu)} \tag{2} 在我的情况下,我已经将视为长度为的过滤器,而是代表过滤器的向量。所以,大号μ大号× 1μμ\muL大号Lμμ\mathbf{\mu}L×1大号×1个L \times 1 该模型可以重写为y(n)=μTa(n)+v(n)(3)(3)ÿ(ñ)=μŤ一个(ñ)+v(ñ)y(n) = \mathbf{\mu^T}a(n) + v(n) \tag{3} 问题:问题公式:(n乘以1)是未观察到的输入,是零均值,方差未知加性噪声。MLE解决方案将基于期望最大化(EM)。 { È (Ñ )} σ 2 ëμ(n)μ(n){\mu(n)}{e(n)}{e(n)}\{e(n)\}σ2Ëσe2\sigma^2_e 在本文中,方程(19)是函数-完整的对数似然性,但是对于我而言,我不理解如何在完整的对数似然表达式中包含的分布。 甲,μ一个AA甲,μA,μA, \mu 使用 EM(包括先验分布)的完全对数似然是什么?ÿyy

1
如何确定先验概率分布?有没有应该使用的经验法则或技巧?
尽管我想认为自己对贝叶斯统计分析和决策中的先验信息概念有很好的了解,但我经常难以理解它的应用。我想到了几种情况,这些都是我奋斗的例证,而且我认为到目前为止,我所读过的贝叶斯统计教科书并未适当地解决这些问题: 假设我几年前进行了一项调查,其中说68%的人会对购买ACME产品感兴趣。我决定再次进行调查。虽然我将使用与上次相同的样本量(例如n = 400),但此后人们的看法可能已经改变。但是,如果我使用beta分布作为先验,在400位受访者中有272位回答“是”,那么我将对几年前进行的调查和现在正在进行的调查给予同等的重视。是否有经验法则来确定我想基于数据存在数年之久的更大不确定性?我知道我可以将优先级从272/400降低到136/200,但这感觉非常武断,我想知道在文献中是否存在某种形式的辩护, 再举一个例子,假设我们要进行一项临床试验。在启动试验之前,我们进行了一些辅助研究,可以用作以前的信息,包括专家意见,先前临床试验的结果(具有不同的相关性),其他基本的科学事实等。如何结合这些信息范围(其中有些是非量化的)到先前的概率分布?只是为了决定选择哪个家庭并使其充分分散以确保其不被数据淹没而已,还是为了建立一个相当有用的先验分布而做了大量工作?

1
完整的概率分布集合的拓扑
我一直在努力使我对概率分布的直观理解与几乎所有概率分布拓扑都具有的怪异属性相协调。 例如,考虑一个混合随机变量:选择一个以0为中心,方差为1且概率为的高斯,将加到结果中。此类随机变量的序列将收敛(微弱且总变化)为以0为中心且方差为1的高斯,但的均值始终为,方差收敛为。我真的不喜欢说这个序列因此而收敛。1XnXnX_n nXn1+∞1n1n\frac{1}{n}nnnXnXnX_n111+∞+∞+\infty 我花了相当长的时间来记住所有关于拓扑遗忘的内容,但最终我弄清楚了这些示例令我感到不满意的是:序列的限制不是常规分布。在上面的示例中,限制为怪异的“均值1和无穷方差的高斯”。用拓扑学的术语来说,在弱者(以及电视以及我看过的所有其他拓扑学)下,概率分布集并不完整。 然后,我面临以下问题: 是否存在拓扑结构使得概率分布集合完整? 如果否,那么这种缺失是否反映了概率分布集合的有趣特性?还是只是无聊? 注意:我已对“概率分布”提出了自己的问题。这些不能关闭,因为它们可以收敛到Diracs和类似没有pdf的东西。但是在薄弱的拓扑结构下仍然没有采取措施,所以我的问题仍然存在 交叉发布到mathoverflow /mathpro/226339/topologies-for-which-the-ensemble-of-probability-measures-is-complete?noredirect=1#comment558738_226339

4
解释AIC值
我在逻辑模型中看到的AIC的典型值是数千,至少数百。例如,在http://www.r-bloggers.com/how-to-perform-a-logistic-regression-in-r/上 ,AIC为727.39 虽然总是说AIC仅应用于比较模型,但我想了解特定AIC值的含义。根据公式, 一个我C= - 2 日志(L )+ 2 K一个一世C=-2日志⁡(大号)+2ķAIC= -2 \log(L)+ 2K 其中,L =来自MLE估计器的最大似然,K是参数数量 在上面的示例中,K = 8 因此,用简单的算术: 727.9 = -2*log(L)+ 2*8 Hence, 711.39 = -2*log(L) Hence, log (L)= 711.39/-2 = -355.695 Hence, L = exp(-355.695) = 3.3391E-155 因此,如果我的理解是正确的,这就是通过MLE拟合数据确定的功能的可能性。这似乎真的真的很低。 我在这里想念什么?

2
充分利用LSTM进行序列内事件预测
假设以下一维序列: A, B, C, Z, B, B, #, C, C, C, V, $, W, A, % ... A, B, C, ..这里的字母代表“普通”事件。 #, $, %, ...这里的符号代表“特殊”事件 所有事件之间的时间间隔是不均匀的(从几秒到几天),尽管过去的事件越远,影响未来事件的可能性就越小。理想情况下,我可以明确考虑这些时间延迟。 大约有10000个普通事件类型,而有大约100个特殊事件类型。特殊事件之前的普通事件数量有所不同,但不太可能超过100-300。 从根本上讲,我对在普通事件序列中寻找最终可预测特殊事件的模式感兴趣。 现在,您可以用不同的方法来实现:创建特征向量+标准分类,关联规则学习,HMM等。 在这种情况下,我对于基于LSTM的网络最适合的情况感到好奇。直截了当就是做类似Karparthy的char-rnn的事情,并根据历史预测下一个事件。然后换一个新序列 C, Z, Q, V, V, ... , V, W 您可以在模型中运行它,然后查看最有可能发生的特殊事件。但这并不太合适。 由于这是一个时间分类问题,因此似乎应该做的正确的事情是使用Alex Graves所描述的连接主义时间分类。 但是,在此刻投入过多之前,我正在寻找更容易,更快捷的方法来进行试验,以了解LSTM在这里的适用性。Tensorflow将会在某个时候看到CTC示例,但尚未出现。 所以我的(子)问题是: 鉴于上述问题,我想尝试使用LSTM值得尝试char-rnn类型的方法,是我该硬着头皮掌握CTC,还是有一个更好的起点。 您将如何明确纳入事件间计时信息。使用带有无操作事件的固定时钟显然可以,但是很难看。 假设我设法训练了LSTM,是否可以检查模型以查看其发生了哪种事件“主题”?(即类似于卷积网络中的过滤器) 任何示例代码(首选python)总是有帮助的。 编辑:只是要补充一下,序列中有一些噪音。有些事件可以安全地忽略,但是确切地说哪些事件并非总是可以预先说出来的。因此,理想情况下,模型(及其衍生的主题)对此具有鲁棒性。

3
如果和,则
这不是功课。 令XXX为随机变量。如果E[X]=k∈RE[X]=k∈R\mathbb{E}[X] = k \in \mathbb{R}和Var[X]=0Var[X]=0\text{Var}[X] = 0,是否遵循Pr(X=k)=1Pr(X=k)=1\Pr\left(X = k\right) = 1? 直观上,这似乎很明显,但是我不确定如何证明这一点。我知道一个事实,从这些假设可以得出\ mathbb {E} [X ^ 2] = k ^ 2的事实E[X2]=k2E[X2]=k2\mathbb{E}[X^2] = k^2。因此 (∫Rx dF(x))2=∫Rx2 dF(x).(∫Rx dF(x))2=∫Rx2 dF(x).\left(\int_{\mathbb{R}}x\text{ d}F(x)\right)^2 = \int_{\mathbb{R}}x^2\text{ d}F(x)\text{.} 这似乎没有带我到任何地方。我可以尝试 Var[X]=E[(X−k)2].Var[X]=E[(X−k)2].\text{Var}[X] = \mathbb{E}\left[\left(X - k\right)^2\right]\text{.} 现在,因为(X−k)2≥0(X−k)2≥0\left(X - k\right)^2 \geq 0,也遵循E[(X−k)2]≥0E[(X−k)2]≥0\mathbb{E}\left[\left(X - k\right)^2\right] \geq 0。 但是,如果我要使用等式 E[(X−k)2]=0E[(X−k)2]=0\mathbb{E}\left[\left(X …

2
在实践中应用深度学习的瓶颈
在阅读了很多深度学习论文之后,一种粗略的感觉是,在训练网络以获得比正常情况更好的性能方面存在很多技巧。从行业应用的角度来看,很难开发这种技巧,除了那些大型科技公司中的精英研究小组,例如google或facebook。那么在实践中应用深度学习算法的最佳方法是什么。任何想法和建议将不胜感激。


2
转换订单统计
假设随机变量和是独立的并且是。证明Z_n = n \ log \ frac {\ max(Y _ {(n)},X _ {(n)})} {\ min(Y _ {(n)},X _ {(n)})}的\文本{Exp}(1)分发。X1,...,XnX1,...,XnX_1, ... , X_nY1,...,YnY1,...,YnY_1, ..., Y_nU(0,a)U(0,a)U(0,a)Zn=nlogmax(Y(n),X(n))min(Y(n),X(n))Zn=nlog⁡max(Y(n),X(n))min(Y(n),X(n))Z_n= n\log\frac{\max(Y_{(n)},X_{(n)})}{\min(Y_{(n)},X_{(n)})}Exp(1)Exp(1)\text{Exp}(1) 我通过设置\ {X_1,...,X_n,Y_1,... Y_n \} = \ {Z_1,...,Z_n \}开始了这个问题,{X1,...,Xn,Y1,...Yn}={Z1,...,Zn}{X1,...,Xn,Y1,...Yn}={Z1,...,Zn}\{X_1,...,X_n,Y_1,...Y_n\} = \{Z_1,...,Z_n\}然后max(Yn,Xn)=Z(2n)max(Yn,Xn)=Z(2n)\max(Y_n,X_n)= Z_{(2n)}分布为(za)2n(za)2n(\frac{z}{a})^{2n}而min(Yn,Xn)=Z(1)min(Yn,Xn)=Z(1)\min(Y_n,X_n)= Z_{(1)}分布为1−(1−za)2n1−(1−za)2n1 - (1 - \frac{z}{a})^{2n} 可以很容易地找到密度,因为fZ1(z)=(2n)(1−za)2n−11afZ1(z)=(2n)(1−za)2n−11af_{Z_{1}}(z) = (2n)(1-\frac{z}{a})^{2n-1}\frac{1}{a}和fZ(2n)(z)=(2n)(za)2n−11afZ(2n)(z)=(2n)(za)2n−11af_{Z_{(2n)}}(z) = (2n)(\frac{z}{a})^{2n-1} \frac{1}{a} 现在,在计算完这些之后,我很难知道下一步要去哪里。我以为它必须进行某种转换,但是我不确定...

1
重尾分布阶数统计量的渐近正态性
背景: 我有一个要在尾部分布较大的情况下建模的样本。我有一些极端的值,以至于观察值的分布相对较大。我的想法是使用广义Pareto分布对此建模,所以我做到了。现在,我的经验数据的0.975分位数(约100个数据点)低于我拟合到我的数据的广义帕累托分布的0.975分位数。我想,现在有什么方法可以检查这种差异是否值得担心吗? 我们知道分位数的渐近分布为: 因此,我认为通过尝试在广义Pareto分布的0.975分位数附近绘制95%的置信带,并使用与我拟合数据时得到的参数相同的参数来激发我的好奇心是个好主意。 如您所见,我们在这里使用一些极限值。而且由于分布是如此之大,因此密度函数的值非常小,使用上面的渐近正态性公式的方差使置信带达到的数量级:± 1012±1012\pm 10^{12} ± 1.96 0.975 * 0.025Ñ (˚Fg ^ Pd(q0.975))2±1.960.975∗0.025ñ(FGPd(q0.975))2\pm 1.96\frac{0.975*0.025}{n({f_{GPD}(q_{0.975})})^2} 因此,这没有任何意义。我的分布只有积极的结果,而置信区间包括负值。所以这里发生了一些事情。如果我计算0.5分位数附近的谱带,则谱带并不是那么大,但仍然很大。 我继续看一下如何与另一个分布,即分布一起使用。从分布模拟观测值,并检查分位数是否在置信带内。我这样做了10000次,以查看置信区间内模拟观察值的0.975 / 0.5分位数的比例。ñ(1 ,1 )ñ(1个,1个)\mathcal{N}(1,1)n = 100ñ=100n=100ñ(1 ,1 )ñ(1个,1个)\mathcal{N}(1,1) ################################################ # Test at the 0.975 quantile ################################################ #normal(1,1) #find 0.975 quantile q_norm<-qnorm(0.975, mean=1, sd=1) #find density value at 97.5 quantile: f_norm<-dnorm(q_norm, mean=1, sd=1) …

1
轮廓函数有趣特征是否通过回归获得?
我假设使用回归的一般设置,即从族\ {h_ \ theta \} _ \ theta中选择一个连续函数h_ \ theta:X \至\ mathbb R ^ n以适合给定数据(x_i,y_i)根据某些自然标准,X乘以X乘以R ^ n,i = 1,\ ldots,k(X可以是任何空间,例如立方体[0,1] ^ m或实际上是任何合理的拓扑空间)。hθ:X→Rnhθ:X→Rnh_\theta:X\to \mathbb R^n{hθ}θ{hθ}θ\{h_\theta\}_\theta(xi,yi)∈X×Rn,i=1,…,k(xi,yi)∈X×Rn,i=1,…,k(x_i,y_i)\in X\times \mathbb R^n, i=1,\ldots, kXXX[0,1]m[0,1]m[0,1]^m 是否有其中一个有兴趣的轮廓回归的应用h−1(y)h−1(y)h^{-1}(y)的hhh对于某些点y∈Rny∈Rny\in \mathbb R^n -例如零集合h−1(0)h−1(0)h^{-1}(0)? 我感兴趣的解释如下:由于在许多情况下,所学习的h_ \ theta都有不确定性hθhθh_\theta(数据的不精确或缺乏),因此人们可能想分析零集h−1(0)h−1(0)h^{-1}(0) “坚固”。即,研究h的所有“扰动”所共有的零集特征hhh。一个很好的了解已经非常一般设置在扰动最近开发fff可以任意连续映射接近hhh在ℓ∞ℓ∞\ell_\infty规范。或者,基本上等价地,fff是任意连续的,这样对于X中的每个x \,x∈Xx∈Xx\in X我们都有|f(x)−h(x)|≤c(x)|f(x)−h(x)|≤c(x)|f(x)-h(x)|\le c(x)其中c:X→Rc:X→Rc:X\to\mathbb R在每个x处给出一些置信度值xxx。 我们发展该理论和算法的主要动机是令人兴奋的数学背后(基本上所有问题/问题都归结为同伦理论)。但是,在当前阶段,为了进一步开发和实现算法,我们需要选择更具体的设置和目标。

2
哪个科学领域研究人们如何解释定量总结和可视化?
有大量的知名资源提供有关数据可视化的建议。(例如,Tufte,Stephen Few等人,Nathan Yau。)但是,对于诸如此类的问题,答案可能会转向哪个领域: 饼图批评在实践中是否有意义?人们在解释线性标尺长度方面比在弧长方面要好得多吗? 假设我构建了一组基础变量的指数摘要,并向一般观众解释美国在2010年的价值为100,在2015年的价值为110。大多数人将如何解释这些数字?在介绍此指标时,我是否应该考虑自然的认知习惯,以便更好地解释或防止误解? 换句话说,定量信息的呈现者可以在哪些科学领域中寻找经验上可靠且经过测试的原理,这些原理可以帮助整理当今可用的大量可视化和设计建议? 目的不是要找到关于如何最佳地可视化数据或解决新颖的数据可视化问题的建议,想法或当前共识,而是要在哪里寻找人们如何解释定量和/或视觉信息的科学。 (对于引用该领域的期刊,会议和学者的额外感谢。)

1
实验设计研究生课程应涵盖哪些内容?
我被要求为农学和生态学的高级研究生提议一门实验设计课程。我从未参加过这样的课程,并且惊讶地发现该课程可能更恰当地命名为“超越单向方差分析”,并且涵盖了我在农业统计学实验高级研究生课程中学习到的材料(例如RCBD,拉丁方,对比度,重复测量和协变量)。也许我对“实验设计”而不是“实验结果分析”感到困惑。 我对此类课程应包含的内容有一些想法,并希望就如何将其整合到满足学生需求的统计学课程中的反馈意见,同时为设计和相关测试的命名列表提供现代替代方案。 例如,当我教学生比较具有线性和二次函数的回归模型时,我无法想象教他们使用ANOVA来对连续变量进行分类,从而使用线性和二次对比。在第二种情况下,他们还将学习如何处理不是实验定义的离散值的因素。如果有的话,我可以比较两种方法。 如果我要教授“实验设计”课程,我真的很想强调与应用的统计模型无关的基本概念,并且这些基本概念将更广泛地转化为其他问题。这将使学生更加灵活地使用现代统计方法。 现有课程中似乎未涵盖的一些相关概念包括: 分层模型和混合模型(我以ANOVA和亲戚为例) 模型比较(例如替换对比) 使用空间模型代替块作为“因素” 复制,随机化和IID 假设检验,p-hacking和模式识别之间的差异。 通过仿真进行功率分析(例如,从仿真数据集中恢复参数), 预注册, 利用已发表的研究和科学原理中的先验知识。 目前有没有采用这种方法的课程?有没有这样关注的教科书?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.