统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
它是否正确 ?(生成截断范数多元高斯)
如果 ,即 X∈Rn, X∼N(0–,σ2I)X∈Rn, X∼N(0_,σ2I)X\in\mathbb{R}^n,~X\sim \mathcal{N}(\underline{0},\sigma^2\mathbf{I})fX(x)=1(2πσ2)n/2exp(−||x||22σ2)fX(x)=1(2πσ2)n/2exp⁡(−||x||22σ2) f_X(x) = \frac{1}{{(2\pi\sigma^2)}^{n/2}} \exp\left(-\frac{||x||^2}{2\sigma^2}\right) 我想要多元情况下的截断正态分布的类似版本。 更确切地说,我想生成一个范数约束(值)的多元高斯 st ,其中ÿ ˚F ý(Ý )= { Ç 。f X(y ), 如果 | | y | | ≥ 一个0 , 否则 。c = 1≥a≥a\geq aYYYfY(y)={c.fX(y), if ||y||≥a0, otherwise .fY(y)={c.fX(y), if ||y||≥a0, otherwise . f_Y(y) = \begin{cases} c.f_X(y), \text{ if …

4
如何避免回归中的log(0)项
我有以下简单的X和Y向量: > X [1] 1.000 0.063 0.031 0.012 0.005 0.000 > Y [1] 1.000 1.000 1.000 0.961 0.884 0.000 > > plot(X,Y) 我想使用X的对数进行回归。为了避免得到log(0),我尝试输入+1或+0.1或+0.00001或+0.000000000000001: > summary(lm(Y~log(X))) Error in lm.fit(x, y, offset = offset, singular.ok = singular.ok, ...) : NA/NaN/Inf in 'x' > summary(lm(Y~log(1+X))) Call: lm(formula = Y ~ log(1 + X)) …

1
区分短期效果和长期效果
我在论文中读了以下句子: 短期系数和长期系数之间存在差异的事实是我们的规范的结果,其中包括滞后的内生变量。 他们对第一个差异进行回归,并包括因变量的滞后。 现在他们争辩说,如果您查看输出中的估计值(例如,称此估计值),则这是对因变量的短期影响。 他们进一步认为,查看 /(1-滞后估计)可以得出p对因变量的长期影响。p pppppppppp 可以在以下脚注23的第20页上找到该文件:https : //www.ecb.europa.eu/pub/pdf/scpwps/ecbwp1328.pdf及其有关短期/长期效果的讨论。 我不完全理解为什么您可以区分对因变量的短期和长期影响。如果有人可以更详细地解释他们的想法,那将非常有帮助。ppp

1
参考:逆cdf的尾巴
我几乎可以肯定,我已经在统计数据中看到以下结果,但是我不记得在哪里。 如果是一个正随机变量,并且则到,其中是 cdf 。È(X )&lt; ∞ ε ˚F - 1(1 - ε )→ 0 ε → 0 + ˚F XXXXE(X)&lt;∞E(X)&lt;∞\mathbb{E}(X)<\inftyεF−1(1−ε)→0εF−1(1−ε)→0\varepsilon F^{-1}(1-\varepsilon) \to 0ε→0+ε→0+\varepsilon\to 0^+FFFXXX 通过使用等式并通过考虑在被积体曲线下的区域的处的水平切口,可以很容易地从几何上看出这一点。ε 1 - ˚FE(X)=∫1−FE(X)=∫1−F\mathbb{E}(X)=\int 1-Fεε\varepsilon1−F1−F1-F 您知道此结果的参考以及它是否有名称吗?

1
中位数是“度量”属性还是“拓扑”属性?
对于术语的轻微滥用,我深表歉意。我希望我下面的意思会清楚。 考虑随机变量。均值和中位数都可以用最优性标准来表征:均值是使最小的数字,而中位数是使。从这个角度来看,平均值和中位数之间的差异是用于评估偏差,平方或绝对值的“度量”的选择。XXXμμ\muE((X- μ )2)Ë((X-μ)2)\mathrm E((X - \mu)^2)E( | X−μ|)E(|X−μ|)\mathrm E(|X - \mu|) 另一方面,中位数是(假定绝对连续性)的数字,即该定义仅取决于对值进行排序的能力,并且与它们有多少不同。这样的结果是,对于每个严格增加的函数,,这意味着它是“拓扑”的在“类似橡胶”的变换下保持不变。Pr(X≤ μ)=12Pr(X≤μ)=1个2\mathrm{Pr}(X \leq \mu) = \frac12XXXF(x)F(X)f(x)米Ë ð 我一个Ñ(f(X)) =f(米Ë ð 我一个Ñ(X))米Ëd一世一个ñ(F(X))=F(米Ëd一世一个ñ(X))\mathrm{median}(f(X)) = f(\mathrm{median}(X)) 现在,我已经完成了数学运算,并且我知道从最佳准则开始,我可以得出 -quantile,因此两者都描述相同的事物。但是我仍然感到困惑,因为我的直觉告诉我,依赖于“度量”的某些事物不能导致“拓扑”属性。1个21个2\frac12 有人可以为我解决这个难题吗?
10 mean  median 

1
随机森林vs Adaboost
在《随机森林》(Breiman,1999年)的第7节中,作者提出了以下猜想:“ Adaboost是随机森林”。 有没有人证明或反对这一点?为证明或反驳1999年以后的职位采取了哪些措施?

1
IV-probit的似然函数的推导
因此,我有一个二元模型,其中是潜在的不可观察变量,而y_1 \ in \ {0,1 \}在观察值中。y_2确定y_1,因此z_2是我的工具。简而言之,模型就是这样。 \ begin {eqnarray} y_1 ^ *&=&\ delta_1 z_1 + \ alpha_1 y_2 + u_1 \\ y_2&=&\ delta_ {21} z_1 + \ delta_ {22} z_2 + v_2 = \ textbf {z} \ delta + v_2 \\ y_1&=&\ text {1} [y ^ *&gt; 0] \ end …

1
如何测试“先前状态”是否对R中的“后续状态”有影响
想象一个情况:我们有三个矿山的历史记录(已有20年)。白银的存在是否会增加明年发现黄金的可能性?如何测试这样的问题? 这是示例数据: mine_A &lt;- c("silver","rock","gold","gold","gold","gold","gold", "rock","rock","rock","rock","silver","rock","rock", "rock","rock","rock","silver","rock","rock") mine_B &lt;- c("rock","rock","rock","rock","silver","rock","rock", "silver","gold","gold","gold","gold","gold","rock", "silver","rock","rock","rock","rock","rock") mine_C &lt;- c("rock","rock","silver","rock","rock","rock","rock", "rock","silver","rock","rock","rock","rock","silver", "gold","gold","gold","gold","gold","gold") time &lt;- seq(from = 1, to = 20, by = 1)

2
什么是预训练?如何预训练神经网络?
我知道预培训可避免常规培训中的某些问题。如果我将反向传播与自动编码器一起使用,我知道我会遇到时间问题,因为反向传播的速度很慢,而且我会陷入局部最优状态而无法学习某些功能。 我不了解的是我们如何预训练网络,以及具体如何进行预训练。例如,如果给我们一堆受限的玻尔兹曼机器,我们将如何对该网络进行预训练?

1
当维数大于观测次数时,PCA是否仍通过协方差矩阵的特征分解完成?
我有一个矩阵,在D = 100维空间中包含我的N = 20个样本。现在,我希望在Matlab中编写自己的主成分分析(PCA)。我首先将X贬为X_0。X N = 20 D = 100 X X 020 × 10020×10020\times100XXXñ= 20N=20N=20d = 100D=100D=100XXXX0X0X_0 我从某人的代码中了解到,在这种情况下,我们的维数比观测值大,我们不再对X0X0X_0的协方差矩阵进行特征分解。取而代之的是,我们对\ frac {1} {N-1} X_0X_0 ^ T进行特征分解1个ñ− 1X0XŤ01N−1X0X0T\frac{1}{N-1}X_0X_0^T。为什么正确? 正常协方差矩阵的大小为深× 深D×DD\times D,其中每个元素告诉我们二维之间的协方差。对我来说,1个ñ− 1X0XŤ01N−1X0X0T\frac{1}{N-1}X_0X_0^T甚至尺寸都不正确!它是N \ x Nñ× Nñ×ñN\times N矩阵,那么它将告诉我们什么?两个观察值之间的协方差?
10 pca 


4
假设是iid随机变量。预计序列何时会首次减少?
如标题中所建议。假设是pdf连续iid随机变量。考虑,,因此是序列首次减少时的时间。那么的值是多少?X1个,X2,… ,XñX1个,X2,…,XñX_1, X_2, \dotsc, X_nFFfX1个≤ X2... ≤ Xñ− 1&gt; XñX1个≤X2…≤Xñ-1个&gt;XñX_1 \leq X_2 \dotsc \leq X_{N-1} > X_Nñ≥ 2ñ≥2N \geq 2ññNË[ N]Ë[ñ]E[N] 我尝试首先评估。我有 同样,我得到。当变大时,计算变得更加复杂,我找不到模式。谁能建议我应该如何进行?P[ N= 我]P[ñ=一世]P[N = i] P[N=4]=1P[ N= 2 ]P[ N= 3 ]= ∫∞- ∞F(x )F(x )dX= F(x )22|∞- ∞= 12= ∫∞- ∞F(x )∫∞XF(y)F(y)dÿdX= ∫∞- ∞F(x )1 − F(x …

1
Holm-Bonferroni检验的置信区间?
我是多重比较问题的新手。我想知道如何为Holm-Bonferroni方法计算置信区间? 我知道,对于Bonferroni方法,我们可以将置信度级别从更改为。1−α1−α1-\alpha1−αm1−αm1-\frac{\alpha}{m} 此方法对Holm-Bonferroni也有效吗? Edit:Edit:\bf{Edit}:似乎HB方法没有提供更正conf的过程。间隔。但是您能否评论一下,我可以使用一种方法进行p值校正,而另一种方法进行间隔校正?

1
在multcomp :: glht中对具有交互作用的混合效应模型(lme4)进行事后测试
我正在R(lme4包)中的线性混合效应模型上执行事后测试。我正在使用multcomp包(glht()函数)执行事后测试。 我的实验设计是重复测量,具有随机阻塞效应。这些模型被指定为: mymod &lt;- lmer(variable ~ treatment * time + (1|block), data = mydata, REML = TRUE) 而不是在这里附上我的数据,我叫了数据的工作过warpbreaks的内multcomp包装。 data &lt;- warpbreaks warpbreaks$rand &lt;- NA 我添加了一个额外的随机变量来模拟我的“阻止”效果: warpbreaks$rand &lt;- rep(c("foo", "bar", "bee"), nrow(warpbreaks)/3) 这模仿了我的模型: mod &lt;- lmer(breaks ~ tension * wool + (1|rand), data = warpbreaks) 我知道“ 其他Multcomp示例-2 Way Anova”中的示例。该示例使您可以比较的张力水平wool。 如果我想做相反的事情-比较wool内的水平tension怎么办?(在我的情况下,这将是在时间水平(三至六月,七月,八月)内比较治疗水平(二至零,一)。 我已经提出了以下代码来执行此操作,但是它似乎不起作用(请参见下面的错误消息)。 …

2
将PCA应用于测试数据以进行分类
我最近了解了出色的PCA,并完成了scikit-learn文档中概述的示例。 我想知道如何将PCA应用于新数据点以进行分类。 在二维平面(x,y轴)上可视化PCA之后,我看到我可能可以画一条线来分隔数据点,以便一侧将属于一种分类,而另一侧则属于另一种分类。如何绘制此“边界”并将其应用于新数据点?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.