统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
WaveNet并不是真正的膨胀卷积,是吗?
在最近的WaveNet论文中,作者将他们的模型称为具有膨胀卷积的堆叠层。他们还产生以下图表,解释“常规”卷积和膨胀卷积之间的区别。 常规卷积看起来像是 一个卷积为2且步幅为1的卷积,重复4层。 然后,他们展示了其模型所使用的体系结构,它们称为膨胀卷积。看起来像这样。 他们说每一层的膨胀都增加了(1、2、4、8)。但是对我来说,这看起来像是常规卷积,滤镜大小为2,步幅为2,重复了4层。 据我了解,一个过滤器大小为2,步幅为1,膨胀为(1、2、4、8、8)的膨胀卷积看起来像这样。 在WaveNet图表中,没有一个过滤器会跳过可用的输入。没有孔。在我的图中,每个过滤器跳过(d-1)个可用输入。这是扩张应该不会起作用的方式吗? 所以我的问题是,以下哪个命题是正确的? 我不了解膨胀和/或规则卷积。 Deepmind实际上并没有实现膨胀卷积,而是跨步卷积,但是滥用了膨胀一词。 Deepmind确实实现了膨胀卷积,但没有正确实现图表。 我对TensorFlow代码的理解不够流利,无法理解他们的代码到底在做什么,但是我确实在Stack Exchange上发布了一个相关的问题,其中包含一些可以回答这个问题的代码。


4
正则化:为什么要乘以1 / 2m?
在吴安德(Andrew Ng)的Coursera机器学习课程的第3周讲义中,费用函数中添加了一个术语以实现正则化: J+(θ)=J(θ)+λ2m∑j=1nθ2jJ+(θ)=J(θ)+λ2m∑j=1nθj2J^+(\theta) = J(\theta) + \frac{\lambda}{2m} \sum_{j=1}^n \theta_j^2 讲义说: 我们还可以将所有theta参数归一化: minθ 12m [∑i=1m(hθ(x(i))−y(i))2+λ ∑j=1nθ2j]minθ 12m [∑i=1m(hθ(x(i))−y(i))2+λ ∑j=1nθj2]min_\theta\ \dfrac{1}{2m}\ \left[ \sum_{i=1}^m (h_\theta(x^{(i)}) - y^{(i)})^2 + \lambda\ \sum_{j=1}^n \theta_j^2 \right] 12m12m\frac 1 {2m}稍后应用于神经网络的正则化项: 回想一下正则逻辑回归的成本函数为: Ĵ(θ )= − 1米∑我= 1米[ y(我) 日志(^ hθ(x(我)))+ (1 − y(我))日志 (1 - ħθ(x(我)))]+λ2m∑j=1nθ2jJ(θ)=−1m∑i=1m[y(i) log⁡(hθ(x(i)))+(1−y(i)) log⁡(1−hθ(x(i)))]+λ2m∑j=1nθj2J(\theta) = …

3
为什么对于给定的n,比例的标准误差最大为0.5?
当所讨论的比例为0.5时,对于给定的N,比例的标准误差将是最大的,并且该比例的标准误差从0.5开始越小。当查看比例的标准误差的方程式时,我可以看到为什么会这样,但是我无法进一步解释。 除了公式的数学性质之外,还有其他解释吗?如果是这样,为什么估计比例(对于给定的N)在接近0或1时为何不确定性较小?


3
用蒙特卡洛估计Kullback Leibler(KL)的散度
我想估计两个连续分布f和g之间的KL散度。但是,我无法写下f或g的密度。我可以通过某种方法(例如,马尔可夫链蒙特卡洛)从f和g中采样。 从f到g的KL散度定义如下 dķ大号(f| | G)= ∫∞- ∞F(x )日志(f(x )G(x )) dXdķ大号(F||G)=∫-∞∞F(X)日志⁡(F(X)G(X))dXD_{KL}(f || g) = \int_{-\infty}^{\infty} f(x) \log\left(\frac{f(x)}{g(x)}\right) dx 这是关于f 的期望,因此您可以想象一些蒙特卡洛估计日志(f(x )G(x ))日志⁡(F(X)G(X))\log\left(\frac{f(x)}{g(x)}\right) 1个ñ∑一世ñ日志(f(x一世)G(x一世))1个ñ∑一世ñ日志⁡(F(X一世)G(X一世))\frac{1}{N}\sum_i^N \log\left(\frac{f(x_i)}{g(x_i)}\right) 其中i索引从f提取的N个样本(即,对于i = 1,...,N,X一世〜˚F()X一世〜F()x_i \sim f()) 但是,由于我不知道f()和g(),因此甚至无法使用此蒙特卡洛估计。在这种情况下估算KL的标准方法是什么? 编辑:我不知道f()或g()的非归一化密度

1
为什么我们不能使用
假设我们有一个线性回归模型,其因变量。我们发现它的。现在,我们进行另一个回归,但是这次是在,类似地找到它的。有人告诉我,我无法将两个进行比较,以查看哪种模型更合适。这是为什么?给我的原因是,我们将比较不同数量(不同因变量)的可变性。我不确定这是否是充分的理由。R 2 y log (y )R 2 log (y ) R 2yyyR2yRy2R^2_ylog(y)log⁡(y)\log(y)R2log(y)Rlog⁡(y)2R^2_{\log(y)}R2R2R^2 还有办法使它正式化吗? 任何帮助,将不胜感激。

1
杰弗里斯(Jeffreys)先验二项式可能性
如果我将Jeffreys先验用于二项式概率参数则这意味着使用分布。θθ\thetaθ∼beta(1/2,1/2)θ∼beta(1/2,1/2)\theta \sim beta(1/2,1/2) 如果我转换为参考的新帧,则显然也不会以分布的形式分布。ϕ=θ2ϕ=θ2\phi = \theta^2ϕϕ\phibeta(1/2,1/2)beta(1/2,1/2)beta(1/2,1/2) 我的问题是,从什么意义上说,杰弗里斯对重新参数化的先验不变性是什么?我想我对这个话题真是个误解。 最好, 本


2
具有连续变量和二进制变量的K最近邻
我有一个带有列a b c(3个属性)的数据集。a是数值型和连续型的,b并且c分别具有两个级别。我使用的是K-近邻方法进行分类a和b上c。因此,为了能够测量距离,我通过删除b和添加b.level1和来变换数据集b.level2。如果观察i在b类别中处于第一级,则b.level1[i]=1和b.level2[i]=0。 现在,我可以在新数据集中测量距离了: a b.level1 b.level2 从理论/数学角度来看:可以同时对二进制数据和连续数据执行K最近邻(KNN)吗? 我FNN在R和功能中使用包knn()



3
HMM拟合中MLE和Baum Welch之间的区别
在这个受欢迎的问题中,高评价的答案使MLE和Baum Welch在HMM拟合中分开。 对于训练问题,我们可以使用以下3种算法:MLE(最大似然估计),Viterbi训练(不要与Viterbi解码混淆),Baum Welch =前向后向算法 但在维基百科中,它说 Baum-Welch算法使用众所周知的EM算法来找到参数的最大似然估计 那么,MLE和Baum-Welch算法之间是什么关系? 我的尝试:Baum-Welch算法的目标是使可能性最大化,但它使用专用算法(EM)来解决优化问题。我们仍然可以通过使用其他方法(例如,梯度体面)来最大程度地提高似然度。这就是为什么答案将两个算法分开的原因。 我是对的,谁能帮我澄清一下?

2
快速锚定RCNN
在Faster RCNN论文中,当谈到锚点时,使用“参考盒金字塔”是什么意思,这是怎么做的?这是否仅意味着在每个W * H * k锚点都生成了边界框? 其中W =宽度,H =高度,k =纵横比的数量*数字刻度 链接到论文:https : //arxiv.org/abs/1506.01497

1
SVM =模板匹配如何?
我了解了SVM,并了解到它们正在解决优化问题,并且最大利润率的想法非常合理。 现在,使用内核,他们甚至可以找到很棒的非线性分离边界。 到目前为止,我真的不知道SVM(一种特殊的内核计算机)和内核计算机如何与神经网络相关联? 在这里考虑Yann Lecun => 的评论: kernel methods were a form of glorified template matching 还有这里: 例如,一些人因为与之相关的数学运算而对内核方法感到迷惑。但是,正如我在过去所说的,最后,内核计算机是执行“标准化模板匹配”的浅层网络。没什么错(SVM是一种很好的方法),但是它有可怕的局限性,我们都应该意识到。 所以我的问题是: SVM与神经网络有何关系?浅层网络如何? SVM通过定义明确的目标函数解决了优化问题,它如何进行模板匹配?输入与之匹配的模板在这里是什么? 我想这些评论需要对高维空间,神经网络和内核机器有透彻的了解,但到目前为止,我一直在尝试并且无法理解其背后的逻辑。但是,注意到两种截然不同的ml技术之间的联系肯定很有趣。 编辑:我认为从神经的角度理解SVM会很棒。我正在寻找对以上两个问题的数学支持的完整答案,以便真正理解SVM和神经网络之间的联系,无论是线性SVM还是带有内核技巧的SVM。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.