统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
反向传播如何在暹罗神经网络中工作?
我一直在研究Yann LeCun和他的同事在1994年提出的用于识别签名的暹罗神经网络的体系结构(“使用暹罗时延神经网络的签名验证” .pdf,NIPS 1994) 我了解了这种体系结构的总体思路,但是我真的无法理解这种情况下反向传播的工作原理。我无法理解神经网络的目标值是什么,这将允许反向传播正确设置每个神经元的权重。 在这种体系结构中,该算法计算两个神经网络的最终表示之间的余弦相似度。论文指出:“当给出真正的签名时,所需的输出是两个子网(f1和f2)的输出之间的小角度。 ,并且如果签名之一是伪造,则大角度书写”。 我真的不明白他们如何使用二进制函数(两个向量之间的余弦相似度)作为目标来进行反向传播。 在暹罗神经网络中如何计算反向传播?

2
什么是收缩?
收缩一词在某些圈子里泛滥了。但是什么是收缩,似乎没有一个明确的定义。如果我有一个时间序列(或某个过程的任何观察结果集合),我可以用什么不同的方式来测量该序列的某种经验性收缩?我可以谈论哪些不同类型的理论收缩?收缩率如何帮助预测?人们能否提供一些好的见解或参考?


3
伯努利试验中估计“成功”可能性所需的样本量
假设一个游戏提供了一个事件,该事件在完成时要么给出奖励,要么什么都不给出。确定是否给出奖励的确切机制尚不清楚,但我假设使用了随机数生成器,并且如果结果大于某个硬编码值,则可以获得奖励。 如果我想对工程师进行什么逆向工程以决定奖励的获得频率(估计为15%至30%),我该如何计算所需的样本数量? 我从这里的“真实概率估计器”部分开始:Checking_whether_a_coin_is_fair,但不确定我是否正朝正确的道路前进。我得到了〜1000个样本的结果,在95%置信度下最大误差为3%。 最终,这是我要解决的问题: 事件#1的X%给予奖励1.0R 事件#2的奖励率为1.4R,有%的时间 我想足够准确地估算X和Y,以确定哪个事件更有效。大样本量是一个问题,因为我最多每20分钟只能获取1个样本。

1
之间的连接(d素)和AUC(下面积ROC曲线); 基本假设
在机器学习中,我们可以使用ROC曲线下的面积(通常缩写为AUC或AUROC)来总结系统在两个类别之间的区分程度。在信号检测理论中,通常将(灵敏度指标)用于类似目的。两者是紧密相连的,如果满足某些假设,我相信它们彼此等效。d′d′d' 的的计算通常是基于假设正态分布的信号分布(见维基链接以上,例如)呈现。ROC曲线计算不做此假设:它适用于任何可输出可阈值的连续值决策标准的分类器。d′d′d' 维基百科说是相当于。如果两个假设都满足,这似乎是正确的。但是,如果假设不相同,那就不是普遍真理。d′d′d'2AUC−12AUC−12 \text{AUC} - 1 将假设的差异描述为“ AUC对基本分布做出的假设更少”是否公平?还是实际上与AUC一样广泛适用,但是使用人们倾向于使用假设正态分布的计算只是一种惯例?我错过的基本假设是否还有其他差异?d′d′d'd′d′d'

2
对分布均值的瞬间有直觉吗?
有人可以提供一个直觉来解释为什么概率分布的较高矩(如第三和第四矩)分别对应于偏度和峰度吗?具体来说,为什么对三次方或三次方的均值方差最终转化为偏度和峰度的量度?有没有办法将此与函数的三阶或四阶导数联系起来?pXpXp_X 考虑偏度和峰度的以下定义: Skewness(X)=E[(X−μX)3]/σ3,Kurtosis(X)=E[(X−μX)4]/σ4.Skewness(X)=E[(X−μX)3]/σ3,Kurtosis(X)=E[(X−μX)4]/σ4.\begin{matrix} \text{Skewness}(X) = \mathbb{E}[(X - \mu_{X})^3] / \sigma^3, \\[6pt] \text{Kurtosis}(X) = \mathbb{E}[(X - \mu_{X})^4] / \sigma^4. \\[6pt] \end{matrix} 在这些方程式中,我们将归一化值提升至幂,并采用其期望值。我不清楚为什么将标准化随机变量提高到4的幂会产生“峰值”,或者为什么将标准化随机变量提高到3的幂会带来“偏斜”。这似乎是神奇而神秘的!(X−μ)/σ(X−μ)/σ(X-\mu)/\sigma

6
如何表征突然的变化?
这个问题可能太基础了。对于数据的时间趋势,我想找出发生“突变”变化的点。例如,在下面显示的第一个图中,我想使用某种统计方法找出更改点。我想在变化点不明显的其他一些数据中使用这种方法(例如第二张图)。

1
图解线性混合效应模型结果的图
我一直在使用R中的线性混合效果建模来分析一些数据。我打算用结果制作海报,我只是想知道是否有人对混合效果模型有经验,可以建议使用哪些图表来说明结果?模型。我在考虑残差图,拟合值与原始值的图等。 我知道这很大程度上取决于我的数据,但我只是想尝试一种最佳方法来说明线性混合效应模型的结果。我在R中使用nlme软件包。 谢谢

2
了解GLM中的虚拟(手动或自动)变量创建
如果在glm公式中使用了因子变量(例如,具有M和F级的性别),则会创建一个或多个虚拟变量,并且可以在glm模型摘要中找到它们以及相关的系数(例如,genderM) 如果不是代替R以此方式分解因子,而是将因子编码为一系列数字0/1变量(例如,genderM(1表示M,0表示F),genderF(1表示F,0表示0)。 M),然后将这些变量用作glm公式中的数字变量,系数结果会有所不同吗? 基本上,问题是:在使用因子变量和数值变量时,R是否使用不同的系数计算? 后续问题(可能由上述方法回答):除了让R创建虚拟变量的效率高之外,将因子重新编码为一系列数字0,1变量并在模型中使用这些变量是否还有其他问题?

3
不同样本大小下p值的相对大小
在不同样本量下ap值的相对大小如何变化?就像如果在得到进行相关,然后在时得到相同的p值0.20,那么与原始p值相比,第二次测试的p值的相对大小是多少当?n = 45 n = 120 n = 45p=0.20p=0.20p=0.20n=45n=45n=45n=120n=120n=120n=45n=45n=45

1
为随机梯度下降(SGD)选择合适的小批量大小
有没有文献研究随机梯度下降时小批量的选择?以我的经验,这似乎是一个经验选择,通常是通过交叉验证或使用不同的经验法则发现的。 随着验证错误的减少,逐渐增加小批量的大小是否是一个好主意?这将对泛化错误产生什么影响?我是否会使用极小的微型批处理程序进行更好的情况更新数十万次?在数量极少与批量之间保持平衡的状态下,我会更好吗? 我是否应该根据数据集的大小或数据集中预期的要素数量来缩放微型批处理的大小? 我显然对实现小批量学习方案有很多疑问。不幸的是,我阅读的大多数论文并没有真正说明他们如何选择此超参数。我从Yann LeCun等作家那里取得了一些成功,尤其是从Tricks of the Trade的论文收集中获得了成功。但是,我仍然没有看到这些问题得到充分解决。是否有人对论文有任何建议,或者关于在尝试学习功能时可以用来确定良好的小批量大小的标准的建议?

2
如何使用R估计Cox模型中的基线危害函数
我需要估计基线风险函数以时间依赖性Cox模型λ0(t)λ0(t)\lambda_0(t) λ(t)=λ0(t)exp(Z(t)′β)λ(t)=λ0(t)exp⁡(Z(t)′β)\lambda(t) = \lambda_0(t) \exp(Z(t)'\beta) 在我学习生存过程时,我记得累积危险函数的直接导数()并不是一个好的估计器,因为Breslow估计器提供了阶跃函数。λ0(t)dt=dΛ0(t)λ0(t)dt=dΛ0(t)\lambda_0(t) dt = d\Lambda_0(t) 那么,R中是否可以直接使用任何函数?或对此主题有任何参考吗? 我不确定是否值得提出另一个问题,所以我只添加一些背景,为什么基线危害功能对我很重要。下面的公式估算一个受试者的生存时间大于另一个受试者的生存时间的概率。在Cox模型设置下,需要基线危险函数。 λ0(t)λ0(t)\lambda_0(t) P(T1>T2)=−∫∞0S1(t)dS2(t)=−∫∞0S1(t)S2(t)λ2(t)dtP(T1>T2)=−∫0∞S1(t)dS2(t)=−∫0∞S1(t)S2(t)λ2(t)dtP(T_1 > T_2 ) = - \int_0^\infty S_1(t) dS_2(t) = - \int_0^\infty S_1(t)S_2(t)\lambda_2(t)dt
13 r  survival  cox-model 

4
高斯过程:如何使用GPML进行多维输出
有没有一种方法可以使用GPML对多维输出(可能是相关的)执行高斯过程回归? 在演示脚本中, 我只能找到一维示例。 关于CV 的类似问题,涉及多维输入的情况。 我浏览了他们的书,看看是否能找到任何东西。在本书的第9章(第9.1节)中,他们提到了这种多输出的情况。他们提到了几种解决方法,一种是使用相关的噪声处理,另一种是使用Cokriging(相关的先验)。 我还是不知道如何将所有这些想法整合到GPML框架中。 另外,还有其他支持多维输出的GP库/框架吗?

3
图书初学者关于概率分布的建议
我正在学习机器学习,打开的每一本书都碰到卡方分布,伽马函数,t分布,高斯分布等。 到目前为止,我读过的每一本书都只定义了分布:它们并不能解释或给出函数的特定公式从何而来的直觉。 例如,为什么卡方分布是这样?什么是t分布?发行背后的直觉是什么?证明?等等 我想对最常用的分布有一个清晰而基本的了解,以便以后每次看到它们时,我都能真正理解什么是t分布,什么是高斯分布,最重要的是为什么它们如此他们是。 如果书籍/教程可以向外行解释这些概念,这样您就不必了解它们就可以了。x)许多书籍都是这样的,它们不适合初学者:(

3
统计:Alpha和Beta之间的关系
我的问题与alpha和beta及其在统计中的定义之间的关系有关。 alpha = I型错误率=考虑到NULL假设正确的显着性水平 Beta = II型错误率 如果alpha降低(特异性随着alpha = 1特异性而增加),则beta增加(灵敏度/功效随着beta = 1-灵敏度/功效而降低) alpha的变化如何影响beta? 是否存在线性关系?α/β之比是否始终相同,换句话说,特异性/敏感性之比始终相同?如果是,则意味着通过使用Bonferroni校正,我们只是转移到较低的敏感性和较高的特异性,而没有改变敏感性/特异性比。这样说正确吗? 更新(针对案例的问题): 对于给定的实验设计,我们对数据运行5个线性模型。我们的True阳性率(灵敏度/功效)为0.8,True阴性率(特异性)为0.7。(让我们想象一下,我们知道什么应该是积极的,什么不应该。)。如果现在使用Bonferroni将显着性水平校正为0.05 / 5 = 0.01。我们是否可以通过数值估算得出的真正率(灵敏度/功率)和真负率(特异性)? 非常感谢你的帮助。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.