统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
线性变换后,余弦相似度如何变化?
之间是否存在数学关系: 余弦相似度 sim(A,B)sim⁡(A,B)\operatorname{sim}(A, B)两个向量的AAA和,和BBB 和的余弦相似度,通过给定矩阵不均匀缩放。这里是一个给定的对角矩阵,对角线上的元素不相等。A B M Msim(MA,MB)sim⁡(MA,MB)\operatorname{sim}(MA, MB)AAABBBMMMMMM 我试图查看计算结果,但无法达到简单/有趣的链接(表达式)。我想知道是否有一个。 例如,在非均匀缩放中不会保留角度,但是原始角度与非均匀缩放后的角度之间是什么关系?关于一组向量S1与另一组向量S2之间的联系,可以说什么-其中S2是通过非均匀缩放S1获得的?

1
什么时候可以写出“我们假设经验分布为正态分布”?
在医学等应用学科的教学中,根深蒂固的是,人群中生物医学数量的测量遵循正常的“钟形曲线”。Google对字符串“我们假定为正态分布”的搜索返回结果!听起来,“在气候变化研究中,“鉴于极少的极端数据点,我们假设温度异常呈正态分布”。或在企鹅的争议较小的文件上“假设雏鸡的孵化日期呈正态分布”;或 “我们假设GDP增长冲击呈正态分布”,23,90023,900\small 23,900, ... 和其他东西)。 最近,我发现自己质疑计数数据由于其严格的正性而被视为正态分布。当然,计数数据是离散的,这使得它们的正常性更加人为。但是,即使撇开后面的观点,为什么应该将连续的经验性测量(例如,体重,身高或血糖浓度)(通常被认为是“连续的”)视为正常的呢?他们所拥有的负面已实现的观察结果绝不会超过计数! 我了解到,当标准偏差明显低于平均值时,表明负值很少(“ 95%范围检查”),这可能是一个实际的假设,并且频率直方图也可以支持该偏差。但是问题似乎并不简单,快速搜索便产生了有趣的东西。 在《自然》杂志上,我们可以在DF Heath的一封信中找到以下陈述:“我想指出的是,对于某些类型的数据的统计分析,假设数据是从正常人群中提取的,通常是错误的。对数正态分布的假设更好。这种选择已被统计学家,经济学家和物理学家广泛使用,但由于某些原因,其他学科的科学家常常忽略了这一点。” Limpert指出,“对数正态模型可能在许多科学家认为正态为有效近似的意义上可以作为近似值”,同时指出正态拟合优度检验的功效较低,并且选择困难处理小样本时,凭经验得出正确的分布。 因此,问题是,“在没有进一步支持证据的情况下,何时可以接受应用科学中经验度量的正态分布?” 而且,为什么其他选择(例如对数正态)没有,甚至可能不会被采用?

1
深度学习需要多少数据?
我正在学习深度学习(特别是CNN),以及它通常如何需要大量数据来防止过拟合。但是,我还被告知,模型具有更高的容量/更多的参数,需要更多的数据来防止过拟合。因此,我的问题是:为什么您不能只减少深度神经网络中每层的层数/节点数,而使其仅处理少量数据呢?在“插入”之前,神经网络是否需要基本的“最小参数数量”?在一定数量的层以下,神经网络的性能似乎不如手工编码的功能好。

1
什么是关于高级实验的好的现代书籍/资源?
我正在寻找的资源(不一定是一本书)将涵盖一些更具挑战性的实验设计和统计分析案例。我希望涵盖一些情况: 1.随机单位与分析单位不同的情况 示例:我运行了一个具有M个卖家和N个买家的电子商务平台,我想介绍一种卖家级别的待遇,但对买家进行购买的可能性感兴趣。典型的买家将在一个会话中访问数家商店。 2.结果变量高度偏斜 示例:我运行了一个呼叫中心,我想尝试提示客户在到达座席之前输入其客户ID。我希望减少平均通话时间。电话分配极为不正确。 3.治疗组的形状分布不同 示例:相同的呼叫中心,但现在我的治疗方法对于较短的呼叫效果更好,而对于较长的呼叫效果稍差。分析此问题的正确方法是什么? 4.治疗本身会使我的团队失去平衡 示例:与1中相同的电子商务平台,但现在我想尝试使用不同的排名机制。通过分配给更有利的排名,卖方可能希望提高价格,增加库存,更改营销策略等,从而使这些变量中的一些对于不同的处理方式系统地不同。

2
贝叶斯估计量之间的比较
考虑二次损失,先验给定其中。令 的可能性。找到贝叶斯估计器。 π (θ )L (θ ,δ)= (θ - δ)2L(θ,δ)=(θ−δ)2L(\theta,\delta)=(\theta-\delta)^2π(θ )π(θ)\pi(\theta)˚F (X | θ )= θ X θ - 1 我[ 0 ,1 ](X ),θ > 0 δ ππ(θ )〜ù(0 ,1 / 2 )π(θ)∼U(0,1/2)\pi(\theta)\sim U(0,1/2)F(X | θ )= θ Xθ - 1一世[ 0 ,1 ](x ),θ > 0f(x|θ)=θxθ−1I[0,1](x),θ>0f(x|\theta)=\theta x^{\theta-1}\mathbb{I}_{[0,1]}(x), \theta>0δπδπ\delta^\pi …



2
预测神经网络的置信度
假设我想训练一个深度神经网络来执行分类或回归,但是我想知道预测的信心。我怎样才能做到这一点? 我的想法是根据每个训练数据在上述神经仪中的预测性能来计算交叉熵。然后,我将训练第二​​个神经网络进行回归,该神经网络将每个数据作为输入,并将交叉熵作为输出(一个输出节点)。然后,您将在实践中使用这两个网络-一个用于预测标签/值,另一个用于预测第一个网络的置信度。(...但是我是否需要第三个网络来预测第二个网络的置信度,依此类推...?!) 这是一个有效的主意吗?此外,这是常用的标准观念吗?如果没有,您会提出什么建议?

1
低效率随机数生成器的现实示例
众所周知,计算机中的随机数生成器不会生成真正的随机数,而是会生成伪随机数。此外,某些RNG优于其他RNG,而某些RNG则比其他RNG更好。 当使用不良RNG或实施不良RNG并加以利用时,有哪些示例? 我发现的例子是 罗恩·哈里斯(Ron Harris)在基诺(Keno)作弊 - 迈克尔·拉尔森(Michael Larsen)殴打“按运气” 使用可预测的RNG进行的早期在线扑克游戏www.cigital.com/papers/download/developer_gambling.php

2
神经网络中的一维卷积
我了解卷积的工作原理,但不了解如何将一维卷积应用于2D数据。 在此示例中,您可以看到2D数据中的2D卷积。但是如果是一维卷积会怎样呢?只是一维内核以相同的方式滑动?如果步幅是2? 谢谢!

2
为回归中的最新观察结果分配更多权重
如何为R中的最新观测值分配更多权重? 我认为这是一个常见的问题或愿望,但是我很难弄清楚该如何实现。我试图对此进行大量搜索,但是我找不到一个很好的实际例子。 在我的示例中,随着时间的推移,我将拥有一个大型数据集。我想说的是对最近的数据行进行某种指数加权。因此,我将具有某种指数函数,即2015年的观测值对训练模型比_2012年的观测值更重要。 我的数据集变量包含分类值和数字值的混合,而我的目标是一个数值-如果重要的话。 我想使用GBM / Random Forest等模型进行测试/尝试,最好在CARET软件包中进行测试。 更新问题 我很欣赏下面给出的关于如何按两点之间的日期距离以指数方式衰减权重的响应。 但是,当涉及到在插入符号中训练此模型时,权重因素又如何精确计算呢?每个训练行中的权重值是将来某个点与该点历史发生之间的距离。 权重是否仅在预测期间起作用?因为如果它们在训练过程中发挥作用,那会不会引起各种问题,因为各种交叉折叠的权重都不同,试图预测可能早于它的某个时间点?

2
为什么在时间序列模型中使用信息标准(未调整的
在时间序列模型(例如ARMA-GARCH)中,为了选择模型的适当滞后或阶数,使用了不同的信息标准(例如AIC,BIC,SIC等)。 我的问题很简单,为什么不使用调整后的[R2R2R^2选择合适的模型?我们可以选择导致较高的值的模型[R2R2R^2。因为调整后的[R2R2R^2和信息准则都会对模型中更多数量的回归变量进行惩罚,因此前者惩罚[R2R2R^2而后者则惩罚似然值。

1
ReLU神经元的输入归一化
根据LeCun等(1998)的“ Efficient Backprop”,优良作法是对所有输入进行归一化,使它们以0为中心并在最大二阶导数范围内。因此,例如,对于“ Tanh”功能,我们将使用[-0.5,0.5]。随着黑森州变得更稳定,这将有助于反向传播进程。 但是,我不确定如何处理max(0,x)的整流神经元。(从那时起,还使用逻辑函数,我们想要类似[0.1,0.9]的东西,但是它并不以0为中心)

2
通过输入得出单层神经网络的梯度,链规则中的算子是什么?
问题是: 对于使用Sigmoid作为输入->隐藏,softmax用于隐藏->输出的单个隐藏层神经网络,得出具有相对熵损失的输入层的梯度。 我可以使用链式规则来完成大部分推导,但是我不确定如何将它们实际“链式”在一起。 定义一些符号 r=xW1+b1r=xW1+b1 r = xW_1+b_1 h=σ(r)h=σ(r) h = \sigma\left( r \right) ,是S型函数σσ\sigma θ=hW2+b2θ=hW2+b2 \theta = hW_2+b_2 , y^=S(θ)y^=S(θ) \hat{y} = S \left( \theta \right) ,是softmax函数SSS J(y^)=∑iy日志y^一世J(y^)=∑一世ÿ日志⁡ÿ^一世 J\left(\hat{y}\right) = \sum_i y \log\hat{y}_i ,是实标号单热向量ÿÿy 然后根据链式规则 ∂Ĵ∂X= ∂Ĵ∂θ·&∂&θ∂H·&∂&H∂[R·&∂&[R∂X∂Ĵ∂X=∂Ĵ∂θ⋅∂θ∂H⋅∂H∂[R⋅∂[R∂X \frac{\partial J}{\partial \boldsymbol{x}} = \frac{\partial J}{\partial \boldsymbol{\theta}} \cdot \frac{\partial \boldsymbol{\theta}}{\partial \boldsymbol{h}} \cdot …

1
数据空间,变量空间,观察空间,模型空间(例如,线性回归)
假设我们有一个数据矩阵(它是 ×)和标签矢量(它是 ×1)。在这里,矩阵的每一行都是一个观察值,每一列都对应一个维度/变量。(假设)XX\mathbf{X}ññnpppÿÿYññnÑ > pñ>pn>p 那么什么data space,variable space,observation space,model space是什么意思? 列向量跨越的空间是否是一个(退化的) -D空间,因为它具有坐标,而列为,又称为列可变空间,因为它被变量向量跨越了?还是因为每个维度/坐标都对应一个观测值,所以将其称为观测空间?ññnññnppp 行向量跨越的空间又如何呢?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.