统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
规范什么特别之处?
一个规范是唯一的(至少部分),因为是在间非凸和凸的边界。一个范数是“最稀疏”凸模(右?)。 p = 1 L 1L1L1L_1p=1p=1p=1L1L1L_1 我了解欧几里得范数源于几何,当维数具有相同单位时,它具有清晰的解释。但是我不明白为什么它优先于其他实数:?吗?为什么不将整个连续范围用作超参数?p > 1 p = 1.5 p = πp=2p=2p=2p>1p>1p>1p=1.5p=1.5p=1.5p=πp=πp=\pi 我想念什么?



2
神经网络:一个热门变量压倒性连续吗?
我有大约20列(20个功能)的原始数据。其中有10个是连续数据,有10个是分类数据。某些分类数据可能具有50个不同的值(美国各州)。在我对数据进行预处理之后,连续的10列变成了10列准备好的列,而10个分类值变得像200个一键编码变量。我担心如果将所有这些200 + 10 = 210个特征都放入神经网络,那么200个热门特征(10个分类列)将完全占据10个连续特征。 也许一种方法是将列“分组”或类似的东西。这是一个有效的问题吗?有没有标准的方法可以解决这个问题? (尽管我认为这没什么大不了,但我正在使用Keras。)

1
为什么深度强化学习不稳定?
在DeepMind于2015年发表的有关深度强化学习的论文中指出,“由于不稳定的学习,将RL与神经网络结合的先前尝试在很大程度上失败了”。然后,论文根据观察结果之间的相关性列出了造成这种情况的一些原因。 请有人可以解释一下这是什么意思吗?这是一种过度拟合的形式吗,神经网络学习了训练中存在但测试中可能没有的某种结构?还是意味着其他? 可以找到该文件:http : //www.nature.com/nature/journal/v518/n7540/full/nature14236.html 我想了解的部分是: 当使用非线性函数逼近器(例如神经网络)表示作用值(也称为Q)函数时,强化学习不稳定或发散。这种不稳定性有多种原因:观察序列中存在相关性,对Q的小更新可能会显着更改策略并因此更改数据分布的事实,以及作用值与目标值之间的相关性。 我们使用一种新颖的Q学习方法解决了这些不稳定性,该方法使用了两个关键思想。首先,我们使用一种称为经验重播的受生物学启发的机制来对数据进行随机化,从而消除观察序列中的相关性,并平滑数据分布中的变化。其次,我们使用了迭代更新,将操作值(Q)调整为仅定期更新的目标值,从而减少了与目标的相关性。

2
变量选择的方法相互冲突:AIC,p值或两者?
据我了解,基于p值的变量选择(至少在回归上下文中)存在很大缺陷。出于相似的原因,基于AIC(或类似方法)的变量选择似乎也被认为存在缺陷,尽管这似乎还不清楚(例如,请参见我的问题和有关此主题的一些链接:“逐步模型选择”到底是什么?)。 但是说您确实选择了这两种方法之一来选择模型中的最佳预测变量集。 Burnham and Anderson 2002(模型选择和多模型推断:一种实用的信息理论方法,第83页)指出,不应将基于AIC的变量选择与基于假设检验的变量选择混合:“对原假设和信息理论方法的检验应不能一起使用;它们是非常不同的分析范例。” 另一方面,Zuur等。2009年(《具有生态学扩展的混合效应模型,R》第541页)似乎主张使用AIC首先找到最佳模型,然后使用假设检验执行“微调”:“缺点是AIC可能比较保守。 ,一旦AIC选择了最佳模型,您可能需要进行一些微调(使用从方法一获得的假设检验)。” 您会看到这如何使两本书的读者对采用哪种方法感到困惑。 1)这些只是统计思维的不同“阵营”和统计学家之间的分歧话题吗?这些方法之一现在是否只是简单地“过时”,但在撰写本文时被认为适当?还是从一开始就是一个明显的错误? 2)在这种情况下是否适合使用这种方法?例如,我来自生物学背景,我经常试图确定哪些变量似乎影响或推动了我的反应。我经常有很多候选的解释变量,我试图找出哪些是“重要的”(相对而言)。另外,请注意,候选预测变量的集合已经减少到被认为具有某些生物学相关性的变量,但是它可能仍然包括5-20个候选预测变量。


2
关于线性关系,r,r平方和残留标准偏差告诉我们什么?
我从事回归分析解释的工作很少,但是我对r,r平方和残差标准偏差的含义感到非常困惑。我知道定义: 表征 r测量散点图上两个变量之间线性关系的强度和方向 R平方是数据与拟合回归线的接近程度的统计量度。 残留标准偏差是用于描述围绕线性函数形成的点的标准偏差的统计术语,并且是对被测量因变量的准确性的估计。(不知道单位是什么,这里有关单位的任何信息都将有所帮助) (来源:此处) 问题 尽管我“理解”了这些特征,但我确实理解了这些术语如何共同得出关于数据集的结论。我将在此处插入一个小示例,也许这可以作为回答我的问题的指南(随时使用您自己的示例!) 示例 这不是howework问题,但是我在书中进行搜索以获得一个简单示例(我正在分析的当前数据集过于复杂和庞大,无法在此处显示) 在一个大玉米田中随机选择了20个地块,每个地块10 x 4米。对于每个样地,观察植物密度(样地中的植物数量)和平均穗轴重量(每穗轴的谷物克数)。下表给出了结果:(来源:生命科学统计) ╔═══════════════╦════════════╦══╗ ║ Platn density ║ Cob weight ║ ║ ╠═══════════════╬════════════╬══╣ ║ 137 ║ 212 ║ ║ ║ 107 ║ 241 ║ ║ ║ 132 ║ 215 ║ ║ ║ 135 ║ 225 ║ ║ ║ 115 ║ …

4
两个变量的总和如何比单个变量解释更多的方差?
当两个预测变量负相关时,我得到的总和与第三个变量的相关性令人困惑。是什么导致这些令人困惑的结果? 示例1:两个变量的总和与第三个变量之间的相关性 考虑Guildford 1965年文本第427页的公式16.23,如下所示。 困惑的发现:如果两个变量都将.3与第三个变量相关联,并且将-.7彼此相关联,则公式得出的值为.52。如果两个变量各自仅与第三个变量相关联为0.2,那么总和与第三个变量的相关性如何为0.52? 示例2:两个变量和第三个变量之间的多重相关性是什么? 考虑Guildford 1965年文本的404页上的公式16.1(如下所示)。 令人困惑的发现:情况相同。如果两个变量都将.3与第三个变量相关联,并将-.7彼此相关联,则公式得出的值为.52。如果两个变量各自仅与第三个变量相关联为0.2,那么总和与第三个变量的相关性如何为0.52? 我尝试了一个快速的蒙特卡洛模拟,它证实了吉尔福德公式的结果。 但是,如果两个预测变量各自预测第三个变量的方差的4%,那么它们之和如何能预测1/3的方差? 资料来源:《心理学和教育基础统计学》,第四版,1965年。 澄清说明 我正在处理的情况涉及基于现在衡量个人能力来预测他们的未来表现。 下面的两个维恩图显示了我对情况的理解,旨在澄清我的困惑。 该维恩图(图1)反映了x1和C之间的零阶r = .2。在我的领域中,有许多这样的预测变量可以适度地预测标准。 该维恩图(图2)反映了两个这样的预测变量x1和x2,每个预测变量在r = .2时预测C,并且两个预测变量呈负相关,r =-。7。 我不知所措,无法想象两个r = .2预测变量之间的关系,可以使它们一起预测C的25%的方差。 我寻求帮助来了解x1,x2和C之间的关系。 如果(有人回答我的问题建议)x2充当x1的抑制变量,那么第二维恩图中的哪个区域被抑制? 如果有一个具体的例子会有所帮助,我们可以认为x1和x2是两个人的能力,而C是四年后的四年制大学GPA。 我在设想抑制器变量如何导致两个r = .2零阶r的8%解释方差扩大并解释C的25%方差时遇到了麻烦。一个具体的示例将是一个非常有用的答案。

2
简述KKT
目的 确认对KKT的理解是否正确。寻求有关KKT的进一步解释和确认。 背景 试图了解KKT条件,尤其是补充条件,在SVM文章中总是突然出现这种情况。我不需要抽象公式列表,但确实需要具体,直观和图形化的说明。 题 如果使成本函数f(X)最小的P在约束内(g(P)> = 0),则为解。KKT在这种情况下似乎无关紧要。 KKT似乎说,如果P不在约束内,那么解X应该在图中满足。到底是KKT,还是我想念其他重要方面? 其他说明 f(x)是否应凸出才能应用KKT? g(x)是否应线性适用于KKT? λ* g(X)= 0时,λ是否必要?为什么g(X)= 0或g(Xi)= 0还不够? 参考文献 拉格朗日乘积KKT条件 SVM中的每个排水沟点都有正乘数吗? http://fnorio.com/0136Lagrange_method_of_undetermined_multipliers/Lagrange_method_of_undetermined_multipliers.html 更新1 感谢您的回答,但仍然难以理解。仅在此处关注必要性: 马修·冈恩(Matthew Gunn)回答中关于非最佳点(绿色圆圈)和KKT的条件(2)在那里是否不满足?就像Mark L. Stone的答案那样,通过观察Hessian可以识别出这一点吗? 我想另外一种情况是鞍点,但是否同样适用? 用户名

1
循环数据的时间序列建模
我正在为某些风/浪数据构建ARIMA模型。我为每个变量建立一个单独的模型。 我需要建模的两个变量是波浪和风向。值单位为度(0-360°)。是否可以对值间隔为圆形的此类数据建模?如果不是,哪种类型的模型最适合此类数据?

3
使用T-SNE选择超参数进行分类
作为我要解决的特定问题(竞赛),我进行了以下设置:21个功能([0,1]上的数字)和二进制输出。我大约有10万行。设置似乎非常嘈杂。 我和其他参与者使用了一段时间的特征生成功能,并且在这种情况下,t分布的随机邻居嵌入非常强大。 我偶然发现了这篇文章“如何有效使用t-SNE”,但我仍然无法真正得出关于如何在我的分类设置中最佳选择超参数的结论。 是否有经验法则(特征数量,嵌入尺寸->困惑选择)? 我现在只是临时应用设置,因为迭代各种设置所需的时间太长。感谢您的任何评论。

1
数据矩阵为对角线时套索问题的闭式解
\newcommand{\diag}{\operatorname{diag}}我们遇到了问题:\ min_ {w \ in \ mathbb {R} ^ {d}} \ left(\ frac {1} {n} \ sum_ {i = 1} ^ {n} \ left(\ langle w,x_ {i} \ rangle-y_ {i} \ right)^ {2} +2 \ lambda || w || _1 \ right),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),minw∈Rd(1n∑i=1n(⟨w,xi⟩−yi)2+2λ||w||1),\min_{w\in\mathbb{R}^{d}}\left( \frac{1}{n}\sum_{i=1}^{n} \left( \langle w,x_{i}\rangle-y_{i} \right)^{2} +2\lambda||w||_1\right), 并假设:∑i=1nxixTi=diag(σ21,...,σ2d).∑i=1nxixiT=diag⁡(σ12,...,σd2).\sum_{i=1}^nx_ix_i^T=\diag(\sigma_1^2,...,\sigma_d^2). 在这种情况下是否有封闭形式的解决方案? …

2
从统计角度看:傅立叶变换与基于傅立叶基础的回归
我试图了解离散傅里叶变换是否使用傅里叶基础给出与回归相同的曲线表示。例如, library(fda) Y=daily$tempav[,1] ## my data length(Y) ## =365 ## create Fourier basis and estimate the coefficients mybasis=create.fourier.basis(c(0,365),365) basisMat=eval.basis(1:365,mybasis) regcoef=coef(lm(Y~basisMat-1)) ## using Fourier transform fftcoef=fft(Y) ## compare head(fftcoef) head(regcoef) FFT给出一个复数,而回归给出一个实数。 他们传达相同的信息吗?两组数字之间是否存在一对一的映射? (如果答案是从统计学家的角度而不是工程师的角度写的,我将不胜感激。我可以找到许多在线资料,到处都有工程术语,这使它们对我而言不太可口。)

2
为什么神经网络容易被愚弄?
我已经阅读了一些有关手动构造图像以“愚弄”神经网络的文章(见下文)。 这是因为网络仅对条件概率建模吗? 如果网络可以对联合概率进行建模,是否还会发生这种情况?p (y ,x )p (ÿ| X)p(ÿ|X)p(y|x)p (ÿ,x )p(ÿ,X)p(y,x) 我的猜测是,这种人工生成的图像与训练数据不同,因此它们具有低概率。因此即使对于这些图像来说可以很高,应该低。p (y ,x )p (y | x )p(X)p(X)p(x)p (ÿ,x )p(ÿ,X)p(y,x)p (ÿ| X)p(ÿ|X)p(y|x) 更新资料 我尝试了一些生成模型,结果证明它没有帮助,所以我想这可能是MLE的结果吗? 我的意思是在的情况下KL散度被用作损失函数,值其中很小不影响损失。因此,对于一个人为的图像不匹配,的值可以是任意的。p d 一吨一个(X )p d 一吨一个 p θpθ(x )pθ(X)p_{\theta}(x)pd一个牛逼一(x )pd一种Ť一种(X)p_{data}(x)pd一个牛逼一pd一种Ť一种p_{data}pθpθp_{\theta} 更新资料 我发现Andrej Karpathy撰写的博客显示 这些结果并非特定于图像,卷积网络,也不是深度学习中的“缺陷”。 解释和利用对抗性示例容易欺骗深层神经网络:无法识别图像的高置信度预测

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.