统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如果在调整超参数时评估验证数据的模型性能,为什么有关验证数据的信息会泄漏?
在FrançoisChollet的Python深度学习中,它说: 结果,即使从未对模型进行过直接训练,根据其在验证集上的性能来调整模型的配置也可能很快导致对验证集的过度拟合。 这种现象的核心是信息泄漏的概念。每次根据模型在验证集上的性能来调整模型的超参数时,一些有关验证数据的信息都会泄漏到模型中。如果仅对一个参数执行一次此操作,那么将泄漏很少的信息,并且您的验证集将保持可靠以评估模型。但是,如果您重复多次(运行一个实验,对验证集进行评估并最终修改模型),那么您将把与验证集有关的越来越多的信息泄漏到模型中。 如果在调整超参数时评估验证数据的模型性能,为什么有关验证数据的信息会泄漏?

2
没有采样的高维推理问题的不确定性估计?
我正在研究一个高维推理问题(大约2000个模型参数),通过结合基于梯度的优化和遗传算法,可以找到对数后验的全局最大值,从而能够稳健地执行MAP估计。 除了找到MAP估计值外,我非常希望能够对模型参数的不确定性做出一些估计。 我们能够有效地计算相对于参数的对数后验的梯度,因此长期而言,我们的目标是使用哈密顿量MCMC进行一些抽样,但是现在我对基于非抽样的估计感兴趣。 我知道的唯一方法是在该模式下计算Hessian的逆值,以近似于多元多元法线的后验,但即使对于这样的大型系统,这似乎也不可行,因为即使我们计算出∼4×106∼4×106\sim 4\times10^{6}元素粗麻布我敢肯定我们找不到它的逆。 谁能建议在这种情况下通常使用哪种方法? 谢谢! 编辑 -有关该问题的其他信息 背景技术 这是一个与大型物理实验有关的反问题。我们有一个2D三角形网格,描述了一些物理场,我们的模型参数是这些场在网格每个顶点处的物理值。网格具有大约650个顶点,我们对3个字段进行了建模,因此这就是我们2000个模型参数的来源。 我们的实验数据来自不能直接测量这些场的仪器,而是来自那些复杂的非线性函数的量。对于每种不同的仪器,我们都有一个正向模型,该模型将模型参数映射到实验数据的预测,并且将预测与测量值进行比较可得出对数似然。 然后,我们总结来自所有这些不同工具的对数似然率,并添加一些对数优先级值,这些值将某些物理约束应用于字段。 因此,我怀疑这个“模型”是否整齐地归为一类-我们无法选择模型是什么,它取决于实际仪器如何收集我们的实验数据。 数据集 数据集由500x500张图像组成,每个摄像机只有一张图像,因此总数据点为500x500x4 = 10610610^6。 错误模型目前, 我们将问题中的所有错误都设为高斯。在某些时候,我可能会尝试移至Student-t错误模型,只是为了获得更大的灵活性,但是对于高斯人来说,事情似乎仍然运作良好。 可能性示例 这是一个等离子物理实验,我们的大部分数据来自指向等离子的相机,镜头前有特定的滤光片,只能观察光谱的特定部分。 要重现数据,有两个步骤;首先,我们必须对来自网格上等离子的光进行建模,然后我们必须对该光进行建模,使其返回相机图像。 不幸的是,对来自等离子体的光进行建模取决于有效的速率系数,即在给定电场的情况下,不同过程发出多少光。这些速率是由一些昂贵的数值模型预测的,因此我们必须将它们的输出存储在网格中,然后进行插值以查找值。费率函数数据仅计算一次-我们将其存储,然后在代码启动时从中构建一个样条,然后将该样条用于所有函数评估。 假设R1R1R_1和R2R2R_2是速率函数(我们通过插值法对其求值),则网格E i的第iii个顶点的发射由 E i = R 1(x i,y i)+ z i给出R 2(x i,y i) 其中(x ,y ,z )EiEi\mathcal{E}_iEi=R1(xi,yi)+ziR2(xi,yi)Ei=R1(xi,yi)+ziR2(xi,yi) \mathcal{E}_i = R_1(x_i, y_i) + z_i R_2(x_i, y_i) …



1
检查硬币是否公平
一位朋友问我以下问题。我不能帮她,但我希望有人可以向我解释。我找不到类似的示例。感谢您的帮助和解释。 问:100次抛硬币实验的结果记录为0 =“ Tail”和1 =“ Head”。输出x是0的字符串,长度为100的1。计算x中得到1-0-0的次数,它是20(例如:如果x =(001001110100),1-0-0发生2次)。您认为这是一个公平的硬币吗?

4
梯度下降优化
我正在尝试了解ML(机器学习)算法中的梯度下降优化。我知道这里有一个成本函数,其目的是使误差最小。在权重被优化以提供最小误差且使用偏导数的情况下,它是在每个步骤中同时改变和还是将其组合(例如,在几次迭代中仅被改变,当不再减小误差时,导数以?该应用程序可以是线性回归模型,逻辑回归模型或增强算法。ÿ^- ÿy^−y\hat y-yw1个,w2w1,w2w_1, w_2w1个w1w_1w2w2w_2w1个w1w_1w1个w1w_1w2w2w_2

1
在GWAS数据集的PCA投影中,孩子如何设法将父母团结在一起?
取20个随机点与每个一万维空间从坐标IID ñ(0 ,1 )ñ(0,1个)\mathcal N(0,1)。将它们分成10对(“对”),并将每对的平均值(“子”)添加到数据集中。然后对所得的30点进行PCA并绘制PC1与PC2的关系图。 发生了一件了不起的事情:每个“家庭”形成一个紧密相连的三元组。当然,在最初的10,000维空间中,每个孩子都更接近其父母中的每个,因此可以期望在PCA空间中每个孩子也都离父母更近。但是,在PCA空间中,每对父母也彼此靠近,即使在原始空间中,它们只是随机点! 在PCA预测中,孩子如何设法将父母团结在一起? \quad\quad\quad\quad 人们可能会担心,这在某种程度上受到以下事实的影响:孩子的规范低于父母。这似乎无关紧要:如果我将子代生成为(x + y)/ 2–√(X+ÿ)/2(x+y)/\sqrt{2},其中XXx和ÿÿy是父母点,那么它们平均具有与父母相同的范数。但是我仍然在PCA领域从质上观察到相同的现象: \quad\quad\quad\quad 这个问题使用的是玩具数据集,但其动机是我在一个全基因组关联研究(GWAS)的真实数据集中所观察到的,其中维度是单核苷酸多态性(SNP)。该数据集包含母婴三重奏。 码 %matplotlib notebook import numpy as np import matplotlib.pyplot as plt np.random.seed(1) def generate_families(n = 10, p = 10000, divide_by = 2): X1 = np.random.randn(n,p) # mothers X2 = np.random.randn(n,p) # fathers X3 = (X1+X2)/divide_by # …

3
在其他回归变量上回归Logistic回归残差
将OLS回归应用于连续响应后,可以通过依次运行每个协变量上的残差回归来建立多元回归方程。我的问题是,有没有办法通过逻辑回归残差进行逻辑回归呢? 也就是说,如果我想使用标准的广义线性建模方法来估计,有没有一种方法可以对x进行逻辑回归并获得伪残差R_1,然后对z回归R_1到得到逻辑回归系数的无偏估计量。对教科书或文献的参考将不胜感激。Pr(Y=1|x,z)Pr(Y=1|x,z)\Pr(Y = 1 | x, z)xxxR1R1R_1R1R1R_1zzz

1
方差和标准偏差的最佳解决方案是什么问题或博弈?
对于给定的随机变量(或总体或随机过程),数学期望是一个问题的答案。。同样,它也是游戏的最佳解决方案,猜猜下一个随机变量的实现(或从总体中吸取新抽奖),如果您对线性不实用,我将用值与猜测之间的平方距离来惩罚您的惩罚。中位数是绝对损失下相应问题的答案,模式是“全有或全无”损失下的答案。 问题:方差和标准偏差是否回答任何类似的问题?这些是什么? 这个问题的动机来自于教授集中趋势和传播的基本方法。尽管集中趋势的度量可以由上述决策理论问题引起,但我想知道人们如何能够激发传播的度量。

1
我的神经网络甚至无法学习欧几里得距离
因此,我试图自学神经网络(用于回归应用,而不是对猫的图片进行分类)。 我的第一个实验是训练网络以实现FIR滤波器和离散傅立叶变换(在“之前”和“之后”信号上进行训练),因为这两个都是线性操作,可以由没有激活功能的单层实现。 两者都很好。 因此,我想看看是否可以添加abs()并使其学习幅度谱。首先,我考虑了在隐藏层中需要多少个节点,并意识到3个ReLU足以满足的粗略近似abs(x+jy) = sqrt(x² + y²),因此我自己对孤复数(2个输入→3个ReLU节点隐藏层→1个)进行了该操作的测试。输出)。有时它起作用: 但是在我尝试的大多数时候,它陷入了局部最小值,无法找到正确的形状: 我已经在Keras中尝试了所有优化器和ReLU变体,但是它们并没有太大的区别。我还能做些其他事情来使像这样的简单网络可靠地融合吗?还是我只是以错误的态度来解决这个问题,而您应该在问题上抛出不必要的更多节点,如果其中一半死亡,这没什么大不了的?

1
相关随机变量之差的界线
给定两个高度相关的随机变量和,我想限制差的概率超出一定数量: XXXYYY|X−Y||X−Y| |X - Y| P(|X−Y|&gt;K)&lt;δP(|X−Y|&gt;K)&lt;δ P( |X - Y| > K) < \delta 为简单起见,假设: 已知相关系数为“高”,例如: ρX,Y=covar(X,Y)/σXσY≥1−ϵρX,Y=covar(X,Y)/σXσY≥1−ϵ \rho_{X,Y}= {covar(X,Y)} / {\sigma_X \sigma_Y} \geq 1 - \epsilon X,YX,YX,Y 为零均值:μx=μy=0μx=μy=0 \mu_x = \mu_y = 0 −1≤xi,yi≤1−1≤xi,yi≤1-1 \leq x_i, y_i \leq 1(或者 如果这样更容易的话)0≤xi,yi≤10≤xi,yi≤1 0 \leq x_i, y_i \leq 1 (如果它使事情变得容易,那么说具有相同的方差:)X,YX,YX,Y σ2X=σ2YσX2=σY2\sigma_X^2 = \sigma_Y^2 …

5
为什么连续均匀分布中的概率之和不是无穷大?
上面显示了均匀分布(连续)的概率密度函数。曲线下的面积为1-这很有意义,因为概率分布中所有概率的总和为1。 形式上,上述概率函数(f(x))可以定义为 [a,b]中x的1 /(ba) 否则为0 考虑到我必须在a(例如2)和b(例如6)之间选择一个实数。这使均匀概率= 0.25。但是,由于在该间隔中存在无限数量的数字,所有概率之和是否不应该等于无穷大?我在俯视什么? f(x)不是x出现的概率吗?

3
统计量与伽玛分布的独立性
设是来自伽马分布G a m m a (α ,β )的随机样本。X1个,。。。,XñX1,...,XnX_1,...,X_nģ 一米米一个(α ,β)Gamma(α,β)\mathrm{Gamma}\left(\alpha,\beta\right) 让和小号2是样品均值和样本方差,分别。X¯X¯\bar{X}小号2S2S^2 然后证明或反驳该和小号2 / ˉ X 2是独立的。X¯X¯\bar{X}小号2/ X¯2S2/X¯2S^2/\bar{X}^2 我的尝试:由于,我们需要检查的独立性ˉX和(X我小号2/ X¯2= 1n − 1∑ñ我= 1(X一世X¯− 1 )2S2/X¯2=1n−1∑i=1n(XiX¯−1)2S^2/\bar{X}^2 = \frac{1}{n-1} \sum_{i=1}^n \left(\frac{X_i}{\bar{X}}-1\right)^2 X¯X¯\bar{X},但我应该怎么建立它们之间的独立性?(X一世X¯)ñ我= 1(XiX¯)i=1n\left(\frac{X_i}{\bar{X}} \right)_{i=1}^{n}

2
最大化艾德高斯派的最有力结果是什么?在实践中最常用?
由于X1,…,Xn,…∼N(0,1)X1,…,Xn,…∼N(0,1)X_1, \ldots, X_n, \ldots \sim \mathscr{N}(0,1) IID,考虑随机变量 Zn:=max1≤i≤nXi.Zn:=max1≤i≤nXi. Z_n := \max_{1 \le i \le n} X_i\,. 问题:这些随机变量最“重要”的结果是什么? 为了澄清“重要性”,哪个结果具有其他大多数这样的结果是合乎逻辑的结果?在实践中最常使用哪个结果? 更具体地说,似乎是(理论上的)统计学家之间的民俗知识,即至少渐近地“基本上与”。(请参阅此相关问题。)ZnZnZ_n2logn−−−−−√2log⁡n\sqrt{2 \log n} 但是,这种类型的结果有很多,而且似乎大多数情况不是等效的,也不是相互暗示的。例如∗∗^*, Zn2logn−−−−−√→a.s.1,(1)(1)Zn2log⁡n→a.s.1, \frac{Z_n}{\sqrt{2 \log n}} \overset{a.s.}{\to} 1 \,, \tag{1} 如果没有别的,也暗示了概率和分布的相应结果。 但是,它甚至似乎并不暗示也有相关的结果(请参见另一个问题),例如 limn→∞EZn2logn−−−−−√=1,(2)(2)limn→∞EZn2log⁡n=1, \lim_{n \to \infty} \frac{\mathbb{E}Z_n}{\sqrt{2 \log n}} =1 \,, \tag{2} (这是第49页的练习2.17 ),或另一个民俗结果:††\dagger EZn=2logn−−−−−√+Θ(1).(3)(3)EZn=2log⁡n+Θ(1). \mathbb{E}Z_n = \sqrt{2 \log n} …

2
改进最小估计量
假设我有正参数来估计以及由估计器产生的相应的无偏估计,即,等。nnn^ μ 1,^ μ 2,。。。,^ μ Ñ ë [ ^ μ 1 ] = μ 1个Ë [ ^ μ 2 ] = μ 2μ1个,μ2,。。。,μñμ1,μ2,...,μn\mu_1,\mu_2,...,\mu_nñnnμ1个^,μ2^,。。。,μñ^μ1^,μ2^,...,μn^\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n}E [ μ1个^] = μ1个E[μ1^]=μ1\mathrm E[\hat{\mu_1}]=\mu_1E [ μ2^] = μ2E[μ2^]=μ2\mathrm E[\hat{\mu_2}]=\mu_2 我想使用手头的估算来估算。显然,幼稚估计被偏置为低 中号我Ñ( μ1个,μ2,。。。,μñ)min(μ1,μ2,...,μn)\mathrm{min}(\mu_1,\mu_2,...,\mu_n)中号我Ñ( μ1个^,μ2^,。。。,μñ^)min(μ1^,μ2^,...,μn^)\mathrm{min}(\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n})E[min(μ1^,μ2^,...,μn^)]≤min(μ1,μ2,...,μn)E[min(μ1^,μ2^,...,μn^)]≤min(μ1,μ2,...,μn)\mathrm E[\mathrm{min}(\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n})]\leq \mathrm{min}(\mu_1,\mu_2,...,\mu_n) 假设我还拥有相应估计量的协方差矩阵。是否有可能使用给定的估计值和协方差矩阵来获得最小的无偏(或偏少偏见)估计?Cov(μ1^,μ2^,...,μn^)=ΣCov(μ1^,μ2^,...,μn^)=Σ\mathrm{Cov}(\hat{\mu_1},\hat{\mu_2},...,\hat{\mu_n}) = \Sigma

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.