统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
根据p值选择特征是否错误?
关于如何选择功能,有几篇文章。一种方法描述了基于t统计量的特征重要性。在varImp(model)应用于具有标准化特征的线性模型的R中,使用每个模型参数的t统计量的绝对值。因此,基本上,我们基于特征的t统计量来选择特征,这意味着系数的精确度。但是系数的精确度是否可以告诉我有关特征的预测能力的信息? 我的特征的t统计量较低,但仍会提高模型的准确性吗?如果是,那么什么时候要基于t统计信息排除变量?还是只是作为检查非重要变量的预测能力的起点?

2
如何使用卡尔曼滤波器?
我在2D空间(表面)中有一个物体的轨迹。轨迹以(x,y)坐标序列的形式给出。我知道我的测量结果很嘈杂,有时会有明显的异常值。因此,我想过滤我的观察结果。 据我了解的卡尔曼滤波器,它确实满足了我的需求。因此,我尝试使用它。我在这里找到了python实现。这是文档提供的示例: from pykalman import KalmanFilter import numpy as np kf = KalmanFilter(transition_matrices = [[1, 1], [0, 1]], observation_matrices = [[0.1, 0.5], [-0.3, 0.0]]) measurements = np.asarray([[1,0], [0,0], [0,1]]) # 3 observations kf = kf.em(measurements, n_iter=5) (filtered_state_means, filtered_state_covariances) = kf.filter(measurements) (smoothed_state_means, smoothed_state_covariances) = kf.smooth(measurements) 我在解释输入和输出时遇到了一些麻烦。我想这measurements正是我的测量值(坐标)。尽管我有点困惑,因为示例中的度量是整数。 我还需要提供一些transition_matrices和observation_matrices。我应该把什么放在那?这些矩阵是什么意思? 最后,在哪里可以找到我的输出?应该是filtered_state_means还是smoothed_state_means。这些阵列具有正确的形状(2, n_observations)。但是,这些数组中的值与原始坐标相距太远。 那么,如何使用该卡尔曼滤波器?


2
QQ情节看起来正常,但Shapiro-Wilk测试却相反
在R中,我有348个度量的样本,并且想知道是否可以假定它正态分布以用于将来的测试。 本质上是在遵循另一个Stack答案之后,我正在使用以下命令查看密度图和QQ图: plot(density(Clinical$cancer_age)) qqnorm(Clinical$cancer_age);qqline(Clinical$cancer_age, col = 2) 我没有统计方面的丰富经验,但是它们看起来像我所见过的正态分布示例。 然后,我正在运行Shapiro-Wilk测试: shapiro.test(Clinical$cancer_age) > Shapiro-Wilk normality test data: Clinical$cancer_age W = 0.98775, p-value = 0.004952 如果我正确地解释它,它告诉我可以否定原假设,即分布是正态的。 但是,我遇到了两个Stack帖子(here和here),这些帖子严重破坏了此测试的用处。看起来如果样本很大(348是否被认为是大样本?),它将总是说分布不正常。 我应该如何解释所有这些?我应该坚持使用QQ图并假设我的分布是正常的吗?

3
当我们仅能减少功能数量时,为什么使用PCA来加快学习算法?
在机器学习课程中,我了解到PCA(主成分分析)的一种常见用法是加快其他机器学习算法的速度。例如,假设您正在训练逻辑回归模型。如果您有一个从1到n 的训练集,结果证明向量x的维数很大(比如说维数),可以使用PCA获得较小的维度(比方说k个维度)特征向量z。然后,您可以在的训练集上从1到n 训练逻辑回归模型。训练此模型将更快,因为特征向量的维数较小。(z (i ),y (i ))(x(i),y(i))(x(i),y(i))(x^{(i)},y^{(i)})(z(i),y(i))(z(i),y(i))(z^{(i)},y^{(i)}) 但是,我不明白为什么不能仅通过随机选择k个特征并消除其余特征来将特征向量的维数减小为k个维。 z向量是特征向量的线性组合。由于z向量限制在k维表面上,因此您可以将ak个消除的特征值写为k个剩余特征值的线性函数,因此所有z都可以通过k个特征的线性组合来形成。因此,在具有消除特征的训练集上训练的模型是否不应该与在其维度被PCA缩减的训练集上训练的模型具有相同的功效?它是否仅取决于模型的类型以及是否取决于某种线性组合?

2
梯度下降在此数据集上找不到普通最小二乘法的解?
我一直在研究线性回归,并在下面的集合{(x,y)}上进行过尝试,其中x以平方英尺为单位指定房屋面积,y以美元指定价格。这是Andrew Ng Notes中的第一个示例。 2104,400 1600,330 2400,369 1416,232 3000,540 我开发了一个示例代码,但是当我运行它时,成本随着每一步都在增加,而应该随着每一步而降低。代码和输出如下。bias是W 0 X 0,其中X 0 = 1。featureWeights是[X 1,X 2,...,X N ] 的数组 我还尝试了这里提供的在线python解决方案,并在此处进行了说明。但是此示例也提供了相同的输出。 理解概念的差距在哪里? 码: package com.practice.cnn; import java.util.Arrays; public class LinearRegressionExample { private float ALPHA = 0.0001f; private int featureCount = 0; private int rowCount = 0; private float bias = …

2
为什么体验重播需要脱离策略算法?
在介绍DQN“ 使用深度强化学习玩Atari ”的论文中,它提到: 请注意,在通过经验重放进行学习时,有必要学习非政策(因为我们当前的参数与用于生成样本的参数不同),这激发了选择Q学习的动机。 我不太明白这是什么意思。如果我们使用SARSA并记住a'要在s'内存中执行的操作的操作,然后像在DQN中一样从中采样批次并更新Q,该怎么办?而且,演员批评方法(特定于A3C)可以使用体验重播吗?如果没有,为什么?

2
什么是规则和正则化?
在学习机器学习时,我越来越多地听到这些话。实际上,有人在方程正则性方面获得了菲尔兹奖。因此,我想这是一个从统计物理/数学到机器学习的术语。当然,我问的很多人都无法直观地解释它。 我知道诸如dropout之类的方法有助于正则化(=>他们说它减少了过度拟合,但是我真的不明白这是什么:如果仅减少过度拟合,为什么不只称其为anti-overfit方法=>我想的更多,因此这个问题)。 如果您能解释一下,我将非常感激(我想天真的ML社区也将如此!) 您如何定义规律性?什么是规律性? 正则化是确保规律性的一种方法吗?即捕获规律? 为什么像dropout这样的集合方法,归一化方法都声称要进行正则化? 为什么这些(正则性/正则化)出现在机器学习中? 非常感谢你的帮助。

2
如何用单纯形法求解最小绝对偏差?
argminwL(w)=∑ni=1|yi−wTx|arg⁡minwL(w)=∑i=1n|yi−wTx| \underset{\textbf{w}}{\arg\min} L(w)=\sum_{i=1}^{n}|y_{i}-\textbf{w}^T\textbf{x}| min∑ni=1uimin∑i=1nui\min \sum_{i=1}^{n}u_{i} ui≥xTw−yii=1,…,nui≥xTw−yii=1,…,nu_i \geq \textbf{x}^T\textbf{w}- y_{i} \; i = 1,\ldots,n ui≥−(xTw−yi)i=1,…,nui≥−(xTw−yi)i=1,…,nu_i \geq -\left(\textbf{x}^T\textbf{w}-y_{i}\right) \; i = 1,\ldots,n 但是我不知道要逐步解决它,因为我是LP的新手。你有什么主意吗?提前致谢! 编辑: 这是我已解决此问题的最新阶段。我正在尝试按照以下说明解决问题: 步骤1:将其制成标准格式 minZ=∑ni=1uiminZ=∑i=1nui\min Z=\sum_{i=1}^{n}u_{i} xTw−ui+s1=yii=1,…,nxTw−ui+s1=yii=1,…,n \textbf{x}^T\textbf{w} -u_i+s_1=y_{i} \; i = 1,\ldots,n xTw+ui+s2=−yii=1,…,nxTw+ui+s2=−yii=1,…,n \textbf{x}^T\textbf{w} +u_i+s_2=-y_{i} \; i = 1,\ldots,n 服从s1≥0;s2≥0;ui≥0 i=1,...,ns1≥0;s2≥0;ui≥0 i=1,...,ns_1 \ge 0; s_2\ge 0; u_i \ge 0 …

4
如何计算比率的置信区间?
考虑一个输出在0到1之间的实验。在这种情况下,如何获得该比率应该无关紧要。在此问题的先前版本中对此进行了详细阐述,但为清晰起见,在关于meta的讨论之后被删除。XiXiX_i 此实验重复次,而n很小(大约3-10)。该X 我被认为是独立同分布的。从这些我们估计平均通过计算平均¯ X,但如何计算相应的置信区间[ ù ,V ]?nnnnnnXiXiX_iX¯¯¯¯X¯\overline X[U,V][U,V][U,V] 使用标准方法计算置信区间时,有时大于1。但是,我的直觉是正确的置信区间...VVV ...应在0到1的范围内 ...应随着n的增加而变小nnn ...大约是使用标准方法计算得出的顺序 ...通过数学上合理的方法计算 这些不是绝对要求,但我至少想了解为什么我的直觉是错误的。 根据现有答案进行计算 在下文中,从现有的答案所产生的置信区间为比较。{Xi}={0.985,0.986,0.935,0.890,0.999}{Xi}={0.985,0.986,0.935,0.890,0.999}\{X_i\} = \{0.985,0.986,0.935,0.890,0.999\} 标准方法(又名“学校数学”) ,σ2=0.0204,因此,99%的置信区间是[0.865,1.053]。这与直觉1相矛盾。X¯¯¯¯=0.959X¯=0.959\overline X = 0.959σ2=0.0204σ2=0.0204\sigma^2 = 0.0204[0.865,1.053][0.865,1.053][0.865,1.053] 裁剪(在评论中由@soakley建议) 只需使用标准方法,然后提供作为结果是很容易做到。但是我们可以这样做吗?我尚未确信下限保持不变(-> 4.)[0.865,1.000][0.865,1.000][0.865,1.000] 逻辑回归模型(@Rose Hartman建议) {4.18,4.25,2.09,2.66,6.90}{4.18,4.25,2.09,2.66,6.90}\{4.18,4.25,2.09,2.66,6.90\}[0.173,7.87][0.173,7.87][0.173,7.87][0.543,0.999][0.543,0.999][0.543,0.999] 二项式比例置信区间(由@Tim建议) 该方法看起来不错,但不幸的是它不适合实验。只需将结果组合起来,然后将其解释为@ZahavaKor建议的一项大型重复的Bernoulli实验,结果如下: 出来的 5 * 1000的总额。将其送入调整。沃尔德计算器给 [ 0.9511 ,0.9657 ]。这似乎是不现实的,因为在该间隔内没有单个 X i!(-> 3.)985+986+890+935+999=4795985+986+890+935+999=4795985+986+890+935+999 = 47955∗10005∗10005*1000[0.9511,0.9657][0.9511,0.9657][0.9511,0.9657]XiXiX_i 引导程序(由@soakley建议) 在我们有3125个可能的排列。取3093n=5n=5n=5的排列的中间手段,我们得到[0.91,0.99]。长得不说坏的,但我希望一个更大的区间( - > …


2
MCMC样本的模式可靠性
John Kruschke在他的《做贝叶斯数据分析》一书中指出,使用R中的JAGS ...根据MCMC样本进行的模式估算可能相当不稳定,因为该估算基于平滑算法,该算法对MCMC样本中的随机隆起和波动敏感。(进行贝叶斯数据分析,第205页,第8.2.5.1节) 虽然我对Metropolis算法和Gibbs采样之类的精确形式有所了解,但我也不熟悉所提到的平滑算法,以及为什么这意味着从MCMC样本中估计模式是不稳定的。是否有人能够直观地了解平滑算法的作用以及为什么会使模式的估计不稳定?
12 bayesian  mcmc  mode 


1
用R计算的多元正交多项式是什么?
单变量点集中的正交多项式是在点上产生值的多项式,其点积和成对相关性为零。R可以产生具有函数poly的正交多项式。 相同的函数具有变式多项式,该变式在多变量点集上生成正交多项式。无论如何,所得的多项式在成对零相关的意义上是不正交的。实际上,由于一阶多项式应该只是原始变量,因此除非原始变量不相关,否则一阶多项式就不会是正交的。 然后,我的问题是: R中由polym计算的多元正交多项式是什么?它们只是单变量正交多项式的乘积吗?它们是用来干什么的? 可以存在真正的多元正交多项式吗?有没有简单的生产方法?在R中?它们实际用于回归吗? 更新资料 在回应Superpronker的评论时,我举一个例子说明不相关多项式的含义: > x<-rnorm(10000) > cor(cbind(poly(x,degree=3))) 1 2 3 1 1.000000e+00 -6.809725e-17 2.253577e-18 2 -6.809725e-17 1.000000e+00 -2.765115e-17 3 2.253577e-18 -2.765115e-17 1.000000e+00 多边形函数返回以点x评估的正交多项式(此处每个多项式为10,000点)。不同多项式上的值之间的相关性为零(存在一些数字误差)。 使用多元多项式时,相关性不为零: > x<-rnorm(1000) > y<-rnorm(1000) > cor(cbind(polym(x,y,degree=2))) 1.0 2.0 0.1 1.1 0.2 1.0 1.000000e+00 2.351107e-17 2.803716e-02 -0.02838553 3.802363e-02 2.0 2.351107e-17 1.000000e+00 -1.899282e-02 0.10336693 …

1
可以从概念上理解pareto / nbd模型吗?
我正在学习使用BTYD程序包,该程序使用Pareto / NBD模型来预测何时将有客户返回。但是,有关该模型的所有文献都充斥着数学,并且似乎没有对该模型的工作原理进行简单/概念性的解释。是否可以为非数学家理解Pareto / NBD模型?我读完了Fader的那篇著名论文。Pareto / NBD模型进行以下假设: 一世。当处于活动状态时,客户在长度为t的时间段内进行的交易数量将以交易率λ进行泊松分布。 ii。客户之间交易率的异质性遵循具有形状参数r和比例参数α的伽马分布。 iii。每个客户都有一个长度τ的不可观察的“寿命”。客户处于非活动状态的这一点以辍学率µ呈指数分布。 iv)客户之间的辍学率异质性遵循形状参数为s和比例参数为β的伽玛分布。 v。交易率λ和退出率μ随客户而独立变化。” 我不理解假设(ii),(iii)和(iv)的(直觉)原理。为什么只分配这些分布,为什么不分配其他分布? BG / NBD模型的假设还包括: i。)在激活时,客户进行的交易数量遵循Poisson流程,交易率为λ。这等效于假设事务之间的时间以事务速率λ呈指数分布 ii)λ中的异质性遵循伽马分布 iii)进行任何交易后,客户以概率p变得不活跃。因此,根据pmf的(移位)几何分布,客户在各个交易中分布的“退出”点 iv)p中的异质性遵循beta分布 假设(ii),(iii)和(iv)的(直观)合理性也不是很明显。 我将不胜感激。谢谢。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.