统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
n iid个正态变量最大比的期望值
假设是 iid,并且表示的第个最小元素。怎样才能使两个连续元素之间的比率的预期最大值达到上限?也就是说,如何计算上限:X1,...,XnX1,...,XnX_1,...,X_nN(μ,σ2)N(μ,σ2)N(\mu,\sigma^2)X(i)X(i)X_{(i)}iiiX1,...,XnX1,...,XnX_1,...,X_nX(i)X(i)X_{(i)} E[maxi=1,...,n−1(X(i+1)X(i))]E[maxi=1,...,n−1(X(i+1)X(i))]E\left[\max\limits_{i=1,...,n-1}\left(\frac{X_{(i+1)}}{X_{(i)}}\right)\right] 我能够找到的文献主要集中在两个随机变量之间的比率上,这导致了比率分布,此处给出了两个不相关的正态分布的pdf:https : //en.wikipedia.org/wiki/ Ratio_distribution#Gaussian_ratio_distribution。虽然这将使我能够提高nnn变量的预期平均比率的上限,但我看不到如何将这一概念推广到nnn变量的预期最大比率。

5
为什么f beta分数可以这样定义beta?
这是F beta得分: Fβ= (1 + β2)⋅ p - [R È Ç 我小号我ö Ñ ⋅ ř Ë Ç 一升升(β2⋅ p - [R È Ç 我小号我Ò Ñ)+ [R Ë Ç 一升升Fβ=(1个+β2)⋅p[RËC一世s一世Øñ⋅[RËC一个升升(β2⋅p[RËC一世s一世Øñ)+[RËC一个升升F_\beta = (1 + \beta^2) \cdot \frac{\mathrm{precision} \cdot \mathrm{recall}}{(\beta^2 \cdot \mathrm{precision}) + \mathrm{recall}} 维基百科文章指出。FβFβF_\beta "measures the effectiveness of retrieval with respect to …

2
了解粒子过滤器的数学和统计学先决条件?
我目前正在尝试了解粒子过滤器及其在金融中的可能用途,并且我在相当努力。为了(i)使粒子过滤器的基础变得易于使用,以及(ii)以后再全面理解它们,我应该重新讨论哪些数学和统计先决条件(来自定量金融的背景)?除了状态空间模型(我尚未介绍)以外,我对研究生级时间序列计量经济学有扎实的知识。 任何提示都非常感谢!

3
可以训练神经网络以某种样式绘制图片吗?
可以训练神经网络以某种样式绘制图片吗?(因此,它会拍摄图像并以训练有素的样式重绘。) 是否有经过批准的技术可用于此类事情?我知道DeepArt算法。可以用特定的图案(例如,vangoghify图像)填充主图像,这很好,但是我正在寻找不同的东西,例如,从输入的肖像中以某种样式制作卡通。

1
通过订单统计显示预估值收敛到百分位数
令是从alpha稳定分布中采样的iid随机变量序列,其参数。X1,X2,…,X3nX1,X2,…,X3nX_1, X_2, \ldots, X_{3n}α=1.5,β=0,c=1.0,μ=1.0α=1.5,β=0,c=1.0,μ=1.0\alpha = 1.5, \; \beta = 0, \; c = 1.0, \; \mu = 1.0 现在考虑序列,其中Y_ {j + 1} = X_ {3j + 1} X_ {3j + 2} X_ {3j + 3}-1,对于j = 0, \ ldots,n-1。Y1,Y2,…,YnY1,Y2,…,YnY_1, Y_2, \ldots, Y_{n}Yj+1=X3j+1X3j+2X3j+3−1Yj+1=X3j+1X3j+2X3j+3−1个Y_{j+1} = X_{3j+1}X_{3j+2}X_{3j+3} - 1j = 0 ,… ,n …

1
为什么在aov模型中更改协变量的顺序时p值的重要性会发生变化?
我有482个观测值的数据集。 data=Populationfull 我将对3个SNP进行基因型关联分析。我试图使用aov(y〜x,data = ...)为我的分析建立模型。对于一个特征,我有几个固定的影响和协变量,我将它们包括在模型中,如下所示: Starts <- aov(Starts~Sex+DMRT3+Birthyear+Country+Earnings+Voltsec+Autosec, data=Populationfull) summary(Starts) Df Sum Sq Mean Sq F value Pr(>F) Sex 3 17.90 5.97 42.844 < 2e-16 *** DMRT3 2 1.14 0.57 4.110 0.017 * Birthyear 9 5.59 0.62 4.461 1.26e-05 *** Country 1 11.28 11.28 81.005 < 2e-16 *** Earnings 1 …
10 r  anova 


2
仅将LASSO用于特征选择
在我的机器学习课程中,我们了解了LASSO回归如何很好地执行特征选择,因为它利用了正则化。升1个升1个l_1 我的问题是:人们通常是仅使用LASSO模型进行特征选择(然后将这些特征转储到其他机器学习模型中),还是通常使用LASSO进行特征选择和实际回归? 例如,假设您想进行岭回归,但是您认为许多功能都不是很好。运行LASSO,仅提取算法未将其归零的功能,然后仅将那些功能用于将数据转储到ridge回归模型中是否明智?这样,您将获得正则化用于执行特征选择的好处,还正则化用于减少过度拟合的好处。(我知道这基本上等于弹性净回归,但是似乎您不需要在最终回归目标函数中同时拥有l_1和l_2项。)升1个升1个l_1升2升2l_2升1个升1个l_1升2升2l_2 除了回归之外,在执行分类任务(使用SVM,神经网络,随机森林等)时,这是否是明智的策略?

2
两个样本的Kullback-Leibler散度
我尝试对两个样本实施Kullback-Leibler散度的数值估计。要调试的执行从两个正态分布绘制样品N(0,1)N(0,1)\mathcal N (0,1)和N(1,2)N(1,2)\mathcal N (1,2)。 为了进行简单的估算,我生成了两个直方图,并尝试在数值上近似积分。我不得不处理直方图的那些部分,其中直方图之一的bin为零,这样我要么以零除或以零的对数结束。我该如何处理? 我想到一个相关的问题:如何精确计算两个不同均匀分布之间的KL散度?我是否必须将积分限制为两个分布的支持的并集?

3
有计算中位数的公式吗?
是否有一个等效的均值公式: 米Ë 一个Ñ =1个ñ∑我= 1ñX一世米Ë一个ñ=1个ñ∑一世=1个ñX一世\begin{equation} \mathrm{mean} = \cfrac{1}{N} \sum_{i=1}^{N} X_i \end{equation} 中位数?

2
回归:为什么要测试整体残差的正态性,而不是以为条件的残差?
我了解到,在线性回归中,误差假定为正态分布,并取决于y的预测值。然后,我们将残差视为错误的一种替代。 通常建议生成如下输出:。但是,我不明白获取每个数据点的残差并将其混和到一个图中的意义是什么。 我知道我们不太可能有足够的数据点来正确评估在每个y预测值处是否都具有正常残差。 但是,是否不是我们的正常残差是否整体上是一个单独的残差,以及与每个y预测值处的正常残差的模型假设没有明确关系的问题?我们不能在每个y预测值处都有正常残差,而总残差却很不正常吗?

5
如何用非参数测试(例如排列测试)测试交互作用?
我有两个类别/名义变量。它们每个只能采用两个不同的值(因此,我总共有4种组合)。 每个值组合都带有一组数字值。因此,我有4组数字。为了更具体,让我们说我有male / female和young / old作为标称变量,而我有weight从属数字“输出”。 我知道从过渡male到female会改变平均体重,而这些变化在统计上是有意义的。因此,我可以计算一个gender因子。这同样适用于age变量。我知道,从过渡young到old不改变平均重量,我可以计算出相应的age系数。 现在,我真正想看看的是数据是否证明从年轻女性到老年男性的转变更多地是性别和年龄因素的结合。换句话说,我想知道数据是否证明存在“ 2D效果”,或者换句话说,年龄和性别效果不是独立的。例如,男性变老可能会使体重增加1.3倍,而女性则相应增加1.1倍。 当然,我可以计算两个提到的因素(男性的年龄因素和女性的年龄因素),它们是不同的。但是我想计算出这种差异的统计意义。这种差异有多真实。 如果可能的话,我想做一个非参数测试。是否可以通过混合四组,重新组合,重新拆分和计算某些东西来做我想做的事情。

2
偏差是估计器的属性还是特定估计的属性?
例如,我经常遇到一些学生,他们知道“观察到的是“人口有偏估计。然后,在撰写报告时,他们会说:R 2[R2[R2R^2[R2[R2R^2 “我计算了观察到的和调整后的,它们非常相似,这表明我们获得的观察到的值仅有少量偏差。”R 2 R 2[R2[R2R^2[R2[R2R^2[R2[R2R^2 我通常会在谈论偏见时谈论的是估算器的属性,而不是特定的估算。但是,上面引用的语句是否滥用了术语,或者可以吗?

2
胖手指分布
简短的问题: 是否有胖手指分布?我敢肯定,如果它存在,那么它会有不同的名称。 我不知道如何将其表述为分析函数。您能帮我找到它的现有版本,还是以比大型模拟更干净的方式开始制定它? 它是当给定数字为预期目标时实际命中的数字分布,但是按钮比手指小得多,因此附近的按钮有时是偶然命中的一个按钮。 像这样的分配方式的使用是对手机按键的错误输入。如果我经营一家公司,必须“立即按1”或某样东西,然后按“您按1,是正确的”,那么尽管连续2个胖手指可能会弄乱胖手指的概率,但是他们可以得到相当不错的胖手指概率一些。 (胖手指的远距离距离?胖手指马尔可夫链?) 我想用它来尝试将纠错内置到按键中。我有一些自己的样本,但是手指“脂肪”或手机键盘拓扑的变化不足以使其健壮。 背景和细节: 这是正常的手机键盘布局: 想象一下,我的手指比琴键大得多,因此当我击打5时,我很可能会得到5,但是然后我也有可能会得到2、4、6或8(同样可能),那么获得1,3,7,9(同等可能性)的可能性较小(但不为零),而获得0的可能性很小。 我可以想象,如果我尝试为固定的“手指直径”键入无穷多个5,那么我将获得值的分布。如果我的手指值较小,则分布会改变。如果我尝试打不同的数字,则分布会改变。 实际上,这将取决于键的布局。如果它们处在一个巨大的环中而不是一个3x3的网格中,那将是另一种问题。在这种情况下,我希望我们只处理3x3矩形网格。我还怀疑键盘上有数字锁存器,因此只能检测到一次按键。其他按钮最多有7个频率,例如按下“ 0”时。我不确定采用哪种干净的方法。可能是目标密钥和候选触发密钥之间的归一化平方距离的倍数? 这是我如何模拟按下五个按钮时的分布(权重有些随意): #number of presses npress <- 1000 #hack this (not quadratic) myprobs <- c(0.85) myprobs <- c(myprobs, 0.1275/4, 0.1275/4, 0.1275/4, 0.1275/4) myprobs <- c(myprobs, 0.019125/4, 0.019125/4, 0.019125/4, 0.019125/4) myprobs <- c(myprobs,1-sum(myprobs) ) #order of number my_button <- …

1
在训练过程中,神经网络通常需要一段时间来“踢”吗?
我正在尝试使用反向传播训练深度神经网络进行分类。具体来说,我使用Tensor Flow库将卷积神经网络用于图像分类。在训练过程中,我遇到一些奇怪的行为,我只是想知道这是否很典型,或者我做错了什么。 因此,我的卷积神经网络有8层(5层卷积,3层完全连接)。所有权重和偏差均以较小的随机数初始化。然后,我设置步长,并使用Tensor Flow的Adam Optimizer进行小批量训练。 我正在谈论的奇怪行为是,对于我的训练数据中的前10个循环,训练损失通常不会减少。权重正在更新,但训练损失大致保持在大约相同的值,有时在小批之间增加或减少。它会保持这种状态一段时间,并且我总是给人以损失永远不会减少的印象。 然后,突然之间,训练损失急剧减少。例如,在训练数据的大约10个循环内,训练精度从大约20%变为大约80%。从那时起,一切最终都很好地融合在一起。每当我从头开始运行训练管道时,都会发生相同的事情,下面的图表说明了一个示例运行。 因此,我想知道的是,这是通过训练深度神经网络进行的正常行为,从而需要一段时间才能“踢进”。还是我做错了某件事导致了此延迟? 非常感谢!

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.