统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
离散均匀分布中未替换的样本之间的最大间隙
这个问题与我实验室对机器人覆盖率的研究有关: 随机绘制Ñnn从组数字{ 1 ,2 ,... ,米}{1,2,…,m}\{1,2,\ldots,m\}无需更换,并以升序排序的数字。 。1 ≤ Ñ ≤ 米1≤n≤m1\le n\le m 从此排序的数字,生成连续数字和边界之间的差:。这给出了间隙。{ 一(1 ),一个(2 ),... ,一个(Ñ ) } {a(1),a(2),…,a(n)}\{a_{(1)},a_{(2)},…,a_{(n)}\}克= { 一(1 ),一个(2 ) - 一(1 ),... ,一个(Ñ ) - 一(ñ - 1 ),m + 1 - a (n ) } g={a(1),a(2)−a(1),…,a(n)−a(n−1),m+1−a(n)}g = \{a_{(1)},a_{(2)}−a_{(1)},\ldots,a_{(n)}−a_{(n-1)},m+1-a_{(n)}\}n +1个n+1n+1 最大差距的分布是什么? P (max (g …

1
我应该知道哪些因果理论?
作为应用统计学家/计量经济学家,我应该知道哪种因果关系理论方法? 我知道(一点点) Neyman–Rubin因果模型(以及Roy,Haavelmo等) 珍珠的因果关系工作 格兰杰因果关系(尽管较少以治疗为导向) 我想念或应该了解哪些概念? 相关:哪些理论是机器学习因果关系的基础? 我已阅读这些有趣的问题和答案(1,2,3),但我认为这是一个不同的问题。我很惊讶地发现,例如《统计学习要素》中没有提到“因果关系” 。



2
受限玻尔兹曼机(RBM)的现代用例?
背景:过去约4年的许多现代研究(后alexnet)似乎已不再使用对神经网络进行生成式预训练来获得最新的分类结果。 例如,此处 mnist的最高结果仅包括前两篇论文中似乎使用生成模型的50篇论文,这两篇论文都是RBM。其他48篇获奖论文涉及不同的判别式前馈体系结构,并且为寻找更好的/新颖的权重初始化和激活函数而不是RBM和许多较旧的神经网络中使用的S型曲线付出了很多努力。 问题:是否有现代的理由使用限制玻尔兹曼机? 如果不是,是否可以对这些前馈体系结构进行实际修改,以使它们的任何层生成? 动机:我问,因为我看到的某些模型可用,通常是RBM上的变体,不一定与这些生成层/模型具有明显相似的区分性,反之亦然。例如: mcRBM ssRBM CRBM(尽管有人可能会说CNN使用的前馈架构是判别式类似架构) 同样,分别从2010年,2011年和2009年起,这些显然也是prelex网络。

2
optim和glm之间的残差标准误差
我尝试使用optim拟合glm甚至nlsR函数的简单线性回归的结果来重现。 参数估计是相同的,但是残差方差估计和其他参数的标准误差并不相同,尤其是在样本量较小时。我想这是在最大似然法和最小二乘法之间计算剩余标准误差的方式上的差异(除以n或除以n-k + 1参见示例中的波纹管)。 我从网上阅读的书中了解到优化不是一项简单的任务,但我想知道是否有可能以简单的方式重现glm使用时的标准误差估计optim。 模拟小型数据集 set.seed(1) n = 4 # very small sample size ! b0 <- 5 b1 <- 2 sigma <- 5 x <- runif(n, 1, 100) y = b0 + b1*x + rnorm(n, 0, sigma) 乐观估计 negLL <- function(beta, y, x) { b0 <- beta[1] b1 …

1
逆向岭回归:给定响应矩阵和回归系数,找到合适的预测因子
考虑一个标准的OLS回归问题:我有矩阵\ Y和\ X,我想找到\ B以最小化L = \ | \ Y- \ X \ B \ | ^ 2。 该解决方案由\ hat \ B = \ argmin_ \ B \ {L \} =(\ X ^ \ top \ X)^ + \ X ^ \ top \ Y给出。\newcommand{\Y}{\mathbf Y}\newcommand{\X}{\mathbf X}\newcommand{\B}{\boldsymbol\beta}\DeclareMathOperator*{argmin}{argmin}YY\YXX\Xββ\Bβ = argmin β { …

2
p值分布的高方差(Taleb 2016中的一个论点)
我正在尝试了解Taleb在2016年提出的总体观点,即标准P值的元分布。 在其中,Taleb针对p值的不可靠性提出了以下论点(据我所知): 对来自某个分布X的nnn数据点进行操作的估计过程将输出ap值。如果我们从该分布中获得n个点并输出另一个p值,则可以对这些p值求平均值,以在极限范围内获得所谓的“真实p值”。XXX 该“真实p值”显示出令人不安的高方差,因此具有“真实p值” 的分布+程序.12.12.12将有60%的时间报告p值<.05。 问题:这如何与赞成值的传统论点相吻合。据我了解,p值应该告诉您过程将为您提供正确间隔(或其他时间)的时间百分比。但是,本文似乎认为这种解释具有误导性,因为如果再次运行该过程,p值将不会相同。ppp 我错过了重点吗?

3
为什么CLT对不起作用?
因此,我们知道的和泊松与参数是本身泊松 。因此,假设可以取并说它实际上是,其中每个是:,并花大的n才能使CLT工作。nnnλλ\lambdanλnλn\lambdax∼poisson(λ=1)x∼poisson(λ=1)x \sim poisson(\lambda = 1) ∑n1xi∼poisson(λ=1)∑1nxi∼poisson(λ=1)\sum_1^n x_i \sim poisson(\lambda = 1) xixix_ixi∼poisson(λ=1/n)xi∼poisson(λ=1/n)x_i \sim poisson(\lambda = 1/n) 这(显然)不起作用。我认为这与CLT如何“更快”地处理与正常情况“更接近”的随机变量有关,并且lambda越小,我们得到的随机变量越多,该随机变量大多为0,并且很少变化。 但是,我的解释是我的直觉。是否有更正式的方式来解释为什么会这样? 谢谢!

3
危险率背后的直觉
我对危险率的定义方程感到困惑。我知道了危险率是多少,但我只是不明白方程式如何表达这种直觉。 如果是一个随机变量,表示某个时间间隔上某人的死亡时间。那么危险率是:xxx[0,T][0,T][0,T] h(x)=f(x)1−F(x)h(x)=f(x)1−F(x)h(x)=\frac{f(x)}{1-F(x)} 其中F(x)F(x)F(x)表示直到时间点x \ in [0,T]的死亡概率x∈[0,T]x∈[0,T]x\in[0,T], 1−F(x)1−F(x)1-F(x)表示直到时间点x \ in [0,T]都存活的概率x∈[0,T]x∈[0,T]x\in[0,T], 而f(x)f(x)f(x)是在x点死亡的概率xxx。 用f(x)除以f(x)f(x)f(x)生存率如何解释下一个\ Delta t中瞬时死亡概率的直觉ΔtΔt\Delta t?难道不是f(x)f(x)f(x),使危险率的计算变得微不足道吗?

2
中心极限定理的动力学系统观点?
(最初发布于MSE。) 我已经看到许多关于经典中心极限定理的启发式讨论,都把正态分布(或任何稳定分布)说成是概率密度空间中的“吸引子”。例如,在Wikipedia的治疗方法顶部考虑以下句子: 在更一般的用法中,中心极限定理是概率论中一组弱收敛定理中的任何一个。他们都表达了这样一个事实,即许多独立且均匀分布的(iid)随机变量的总和,或者具有特定依赖类型的随机变量将倾向于根据一小部分吸引子分布进行分布。当iid变量的方差是有限的时,吸引子分布为正态分布。 这种动态系统语言很有启发性。费勒在第二卷中对CLT的处理中也提到了“吸引力”(我想知道这是否是该语言的来源),而本笔记中的尤瓦尔·弗利姆斯(Yuval Flimus)甚至谈到了“吸引力盆地”。(我不认为他的意思是“ 事先可以推断出吸引盆的确切形式”,而是“ 事先可以推断出吸引子的确切形式”;但是,语言在那里。)我的问题是:这些可以吗?动态类比可以精确吗?我不知道它们在哪本书中-尽管许多书确实强调了正态分布对于卷积下的稳定性(以及傅立叶变换下的稳定性)是特殊的。这基本上告诉我们,法线很重要,因为它是一个固定点。CLT进一步发展,告诉我们这不仅是一个固定点,而且是吸引子。 为了使此几何图形精确,我假设将相空间作为一个合适的无限维函数空间(概率密度的空间),并将演化算子与初始条件重复卷积。但是我不知道使这张照片起作用的技术性或是否值得追求。 我猜想,因为我找不到确实可以明确采用这种方法的治疗方法,所以我认为这是可以做的或者很有趣,这肯定存在一些错误。如果是这样,我想听听为什么。 编辑:在整个Math Stack Exchange和MathOverflow中,读者可能会对三个类似的问题感兴趣: 高斯分布作为某些分布空间(MO)中的固定点 通过最大熵(MO)的中心极限定理 是否有通过某些不动点定理证明中心极限定理?(MSE)

2
为什么F检验对正态性假设如此敏感?
为什么方差差异的F检验对正态分布的假设如此敏感,即使对于大?NNN 我试图在网上搜索并访问了图书馆,但是没有一个给出好的答案。它说测试对于违反正态分布假设非常敏感,但是我不明白为什么。有人对此有很好的答案吗?

5
第5个回答选项(“我不知道”)已添加到5点李克特量表中。数据丢失了吗?
我需要一些帮助,以从问卷调查中挽救数据。 我的一位同事使用了问卷,但无意中没有使用原始的5点李克特量表(强烈不同意表示强烈同意),而是在量表中插入了第六个答案。而且,更糟糕的是,第六个响应选项是……“我不知道”。 问题在于,在某一点或另一点选择“我不知道”的受访者比例很大。如果它们只是一个很小的百分比,我将把它们从数据库中排除掉。但是,研究的核心在于概念模型,排除如此多的记录会给模型带来问题。 有人可以在这里指出正确的方向吗?是否有任何“良好做法”,或者我可以做些什么来使用(转换,转换等)那些“我不知道”的回答? 另外,如果我对相关数据进行了任何处理(即,如果我通过替换,插补等方式转换“我不知道”的响应),则什么样的“免责声明”,“警告”,注释,我应该使用吗? 我知道这是一个漫长的过程,但是我承认,除了挽救回应之外,我还很好奇在这种情况下达成的共识做法(如果有)。 PS:我知道这听起来很幼稚,但是不,“同事”不是我:)


2
从'69的数据中进行一般学习的最新状态
我试图了解1969年著名的Minsky和Papert所著的“ Perceptrons”的上下文,这对神经网络至关重要。 据我所知,除感知器外,没有其他通用的有监督学习算法:决策树仅在70年代后期才开始真正变得有用,随机森林和SVM都是90年代。似乎已经知道折刀法了,但k-cross验证(70s)或bootstrap(1979?)还不知道。 维基百科说,尽管上世纪40年代首次尝试描述混合理论,但内曼-皮尔森(Neyman-Pearson)和费舍尔(Fisher)的经典统计框架仍存在分歧。 因此,我的问题是:解决根据数据进行预测的一般问题的最新方法是什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.