统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
Dirac的delta函数是否应被视为高斯分布的子类?
在Wikidata中,可以将本体中的概率分布(像其他所有事物一样)联系起来,例如,t分布是非中心t分布的子类,请参见,例如, https://angryloki.github.io/wikidata-graph-builder/?property=P279&item=Q209675&iterations=3&limit=3 存在多种限制情况,例如,当t分布中的自由度变为无穷大时,或者当正态分布(高斯分布)的方差接近零时。在后一种情况下,分布将​​趋向于Dirac的delta函数。 我注意到,在英语Wikipedia上,方差参数当前被表示为大于零,因此严格解释下,人们不会说Dirac的delta函数是正态分布的子类。但是,对我来说似乎还可以,因为我要说指数分布是狄拉克三角函数的超类。 说明Dirac的delta函数是高斯分布的子类是否有问题?

1
ReLU激活的单层神经网络等于SVM?
假设我有一个简单的单层神经网络,具有n个输入和一个输出(二进制分类任务)。如果我将输出节点中的激活函数设置为S型函数,则结果将是Logistic回归分类器。 在相同的情况下,如果将输出激活更改为ReLU(整流线性单位),那么结果结构是否与SVM相同或相似? 如果不是,为什么?

1
“棒球的勾股定理”背后是否有任何真实的统计数据?
我正在阅读一本有关Sabermetrics的书,特别是Wayne Winston的Mathletics,在第一章中,他介绍了可用于预测球队获胜率的数量: 他似乎在暗示,赛季中期的时候,它可以被用来预测赢率更好的比本赛季上半场的胜率。他将公式推广为 其中是得分与得分之比。然后,他找到最适合的指数来预测3项运动获胜百分比,并找到 [REXP得分点2得分点2+ 反对2≈ %游戏赢了,Points Scored2Points Scored2+Points Against2≈% Games Won,\frac{\text{Points Scored}^2 }{\text{Points Scored}^2 + \text{Points Against}^2} \approx \text{% Games Won},- [R棒球:EXP≈2,足球:EXP≈2.7,篮球:EXP≈14.我P小号我P甲我1[R经验值[R经验值+ 1,RexpRexp+1, \frac{R^{\text{exp}}}{R^{\text{exp}} + 1}, [RRR棒球:EXP ≈ 2 ,Baseball: exp≈2, \text{Baseball: exp} \approx 2 , 足球:EXP ≈ 2.7 ,Football: exp≈2.7, \text{Football: exp} \approx 2.7, 篮球:EXP ≈ 14。Basketball: exp≈14. …


1
MIMIC因子和指标综合指数(SEM)有什么区别?
在具有潜在变量(SEM)的结构方程建模中,常见的模型公式是“多个指标,多个原因”(MIMIC),其中潜在变量是由某些变量引起并由其他变量反映的。这是一个简单的示例: 从本质上讲,f1是一个回归结果为x1,x2和x3,和y1,y2和y3用于测量指标f1。 也可以定义一个复合的潜在变量,其中潜在变量基本上等于其组成变量的加权组合。 这是我的问题:f1在MIMIC模型中,定义为回归结果与将其定义为复合结果之间有区别吗? 使用中的lavaan软件进行的一些测试R表明系数相同: library(lavaan) # load/prep data data <- read.table("http://www.statmodel.com/usersguide/chap5/ex5.8.dat") names(data) <- c(paste("y", 1:6, sep=""), paste("x", 1:3, sep="")) # model 1 - canonical mimic model (using the '~' regression operator) model1 <- ' f1 =~ y1 + y2 + y3 f1 ~ x1 + x2 + x3 ' …

1
两个样本卡方检验
这个问题来自范德法特(Van der Vaart)的书《渐近统计》(渐近统计)。253.#3: 假设和是具有参数和独立多项式向量。在零假设下表明XmXm\mathbf{X}_mYnYn\mathbf{Y}_n(m,a1,…,ak)(m,a1,…,ak)(m,a_1,\ldots,a_k)(n,b1,…,bk)(n,b1,…,bk)(n,b_1,\ldots,b_k)ai=biai=bia_i=b_i ∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i∑i=1k(Xm,i−mc^i)2mc^i+∑i=1k(Yn,i−nc^i)2nc^i\sum_{i=1}^k \dfrac{(X_{m,i} - m\hat{c}_i)^2}{m\hat{c}_i} + \sum_{i=1}^k \dfrac{(Y_{n,i} - n\hat{c}_i)^2}{n\hat{c}_i}具有分布。其中。Ç我 = (X 米,我 + ÿ Ñ ,我)/(米+ Ñ )χ2k−1χk−12\chi^2_{k-1}c^i=(Xm,i+Yn,i)/(m+n)c^i=(Xm,i+Yn,i)/(m+n)\hat{c}_i = (X_{m,i} + Y_{n,i})/(m+n) 我需要一些入门帮助。这里的策略是什么?我能够将两个求和数合并为: ∑i=1k(mYn,i−nXm,i)2mn(m+n)c^i∑i=1k(mYn,i−nXm,i)2mn(m+n)c^i\sum_{i=1}^k \dfrac{(mY_{n,i} - nX_{m,i})^2}{mn(m+n)\hat{c}_i} 但与CLT,因为它的加权组合这不会工作XmXmX_m和YnYnY_n。不确定这是否是正确的路径。有什么建议么? 编辑:如果m=nm=nm=n则很容易,因为我们得到 mYn−nXmmn(m+n)−−−−−−−−−√=Yn−Xm(m+n)−−−−−−−√mYn−nXmmn(m+n)=Yn−Xm(m+n)\begin{align*} \dfrac{mY_{n} - nX_{m}}{\sqrt{mn(m+n)}} &= \dfrac{Y_{n} - X_{m}}{\sqrt{(m+n)}} \end{align*} 其中分子可以看作是多项式变量的差之和,因此我们可以应用CLT,然后使用同一章的定理17.2结束它。但是,我无法弄清楚如何在这种情况下使用不同的样本量来解决这个问题。有什么帮助吗?(1,a1,…,ak)(1,a1,…,ak)(1,a_1,\ldots,a_k) 链接到van der Vaart的 Google图书的第17章


3
统计测试,以验证两个相似的时间序列何时开始偏离
从标题开始,我想知道是否存在统计测试,可以帮助我确定两个相似时间序列之间的重大差异。具体来说,看下图,我想检测到序列在时间t1开始发散,即它们之间的差异开始显着。此外,我还将检测系列之间的差异何时不显着。 有任何有用的统计检验可以做到这一点吗?

1
超出方差,偏度和峰度的高阶累积量和矩名称
在物理学或数学力学中,从基于时间的位置,可以通过导数获得相对于时间的变化率:速度,加速度,加加速度(3阶),抖动(4阶)。x (t )X(Ť)x(t) 一些人已经提出 了对七阶导数的捕捉,破裂,爆破。 受到机械物理学和弹性理论启发的矩在统计中也很重要,请参阅概率分布的“矩”有什么“矩”?早在K. Pearson的著作中提到过。 前滞后累积量(有时被归一化或居中),经典地称为方差(2阶),偏度 (3阶)和峰度或平坦度 (4阶)。000 尽管五阶或六阶累积量/矩的估计在有限样本中可能会很麻烦,但是否存在普遍接受或采用的五阶或六阶累积量/矩以及其他名称(“高阶矩”除外)? 引用《数字食谱》第3版:《科学计算的艺术》,第1页。723: 偏度(或第三时刻)和峰度(或第四时刻)应谨慎使用,或者更好的是,根本不使用 《对冲基金合规性和风险管理指南》的Armelle Guizot认为,显然可以在投资组合的风险分析中使用高达7或8阶的矩来证实这一点: 补充笔记: SE.maths:是否有过度偏斜的解释? 尾巴与中心(模式,肩膀)在造成偏斜方面的相对重要性

1
间距与样本均值的比率分布是多少?
令X1,…,XnX1,…,XnX_1,\dots,X_n为均值为的iid指数随机变量的样本ββ\beta,令X(1),…,X(n)X(1),…,X(n)X_{(1)},\dots,X_{(n)}为该样本的阶数统计量。让X¯=1n∑ni=1XiX¯=1n∑i=1nXi\bar X = \frac{1}{n}\sum_{i=1}^n X_i。 限定间隔Wi=X(i+1)−X(i) ∀ 1≤i≤n−1.Wi=X(i+1)−X(i) ∀ 1≤i≤n−1.W_i=X_{(i+1)}-X_{(i)}\ \forall\ 1 \leq i \leq n-1\,. 可以示出,每个WiWiW_i还指数,平均βi=βn−iβi=βn−i\beta_i=\frac{\beta}{n-i}。 问题:如何找到P(WiX¯>t)P(WiX¯>t)\mathbb{P}\left( \frac{W_i}{\bar X} > t \right),其中ttt是已知的并且非负? 尝试:我知道,这是等于1−FWi(tX¯)1−FWi(tX¯)1 - F_{W_i}\left(t \bar X\right)。因此,我使用的总概率的法如下所示: P(Wi>tX¯)=1−FWi(tX¯)=1−∫∞0FWi(ts)fX¯(s)ds,P(Wi>tX¯)=1−FWi(tX¯)=1−∫0∞FWi(ts)fX¯(s)ds, \mathbb{P}\left( W_i > t \bar X \right) = 1 - F_{W_i}\left( t \bar X \right) = 1 - \int_0^\infty F_{W_i}(ts)f_{\bar X}(s) …

2
如何模拟数据以证明与R(lme4)的混合效果?
作为这篇文章的对应内容,我致力于模拟具有连续变量的数据,使它们适合于相关的截距和斜率。 虽然有关于这一主题伟大的职位在网站上,并在现场之外,我在跨开始到结束例如即将与并联一个简单的,现实生活中的情景模拟数据有困难。 因此,问题是如何模拟这些数据,并使用进行“测试” lmer。对于许多人而言,这并不是什么新鲜事物,但对于其他许多试图了解混合模型的人来说,却可能有用。

2
多项式分布系数之和
\newcommand{\P}{\mathbb{P}}我要死了。每当我得到1、2或3时,我都写下一个“ 1”。每当我得到4时,我就写下“ 2”;每当我得到5或6时,我都会写下“ 3”。 令为我写下的所有数字乘积所需的总抛出次数。我想计算(或近似),并且可以根据正态分布给出近似值。NNN≥100000≥100000\geq 100000P(N≥25)P(N≥25)\P(N\geq 25) 首先,我知道因为。现在,让,和分别是我写下1、2和3的次数。然后:P(N≥11)=1P(N≥11)=1\P(N\geq 11) = 1log3100.000≈10.48log3⁡100.000≈10.48\log_3 100.000 \approx 10.48aaabbbccc P(a,b,c∣n)=⎧⎩⎨⎪⎪(na,b,c)(12)a(16)b(13)c0 if a+b+c=n otherwiseP(a,b,c∣n)={(na,b,c)(12)a(16)b(13)c if a+b+c=n0 otherwise\P(a,b,c\mid n) = \begin{cases}\displaystyle\binom {n}{a, b, c} \left(\frac 1 2\right) ^ a \left(\frac 1 6\right)^b\left(\frac 1 3\right)^c &\text{ if } a + b + c = n \\ 0 &\text{ …

1
IID随机变量的期望值
我碰到这种推导,我不明白:如果X1,X2,...,XnX1,X2,...,XnX_1, X_2, ..., X_n是大小的随机样本n的平均值的人口采取μμ\mu和方差σ2σ2\sigma^2,那么 X¯=(X1+X2+...+Xn)/nX¯=(X1+X2+...+Xn)/n\bar{X} = (X_1 + X_2 + ... + X_n)/n E(X¯)=E(X1+X2+...+Xn)/n=(1/n)(E(X1)+E(X2)+...+E(Xn))E(X¯)=E(X1+X2+...+Xn)/n=(1/n)(E(X1)+E(X2)+...+E(Xn))E(\bar{X}) = E(X_1 + X_2 + ... + X_n)/n = (1/n)(E(X_1) + E(X_2) + ... + E(X_n)) E(X¯)=(1/n)(μ+μ+...n times)=μE(X¯)=(1/n)(μ+μ+...n times)=μE(\bar{X}) = (1/n)(\mu + \mu + ...n ~\text{times}) = \mu 这是我迷路的地方。使用的自变量为E(Xi)=μE(Xi)=μE(X_i) = \mu因为它们的分布相同。实际上这不是事实。假设我有一个样品,S={1,2,3,4,5,6}S={1,2,3,4,5,6}S=\{1,2,3,4,5,6\},然后,如果随机地选择2号与替换,并重复此过程10次,然后我得到10个样品:(5,4)(2 ,5)(1,2)(4,1)(4,6)(2,4)(6,1)(2,4)(3,1)(5,1)。这是2个随机变量样子X1,X2X1,X2X_1, X_2。现在,如果我将期望值X1X1X_1我明白了 E(X1)=1.(1/10)+2.(3/10)+3.(1/10)+4.(2/10)+5.(2/10)+6.(1/10)=34/10=3.4E(X1)=1.(1/10)+2.(3/10)+3.(1/10)+4.(2/10)+5.(2/10)+6.(1/10)=34/10=3.4E(X_1) = 1.(1/10) …

1
误差函数和标准正态分布函数如何相关?
如果标准普通PDF为f(x)=12π−−√e−x2/2f(x)=12πe−x2/2f(x) = \frac{1}{\sqrt{2\pi}} e^{-x^2/2} CDF为 F(x )= 12个π--√∫X- ∞Ë− x2/ 2d X,F(X)=1个2π∫-∞XË-X2/2dX,F(x) = \frac{1}{\sqrt{2\pi}} \int_{-\infty}^x e^{-x^2/2}\mathrm{d}x\,, 这如何变成的误差函数?žžz

1
在因子分析中计算二元变量的皮尔逊相关性(而不是四项式)有什么危险?
我从事教育游戏的研究,目前的一些项目涉及使用BoardGameGeek(BGG)和VideoGameGeek(VGG)的数据来检查游戏设计元素之间的关系(例如“第二次世界大战”,“涉及掷骰子” )和这些游戏的玩家评分(例如,满分10分)。这些设计元素中的每个元素都与BGG或VGG系统中的标签相对应,因此每个元素本质上都是二分变量。游戏在数据库中为每个存在的标签提供1,为每个不存在的标签提供0。 这些标记有数十种,因此我想使用探索性因子分析(EFA)提出可管理数量的“类型”,以捕获游戏设计中的模式。咨询几个来源,据我所知,因为我有工作二元变量,我应该使用polychoric相关(四项,特别是在这里),而不是皮尔森用我的因素,即将到来的时候(也有其他的选择,喜欢的潜在特质分析-那些那里,但这是我现在正在探索的那个)。 出于好奇,我想出了两套因素,一套使用Pearson相关,另一套使用多色相关(每次使用相同数量的因素)。我的问题是,使用Pearson相关性计算出的因子比使用多色相关性计算出的因子更有意义并且更易于解释。换句话说,来自第一组因素的“类型”具有直觉意义,并且与我对游戏设计的理解相一致。第二组因素则不是这样。 一方面,我想确保我符合正在使用的测试的假设,即使这样做会使我的结果不太美观。另一方面,我认为因素分析和(更广泛的)模型构建的目标的一部分是想出一些有用的东西,而当我“违反规则”时,就会出现更多有用的信息。对有用模型的需求是否足以超过违反该检验假设的条件?使用Pearson相关而不是多选相关的结果到底是什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.