统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
填充渐近线的数学定义
我正在写一篇使用渐近渐近线的论文,我的一位审稿人要求我提供关于渐进渐近线的严格数学定义(即带有数学符号和符号)。 我似乎在文献中找不到任何内容,希望有人可以将我指向某些人的方向,或者为我提供一个手写的定义。 如果您不熟悉填充渐近线(也称为固定域渐近线),则它们如下:填充渐近线基于观察的结果,随着其数量的增加,在某些固定和有界区域中密度越来越高。 换句话说,填充渐近线是通过在固定域中更密集地采样来收集更多数据的地方。 我已经看过Stein 1999和Cressie 1993,但在那里“数学上”都不严格。 这是我论文引用的段落。 因此,重要的是要认识到我们正在处理的渐近性。在我们的案例中,我们处理的渐近性基于观察结果,随着观察次数的增加,它们在某些固定和有界区域中变得越来越密集。这些类型的渐近线被称为固定域渐近线(Stein,1999)或填充渐近线(Cressie,1993)。填充渐近线通过在固定域中进行更密集的采样来收集更多数据,将在帮助我们发展关于...的论点中发挥关键作用。 重要的是,我正在使用拉丁超立方体抽样来抽样观察。 这是Cressie的书中关于填充渐近线的内容。

2
主成分分析可以用于股票价格/非平稳数据吗?
我正在阅读《面向黑客的机器学习》一书中给出的示例。我将首先详细说明示例,然后再讨论我的问题。 范例: 以25个股价的10年为一个数据集。以25股价格运行PCA。将主要成分与道琼斯指数进行比较。观察PC与DJI之间的强烈相似之处! 据我了解,该示例更像是一个玩具,可以帮助像我这样的新手了解PCA工具的有效性! 但是,从另一个消息来源看,我发现股价是不稳定的,以股价运行PCA是荒谬的。我从中阅读的资料完全嘲笑了计算股价的协方差和PCA的想法。 问题: 这个例子如何运作得如此好?股价的PCA与DJI非常接近。该数据是2002-2011年股价的真实数据。 有人可以为我指出一些不错的资源来读取固定/非固定数据吗?我是电脑程序编制员。我有很好的数学背景。但是三年来我都没有做过认真的数学运算。我已经开始重新阅读有关随机漫步等内容的信息。

2
没有替换的独立随机样本的交集的基数分布是什么?
SSS是一些组具有n∈Nn∈Nn\in\mathbb{N}元件,和a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_m被固定的正整数小于或等于nnn。 由于的元素SSS相等,因此mmm样本L1,L2,...,LmL1,L2,...,LmL_1, L_2,...,L_m分别和独立地从吸入SSS无需更换,其尺寸是a1,a2,...,ama1,a2,...,ama_1,a_2,...,a_m,分别。 |L1∩L2∩ ... ∩Lm||L1∩L2∩ ... ∩Lm|\left|L_1\cap L_2\cap\ ...\ \cap L_m\right|{0,1,...,min{a1,a2,...,am}}{0,1,...,min{a1,a2,...,am}}\{0,1,...,\min\{a_1,a_2,...,a_m\}\}

2
表示法到底是什么意思?
在像这样的上下文中,表示法(点在波浪号上)是什么意思?∼˙∼˙\dot\simx∼˙N(0,1)x∼˙N(0,1)x \mathrel{\dot\sim} \mathcal N(0,1) 事实证明,找到如何正确排版的方法要容易得多:tex.SE解释说,应该输入\mathrel{\dot\sim}而不是简单\dot\sim地解决间距问题,而不是查找其实际含义。到目前为止,它仅在CV上使用了4次;这是标准的吗?

3
我可以使用哪些统计方法来找到分类变量的流行或常见组合?
我正在研究多种药物的使用。我有一个包含400名吸毒者的数据集,每个人都陈述了他们滥用的药物。有10种以上的药物,因此可能有很大的组合。我将它们消耗的大多数药物重新编码为二进制变量(即,如果吸毒者滥用了海洛因,则海洛因为1,否则为0)。我想找到2或3种药物的流行或常见组合。我可以使用统计方法吗?

1
证明/否定
证明/否定E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1A|Ft]=0 or 1 a.s. ⇒E[1A|Fs]=E[1A|Ft] a.s.E[1_A | \mathscr{F_t}] = 0 \ \text{or} \ 1 \ \text{a.s.} \ \Rightarrow E[1_A | \mathscr{F_{s}}] = E[1_A | \mathscr{F_t}] \ \text{a.s.} 给定已过滤的概率空间(Ω,F,{Fn}n∈N,P)(Ω,F,{Fn}n∈N,P)(\Omega, \mathscr{F}, \{\mathscr{F}_n\}_{n \in \mathbb{N}}, \mathbb{P}),令A∈FA∈FA \in \mathscr{F}。 假设∃t∈N s.t. E[1A|Ft]=1 a.s.∃t∈N s.t. E[1A|Ft]=1 a.s.\exists t \in \mathbb{N} …

3
如何读取auto.arima()的p,d和q?
我如何获得模型的估计p,d and q值?ARIMA(p,d,q)auto.arima(mytimeseries) arima_model <-auto.arima(mytimeseries,ic ='bic') 如果我们看一下输出 arima_model $ arma 我们得到 [1] 1 0 0 0 1 2 0 上面顺序出现的数字是什么意思?
10 r  arima 

1
在2x2和1x2(单因素-二进制响应)列联表中是否进行逻辑回归与卡方检验?
我想了解2x2和Ix2列联表中逻辑回归的使用。例如,以此为例 使用卡方检验和逻辑回归有什么区别?像这样具有多个名义因子的表(Ix2表)呢: 还有一个类似的问题在这里 -但答案是主要是卡方能够处理MXN表,但我的问题是什么是specificalyl的时候有一个二元结果和单一标称因素。(链接的线程也引用该线程,但这与多个变量/因数有关)。 如果只是具有二进制响应的单个因素(即无需控制其他变量),那么进行逻辑回归的目的区别是什么?

2
标度变量作为计数数据-对不对?
在本文中(可通过PubMed Central免费获得),作者使用负二项式回归在得分为0-40的10项筛选工具上对得分进行建模。此过程假定计数数据,这里显然不是这种情况。我希望您对此方法是否可以接受发表意见,因为有时我在工作中使用相同或相似的工具。如果没有,我想知道是否有任何可接受的替代方法。以下是更多详细信息: 所使用的量表是酒精使用障碍识别测试(AUDIT),这是一项10项问卷,旨在筛查酒精使用障碍和有害/有害饮酒。乐器的得分从0到40,并且结果通常偏左。 据我了解,使用计数数据是假设所有“计数”的值彼此独立-每天上急诊室的患者,特定人群中的死亡人数等-它们彼此独立,尽管取决于基础变量。此外,我认为使用计数数据时不能有最大允许计数,尽管我认为当理论最大值与数据中观察到的最大值相比很高时,可以放宽此假设? 使用AUDIT量表时,我们没有真实的计数。我们有10个项目,最大总分40,尽管在实践中很少看到高分。这些项目的分数自然相互关联。 因此违反了使用计数数据所需的假设。但这仍然是可以接受的方法吗?违反这些假设有多严重?在某些情况下可以认为此方法更可接受?该方法是否有不涉及将scale变量减少到类别的替代方法?

1
如何将简单的感知器内核化?
带有非线性边界的分类问题不能通过简单的感知器来解决。以下R代码出于说明目的,并且基于Python中的此示例): nonlin <- function(x, deriv = F) { if (deriv) x*(1-x) else 1/(1+exp(-x)) } X <- matrix(c(-3,1, -2,1, -1,1, 0,1, 1,1, 2,1, 3,1), ncol=2, byrow=T) y <- c(0,0,1,1,1,0,0) syn0 <- runif(2,-1,1) for (iter in 1:100000) { l1 <- nonlin(X %*% syn0) l1_error <- y - l1 l1_delta <- l1_error * …

1
重新设置似然函数的参数时,仅插入转换后的变量而不是更改变量公式就足够了吗?
假设我正在尝试重新设定指数分布的似然函数的参数。如果我的原始似然函数是: p(y∣θ)=θe−θyp(y∣θ)=θe−θy p(y \mid \theta) = \theta e^{-\theta y} 并且我想使用重新设置参数,因为不是随机变量,而是参数,仅用于插入就足够了吗?ϕ=1θϕ=1θ\phi = \frac{1}{\theta}θθ\theta 我的明确意思是: p(y∣ϕ=1θ)=1ϕe−1ϕyp(y∣ϕ=1θ)=1ϕe−1ϕy p\left(y \mid \phi = \frac{1}{\theta}\right) = \frac{1}{\phi} e^{-\frac{1}{\phi} y} 如果是这样,我不确定这背后的理论是什么。我的理解是,似然函数是参数的函数,所以为什么我不需要使用变量公式的变化使我感到困惑。任何帮助将不胜感激,谢谢!

1
PCA仅保留较大的成对距离是什么意思?
我目前正在阅读t-SNE可视化技术,有人提到使用主成分分析(PCA)来可视化高维数据的缺点之一是它仅保留了点之间的较大成对距离。在高维空间中相距较远的意义点在低维子空间中也将相距较远,但除此之外,所有其他成对距离都将被搞砸。 有人可以帮助我理解为什么会这样吗?它在图形上意味着什么?

2
如何统计检验我的网络(图形)是否是“小世界”网络?
阿小世界网络是一种类型的数学曲线图,其中大多数节点不在彼此的邻居,但大多数节点可以与每个其它由少量啤酒花或步骤的到达。具体来说,小世界网络定义为这样一个网络,其中两个随机选择的节点之间的典型距离L(所需步数)与网络中节点数N的对数成正比增长,即 大号≈ 日志(N)大号≈日志⁡(ñ) L \approx \log(N) L和N之间的这种关系是“拇指法则”。我正在为我的研究寻找更专业的小世界图确定。如何测试我的图是否是小世界图? 这个小世界实验包括由斯坦利·米尔格拉姆(Stanley Milgram)和其他研究人员进行的几项实验,旨在研究美国人群社交网络的平均路径长度。该研究具有开创性,因为它表明人类社会是一个以短路径为特征的小世界网络。尽管米尔格拉姆本人并没有使用该术语,但这些实验通常与短语“六度分离”相关。 先感谢您。

4
线性分类器过度拟合
今天,我们的教授在课堂上说:“不可能过度拟合线性分类器”。我认为这是错误的,因为即使线性分类器也可能对训练集中的离群值敏感-以硬边距支持向量机为例:一个嘈杂的数据点可以更改将使用哪个超平面来分离数据集。还是我错了?显然,由于模型复杂度较低,线性可能会防止过度拟合,但我仍然不明白为什么过度拟合是不可能的。还有一点是,当我试图考虑这个问题时,我意识到“过拟合”似乎没有被正式定义。这是为什么?训练和测试集性能之间的某种距离度量是否可以使这种形式化?谢谢

2
逻辑模型的RMSE(均方根误差)
我对使用RMSE(均方根误差)比较不同逻辑模型的有效性存在疑问。响应为0或1,并且预测为0- 之间的概率1。 以下应用的方式对二进制响应也有效吗? # Using glmnet require(glmnet) load(url("https://github.com/cran/glmnet/raw/master /data/BinomialExample.RData")) cvfit = cv.glmnet(x, y, family = "binomial", type.measure = "mse") A <- predict(cvfit, newx = x, s = "lambda.min", type = "response") RMSE1 <- mean((y - A)^2) # 0.05816881 # glm mydata <- read.csv("https://stats.idre.ucla.edu/stat/data/binary.csv") mydata$rank <- factor(mydata$rank) mylogit <- glm(admit ~ …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.