统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
如何将与三次样条曲线拟合的lm()的输出转换为回归方程
我有一些代码和输出,我想构建一个模型。我不知道如何使用此输出来构建模型: require("splines") x <- c(0.2, 0.23, 0.26, 0.29, 0.33, 0.46, 0.53 ) y <- c(0.211, 0.2026, 0.2034, 0.2167, 0.2177, 0.19225, 0.182) fit <- lm(y ~ ns(x,3)) summary(fit) 请注意,ns()将为自然三次样条生成B样条基础矩阵。因此,该模型y针对x使用三个自由度的B样条回归。这样的模型的方程是什么样的?
12 r  splines 

2
具有对数偏移量的二进制模型(Probit和Logit)
是否有人对偏移量在probit和logit等二进制模型中的工作原理有任何推论? 我的问题是,后续窗口的长度可能会有所不同。假设患者接受了预防性治疗。这个镜头发生在不同的时间,所以如果结果是是否二进制指示任何的突发事,你需要调整的事实,有些人有更多的时间来展示症状。爆发的可能性似乎与随访时间的长短成正比。对我而言,数学上尚不清楚,具有偏移量的二进制模型如何捕获这种直觉(与Poisson不同)。 偏移量是Stata(p.1666)和R的标准选项,对于Poisson来说我很容易看到它,但是二进制情​​况有点不透明。 例如,如果我们有 在代数上等于模型,其中 是标准模型,上的系数限制为。这称为对数偏移量。如果我们将替换为或我很难弄清楚它是如何工作的。E[y|x]Z=exp{x′β},E[y|x]Z=exp⁡{x′β},\begin{equation} \frac{E[y \vert x]}{Z}=\exp\{x'\beta\}, \end{equation}E[y|x]=exp{x′β+logZ},E[y|x]=exp⁡{x′β+log⁡Z},\begin{equation}E[y \vert x]=\exp\{x'\beta+\log{Z}\}, \end{equation}logZlog⁡Z\log Z111exp{}exp⁡{}\exp\{\}Φ()Φ()\Phi()Λ()Λ()\Lambda() 更新#1: 下面说明了logit情况。 更新#2: 这是对非泊松模型(如Probit)的偏移量主要用途的解释。该偏移量可用于对指标函数系数进行似然比测试。首先,您要估算无约束模型并存储估算值。假设您要检验的假设。然后,创建变量,将模型删除并使用作为非对数偏移量进行拟合。这是约束模型。LR测试将两者进行比较,并且可以替代常规的Wald测试。βx=2βx=2\beta_x=2z=2⋅xz=2⋅xz=2 \cdot xxxxzzz

4
简单存储数据以在R中进行统计分析的最佳方法
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 6年前关闭。 一段时间以来,我一直在使用文本文件来存储我的R数据。但是对于最近的项目,文件的大小太大了,原始文本文件无法处理。最好的简单替代方法是什么?
12 r  dataset 

2
如何将神经网络应用于多标签分类问题?
描述: 让问题域为文档分类,其中存在一组特征向量,每个特征向量属于一个或多个类。例如,文档doc_1可能属于Sports和English类别。 题: 使用神经网络进行分类,特征向量的标签是什么?它是构成所有类的向量,以便对不相关的类赋予0值,对相关的类赋予1值吗?因此,如果类标签的列表为[Sports, News, Action, English, Japanese],那么对于文档doc_1,标签将为[1, 0, 0, 1, 0]?

1
在隐马尔可夫模型中选择“最佳”模型的标准
我有一个时间序列数据集,试图将其拟合隐马尔可夫模型(HMM),以便估计数据中的潜在状​​态数。我的伪代码是这样的: for( i in 2 : max_number_of_states ){ ... calculate HMM with i states ... optimal_number_of_states = "model with smallest BIC" ... } 现在,在通常的回归模型中,BIC倾向于支持最简约的模型,但对于HMM,我不确定这是在做什么。谁真的知道BIC标准倾向于哪种HMM?我也能够获得AIC和似然值。由于我试图推断出真实的州总数,因此其中一个标准是否比另一个标准“更好”?

2
每级1个观察值的混合模型
我正在glmer为一些业务数据拟合随机效应模型。目的是分析分销商的销售业绩,并考虑到地区差异。我有以下变量: distcode:发行商ID,大约有800个级别 region:顶级地理ID(北,南,东,西) zone:嵌套在中层地理区域内region,总共约30个层级 territory:嵌套在zone约150层中的低层地理 每个分销商仅在一个地区运营。棘手的部分是这是汇总数据,每个分发服务器只有一个数据点。因此,我有800个数据点,尽管有规律地尝试,但我试图(至少)容纳800个参数。 我已经安装了一个模型,如下所示: glmer(ninv ~ 1 + (1|region/zone/territory) + (1|distcode), family=poisson) 尽管可以打印出注释,但运行没有问题: 随机效应的分组因子的级别数等于 n,即观察数 这是明智的做法吗?我得到了所有系数的有限估计,而且AIC也不是不合理的。如果我尝试使用带身份链接的泊松GLMM,则AIC会更糟,因此日志链接至少是一个不错的起点。 如果我绘制拟合值与响应的关系图,我得到的基本上是完美拟合,我猜这是因为每个分配器有一个数据点。那合理吗,还是我做的事完全愚蠢? 这正在使用一个月的数据。我可以获取多个月的数据并以这种方式进行一些复制,但是我必须添加新的术语来表示逐月的变化以及可能的交互作用,对吗? ETA:我再次运行了上面的模型,但是没有family参数(所以只是一个高斯LMM而不是GLMM)。现在lmer给我以下错误: (函数(fr,FL,start,REML,verbose)中的错误:用于随机效应的分组因子的数量级必须小于观察值的数量 因此,我想我做的事情不明智,因为改变家庭不会产生影响。但是现在的问题是,为什么它首先起作用?

2
时间序列与回归之间的关系和差异?
时间序列和回归之间的关系和区别是什么? 对于模型和假设,回归模型假设输入变量的不同值在输出变量之间具有独立性,而时间序列模型不是,这是否正确?还有什么其他区别? 有关方法,请访问达灵顿网站 时间序列分析有多种方法,但是最著名的两种方法是回归方法和Box-Jenkins(1976)或ARIMA(自回归综合移动平均)方法。本文档介绍了回归方法。我认为回归方法远远优于ARIMA,主要有以下三个原因 我不太了解网站上的时间序列“回归方法”是什么,它与Box-Jenkins或ARIMA方法有何不同。我很高兴有人可以对这些问题发表一些见解。 感谢致敬!

4
抽牌后我期望的数字,直到获得ace,2、3等
我在解决以下问题时遇到了一些麻烦。 您可以从标准的52张卡片组中抽牌,而无需替换,直到获得一张A。您从剩余的剩余数中提取,直到得到2。继续进行3.整个甲板用完后,您期望的剩余数字是多少? 让它自然 Ti=first position of card whose value is iTi=first position of card whose value is iT_i = \text{first position of card whose value is }i Ui=last position of card whose value is iUi=last position of card whose value is iU_i = \text{last position of card whose value is …

2
如何从日志空间中的离散(分类)分布中采样?
假设我有一个由向量定义的离散分布这样将以概率来绘制类别。然后,我发现分布中的某些值是如此之小,以至于淹没了我计算机的浮点数表示形式,因此,为了补偿,我在对数空间中进行了所有计算。现在我有一个日志空间向量。θ0,θ1,...,θNθ0,θ1,...,θN\theta_0, \theta_1, ..., \theta_N000θ0θ0\theta_0log(θ0),log(θ1),...,log(θN)log(θ0),log(θ1),...,log(θN)log(\theta_0), log(\theta_1), ..., log(\theta_N) 是否可以从分布中采样,以使原始概率成立(类别是用概率绘制的),而又不会离开对数空间?换句话说,如何从该分布中采样而不会出现下溢?iiiθiθi\theta_i

2
在2D中集成内核密度估计器
我来自这个问题,以防有人要跟踪。 基本上,我有一个由对象组成的数据集,其中每个对象都具有给定数量的测量值(在这种情况下为两个):ΩΩ\OmegaNNN Ω=o1[x1,y1],o2[x2,y2],...,oN[xN,yN]Ω=o1[x1,y1],o2[x2,y2],...,oN[xN,yN]\Omega = o_1[x_1, y_1], o_2[x_2, y_2], ..., o_N[x_N, y_N] 我需要一种确定新对象属于的概率的方法,因此建议我通过内核密度估计器获得概率密度,我相信我已经有。p[xp,yp]p[xp,yp]p[x_p, y_p]˚FΩΩ\Omegaf^f^\hat{f} 由于我的目标是获得这个新对象的概率(属于这个二维数据集),有人告诉我到PDF集成在“ 为其支持的值密度小于您观察到的密度 ”。在新对象评估“观察”密度,即:。所以我需要求解方程:Ω ˚F ˚F p ˚F(X p,ÿ p)p[xp,yp]p[xp,yp]p[x_p, y_p]ΩΩ\Omegaf^f^\hat{f}f^f^\hat{f}pppf^(xp,yp)f^(xp,yp)\hat{f}(x_p, y_p) ∬x,y:f^(x,y)&lt;f^(xp,yp)f^(x,y)dxdy∬x,y:f^(x,y)&lt;f^(xp,yp)f^(x,y)dxdy\iint_{x, y:\hat{f}(x, y) < \hat{f}(x_p, y_p)} \hat{f}(x,y)\,dx\,dy 我的2D数据集的PDF(通过python的stats.gaussian_kde模块获得)如下所示: 红点代表新对象绘制在我的数据集的PDF上。p[xp,yp]p[xp,yp]p[x_p, y_p] 所以问题是:当pdf看起来像这样时,如何计算极限的上述积分?x,y:f^(x,y)&lt;f^(xp,yp)x,y:f^(x,y)&lt;f^(xp,yp)x, y:\hat{f}(x, y) < \hat{f}(x_p, y_p) 加 我进行了一些测试,以查看我在评论之一中提到的蒙特卡洛方法的效果。这是我得到的: 对于较低密度的区域,该值似乎会有更多变化,两个带宽或多或少都显示出相同的变化。比较Silverman的2500和1000样本值时,表中最大的变化发生在点(x,y)=(2.4,1.5)处,其差值为0.0126或~1.3%。就我而言,这在很大程度上是可以接受的。 编辑:我只是注意到,根据此处给出的定义,在二维中Scott的规则等效于Silverman的规则。

3
固定效果何时真正固定?
考虑以下类型的线性不可观察效应模型: 其中,是不可观察但时不变的特征,是误差,和分别索引个人观察和时间。固定效应(FE)回归中的典型方法是通过单个假人(LSDV)/去义或通过首次求差来消除。 Ç ë 我吨Ç 我ÿ我Ť= X我Ťβ+ c一世+ e我Ťyit=Xitβ+ci+eity_{it} = X_{it}\beta + c_{i} + e_{it}CccËee一世iiŤttC一世cic_{i} 我一直想知道的是:何时真正被“修复”?C一世cic_{i} 这可能是一个琐碎的问题,但由于其背后的原因,让我举两个例子。 假设我们采访的人今天并要求她的收入,重量等,所以我们得到我们的。在接下来的10天里,我们去找那个人并且每天再次与她面谈,因此我们有关于她的面板数据。我们是否应将这10天未观察到的特征视为固定的,以确保它们将来会在其他某个时候发生变化?在10天之内,她的个人能力可能不会改变,但是随着年龄的增长,这种能力就会改变。或以一种更极端的方式问:如果我每天在10个小时内每小时采访一次此人,那么她的“未察觉”特征很可能会在“样本”中得到固定,但这有什么用呢?XXX 现在,假设我们从一个人的生命开始到生命终结,每个月都要进行约85年的采访。这段时间将保持什么固定状态?出生地,性别和眼睛颜色最有可能,但除此之外,我几乎没有别的想法。但更重要的是:如果某项特征在她的生活中的某个时刻发生了变化,但变化却无限小,该怎么办?然后,它不再是固定的效果,因为在实践中,此特性是准固定的,它已经改变了。 从统计角度来看,什么是固定效果是相对清楚的,但是从直觉角度来看,这是我很难理解的。也许其他人以前有过这些想法,并提出了关于何时固定效应确实是固定效应的争论。我非常感谢您对此主题的其他想法。

1
时间序列数据的实时归一化算法?
我正在研究一种算法,该算法将从多个传感器流中获取最新数据点的向量,并将欧几里德距离与以前的向量进行比较。问题在于,不同的数据流来自完全不同的传感器,因此采用简单的欧几里德距离将大大过分强调某些值。显然,我需要某种方式来规范化数据。但是,由于该算法是设计为实时运行的,因此在规范化过程中,我无法整体使用有关任何数据流的任何信息。到目前为止,我一直在跟踪每个传感器在启动阶段看到的最大值(前500个数据向量),然后将来自该传感器的所有将来数据除以该值。这工作出奇地好,但是感觉很不雅致。 我并没有为找到一个预先存在的算法而感到幸运,但是也许我只是没有在正确的地方寻找。有人知道吗?或有什么想法?我看到一个建议使用移动平均值(可能是由Wellford的算法计算得出的),但是如果我这样做了,那么相同值的多个读数将不会显示为相同,这似乎是一个很大的问题,除非我缺少一些东西。任何想法表示赞赏!谢谢!

1
测试某些对比:这是否确实是一个难题?
我将其发布到mathoverflow上,没有人回答: Scheffé的用于识别统计上显着差异的方法是众所周知的。甲对比度的装置中,我= 1 ,... ,- [R的ř种群是线性组合Σ ř 我= 1 c ^ 我μ 我其中Σ ř 我= 1 c ^ 我 = 0μ一世μi\mu_ii = 1 ,… ,ri=1,…,ri=1,\ldots,r[Rrr∑[R我= 1C一世μ一世∑i=1rciμi\sum_{i=1}^r c_i \mu_i∑[R我= 1C一世= 0∑i=1rci=0\sum_{i=1}^r c_i=0,并且对比度的标量倍数本质上是相同的对比度,因此可以说这组对比度是一个投影空间。Scheffé的方法测试了一个零假设,该假设表示这r个总体之间的所有对比均为0,并且在给定显着性水平α的情况下,假设零假设为真,则以概率α拒绝该零假设。而且,如果否定原假设被拒绝,Scheffé指出,他的测试告诉我们哪些对比与0明显不同(我不确定我链接到的Wikipedia文章指出了这一点)。[Rrr000αα\alphaαα\alpha000 我想知道在不同情况下是否可以做类似的事情。考虑一个简单的线性回归模型,其中ε 我〜我。我。d 。ÿ一世= α + βX一世+ ε一世Yi=α+βxi+εiY_i = \alpha + \beta x_i + \varepsilon_i,我= 1 ,... ,Ñ。ε一世〜我。我。d 。ñ(0 ,σ2)εi∼i.i.d.⁡N(0,σ2)\varepsilon_i\sim\operatorname{i.i.d.}N(0,\sigma^2)i=1,…,ni=1,…,ni=1,\ldots,n …

1
使用pymc进行贝叶斯网络推断(初学者的困惑)
我目前正在Daphne Koller在Coursera上参加PGM课程。这样,我们通常将贝叶斯网络建模为变量的因果关系图,这些变量是观察数据的一部分。但是在PyMC教程和示例中,我通常看到它的建模方式与PGM或至少我感到困惑。在PyMC中,任何观察到的真实世界变量的父母通常都是您用来对变量建模的分布参数。 现在我的问题确实是一个实际的问题。假设我有3个变量用于观察数据(A,B,C)(仅出于此目的,假设它们都是连续变量)。从某些领域的知识来看,可以说A和B导致C。因此,我们在这里有一个BN-A,B是父母,C是孩子。现在从BN方程P(A,B,C)= P(C | A,B)* P(A)* P(B) 我可以说A和B是一些具有一定mu和sigma的正态分布,但是如何建模P(C | A,B)?我想学习的一般想法是如何使用PyMC学习此BN,以便可以查询BN。还是我必须以某种方式用模型的参数来增加BN。 使用pymc可以解决此问题吗?还是我的基本原理有误? 任何帮助,将不胜感激!

2
可以仅根据相关系数和样本数量来计算Pearson相关检验的p值吗?
背景:我读过一篇文章,作者从878样本中报告了Pearson相关系数0.754。相关检验的p值显着为“两颗星”(即p &lt;0.01)。但是,我认为在如此大的样本量下,相应的p值应小于0.001(即三颗星)。 可以仅根据皮尔逊相关系数和样本量来计算该检验的p值吗? 如果是,该如何在R中完成?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.