统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
在原假设下,确定系数期望值
我对本文第一页底部 关于调整的声明感到好奇R2adjustedRadjusted2R^2_\mathrm{adjusted} R2adjusted=1−(1−R2)(n−1n−m−1).Radjusted2=1−(1−R2)(n−1n−m−1).R^2_\mathrm{adjusted} =1-(1-R^2)\left({\frac{n-1}{n-m-1}}\right). 文本指出: 调整的逻辑如下:在普通多元回归中,随机预测变量平均解释响应变化的比例1/(n–1)1/(n–1)1/(n – 1),因此mmm随机预测变量平均一起解释m/(n–1)m/(n–1)m/(n – 1)响应的变化;换句话说,R ^ 2的期望值R2R2R^2为E(R2)=m/(n–1)E(R2)=m/(n–1)\mathbb{E}(R^2) = m/(n – 1)。将[ R2adjustedRadjusted2R^2_\mathrm{adjusted} ]公式应用于该值(所有预测变量都是随机的),得出R2adjusted=0Radjusted2=0R^2_\mathrm{adjusted} = 0。” 对于R ^ 2_ \ mathrm {adjusted},这似乎是一个非常简单且可解释的动机R2adjustedRadjusted2R^2_\mathrm{adjusted}。但是,对于单个随机(即不相关)的预测变量,我无法得出E(R2)=1/(n–1)E(R2)=1/(n–1)\mathbb{E}(R^2)=1/(n – 1))的值。 有人可以在这里指出正确的方向吗?

2
高斯过程的导数
我相信高斯过程(GP)的导数是另一个GP,因此我想知道GP的导数的预测方程式是否存在闭式方程式?特别是,我正在使用平方指数(也称为高斯)协方差核,想了解有关对高斯过程的导数进行预测的信息。


2
在校准概率模型时如何选择最佳箱宽?
背景:这里有一些很棒的问题/答案,如何校准可预测结果发生概率的模型。例如 Brier分数,并将其分解为分辨率,不确定性和可靠性。 标定图和等渗回归。 这些方法通常需要对预测的概率使用分箱方法,以便通过取平均结果在分箱上使结果(0,1)的行为平滑。 问题: 但是,我找不到任何有关如何选择纸槽宽度的信息。 问题:如何选择最佳纸槽宽度? 尝试:正在使用的两种常见的料箱宽度似乎是: 等宽合并,例如10个合并,每个合并覆盖间隔[0,1]的10%。 Tukey的分箱方法在这里讨论。 但是,如果有兴趣在预测概率最不正确的区间中找到间隔,那么这些垃圾箱的选择是否是最佳选择?

1
泊松与拟泊松模型中估计的相同系数
在保险环境中建模索赔计数数据时,我从泊松开始,但后来发现分散过度。准泊松比基本泊松更好地模拟了更大的均方差关系,但我注意到泊松模型和准泊松模型中的系数相同。 如果这不是错误,为什么会这样?与Poisson相比,使用Quasi-Poisson有什么好处? 注意事项: 基本损失是过大的(我认为)使Tweedie无法正常工作-但这是我尝试的第一个发行版。我还检查了NB,ZIP,ZINB和Hurdle模型,但仍然发现准泊松提供了最佳拟合。 我通过AER封装中的分散测试对过分散进行了测试。我的色散参数约为8.4,p值为10 ^ -16。 我正在将glm()与family = poisson或quasipoisson一起使用,并使用代码的日志链接。 当运行Poisson代码时,出现“ In dpois(y,mu,log = TRUE):非整数x = ...”的警告。 每个Ben指导的有用SE线程: 泊松回归中偏移的基本数学 偏移量对系数的影响 使用曝光作为协变量与偏移量之间的区别

4
认为问题非常适合线性回归
我正在使用Montgomery,Peck和Vining的《线性回归分析简介》学习线性回归。我想选择一个数据分析项目。 我天真地认为,仅当人们怀疑解释变量和响应变量之间存在线性函数关系时,线性回归才合适。但是,现实世界中似乎没有多少应用程序可以满足此标准。然而线性回归如此普遍。 经验丰富的统计学家会在考虑项目的哪些方面,如果它们适合我,那么他们会寻找非常适合线性回归的问题和数据。

1
t检验的“近似正常”评估
我正在使用Welch的t检验来测试均值。底层分布远非正常分布(比此处相关讨论的示例更偏斜)。我可以获取更多数据,但希望有一些原则性的方法来确定在多大程度上可以这样做。 是否有一个很好的试探法可以评估样本分布是否可以接受?与正常性的哪些偏差最令人担忧? 是否还有其他方法(例如,对样本统计数据依赖引导置信区间)会更有意义?

1
Python中的顺序逻辑回归
我想在Python中运行顺序逻辑回归-对于具有三个级别并具有一些解释性因素的响应变量。该statsmodels软件包支持二进制logit和多项式logit(MNLogit)模型,但不支持有序logit。由于基础数学没有太大不同,我想知道是否可以使用这些方法轻松实现?(或者,其他可以使用的Python软件包也受到赞赏。)


1
Logistic回归中的拟合优度检验;我们要测试哪个“合适”?
我指的是这个问题及其答案:如何比较通过Logistic回归开发的模型的(概率)预测能力?@Clark Chong发表,@ Frank Harrell回答/评论。并在Hosmer-Lemeshow测试和评论中质疑的自由度χ2χ2\chi^2。 我已经阅读了DW Hosmer,T. Hosmer,S. Le Cessie,S. Lemeshow的论文,“ Logistic回归模型的拟合优度检验比较”,《医学统计》,第1卷。16,965-980(1997)。 阅读后,我感到困惑,因为我提到的问题明确要求“(概率)预测能力”,我认为这与上述论文的拟合优度检验旨在: 如我们大多数人所知,逻辑回归假设解释变量和成功概率之间呈S形联系,S形的函数形式为 P(y=1|xi)=11+e−(β0+∑iβixi)P(y=1|xi)=11+e−(β0+∑iβixi)P(y=1|_{x_i})=\frac{1}{1+e^{-(\beta_0+\sum_i \beta_i x_i)}} 在不假装Hosmer-Lemeshow检验没有缺点的情况下,我认为我们必须区分(a)“(概率)预测能力 ”和(b)“ 拟合优度 ”的检验。 前者的目标是检验概率是否得到了很好的预测,而拟合优度检验则检验了上面的S形函数是否为“正确”函数。更正式地: “概率预测能力测试”的检验具有,表明模型很好地预测了成功概率;H0H0H_0 而对于拟合优度测试,(参见Hosmer等人)认为上述S形功能形式是正确的。Hosmer等。进行仿真,在仿真中他们发现有能力检测到两种与零值的偏差,即链接函数错误或分母中的指数不是线性的。H0H0H_0 显然,如果上述函数具有“正确”的函数形式(因此,如果测试得出结论,我们可以接受作为拟合优度检验),则预测的概率将很好,...H0H0H_0 第一句话 ...但是,接受的结论很微弱,如我们未能否定原假设时该怎么办?。H0H0H_0 第一个问题 我最重要的问题/评论是,如果拟合优度被拒绝,则测试的结论是功能形式不是“正确的”形式,但是,这暗示着概率是预测不好?H0H0H_0 第二个问题 此外,我想指出Hosmer等人的结论。al; (我从摘要中引用): ``当正确的模型具有二次项但仅包含线性项的模型已拟合时,对测试性能的检查表明,皮尔逊卡方,未加权平方和,Hosmer-Lemeshow十分位数风险,平滑的残差平方和和Stukel得分测试,当样本量为100时,具有超过50%的功效来检测线性的适度偏离,对于大小为500的样本,这些相同替代品的功效为90%以上当正确的模型具有二分和连续协变量之间的相互作用,但只有连续协变量模型适合时,所有检验均无功效。对于大小为100的样本,检测到错误指定链接的能力很差。对于大小为500的样本,Stukel' s得分测试的功效最佳,但检测不对称链接功能的结果仅超过50%。未加权平方和检验用于检测指定不正确的链接函数的能力比Stukel的分数检验要小'' 我可以由此得出结论,哪个测试具有更大的功效,或者说Hosmer–Lemeshow的功效更低(检测这些特定异常)? 第二句话 Hosmer等人的论文。等 我在上文中提到过,计算(模拟)检测特定异常的功率(仅在指定情况下才能计算功率)。我认为这并不意味着可以将这些结果推广到“所有可能的替代方案 ”?H1H1H_1H1H1H_1

2
在使用截断的反向传播时捕获初始模式(RNN / LSTM)
假设我使用RNN / LSTM进行情感分析,这是一种多对一的方法(请参阅此博客)。通过截断时间反向传播(BPTT)对网络进行训练,在该网络中,像往常一样仅在最后30个步骤中展开网络。 就我而言,我要分类的每个文本节都比展开的30个步骤(〜100个单词)长得多。根据我的知识,BPTT仅对单个文本部分运行一次,这是当BPTT遍历整个文本部分并计算了二进制分类目标,它将与损失函数进行比较以发现错误。yyy 这样就永远不会针对每个文本部分的第一个单词计算梯度。然后,RNN / LSTM如何仍然调整其权重以捕获仅在前几个单词内出现的特定模式?例如,假设所有标记为句子均以“我爱这个” 开头,所有标记为句子均以“我讨厌这个”开头。当RNN / LSTM到达100步长序列的末尾时,它仅在最后30步才展开时,将如何捕获呢?positivepositivepositivenegativenegativenegative

2
将机器学习问题转化为回归框架
假设我有一组解释变量,其中,,还有二进制结果相关变量的向量。因此,仅在最后时间观察到,而在任何更早的时间观察不到完全一般的情况下是有多个为为每个单元在每个时间,但让我们集中在壳体为简洁。 i = 1 。。。N t =1 。。。T Y i T Y T X i j t j = 1 ... K i t K = 1XitXitX_{it}i=1...Ni=1...Ni = 1 ... Nt=1...Tt=1...Tt = 1 ... TYiTYiTY_{iT}YYYTTTXijtXijtX_{ijt}j=1...Kj=1...Kj=1...KiiitttK=1K=1K=1 具有时间相关的解释变量的“不平衡”对的应用例如(每日股票价格,季度股息),(每日天气报告,年度飓风)或(每次移动后的棋盘位置特征,赢/输结果)游戏结束)。(X,Y)(X,Y)(X, Y) 我对(可能非线性)回归系数做预测的,知道在训练数据中,给定的早期观察为它会导致最终结果βtβt\beta_t X 我吨吨&lt; Ť ÿ 我ŤYitYitY_{it}XitXitX_{it}t&lt;Tt&lt;Tt < TYiTYiTY_{iT} Y^it=f(∑tk=1Xikβk),t=1...TY^it=f(∑k=1tXikβk),t=1...T\hat{Y}_{it} = f(\sum_{k=1}^{t} X_{ik} \beta_k), …

3
通过逻辑回归生成比值比置信区间的不同方法
我正在研究如何根据逻辑回归中获得的系数为比值比构建95%的置信区间。因此,考虑逻辑回归模型, log(p1−p)=α+βxlog⁡(p1−p)=α+βx \log\left(\frac{p}{1 - p}\right) = \alpha + \beta x \newcommand{\var}{\rm Var} \newcommand{\se}{\rm SE} 这样,对于对照组,x=0x=0x = 0,对于病例组,x=1x=1x = 1。 我已经读过,最简单的方法是为\ beta构造95%CI,ββ\beta然后我们应用指数函数,即 β^±1.96×SE(β^)→exp{β^±1.96×SE(β^)}β^±1.96×SE(β^)→exp⁡{β^±1.96×SE(β^)} \hat{\beta} \pm 1.96\times \se(\hat{\beta}) \rightarrow \exp\{\hat{\beta} \pm 1.96\times \se(\hat{\beta})\} 我的问题是: 证明该程序合理的理论原因是什么?我知道odds ratio=exp{β}odds ratio=exp⁡{β}\mbox{odds ratio} = \exp\{\beta\}并且最大似然估计是不变的。但是,我不知道这些元素之间的联系。 增量法是否应该产生与先前步骤相同的95%置信区间?使用增量法 exp{β^}∼˙N(β, exp{β}2Var(β^))exp⁡{β^}∼˙N(β, exp⁡{β}2Var(β^))\exp\{\hat{\beta}\} \dot{\sim} N(\beta,\ \exp\{\beta\}^2 \var(\hat{\beta})) 然后, exp{β^}±1.96×exp{β}2Var(β^)−−−−−−−−−−−−√exp⁡{β^}±1.96×exp⁡{β}2Var(β^)\exp\{\hat{\beta}\} \pm 1.96\times …

3
我可以使用哪种算法查找事件之间的相关性?
我是机器学习的新手,因此我正在尝试查找一些文献,但是我什至不确定要做什么。我的数据具有以下形式: User A performs Action P User B performs Action Q User C performs Action R ... User C performs Action X User A performs Action Y User B performs Action Z ... 每个动作具有某些特征(日期,时间,客户等)的地方。大约有300个用户,我们有大约20,000个操作。 问题: 我想找出用户操作之间是否存在因果关系。例如,“每次用户E执行动作T,两天后用户G执行动作V”。但是在这两者之间,可能会有许多其他用户执行许多其他操作,并且可能找不到关联。有些用户可能是相关的,而其他用户则是完全独立的。这是机器学习能够为我找到的东西吗?是否有特定的算法或一组算法可以帮助我? 我一直在阅读关联分析和Apriori算法,但我认为这不能满足我的需要,因为它似乎需要已知的,定界的数据集作为输入,而我似乎只有一堆看似随机的用户动作。关于看什么的任何建议将不胜感激!

5
自动化机器学习是一个梦想吗?
当我发现机器学习时,我看到了不同的有趣技术,例如: 使用以下技术自动调整算法grid search: 打通的相同的“类型”的不同算法的组合更准确的结果,那就是boosting, 通过对不同算法的组合得到更准确的结果(但不是同一个类型的算法),这就是stacking, 可能还有更多我仍要发现... 我的问题是:所有这些部分。但是,是否有可能将它们组合在一起,以形成一种算法,该算法通过充分利用所有技术中的优势来将输入的清洁数据作为输入并输出良好的结果?(当然,专业数据科学家的工作效率可能会降低,但他会比我更好!)如果是,您是否有示例代码,或者您知道可以做到这一点的框架吗? 编辑:经过一些答案后,似乎必须进行一些缩小。让我们举个例子,我们有一列包含分类数据,我们称之为它,y并且我们希望从X虚拟数据或实际数值数据(高度,温度)的数值数据进行预测。我们假设以前已经清洁过。是否存在可以获取此类数据并输出预测的现有算法?(通过测试多种算法,对其进行调整,增强等),如果是,它的计算效率是否很高(如果与正常算法进行比较,是否可以在合理的时间内完成计算),您是否有代码示例?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.