统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
相同时刻的分布是否相同
以下内容与此处和此处的以前的帖子类似,但有所不同 给定两个允许所有阶次矩的分布,如果两个分布的所有矩都相同,那么它们是否是相同的分布ae? 给定两个分配矩生成函数的分布,如果它们具有相同的矩,它们的矩生成函数是否相同?


4
累积危害函数的直觉(生存分析)
我试图对精算科学的每个主要功能(特别是对于Cox比例危害模型)有所了解。这是我到目前为止的内容: f(x)f(x)f(x):从开始的时间开始,到您死亡的概率分布。 F(x)F(x)F(x):仅累积分布。在时间TTT,将有百分之几的人口死亡? S(x)S(x)S(x):1−F(x)1−F(x)1-F(x)。在时间TTT,人口中还活着的百分比是多少? h(x)h(x)h(x):危险函数。在给定的时间TTT,仍然活着的人中,这可以用来估计在下一个时间间隔内将有多少人死亡,或者如果时间间隔-> 0,则是“瞬时”死亡概率。 H(x)H(x)H(x):累积危害。不知道。 组合危险值(尤其是连续危险值)的背后是什么想法?如果我们使用一个离散的例子来说明四个季节的死亡率,那么危害函数如下: 从春季开始,每个人都还活着,有20%会死亡 现在在夏天,剩下的人中有50%会死 现在在秋天,剩下的人中有75%将死 最后的季节是冬天。在剩下的人中,有100%将死 那么累积危害是20%,70%,145%,245%?这是什么意思,为什么有用?

8
对于好的本科统计入门书有什么建议吗?
我希望你能给我一些建议。我在一所非常多样化的大学(由少数群体组成)中任教,而学生大多是心理学专业。大多数学生都是刚从高中毕业的学生,​​但其中一些是年龄较大的40岁以上的回国学生。大多数学生都存在动机问题和对数学的反感。但是我仍在寻找一本涵盖基本课程的书:从描述性到ANOVA一直到实验方法范围内的采样,测试和测试。该部门要求我在课堂上使用SPSS,但我喜欢在Excel等电子表格中进行分析的想法。 ps其他老师使用一本我不喜欢的书,因为它广泛依赖于计算公式。我发现使用这些计算公式-而不是更直观,计算量更大的与合理和基本算法一致的公式-直观,不必要和令人困惑。这是我所引用的《行为科学统计学要旨》,第7版,纽约州立大学弗雷德里克·J·格雷夫特分校,布罗克波特Larry B. Wallnau纽约州立大学,布罗克波特ISBN-10:049581220X谢谢您的阅读!

3
针对截距/漂移和线性趋势建模的时间序列的哪个Dickey-Fuller测试?
精简版: 我有一个正在测试平稳性的时间序列气候数据。根据先前的研究,我希望数据的基础模型(或可以说是“生成”)具有截距项和正线性时间趋势。为了测试这些数据的平稳性,我是否应该使用包含截距和时间趋势(即等式#3)的Dickey-Fuller检验? ∇ ÿŤ= α0+ α1个t + δÿt − 1+ 你Ť∇ÿŤ=α0+α1个Ť+δÿŤ-1个+üŤ\nabla y_t = \alpha_0+\alpha_1t+\delta y_{t-1}+u_t 还是我应该使用仅包含截距的DF检验,因为我认为该模型所基于的方程的第一个差异只有截距? 长版: 如上所述,我有一个时间序列的气候数据正在测试平稳性。根据先前的研究,我希望数据基础模型具有拦截项,正线性时间趋势和一些正态分布的误差项。换句话说,我希望基础模型看起来像这样: ÿŤ= 一个0+ 一个1个t + βÿŤ− 1+ 你ŤÿŤ=一种0+一种1个Ť+βÿŤ-1个+üŤy_t = a_0 + a_1t + \beta y_{t-1} + u_t 其中üŤüŤu_t是正态分布。因为我假设基础模型具有截距和线性时间趋势,所以我使用简单的Dickey-Fuller检验的方程式#3测试了单位根,如下所示: ∇yt=α0+α1t+δyt−1+ut∇yt=α0+α1t+δyt−1+uŤ\nabla y_t = \alpha_0+\alpha_1t+\delta y_{t-1}+u_t 该测试返回了一个临界值,该临界值将导致我拒绝原假设,并得出基本模型非平稳的结论。但是,如果我正确运用这一点,因为即使我的问题底层模型假设有一个截距和时间趋势,这并不意味着第一个区别∇yt∇yt\nabla y_t的意志为好。相反,实际上,如果我的数学正确的话。 计算基于所述方程的第一差假定的主要模型给出: ∇yt=yt−yt−1=[a0+a1t+βyt−1+ut]−[a0+a1(t−1)+βyt−2+ut−1]∇yt=yt−yt−1=[a0+a1t+βÿŤ-1个+üŤ]-[一种0+一种1个(Ť-1个)+βÿŤ-2+üŤ-1个]\nabla y_t = y_t - y_{t-1} = …

2
如何在ggplot2中预测或扩展回归线?
我有一个包含两个时间序列的数据框:Emacs和Firefox发行版的日期和版本号。使用一个ggplot2命令,很容易制作一个使用黄土的图表(这种方式看起来有点可笑,我不介意)将点变成线。 我该如何将线延伸到未来?我想确定Emacs和Firefox版本号何时何地交叉,如果有办法显示错误范围,那就更好了。 鉴于ggplot2正在绘制线条,它必须有一个模型,但我看不出如何告诉它扩展线条,或取出模型并对其进行处理。 > library(ggplot2) > programs <- read.csv("http://www.miskatonic.org/files/se-program-versions.csv") > programs$Date <- as.Date(programs$Date, format="%B %d, %Y") > head(programs) Program Version Date 1 Emacs 24.1 2012-06-10 2 Emacs 23.4 2012-01-29 3 Emacs 23.3 2011-03-10 4 Emacs 23.2 2010-05-08 5 Emacs 23.1 2009-07-29 6 Emacs 22.3 2008-09-05 > head(subset(programs, Program == "Firefox")) …

2
我应该如何组织我的海报展示?
我目前正在制作海报演示文稿,并希望就图形的某些方面提供一些建议(或参考建议)。例如,我正在谈论的示例海报,请参阅《计算与图形统计杂志》第20卷第2期中的ASA Data Expo文章的补充材料(另一个示例在此处(Hendrix等人,2008年))。还要注意,如果重要的话,我将站在打印好的海报上,如果有路人要求,请提供一份有关该项目的更多详细信息的论文,该场地将是一次学术会议。 图形中应如何显示对象的流动。使用英语的人通常从左到右阅读,我的海报中的面板应该遵循相同的面板吗?例如(考虑序号,我打算阅读面板的顺序),表1的顺序是否总是比表2更好? Table 1: 1 2 3 Table 2: 1 3 5 4 5 6 2 4 6 单个图形应该多大/小?当人们停下来观看图形时,比如说他们仍然站在院子里(这是合理的假设吗?),图形元素仍可解释的最小尺寸大约是多少?我是否应该在乎(如果他们需要阅读图例/轴,他们会着眼睛)? 多少是太多了?提供的信息量是否有明显的限制?图形附带的文字也是如此。我可以告诉我图形中是否有太多文字?有什么经验法则吗? 我看到的许多海报都有不同大小的面板,并且没有明显的对齐方式。我个人不喜欢这样(它对我来说是无序的),但是我只是被诅咒吗?我订购当前海报的方式与我刚刚撰写论文的分析部分的方式类似,但是这种订购方式不适用于海报展示吗?作为有序部分的反例,可以有一个中央图形,在海报的中央放大,然后用较小的面板围绕中央图形,并附加其他补充信息。 如果人们有一些他们认为特别有效的海报示例(无论出于何种原因),并解释您为什么认为他们有效(或仅在美学上令人愉悦),我也将感兴趣。我也对正面情况感兴趣(例如,海报效果特别差)。 Nathan Yau在流动数据博客上进行数据可视化的许多工作似乎都与该讨论有关,但对于大多数讨论而言,媒体(一种物理印刷的海报)和观众(学术界)并不是常态。还有其他一些参考资料可以解决这些方面的问题吗?我目前更担心解释而不是“吸引人的眼球”(我认为随着注意力的增强,许多明亮的图形就足够了)。 另外,我会对这些问题的答案感兴趣(例如,您不必花时间回答所有问题)。我全是耳朵。

1
使用潜在Dirichlet分配的主题预测
我在一组文档上使用了LDA,并发现了一些主题。我的代码的输出是两个包含概率的矩阵。一个doc-topic概率,另一个word-topic概率。但是我实际上不知道如何使用这些结果来预测新文档的主题。我正在使用Gibbs采样。有人知道吗?谢谢

1
促进和袋装树木(XGBoost,LightGBM)
有很多关于袋装 或 助树的想法的博客文章,YouTube视频等。我的一般理解是,每个的伪代码为: 套袋: 取N个随机样本,占样本的x%和特征的y% 在每个N上拟合您的模型(例如决策树) 预测每个N 对预测取平均以得出最终预测 提升: 使模型(例如决策树)适合您的数据 获取残差 使模型适合残差 进行2次N轮助推 最终预测是顺序预测变量的加权和。 我将对上面的理解进行任何澄清,但是我想要的问题如下: XGBoost和LightGBM都具有允许打包的参数。该应用程序不是Bagging OR Boosting(每篇博客文章都在谈论),而是Bagging AND Boosting。在何时何地进行装袋和装袋的伪代码是什么? 我以为它是“袋装升压树”,但似乎是“升压袋装树”。差异似乎很大。 袋装助推树: 取N个随机样本,占样本的x%和特征的y% 在N个样本中的每个样本上拟合Boosted树 预测每个N 对预测取平均以得出最终预测 这似乎是最好的方法。毕竟,增加压力的风险是过度安装,装袋的主要好处是减少过度安装;打包一堆增强模型似乎是个好主意。 但是,通过浏览(例如,scikit-learn gradient_boosting.py(用于示例装袋,但不选择随机特征)),并在有关LightGBM和XGBoost的帖子中整理一些小块,看起来XGBoost和LightGBM的工作方式如下: 增强袋装树: 使决策树适合您的数据 对于我在N轮助推中: 获取残差 如果我mod bag_frequency == 0(即每5轮装袋): 取一个随机样本,占样本的x%和特征的y%;继续使用此随机样本 使树适合残差 最终预测是顺序预测变量的加权和。 请在这里更正我的理解并填写详细信息。Boosted Bagged树(每个bag_frequency仅包含1个随机树)似乎不如Bagged Boosted Tree强大。

2
虚拟变量的功能重要性
我试图了解如何获得已分解为虚拟变量的分类变量的功能重要性。我正在使用scikit-learn,它不像R或h2o那样为您处理分类变量。 如果将分类变量分解为虚拟变量,则该变量中每个类的功能重要性都不同。 我的问题是,将这些虚拟变量的重要性通过简单地求和重新组合为分类变量的重要性值是否有意义? 从《统计学习的要素》第368页开始: 变量的平方相对重要性XℓXℓX_{ℓ}是在所有的内部节点,例如平方改进它为之选择作为分割变量的总和 这使我认为,由于重要性值已经通过在每个节点上选择一个变量的总和来创建,因此我应该能够组合虚拟变量的变量重要性值以“恢复”分类变量的重要性。当然,我不希望它是完全正确的,但是无论如何这些值实际上都是准确的值,因为它们是通过随机过程找到的。 我已经编写了以下python代码(以jupyter格式)作为调查: import numpy as np import pandas as pd import matplotlib.pyplot as plt from matplotlib import animation, rc from sklearn.datasets import load_diabetes from sklearn.ensemble import RandomForestClassifier import re #%matplotlib inline from IPython.display import HTML from IPython.display import set_matplotlib_formats plt.rcParams['figure.autolayout'] = False plt.rcParams['figure.figsize'] = 10, …

5
“样本内”和“样本外”预测之间有何区别?
我不了解“样本内”和“样本外”预测的确切区别是什么?样本内预测利用可用数据的子集来预测估计周期以外的值。样本超出预测将使用所有可用数据, 这些正确吗? 具体来说,以下定义正确吗? 样本内预测利用可用数据的子集来预测估计周期以外的值,并将它们与相应的已知或实际结果进行比较。这样做是为了评估模型预测已知值的能力。例如,1980年至2015年的样本内预测可能会使用1980年至2012年的数据来估计模型。然后,使用此模型,预测员将预测2013-2015年的值,并将预测值与实际已知值进行比较。反之,样本外预测将使用样本中的所有可用数据来估计模型。对于前面的示例,估计将在1980-2015年进行,而预测将在2016年开始。

2
如何使用具有随机效应的有序逻辑回归?
在我的研究中,我将使用几种指标来衡量工作量。具有心率变异性(HRV),皮肤电活动(EDA)和主观量表(IWS)。标准化后,IWS具有三个值: 工作量低于正常水平 平均工作量 工作量高于正常水平。 我想看看生理指标可以很好地预测主观工作量。 因此,我想使用比率数据来预测序数值。根据:如何在R中同时使用数字/分类值进行有序逻辑回归分析?使用此MASS:polr功能很容易做到。 但是,我也想考虑随机效应,例如受试者之间的差异,性别,吸烟等。在本教程中,我看不到如何向添加随机效应MASS:polr。替代地lme4:glmer,然后将是一种选择,但是该功能仅允许预测二进制数据。 是否可以向序数逻辑回归添加随机效应?

2
了解R中的Kolmogorov-Smirnov检验
我正在尝试了解Kolmogorov-Smirnov测试函数的输出(两个样本,两个侧面)。这是一个简单的测试。 x <- c(1,2,2,3,3,3,3,4,5,6) y <- c(2,3,4,5,5,6,6,6,6,7) z <- c(12,13,14,15,15,16,16,16,16,17) ks.test(x,y) # Two-sample Kolmogorov-Smirnov test # #data: x and y #D = 0.5, p-value = 0.1641 #alternative hypothesis: two-sided # #Warning message: #In ks.test(x, y) : cannot compute exact p-value with ties ks.test(x,z) #Two-sample Kolmogorov-Smirnov test #data: x and z …

2
使用梯度增强进行分类:如何将预测保持在[0,1]
问题 我在努力了解预测是如何保持在内[0,1][0,1][0,1]的时间间隔与梯度推进做二元分类时。 假设我们正在研究二进制分类问题,我们的目标函数是对数损失,其中是的目标变量而是我们当前的模型。−∑yilog(Hm(xi))+(1−yi)log(1−Hm(xi))−∑yilog⁡(Hm(xi))+(1−yi)log⁡(1−Hm(xi))-\sum y_i \log(H_m(x_i)) + (1-y_i) \log(1-H_m(x_i))yyy∈{0,1}∈{0,1}\in \{0,1\}HHH 当训练下一个弱学习者,使我们的新模型为,应该使的机制是什么?或者,也许是一个更相关的问题,是否存在这样的机制?hihih_iHi=Hi−1+hiHi=Hi−1+hiH_i = H_{i-1} + h_iHi∈[0,1]Hi∈[0,1]H_i \in [0,1] 有关我在做什么的更多信息 我正在尝试使用回归树来实现梯度增强。我要避免的是将乘以因子,这样不会小于零或大于零一,然后在该范围内选择以使损失函数最小。hihih_ic∈[0,cmax]c∈[0,cmax]c \in [0,c_{\text{max}}]H+cmaxhH+cmaxhH + c_{\text{max}}hccc 这带来了以下问题:经过几轮后,我得到了一个已完全分类的点,并且可用于沿梯度方向推动分类器的最佳拆分希望将这一点推动至一个以上,我确保不会发生这种情况设置。因此,所有下一次迭代将选择相同的拆分和相同的。c=0c=0c = 0c=0c=0c = 0 我尝试了常见的正则化做法 乘以降低学习率由。这只会延迟问题。μ = 0.01cccμ=0.01μ=0.01\mu = 0.01 对特征空间进行二次采样,但是有些点很容易分类,它们几乎标记了“这是肯定的吗?”中的每个框。形式,几乎每个“良好的分裂”都显示了此行为。 我认为这不是参数问题,应该有更合理的方法来解决此问题。我并没有放弃实现被破坏的可能性,但是我没有找到解决此问题的方法。 在逻辑损失的背景下,我们所要操纵的应该是一个概率,那么我们如何避免它呢? 我的直觉是把我们构建模型,,在S形函数,使得它为界,[ 0 ,1 ],我想这会的工作,但我想知道是否有其他的解决方案。由于在分类任务中似乎成功使用了梯度增强,因此应该存在一个“正确的”(即有正当理由)解决方案。HHH[0,1][0,1][0,1]

1
如何从R中的密度函数查找/估计概率密度函数
假设我有一个X未知分布的变量。在Mathematica中,通过使用SmoothKernelDensity函数,我们可以得到一个估计的密度函数。该估计的密度函数可以与PDF函数一起用于计算某个值的概率密度函数,例如X以PDF[density,X]“密度”为的形式表示SmoothKernelDensity。如果R中具有这样的功能,那将是很好的。这就是Mathematica中的工作方式 http://reference.wolfram.com/mathematica/ref/SmoothKernelDistribution.html 作为一个示例(基于Mathematica函数): data = RandomVariate[NormalDistribution[], 100]; #generates 100 values from N(0,1) density= SmoothKernelDistribution[data]; #estimated density PDF[density, 2.345] returns 0.0588784 在这里您可以找到有关PDF的更多信息: http://reference.wolfram.com/mathematica/ref/PDF.html 我知道我可以density(X)在R中使用它绘制密度函数,并通过使用ecdf(X)它可以获得经验累积分布函数。基于我对Mathematica的描述,是否有可能在R中做同样的事情? 任何帮助和想法表示赞赏。
17 r  pdf  cdf 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.