统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
Logistic分位数回归–如何最好地传达结果
在上一篇文章中,我想知道如何处理EQ-5D分数。最近,我偶然发现了由Bottai和McKeown建议的逻辑分位数回归,该回归引入了一种处理有限结果的优雅方法。公式很简单: 升Ò 克我吨(ÿ)= 升Ô 克(y- ÿ中号我Ñÿ中号一个X- ÿ)logit(y)=log(y−yminymax−y)logit(y)=log(\frac{y-y_{min}}{y_{max}-y}) 为避免log(0)和被0除,可以将范围扩展一个小值。这提供了尊重分数边界的环境。ϵϵ\epsilon 问题在于,任何都将处于对数刻度,除非转换回常规刻度才有意义,但这意味着将是非线性的。出于图形目的,这并不重要,但如果使用更多:s,则将非常不便。β βββ\betaββ\betaββ\beta 我的问题: 您如何建议在不报告整个跨度的情况下报告logit?ββ\beta 实施实例 为了测试实现,我基于此基本功能编写了一个仿真: Ò ù 吨Ç ø 米Ë = β0+ β1个* x t e s t3+ β2* 小号Ë Xoutcome=β0+β1∗xtest3+β2∗sexoutcome=\beta_0+\beta_1* xtest^3+\beta_2*sex 其中,和。由于分数是有上限的,因此我将大于4的任何结果值和小于-1的任何结果值设置为最大值。β 1 = 0.5 β 2 = 1β0= 0β0=0\beta_0 = 0β1个= 0.5β1=0.5\beta_1 = 0.5β2= 1β2=1\beta_2 = 1 模拟数据 set.seed(10) …

2
关联音量时间序列
考虑下图: 红线(左轴)描述了某只股票的交易量。蓝线(右轴)描述了该股票的推特消息量。例如,在5月9日(05-09),进行了约110万笔交易和4.000条推文。 我想计算出时间序列之间是否存在相关性,无论是在同一天还是滞后-例如:推特交易量与一天后的交易量相关。我正在阅读许多进行过此类分析的文章,例如将财务时间序列与微博客活动相关联,但它们并未描述如何实际进行这种分析。文章中说明了以下内容: 但是,我很少有统计分析方面的经验,并且不知道如何在已有的系列文章中执行此操作。我使用SPSS(也称为PASW),我的问题是:从上面的图像基于数据文件的角度出发,要进行这样的分析需要采取哪些步骤?这样的测试是否是默认功能(称为“默认功能”)和/或我还可以执行它吗? 任何帮助将不胜感激 :-)

2
虚假相关的期望值
我们独立于正态分布绘制NNN样本,每个样本的大小为。(μ ,σ 2)nnn(μ,σ2)(μ,σ2)(\mu,\sigma^2) 然后,从样本中选择彼此具有最高(绝对)Pearson相关性的2个样本。NNN 这种相关性的期望值是多少? 谢谢[PS这不是作业]

1
根据数据估算分布
我有一个R由生成的数据样本rnorm(50,0,1),因此该数据显然呈正态分布。但是,R不“知道”有关数据的分布信息。 有没有一种方法R可以估算我的样本来自哪种分布?如果没有,我将使用该shapiro.test功能并继续进行操作。
12 r  distributions 

2
何时使用引导与贝叶斯技术?
我有一个涉及可靠性测试的相当复杂的决策分析问题,而逻辑方法(对我而言)似乎涉及使用MCMC支持贝叶斯分析。但是,已经建议使用引导方法会更合适。有人可以提出一个(或三个)参考文献来支持使用另一种技术(即使在特定情况下)吗?FWIW,我有来自多个不同来源的数据,很少/零故障观察。我也有子系统和系统级别的数据。 似乎应该可以进行这样的比较,但是我没有找到通常的嫌疑人。在此先感谢您提供任何指导。


3
具有可参数化协方差矩阵的正k维象限的分布是什么?
继zzk关于其负模拟问题的问题之后,我想知道正k维象限上的参数化分布族是什么,可以为其设置协方差矩阵。 ΣRk+R+k\mathbb{R}_+^kΣΣ\Sigma 如zzk所讨论的那样,从的分布开始并应用线性变换不起作用。 X⟶Σ 1 / 2(X-μ)+μRk+R+k\mathbb{R}_+^kX⟶Σ1/2(X−μ)+μX⟶Σ1/2(X−μ)+μX \longrightarrow\Sigma^{1/2} (X-\mu) + \mu

2
分析逻辑回归系数
这是逻辑回归系数的列表(第一个是截距) -1059.61966694592 -1.23890500515482 -8.57185269220438 -7.50413155570413 0 1.03152408392552 1.19874787949191 -4.88083274930613 -5.77172565873336 -1.00610998453393 我发现截距如此之低如此奇怪,并且我的系数实际上等于0。我不确定如何解释这一点。0是否表示特定变量对模型完全没有影响?但是,通过输入某列进行的拦截真的很重要吗?还是我的数据只是废话而模型无法正确地适应它。

2
分层贝叶斯模型(?)
请为统计术语but之以鼻:)我在这里发现了几个与广告和点击率有关的问题。但是他们对我的等级状况的了解都没有对我有太大帮助。 还有一个相关的问题,即相同的贝叶斯模型的这些等效表示吗?,但我不确定它们是否确实存在类似问题。另一个问题是贝叶斯分层二项式模型的先验论证了有关超优先级的细节,但是我无法将其解决方案映射到我的问题上 我在网上有几个新产品的广告。我让广告投放了几天。到那时,足够多的人点击了广告,以查看哪个获得了最多的点击。在排除所有点击次数最多的广告之后,我让该广告再运行几天,以查看点击广告后实际有多少人购买。那时我知道首先投放广告是否是个好主意。 我的统计数据非常嘈杂,因为我每天只卖几件商品,所以我没有很多数据。因此,很难估计看到广告后有多少人买东西。每150次点击中只有约1次导致购买。 一般而言,我需要通过某种方式使用所有广告的全局统计信息来平滑每个广告组的统计信息,以了解是否会尽快在每个广告上赔钱。 如果我等到每个广告都看到足够的购买,我就会破产,因为它花费的时间太长:测试10个广告,我需要多花10倍的钱,以便每个广告的统计数据足够可靠。到那时我可能已经亏钱了。 如果我平均购买所有广告,那么我将无法淘汰效果不佳的广告。 我可以使用全球购买率( N $子分配的优先级吗?这意味着我为每个广告获得的数据越多,该广告获得的统计信息就越独立。如果没有人点击广告,我认为全球平均水平是合适的。perclick)anduseitasapriorforperclick)anduseitasapriorfor per click) and use it as a prior for 我会为此选择哪个发行版? 如果我在A上有20次点击,在B上有4次点击,该如何建模?到目前为止,我已经发现二项分布或泊松分布在这里可能有意义: purchase_rate ~ poisson (?) (purchase_rate | group A) ~ poisson (仅估算A组的购买率?) 但是,接下来我该怎么做才能真正计算出purchase_rate | group A。如何将两个发行版连接在一起以使组A(或任何其他组)有意义。 我必须先拟合模型吗?我有可用于“训练”模型的数据: 广告A:352次点击,5次购买 广告B:15次点击,0次购买 广告C:3519次点击,130次购买 我正在寻找一种方法来估计任何一组的概率。如果一个组只有几个数据点,那么我本质上想回落到全局平均值。我对贝叶斯统计信息有些了解,并且阅读了很多PDF,这些人描述了如何使用贝叶斯推理和共轭先验进行建模等。我认为有一种方法可以正确执行此操作,但是我无法弄清楚如何正确建模。 我会很高兴能以贝叶斯方式解决问题的提示。这将对在线查找示例产生很大帮助,我可以使用这些示例来实际实现此目标。 更新: 非常感谢您的回复。我开始对我的问题越来越了解。谢谢!让我问几个问题,看看我现在对这个问题的理解是否更好: 因此,我假设转换是作为Beta分布分布的,并且Beta分布具有两个参数和。baaabbb 所述的参数是超参数,所以它们的参数现有?因此,最终我将转化次数和点击次数设置为Beta分发的参数吗? 11212\frac{1}{2} 1212\frac{1}{2} 在某些时候,当我想比较不同的广告时,我会计算。如何计算该公式的每个部分?P(conversion|ad=X)=P(ad=X|conversion)∗P(conversion)P(ad=X)P(conversion|ad=X)=P(ad=X|conversion)∗P(conversion)P(ad=X)P(\mathrm{conversion} | …

2
统计检验值远非总体平均值:Z检验还是T检验?
值与值列表相比有多重要?在大多数情况下,统计测试涉及将样本集与总体进行比较。在我的情况下,样本是由一个值构成的,我们将其与总体进行比较。 我是统计假设检验中的最重要人物,可能面临最基本的问题。这不仅是一项测试,而且包括数百项测试。我有一个参数空间,并且必须对每个点进行显着性检验。将为每个参数组合生成值和背景列表(填充)。然后按p值对它进行排序,并找到有趣的参数组合。实际上,找到此p值高(无意义)的参数组合也很重要。 因此,让我们进行一个测试:我有一个从选定的集合生成的计算值和一个通过选择随机训练集计算的背景值。计算值是0.35,背景集(可能是?)正态分布,平均值为0.25,且std非常窄(e-7)。我实际上对分布情况一无所知,因为样本是通过其他方式计算得出的,它们不是某种分布中的随机数样本,因此背景是正确的词。 零假设是“样本检验的平均值等于我的计算值0.35”。我什么时候应该将其视为Z检验或T检验?我希望该值显着高于总体平均值,因此这是单尾检验。 对于样本应考虑的内容,我有点困惑:我要么拥有一个样本(观测值),而且将背景列表作为总体,要么我的样本是背景列表,并且我将其与整体(未抽样)进行比较根据原假设的总体应该具有相同的均值。一旦决定,我猜测试会朝不同的方向发展。 如果是T检验,如何计算其p值?我想自己计算而不是使用R / Python / Excel函数(我已经知道该怎么做),因此我必须首先建立正确的公式。 T=Z/s,T=Z/s,T=Z/s,Z=X¯σn√Z=X¯σnZ=\frac{\bar{X}}{\frac{\sigma}{\sqrt{n}}}s=σ^/σs=σ^/σs=\hat{\sigma}/\sigma 如何计算p值?(即不使用R / Python / Excel函数或p值表查找,而是根据公式实际计算它,因为我想知道自己在做什么) 如何根据样本量确定显着性阈值?(一个公式会很好)

1
适用于高斯混合模型(GMM)的Python软件包
在Python中使用高斯混合模型(GMM)似乎有几种选择。乍看之下至少有: PyMix- http: //www.pymix.org/pymix/index.php 混合物建模工具 PyEM- http://www.ar.media.kyoto-u.ac.jp/members/david/softwares/em/,它是Scipy工具箱的一部分,似乎专注于GMM 更新:现在称为sklearn.mixture 。 PyPR- http: //pypr.sourceforge.net/ 模式识别和相关工具,包括GMM ...甚至其他人。它们似乎都提供了GMM的最基本需求,包括创建和采样,参数估计,聚类等。 它们之间有什么区别,应该如何确定最适合特定需求的呢? 参考:http : //www.scipy.org/Topical_Software

1
R中的偏最小二乘回归:为什么标准化数据上的PLS不等于最大化相关性?
我在偏最小二乘(PLS)非常新,我试着去了解R函数的输出plsr()的pls包。让我们模拟数据并运行PLS: library(pls) n <- 50 x1 <- rnorm(n); xx1 <- scale(x1) x2 <- rnorm(n); xx2 <- scale(x2) y <- x1 + x2 + rnorm(n,0,0.1); yy <- scale(y) p <- plsr(yy ~ xx1+xx2, ncomp=1) 我期望以下数字aaa和bbb > ( w <- loading.weights(p) ) Loadings: Comp 1 xx1 0.723 xx2 0.690 Comp 1 SS …

2
交叉验证和有序逻辑回归
我正在尝试了解有序逻辑回归的交叉验证。游戏的目的是验证分析中使用的模型。 我首先构造一个玩具数据集: set.seed(1) N <- 10000 # predictors x1 <- runif(N) x2 <- runif(N) x3 <- runif(N) # coeffs in the model a <- c(-2,-1) x <- -x1+2*x2+x3 # P( y ≤ i ) is given by logit^{-1} ( a[i]+x ) p <- outer(a,x, function(a,x) 1/(1+exp(-a-x)) ) # computing the …

1
在可能简单到具有解析形式的情况下,找出后验分布的步骤?
计算科学也曾问过这个问题。 我试图计算一些系数的自回归的贝叶斯估计,11个的数据样本: 其中 ε 我是高斯均值为0,方差 σ 2 ë 于载体上的先验分布(μ ,α )吨是高斯均值(0 ,0 ),并与对角项等于一个对角协方差矩阵到 σ 2 pYi=μ+α⋅Yi−1+ϵiYi=μ+α⋅Yi−1+ϵi Y_{i} = \mu + \alpha\cdot{}Y_{i-1} + \epsilon_{i} ϵiϵi\epsilon_{i}σ2eσe2\sigma_{e}^{2}(μ,α)t(μ,α)t(\mu, \alpha)^{t}(0,0)(0,0)(0,0)σ2pσp2\sigma_{p}^{2}。 基于自回归式,这意味着,数据点(分布)是正常的均值μ + α ·&YiYiY_{i}和方差 σ 2 ë。因此,所有数据点(Y )的密度共同(假设独立性,这对我正在编写的程序很好)将为: p (Yμ+α⋅Yi−1μ+α⋅Yi−1\mu + \alpha\cdot{}Y_{i-1}σ2eσe2\sigma_{e}^{2}(Y)(Y)(Y)p(Y|(μ,α)t)=∏i=21112πσ2e−−−−√exp−(Yi−μ−α⋅Yi−1)22σ2e.p(Y|(μ,α)t)=∏i=21112πσe2exp⁡−(Yi−μ−α⋅Yi−1)22σe2. p(Y \quad | (\mu, \alpha)^{t}) = \prod_{i=2}^{11}\frac{1}{\sqrt{2\pi\sigma_{e}^{2}}}\exp{\frac{-(Y_{i} - \mu - \alpha\cdot{}Y_{i-1})^{2}}{2\sigma_{e}^{2}}}. 根据贝叶斯定理,我们可以将上述密度与先验密度相乘,然后只需要归一化常数即可。我的直觉是,这应该算是高斯分布,因此我们可以担心最后的归一化常数,而不用用和α上的积分来显式地计算它。μμ\muαα\alpha 这是我遇到的麻烦。如何计算先验密度(即多元变量)与单变量数据密度乘积的乘积?后验纯粹是和α的密度,但是我看不到如何从这样的乘积中得到。μμ\muαα\alpha …

1
了解Duda等人的模式分类中没有免费的午餐定理
我对第9.2节Duda,Hart和Stork的模式分类中的任何分类器缺乏固有的优越性所用的符号有疑问。首先让我引用书中的一些相关文字: 为简单起见,考虑一个两类问题,其中训练集由模式和相关联的类别标签 ,其中由待学习的未知目标函数,其中。DDDxixix^iyi=±1yi=±1y_i = ± 1i=1,...,ni=1,...,ni = 1,..., nF(x)F(x)F(x)yi=F(xi)yi=F(xi)y_i = F(x^i) 令表示假设(离散)或可能学习的参数集。的特定假设 可以通过神经网络中的量化权重或功能模型中的参数0或树中的决策集等来描述。HHHh(x)∈Hh(x)∈Hh(x) \in H 此外,是算法在训练后产生假设的先验概率;注意,这不是正确的可能性。P(h)P(h)P(h)hhhhhh 接下来,表示算法在对数据训练时产生假设的概率。在确定性学习算法(例如最近邻居和决策树)中, 在任何地方都为零,除了单个假设。对于随机方法(例如从随机初始权重训练的神经网络)或随机Boltzmann学习,可能分布很广。P(h|D)P(h|D)P(h|D)hhhDDDP(h|D)P(h|D)P(h|D)hhhP(h|D)P(h|D)P(h|D) 设为零一或其他损失函数的误差。EEE 给出真实函数为且第个候选学习算法的概率为时的预期训练集分类错误F(x)F(x)F(x)kkkPk(h(x)|D)Pk(h(x)|D)P_k(h(x)|D)Ek(E|F,n)=∑x∉DP(x)[1−δ(F(x),h(x))]Pk(h(x)|D)Ek(E|F,n)=∑x∉DP(x)[1−δ(F(x),h(x))]Pk(h(x)|D) \mathcal{E}_k(E|F,n) = \sum_{x\notin D} P(x) [1-\delta(F(x), h(x))] P_k(h(x)|D) 定理9.1。(不提供免费午餐)对于任何两个学习算法和,以下事实都是正确的,与采样分布和训练点数无关:P 2(h | D )P (x )nP1(h|D)P1(h|D)P_1 (h |D)P2(h|D)P2(h|D)P_2(h|D)P(x)P(x)P(x)nnn 对所有目标函数均匀地求平均,E 1(E | F ,FFFE1(E|F,n)—E2(E|F,n)=0E1(E|F,n)—E2(E|F,n)=0\mathcal{E}_1 (E|F, n) — \mathcal{E}_2(E|F, n) = 0 对于任何固定的训练集,均匀地平均, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.