统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
使用Python进行时间序列异常检测
我需要对几个时间序列数据集执行异常检测。我以前从未做过此事,希望能得到一些建议。我对python非常满意,因此我希望在其中实现解决方案(我的大部分代码在其他工作中都是python)。 数据描述:在过去的两年左右(即只有24-36个时间段)才刚刚开始收集每月的时间序列数据。从本质上讲,每月有多个指标被多个客户监视。 time_period client metric score 01-2013 client1 metric1 100 02-2013 client1 metric1 119 01-2013 client2 metric1 50 02-2013 client2 metric2 500 ... 这就是我的想法:将数据放入数据框(熊猫),然后为每个客户/指标对计算6个月的滚动平均值。如果当前时间段的值超过了基于6个月平均值的某个阈值,则升旗。这个问题似乎很简单。我只想确保我采取可靠的方法。 任何建议,以充实这一想法,将不胜感激。我知道这个问题有点抽象,对此我深表歉意。


2
如何解释ACF和PACF图
我只想检查一下我是否正确解释了ACF和PACF图: 数据对应于在实际数据点之间生成的误差和使用AR(1)模型生成的估计值。 我在这里看了答案: 通过ACF和PACF检查估算ARMA系数 阅读后,似乎错误不是自相关的,但我只是想确定,我担心的是: 1.)第一个错误就在边界上(在这种情况下,我应该接受还是拒绝在滞后1存在明显的自相关)? 2.)线代表95%的置信区间,并且考虑到存在116个滞后,我希望不超过(0.05 * 116 = 5.8,我向上舍入为6个)6个滞后。对于ACF就是这种情况,但对于PACF大约有10个例外。如果把那些包括在边界上,那更像是14?这仍然表明没有自相关吗? 3.)我是否应该从一个事实中了解到所有违反95%置信区间的情况都是不利的?

1
具有的最小方差的无偏估计量
让X1个,。。。,XñX1个,。。。,Xñ X_1, ...,X_n 成为分布的随机样本 ģ Ë ø 米é 吨ř 我Ç (θ )GËØ米ËŤ[R一世C(θ)Geometric(\theta) 对于 0 &lt; θ &lt; 10&lt;θ&lt;1个0<\theta<1。即 pθ(X )= θ (1 - θ)x − 1一世{ 1 ,2 ,。。。}(x )pθ(X)=θ(1个-θ)X-1个一世{1个,2,。。。}(X)p_{\theta}(x)=\theta(1-\theta)^{x-1} I_{\{1,2,...\}}(x) 查找具有最小方差的无偏估计量 G(θ )=1个θG(θ)=1个θg(\theta)=\frac{1}{\theta} 我的尝试: 由于几何分布来自指数族,因此统计 ∑X一世∑X一世\sum X_i 完整且足够 θθ \theta。另外,如果Ť(X)=X1个Ť(X)=X1个T(X)=X_1 是一个估计 G(θ )G(θ)g(\theta),这是公正的。因此,根据Rao-Blackwell定理和Lehmann-Scheffé定理, w ^(X)= E[X1个| ∑X一世]w ^(X)=Ë[X1个|∑X一世]W(X) = …

3
人们为什么喜欢平滑的数据?
我将使用平方指数内核(SE)进行高斯过程回归。该内核的优点是:1)简单:仅3个超参数;2)平滑:此内核是高斯型的。 人们为什么如此喜欢“平稳”?我知道高斯核是无限可微的,但这是如此重要吗?(请让我知道SE内核如此受欢迎的其他原因。) PS:有人告诉我,现实世界中的大多数信号(无噪声)都是平滑的,因此使用平滑的内核对其建模是合理的。有人可以帮我理解这个概念吗?

4
相关矩阵中随机变量的最小相关子集
我有一个相关矩阵,它是通过Matlab的corrcoef()使用Pearson线性相关系数获得的。尺寸为100x100的相关矩阵,即我针对100个随机变量计算了相关矩阵。AAA 在这100个随机变量中,我想找到10个随机变量,它们的相关矩阵包含尽可能少的“相关性”(请参阅量化相关矩阵A与相关矩阵B相比要测量的指标多少)相关矩阵中的整体相关性)。我只关心成对相关。 是否有好的方法可以在合理的时间内找到这10个随机变量(例如,我不想尝试(10010)(10010)\binom{100}{10}组合)?近似算法是可以的。

1
指数族:观察到的与期望的足够统计量
我的问题来自阅读Minka的“估计Dirichlet分布”,该陈述在根据随机向量的观察推导Dirichlet分布的最大似然估计的情况下,没有证明以下内容: 与指数族一样,当梯度为零时,期望的足够统计量等于观察到的足够统计量。 我没有看到以这种方式呈现的指数族中的最大似然估计,也没有在搜索中找到任何合适的解释。有人可以提供对观察到的和预期的足够统计量之间的关系的洞察力,也许可以通过最大程度地减少差异来帮助理解最大似然估计?


5
使用十分位找到相关性是一种统计上有效的方法吗?
我有一个1,449个不相关的数据点的样本(r平方0.006)。 在分析数据时,我发现通过将自变量值分为正向和负向组,每组因变量的平均值似乎存在显着差异。 使用自变量值将点分成10个bin(十分位数),十分位数与平均因变量值之间的相关性似乎更强(r平方0.27)。 我对统计信息了解不多,因此这里有几个问题: 这是有效的统计方法吗? 有没有找到最佳箱数的方法? 这种方法的正确用语是什么,以便我可以使用Google? 有哪些入门资源可用于学习这种方法? 我可以使用哪些其他方法来查找此数据中的关系? 这是十进制数据供参考:https : //gist.github.com/georgeu2000/81a907dc5e3b7952bc90 编辑:这是数据的图像: 行业动量是自变量,入口点质量是因变量

2
逻辑回归和序数自变量
我发现了这篇文章: 是。该系数反映了顺序预测变量中每个变化增量的对数几率变化。这个(非常常见的)模型规范假设预测变量在其增量上具有线性影响。为了检验假设,您可以将使用序数变量作为单个预测变量的模型与将响应离散化并将其视为多个预测变量的模型进行比较(就像变量是名义变量一样)。如果后一种模型的拟合效果不佳,则将每个增量视为具有线性效应是合理的。 – @ dmk38 2010年12月12日,5:21 您能否告诉我在哪里可以找到支持该主张的出版物?我正在处理数据,我想在逻辑回归中使用序数自变量。



1
随机变量函数的概率分布?
我有一个疑问:考虑实值随机变量和无论在概率空间定义。XXXZZZ(Ω,F,P)(Ω,F,P)(\Omega, \mathcal{F},\mathbb{P}) 令,其中是实值函数。由于是随机变量的函数,因此它是随机变量。Y:=g(X,Z)Y:=g(X,Z)Y:= g(X,Z)g(⋅)g(⋅)g(\cdot)YYY 令即的实现。x:=X(ω)x:=X(ω)x:=X(\omega)XXX 是等于?P(Y|X=x)=P(g(X,Z)|X=x)P(Y|X=x)=P(g(X,Z)|X=x)\mathbb{P}(Y|X=x)=\mathbb{P}(g(X,Z)|X=x)P(g(x,Z))P(g(x,Z))\mathbb{P}(g(x,Z))

2
通过使用一组样本估算多个集合的交集的大小
我正在研究一种算法,该算法需要计算由至少2个集合的交集生成的集合的大小。进一步来说: z=|A0∩…∩An|z=|A0∩…∩An| z = \left |A_0 \cap \ldots \cap A_n \right | 相交的集合是由SQL查询生成的,为了保持运行速度,我提前获取了每个查询的计数,然后以计数最小()的集合为准,并使用这些ID作为其余的大查询,因此交集实际上变为:A0A0A_0 z=|(A0∩A1)∩…∩(A0∩An)|z=|(A0∩A1)∩…∩(A0∩An)| z = \left |\left ( A_0 \cap A_1 \right ) \cap \ldots \cap \left ( A_0 \cap A_n \right ) \right | 即使这个策略也让我有一些相当大的查询要运行,因为有时可能很大。我要解决的想法是随机抽取样本,并将其与其余集合相交,然后外推回的适当估计。我的问题是:进行采样然后外推以返回到值(如果不是完全准确的话)具有可预测的误差范围的最佳方法是什么?|A0||A0|\left | A_0 \right |A0A0A_0zzzzzz 到目前为止,这是我尝试过的(使用伪代码): sample_threshold := 10000 factor := 1 if (len(A0) …
10 error  sample 

1
如何解释GAM P值?
我叫休,我是一名使用广义加性模型进行探索性分析的博士研究生。 我不确定如何解释来自MGCV软件包的p值,并想检查我的理解(我使用的是1.7-29版,并已查阅了Simon Wood的一些文档)。我首先寻找了其他简历问题,但最相关的问题似乎与一般回归有关,尤其不是GAM p值。 我知道GAM有很多不同的参数,而p值仅是近似值。但是,我只是简单地开始看看我的协变量是否存在任何“信号”。例如: Y〜s(a,k = 3)+ s(b,k = 3)+ s(c,k = 3)+ s(d,k = 3)+ s(e,k = 3) 平滑项的近似p值: s(a)= 0.000473 s(b)= 1.13e-05 s(c)= 0.000736 s(d)= 0.887579 s(e)= 0.234017 ř ²(调整)= 0.62\quad 解释的偏差= 63.7% GCV分数= 411.17\quad 规模估算值= 390.1\quad n = 120 由于格式化,我剪切了df列等。我将每个协变量的p值解释为测试相应的平滑函数是否显着降低模型偏差,其中p是获得数据的概率至少与在零模型0下观察到的“相对不可信”。 这将意味着(例如,在alpha = 0.05的情况下)与零模型相比,平滑函数不会减小“ d”和“ e”的偏差,而对于其他项却会减小。因此,(d)和(e)不会在回归中添加重要信息,并且解释的偏差可归结为(a)(b)(c)? 任何建议将不胜感激,并祝您研究顺利。
10 p-value  mgcv 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.