统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


5
如何将距离(欧几里得)转换为相似度分数
我正在使用表示聚类以聚类说话者的声音。当我将话语与聚集的扬声器数据进行比较时,我得到(基于欧几里得距离)平均失真。该距离可以在范围内。我想将此距离转换为相似度得分。请指导我如何实现这一目标。ķkk[ 0 ,1 ][ 0 ,∞ ][0,∞][0,\infty][ 0 ,1 ][0,1][0,1]

1
用层和层-协变量相互作用拟合Cox模型与拟合两个Cox模型是否不同?
在Harrell的《回归建模策略》(第二版)中,有一节(第20.1.7节)讨论了Cox模型,其中包括我们也要估计其对生存率有主要影响的协变量(年龄在以下示例中)与我们不想估计其主要影响的协变量(在以下示例中为性别)。 具体而言:假设在总体中,(未知,真实)危险遵循模型ħ (吨)h(t)h(t) h (t )= { hF(t )经验(β1个年龄),H米(t )经验((β1个+ β2)年龄),对于女性患者男性患者h(t)={hf(t)exp⁡(β1age),for female patienshm(t)exp⁡((β1+β2)age),for male patiensh(t) = \begin{cases} h_f(t) \exp(\beta_1 \textrm{age}), & \textrm{for female patiens} \\ h_m(t) \exp((\beta_1 + \beta_2) \textrm{age}), & \textrm{for male patiens} \end{cases} 其中HFhfh_f,H米hmh_m是未知的,真实的,不应被估计的基准风险函数和β1个β1\beta_1,β2β2\beta_2是未知的,真正的参数来从数据中估算出来。 (这个例子几乎是从书中摘录的。) 现在,Harrell表示可以将以上情况重写为分层Cox模型模型1: h (t )= h性别(t )经验(β1个年龄 + β2X)h(t)=hgender(t)exp⁡(β1age+β2X)h(t) = h_{\textrm{gender}}(t) \exp(\beta_1 \textrm{age} + …

1
长期差异是多少?
如何定义时间序列分析领域中的长期差异? 我知道在数据中存在相关结构的情况下会使用它。因此,我们的随机过程不会是X1,X2…X1,X2…X_1, X_2 \dots iid随机变量的一个家族,而只会是相同分布的? 我可以将标准参考作为该概念及其估计中所涉及的困难的介绍吗?

3
随机森林和增强算法是参数化还是非参数化?
通过阅读出色的统计模型:这两种文化(Breiman 2001),我们可以抓住传统统计模型(例如线性回归)和机器学习算法(例如Bagging,Random Forest,Boosted tree ...)之间的所有差异。 布雷曼批评数据模型(参数化),因为它们基于这样的假设:观测值是由统计学家规定的已知的正式模型生成的,该模型可能无法很好地模仿自然。另一方面,机器学习算法不采用任何形式化的模型,而是直接从数据中学习输入变量和输出变量之间的关联。 我意识到Bagging / RF和Boosting也是某种参数:例如,ntree,RF中的mtry,学习率,包率,随机梯度Boosted树中的树复杂性都是调整参数。由于我们正在使用数据来查找这些参数的最佳值,因此我们还需要根据数据估算这些参数。 那有什么区别呢?RF和Boosted Trees参数模型吗?

1
与Borel-Cantelli Lemma相关的问题
注意: Borel-Cantelli Lemma说 ∑n=1∞P(An)<∞⇒P(limsupAn)=0∑n=1∞P(An)<∞⇒P(limsupAn)=0\sum_{n=1}^\infty P(A_n) \lt \infty \Rightarrow P(\lim\sup A_n)=0 ∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1∑n=1∞P(An)=∞ and An's are independent⇒P(limsupAn)=1\sum_{n=1}^\infty P(A_n) =\infty \textrm{ and } A_n\textrm{'s are independent} \Rightarrow P(\lim\sup A_n)=1 然后, 如果∑n=1∞P(AnAcn+1)<∞∑n=1∞P(AnAn+1c)<∞\sum_{n=1}^\infty P(A_nA_{n+1}^c )\lt \infty 通过使用Borel-Cantelli Lemma 我想证明 首先, limn→∞P(An)limn→∞P(An)\lim_{n\to \infty}P(A_n)存在 其次, limn→∞P(An)=P(limsupAn)limn→∞P(An)=P(limsupAn)\lim_{n\to \infty}P(A_n) =P(\lim\sup A_n) 请帮助我展示这两部分。谢谢。


1
与变量模型中的无偏估计相比,用于回归的偏倚估计量可获得更好的结果
我正在研究“误差中的误差”模型的一些句法数据,以进行一些研究。目前,我只有一个自变量,并且假设我知道因变量的真实值的方差。 因此,利用这些信息,我可以实现因变量系数的无偏估计。 该模型: Ŷ=0.5X-10+ë2其中: ë1〜Ñ(0,σ2)对于一些σë2〜Ñ(0,1x~=x+e1x~=x+e1\tilde{x} = x + e_1 y=0.5x−10+e2y=0.5x−10+e2y = 0.5x -10 + e_2 e1~N(0,σ2)e1~N(0,σ2)e_1\text{~}N(0,\sigma^2)σσ\sigma e2~N(0,1)e2~N(0,1)e_2\text{~}N(0,1) 其中的值是已知的对于每个样品只,并且还的实际价值的标准偏差X为已知样品:σ Xy,x~y,x~y,\tilde{x}xxxσxσx\sigma_x。 我得到的偏向(β使用OLS,然后进行使用调整)系数:β^β^\hat{\beta} β′= β^* σ^2X〜σ2Xβ′=β^∗σ^x~2σx2\beta' = \hat{\beta} * \frac{\hat{\sigma}_\tilde{x}^2}{\sigma_x^2} 我看到,使用该模型,新的系数的无偏估计器要好得多(更接近于实际值),但是MSE比使用有偏估计器要差得多。 怎么了?我期望一个普遍的估计器会比有偏估计器产生更好的结果。 Matlab代码: reg_mse_agg = []; fixed_mse_agg = []; varMult = 1; numTests = 60; for dataNumber=1:8 reg_mses = []; fixed_mses = []; …

1
如果总和的中位数或平均值大于加数的总和,那意味着什么?
我正在分析网络延迟的分布。中值上传时间(U)为0.5秒。中值下载(D)时间为2秒。但是,中值总时间(对于每个数据点,T = U + D)为4s。 知道总和的中位数比加数的中位数之和大得多,可以得出什么结论? 出于对统计数据的好奇,如果这个问题用平均数代替中位数,那意味着什么?

3
当参数向量为p维时,为什么在最小二乘回归中踪迹为?
在模型y=Xβ+ϵy=Xβ+ϵ{y} = X \beta + \epsilon,我们可以使用正态方程估算ββ\beta: β^=(X′X)−1X′y,β^=(X′X)−1X′y,\hat{\beta} = (X'X)^{-1}X'y,我们可以得到y^=Xβ^.y^=Xβ^.\hat{y} = X \hat{\beta}. 残差向量可通过 ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,ϵ^=y−Xβ^=(I−X(X′X)−1X′)y=Qy=Q(Xβ+ϵ)=Qϵ,\hat{\epsilon} = y - X \hat{\beta} = (I - X (X'X)^{-1} X') y = Q y = Q (X \beta + \epsilon) = Q \epsilon, 其中Q=I−X(X′X)−1X′.Q=I−X(X′X)−1X′.Q = I - X (X'X)^{-1} X'. 我的问题是如何得出\ textrm {tr}(Q)= n-p的结论tr(Q)=n−p.tr(Q)=n−p.\textrm{tr}(Q) = …

1
参数与潜在变量
我以前曾问过这个问题,并且一直在努力确定什么使模型参数以及什么使它成为潜在变量。因此,在本站点上有关该主题的各种主题中,主要区别似乎是: 不会观察到潜在变量,但它们具有相关的概率分布,因为它们是变量,也未观察到参数,也没有与它们相关的分布,据我所知,这些变量是常数,并且具有固定但未知的值,我们正在尝试找。同样,我们可以对参数进行先验表示,以表示我们对这些参数的不确定性,即使只有一个真实值与它们相关联,或者至少是我们所假设的。我希望到目前为止我是对的吗? 现在,我一直在从期刊论文中查看贝叶斯加权线性回归的示例,并且确实在努力理解什么是参数和什么是变量: yi=βTxi+ϵyiyi=βTxi+ϵyi y_i = \beta^T x_i + \epsilon_{y_i} 这里观察到和,但是只有被视为变量,即具有与之关联的分布。ÿ ÿxxxyyyyyy 现在,建模假设为: y∼N(βTxi,σ2/wi)y∼N(βTxi,σ2/wi) y \sim N(\beta^Tx_i, \sigma^2/w_i) 因此,的方差被加权。yyy 和上也有一个先验分布,分别是正态分布和gamma分布。 w ^ββ\betawww 因此,完整的对数可能性由下式给出: logp(y,w,β|x)=ΣlogP(yi|w,β,xi)+logP(β)+ΣlogP(wi)log⁡p(y,w,β|x)=Σlog⁡P(yi|w,β,xi)+log⁡P(β)+Σlog⁡P(wi) \log p(y, w, \beta |x) = \Sigma \log P(y_i|w, \beta, x_i) + \log P(\beta) + \Sigma \log P(w_i) 现在,据我了解,和都是模型参数。但是,在本文中,他们一直将它们称为潜在变量。我的推论是和都是变量的概率分布的一部分,它们都是模型参数。但是,作者将它们视为潜在的随机变量。那是对的吗?如果是这样,模型参数是什么?w ^ β w ^ ÿββ\betawwwββ\betawwwyyy 可以在这里找到该论文(http://www.jting.net/pubs/2007/ting-ICRA2007.pdf)。 本文是Ting等人的《自动离群值检测:贝叶斯方法》。


1
加法误差还是乘法误差?
我是统计学的新手,不胜感激可以帮助您更好地理解这一点。 在我的领域中,有以下形式的常用模型: PŤ= PØ(五Ť)αPt=Po(Vt)αP_t = P_o(V_t)^\alpha 当人们将模型拟合到数据时,他们通常将模型线性化并符合以下条件 日志(PŤ)= 日志(PØ)+ α 日志(五Ť)+ ϵlog⁡(Pt)=log⁡(Po)+αlog⁡(Vt)+ϵ\log(P_t) = \log(P_o) + \alpha \log(V_t) + \epsilon 这个可以吗?我在某处读到,由于信号中的噪声,实际模型应该是 PŤ= PØ(五Ť)α+ ϵPt=Po(Vt)α+ϵP_t = P_o(V_t)^\alpha + \epsilon 并且不能像上面那样线性化。这是真的?如果是这样,是否有人知道我可以阅读和参考的参考文献,并且可能在报告中引用?


2
使用R的时间序列分析过程和方法
我正在做一个小项目,我们试图预测未来6个月内商品(油,铝,锡等)的价格。我有12个这样的变量可以预测,并且我有2008年4月至2013年5月的数据。 我应该如何进行预测?我已经完成以下工作: 导入的数据作为时间序列数据集 所有变量的季节性都倾向于随趋势而变化,因此我将使用乘法模型。 我将变量的对数转换为加性模型 对于每个变量,使用STL分解数据 我打算使用Holt Winters指数平滑,ARIMA和神经网络进行预测。我将数据分为训练和测试(80、20)。计划选择MAE,MPE,MAPE和MASE较少的模型。 我做对了吗? 我还有一个问题是,在传递给ARIMA或神经网络之前,我应该对数据进行平滑处理吗?如果是,使用什么?数据显示季节性和趋势。 编辑: 附加时间序列图和数据 Year <- c(2008, 2008, 2008, 2008, 2008, 2008, 2008, 2008, 2008, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2009, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2010, 2011, 2011, 2011, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.