统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
欧氏距离得分和相似性
我刚读完《集体智慧》(托比·塞加兰(Toby Segaran))一书,就遇到了欧几里得距离得分。在书中作者展示了如何计算两个建议阵列之间的相似性(即。人 ×电影 ↦分数)person×movie↦score)\textrm{person} \times \textrm{movie} \mapsto \textrm{score}) 他通过 d (p 1,p 2)= √计算两个人和p 2的欧几里得距离p1个p1p_1p2p2p_2d(p1个,p2)= ∑我∈ 项目 (sp1个− 秒p2)2-------------√d(p1,p2)=∑i ∈ item(sp1−sp2)2d(p_1, p_2) = \sqrt{\sum_{i~\in~\textrm{item}} (s_{p_1} - s_{p_2})^2} 这对我来说完全有意义。我真正不明白的是,为什么他最后计算以下内容以获得“基于距离的相似性”: 1个1 + d(p1个,p2)11+d(p1,p2) \frac{1}{1 + d(p_1, p_2)} 因此,我不知何故必须是从远距离到相似的转换(对吗?)。但是为什么配方设计师看起来像这样?有人可以解释吗?

2
经验分布替代
赏金: 完整的奖金将颁发给别人谁提供任何发表的论文,它使用或提及的估计参考以下。F~F~\tilde{F} 动机: 本部分对您可能并不重要,我怀疑它不会帮助您获得赏金,但是由于有人问了动机,这就是我正在努力的目标。 我正在研究统计图论问题。标准稠密图限制性目的是在这个意义上的对称函数,w ^ (Û ,v )= w ^ (v ,Ú )。取样在图上Ñ顶点可以被认为是取样Ñ在单位间隔均匀值(û 我为我= 1 ,... ,ÑW:[0,1]2→[0,1]W:[0,1]2→[0,1]W : [0,1]^2 \to [0,1]W(u,v)=W(v,u)W(u,v)=W(v,u)W(u,v) = W(v,u)nnnnnnUiUiU_ii=1,…,ni=1,…,ni = 1, \dots, n),那么边的概率为W (U i,U j)。我们得到的邻接矩阵被称为一个。(i,j)(i,j)(i,j)W(Ui,Uj)W(Ui,Uj)W(U_i, U_j)AAA 我们可以把作为密度˚F = w ^ / ∬ W¯¯假设∬ w ^ > 0。如果我们基于A来估计f,而对f没有任何约束,那么我们将无法获得一致的估计。我发现一个有趣的结果,当f来自一组可能的函数时,不断估计f。从这个估计和Σ 一,我们可以估算w ^。WWWf=W/∬Wf=W/∬Wf = W / \iint W∬W>0∬W>0\iint …

1
微分熵
高斯RV的微分熵是。这取决于标准偏差σ。log2(σ2πe−−−√)log2⁡(σ2πe)\log_2(\sigma \sqrt{2\pi e})σσ\sigma 如果我们对随机变量进行归一化,使其具有单位方差,则其微分熵下降。对我来说,这是违反直觉的,因为与熵的减少相比,归一化常数的Kolmogorov复杂度应该很小。可以简单地设计一种编码器解码器,该编码器解码器将归一化常数除以/乘以恢复由该随机变量生成的任何数据集。 我的理解可能不正确。你能指出我的缺点吗?

2
指数随机变量的条件期望
为一个随机变量(é [ X ] = 1X∼Exp(λ)X∼Exp(λ)X\sim \text{Exp}(\lambda))我凭直觉感到E[X| X>x]应该等于x+E[X],因为通过无记忆属性,X|x的分布 X>x与X相同,但向右移动x。E[X]=1λE[X]=1λ\mathbb{E}[X] = \frac{1}{\lambda}E[X|X>x]E[X|X>x]\mathbb{E}[X|X > x]x+E[X]x+E[X]x + \mathbb{E}[X]X|X>xX|X>xX|X > xXXXxxx 但是,我正在努力使用无记忆属性来提供具体的证明。任何帮助深表感谢。 谢谢。

1
如何从脆弱模型(使用R coxph)生成预测的幸存者曲线?
我想计算一个脆弱的考克斯比例风险模型的预测幸存者功能[使用生存包]。看起来当脆弱项在模型中时,无法计算预测的幸存者功能。 ## Example require(survival) data(rats) ## Create fake weight set.seed(90989) rats$weight<-runif(nrow(rats),0.2,0.9) ## Cox model with gamma frailty on litter fit <- coxph(Surv(time, status) ~ rx+weight+frailty(litter,dist="gamma"), data = rats) ## Compute survival curve from the cox model for rx=0 and weight=0.5 kg plot(survfit(fit, newdata=data.frame(rx=0,weight=0.5)),xlab = "time", ylab="Survival") ## Running this line, …

1
生存分析和泊松回归之间有什么区别?
我正在使用给定用户访问站点的次数来处理经典客户流失预测问题,并且我认为泊松回归是建模该用户未来参与度的正确工具。那时我碰到一本关于生存分析和危害建模的书,但我不知道哪种技术最好。 我不想同时研究两个主题,那么使用过去的数据和人口统计来建模用户参与度的最佳方法是什么?

1
比较两条生存曲线以获取配对数据
我想比较两种不同的方法来检测生存分析中的状态变化。跟踪一组对象的时间较长(很多年),并且使用了两种检查方法来检查状态是否发生了变化。一种方法用于每年两次检查每个受试者,第二种方法用于每年一次检查每个受试者。问题是,这两种方法在检测状态变化的能力方面是否存在系统差异。 我想到的测试是对数秩测试,以查看两种方法的Kaplan-Meier曲线是否不同。我想知道在执行对数秩检验时,生存曲线是否“成对”(即,两种方法用于同一受试者)是否存在问题。它是否违反了对数秩检验中的假设,或者仅仅是效率低下的检验,因为它没有考虑到两条曲线是相关的?是否有人建议进行替代分析,以说明观察结果中的依赖性? 也许这不是问题,也许我正在思考。 好吧,我不知道状态改变的真实时间,只有方法检测到状态改变的时间点才知道。我曾经想到的是将生存时间设置为上一次未检测到状态变化的检查与检测到状态变化的检查之间的时间间隔的中点。与每年使用两次的方法相比,这可以弥补每年仅检查一次对象的方法的缺点。然后根据这些数据构建生存曲线。

3
受限制的玻尔兹曼机回归?
我正在跟我先前在RBM上提出的问题进行跟进。我看到很多描述它们的文献,但是没有一篇真正地谈到回归(甚至没有带有标记数据的分类)。我感觉它仅用于未标记的数据。是否有处理回归的资源?还是像在隐藏层之上添加另一层并上下运行CD算法那样简单?在此先感谢。

3
R中的非负套索实现
我正在寻找可以使用的开放源代码或现有库。据我所知,glmnet软件包不是很容易扩展以涵盖非负面情况。我可能是错的,任何有任何想法的人都非常感谢。 非负数是指所有系数均被约束为正数(> 0)。
13 r  lasso 

3
如何在具有高多重共线性的线性回归中处理不稳定的
具有高多重共线性的线性回归中的Beta稳定性? 假设在线性回归中,变量和x 2具有较高的多重共线性(相关系数约为0.9)。X1个x1x_1X2x2x_2 我们担心系数的稳定性,因此我们必须处理多重共线性。ββ\beta 教科书的解决方案是只丢弃一个变量。 但是我们不想仅仅丢弃变量就失去有用的信息。 有什么建议?

4
在有马之前或有马以内的时差时间序列
在使用Arima之前最好先区分一个系列(假设需要),还是在Arima中使用d参数更好? 令我惊讶的是,取决于使用相同模型和数据的路线,拟合值有多么不同。还是我做错了什么? install.packages("forecast") library(forecast) wineindT<-window(wineind, start=c(1987,1), end=c(1994,8)) wineindT_diff <-diff(wineindT) #coefficients and other measures are similar modA<-Arima(wineindT,order=c(1,1,0)) summary(modA) modB<-Arima(wineindT_diff,order=c(1,0,0)) summary(modB) #fitted values from modA A<-forecast.Arima(modA,1)$fitted #fitted from modB, setting initial value to the first value in the original series B<-diffinv(forecast.Arima(modB,1)$fitted,xi=wineindT[1]) plot(A, col="red") lines(B, col="blue") 加: 请注意,我先对系列进行求差并拟合arima(1,0,0),然后将arima(1,1,0)拟合到原始序列。我(我认为)反转差异文件上arima(1,0,0)的拟合值的差异。 我正在比较拟合值-而不是预测。 这是情节(红色是arima(1,1,0),蓝色是在变回原始比例后的差分序列上的arima(1,0,0)): 回应Hyndman博士的回答: 1)您能否在R代码中说明我需要做些什么才能使Arima(1,1, 0)和Arima(1,0,0)在手动差分序列上?我认为这与没有包含在modA中有关,但是我不确定如何进行。 …
13 r  time-series  arima 

4
当两个样本的均值显着不同但差异似乎很小时该怎么办
我有两个样本(在两种情况下)。平均值相差大约是标准池的两倍。开发。得到的T值大约为10。虽然很高兴知道我已经得出结论说,均值不相同,但在我看来,这是由大n决定的。查看数据的直方图,我当然不认为像p值这样的小值确实可以代表数据,并且老实说,引用它并不太舒服。我可能在问错问题。我在想的是:好的,方法是不同的,但这真的很重要,因为分布共享大量重叠吗?ñ ≈ 70n≈70n \approx 70ŤTT 贝叶斯测试在这里有用吗?如果是这样,那么从哪里开始是个好地方,那么使用谷歌搜索并没有产生任何有用的东西,但是我可能没有问正确的问题。如果这是错误的事情,那么有人有什么建议吗?还是与定量分析相反,这仅仅是讨论的重点吗?

2
如何测试是否从相同的基础人群中采样了两个多元分布?
假设您获得了两个多元数据集,分别是一个旧数据集和一个新数据集,并且它们应该是由同一过程(您没有模型)生成的,但可能是在收集/创建过程中的某个地方数据,出了点问题。您不想将新数据用作旧数据的验证集或将其添加到旧数据中。 您可以进行一维一维统计(每个变量),例如Wilcoxon排名总和,然后尝试进行多次测试校正,但是我不确定这是最佳的(要捕获多变量数据的复杂性,更不用说多次测试问题了)。一种方法是使用分类器,看看是否可以区分两个数据集(给定最佳分类器)。这似乎确实有效,但是仍然a)perhpas有更好的方法b)并不是真的要告诉您它为何与众不同(如果没有别的,它将使用最好的预测变量,并且可能会错过由更好的预测变量所包含的其他好的预测变量)


2
在交互模型中找到最佳功能
我有蛋白质列表及其特征值。样本表如下所示: ...............Feature1...Feature2...Feature3...Feature4 Protein1 Protein2 Protein3 Protein4 行是蛋白质,列是特征。 我也列出了相互作用的蛋白质。例如 Protein3, Protein4 Protein1, Protein2 Protein4, Protein1 问题:对于初步分析,我想知道哪些功能对蛋白质相互作用的贡献最大。 我的理解是,决策树通常可以用于基于熵获得最重要的特征,但是我不确定如何将其扩展到蛋白质对(即相互作用)。是否有用于此目的的方法?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.