统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
神经网络用于多重输出回归
我有一个包含34个输入列和8个输出列的数据集。解决问题的一种方法是采用34个输入并为每个输出列建立单独的回归模型。我想知道是否可以仅使用一种模型(特别是使用神经网络)解决该问题。 我使用了多层感知器,但是像线性回归一样需要多个模型。顺序学习1可以可行吗?我尝试使用TensorFlow,它似乎无法处理浮点值。 任何通过仅使用一个统一模型(特别是使用神经网络)解决该问题的建议将不胜感激。 Ilya Sutskever,Oriol Vinyals和Quoc V.Le(2014)。使用神经网络进行序列学习。神经信息处理系统进展,27。(pdf)

1
内核近似的Nystroem方法
我一直在阅读有关低阶内核近似的Nyström方法。该方法在scikit-learn [1]中实现,作为一种将数据样本投影到内核特征映射的低秩近似的方法。 据我所知,给定训练集和一个核函数,它通过将SVD应用于来生成核矩阵的低秩近似。和。{xi}ni=1{xi}i=1n\{x_i\}_{i=1}^nn×nn×nn \times nKKKWWWCCC K=[WK21KT21K22]K=[WK21TK21K22]K = \left [ \begin{array}{cc} W & K_{21}^T \\ K_{21} & K_{22} \end{array} \right ] C=[WK21]C=[WK21]C = \left [\begin{array}{cc} W \\ K_{21} \end{array}\right ],W∈Rl×lW∈Rl×lW \in \mathbb{R}^{l\times l} 但是,我不了解如何使用内核矩阵的低秩近似将新样本投影到近似的内核特征空间。我发现的论文(例如[2])并没有太大帮助,因为它们几乎没有说教性。 另外,我对这种方法在训练和测试阶段的计算复杂性感到好奇。 [1] http://scikit-learn.org/stable/modules/kernel_approximation.html#nystroem-kernel-approx [2] http://www.jmlr.org/papers/volume13/kumar12a/kumar12a.pdf


5
您如何看待马尔可夫链是不可约的?
我有一些很难理解的马尔可夫链财产束缚。 所谓不可简化是指随机过程可以“从任何状态进入任何状态”。 但是,什么定义了它可以从状态进入状态还是不能进入状态?Ĵ一世iiĴjj 在维基百科页面给出了形式化: 状态Ĵjj是可访问的(写入i → ji→ji\rightarrow j)从状态一世ii,如果存在整数ñ我Ĵ> 0nij>0n_{ij}>0 ST P(Xñ我Ĵ= j | X 0= i )= p(n我Ĵ)我Ĵ> 0P(Xnij=j | X0=i)=pij(nij)>0P(X_{n_{ij}}=j\space |\space X_0=i)=p_{ij}^{(n_{ij})} >0 那么交流是如果i → ji→ji\rightarrow j和j → 我j→ij \rightarrow i。 从这些不可还原性以某种方式得出。


2
鲁宾因果模型中的无疑之处-莱曼的解释
在实施鲁宾的因果模型时,我们需要的(不可笑)假设之一是无混杂感,这意味着 (Y(0),Y(1))⊥T|X(Y(0),Y(1))⊥T|X(Y(0),Y(1))\perp T|X LHS是反事实,T是治疗方法,X是我们控制的协变量。 我想知道如何将其描述给对鲁宾因果模型了解不多的人。我理解为什么从理论上讲我们需要这个假设,但是从概念上我不确定为什么这很重要。具体来说,如果使用T作为治疗方法,那么潜在的结果是否应该非常依赖于它?同样,如果我们有一个随机对照试验,然后自动,(Y(0),Y(1))⊥T(Y(0),Y(1))⊥T(Y(0),Y(1))\perp T。为什么这适用呢? 您将如何向未学习RCM的人描述“无足轻重/无知”的假设?

3
如何为多分类器建立混淆矩阵?
我有6个班级的问题。因此,我构建了一个多类分类器,如下所示:对于每个类,我都有一个Logistic回归分类器,使用“一个vs全部”,这意味着我有6个不同的分类器。 我可以为我的每个分类器报告一个混淆矩阵。但是,我想报告所有分类器的混淆矩阵,正如我在此处的许多示例中所看到的那样。 我该怎么做?我是否必须使用“一对一”算法而不是“一对一”算法来更改分类策略?因为在这些混淆矩阵上,报告指出了每个类别的误报。 多类混淆矩阵的示例 我想找到错误分类的物品数量。在第一行中,有137个类别1的示例被分类为1类,而13个类别1的示例被分类为2类。如何获得这个号码?





2
如何使用auto.arima插补缺失值
我有一个动物园系列,但缺少很多值。我读到auto.arima可以推论这些缺失的值吗?谁能教我该怎么做?非常感谢! 这是我尝试过的,但是没有成功: fit <- auto.arima(tsx) plot(forecast(fit))
12 arima 

1
在时间序列模型中使用R平方有什么问题?
我已经读过,对时间序列使用R平方是不合适的,因为在时间序列上下文中(我知道还有其他上下文),R平方不再是唯一的。为什么是这样?我试图进行查找,但没有找到任何东西。通常,在评估模型时,我不会对R平方(或调整R平方)进行任何评估,但是我的许多同事(例如,商务专业)绝对喜欢R平方,因此我希望能够向他们解释为什么R-Squared在时间序列的背景下不合适。



By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.