统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
具有多个输出的随机森林是否可能/可行?
随机森林(RF)是一种竞争性的数据建模/挖掘方法。 RF模型具有一个输出-输出/预测变量。 用RF建模多个输出的简单方法是为每个输出变量构造一个RF。因此,我们有N个独立的模型,并且在输出变量之间存在相关性的地方,我们将具有冗余/重复的模型结构。确实,这可能非常浪费。通常,更多的模型变量意味着更多的拟合模型(较少的泛化)。不知道这是否适用于此,但可能适用。 原则上我们可以有一个带有多个输出的RF。预测变量现在是一个向量(n元组)。现在,每个决策树中的决策节点都基于阈值向量拆分目标/预测向量集,我认为该阈值被视为n维空间中的一个平面,因此我们可以确定阈值的哪一侧向量每个目标向量都打开。 决策拆分每一侧的最佳预测值是为每一侧的向量计算的平均值(质心)。 在处理单个变量时找到最佳分割点很简单,而且计算速度快/效率高。对于n元组,我们无法找到最佳拆分(或者至少随着N的增加,它在计算上变得不可行),但是我们可以使用Monte Carlo类型方法(或Monte Carlo和Local的某种混合)找到接近最佳拆分梯度遍历)。 这真的行得通吗?也就是说,它是否可以仅映射训练对而不进行概括?此技术是否已经以其他名称存在? 您可能还需要考虑这与诸如限制玻尔兹曼机器(RBM)和深度信念网络之类的神经网络之间的关系。

2
如何处理R中的错误,例如“系数:14由于奇异而未定义”?
当执行GLM时,在方差分析输出中出现“由于奇异而未定义”错误,如何抵消这种错误的发生? 有人认为这是由于协变量之间的共线性或数据集中不存在其中一个级别(请参阅:在lm中解释“由于奇异而未定义”) 如果我想看看这“特殊治疗”驱动模式,我有4个级别的待遇:Treat 1,Treat 2,Treat 3和Treat 4,这是记录在我的电子表格是:当Treat 1是1,其余都是零,如果Treat 2是1,其余都是零,等,我该怎么办?

2
非线性回归文献综述
有谁知道关于非线性回归的统计文献的好评论文章?我主要对一致性结果和渐近性感兴趣。 特别感兴趣的是模型 yit=m(xit,θ)+ϵit,yit=m(xit,θ)+ϵit,y_{it} = m(x_{it},\theta) + \epsilon_{it}, 用于面板数据。 非参数方法的兴趣不大。 也欢迎提供期刊建议。 目前,我正在阅读《计量经济学手册》中的 Amemiya(1983),但我希望能得到更多更新的信息。 Wooldridge,JM(1996)《计量经济学杂志》中的“用不同的工具为不同的方程式估计方程系统” 是一个比上述评论晚的贡献的例子,因此不包括在内。


3
不平衡数据集上的ROC与精确召回曲线
我刚刚阅读完此讨论。他们认为,在不平衡数据集上,PR AUC比ROC AUC更好。 例如,我们在测试数据集中有10个样本。9个样本为阳性,1个样本为阴性。我们有一个糟糕的模型,它预测一切都是积极的。因此,我们将得到一个度量,TP = 9,FP = 1,TN = 0,FN = 0。 然后,Precision = 0.9,Recall = 1.0。精度和召回率都很高,但是分类器很差。 另一方面,TPR = TP /(TP + FN)= 1.0,FPR = FP /(FP + TN)= 1.0。由于FPR很高,我们可以确定这不是一个很好的分类器。 显然,在不平衡数据集上,ROC优于PR。有人可以解释为什么PR更好吗?

2
通常做法是将批次的平均损失而不是总和减到最小?
Tensorflow有一个有关对CIFAR-10进行分类的示例教程。在本教程中,批次中的平均交叉熵损失最小。 def loss(logits, labels): """Add L2Loss to all the trainable variables. Add summary for for "Loss" and "Loss/avg". Args: logits: Logits from inference(). labels: Labels from distorted_inputs or inputs(). 1-D tensor of shape [batch_size] Returns: Loss tensor of type float. """ # Calculate the average cross entropy loss across the …

4
解释余弦负相似度
我的问题可能很愚蠢。所以我会提前道歉。 我正在尝试使用由Stanford NLP组预训练的GLOVE模型(链接)。但是,我注意到我的相似性结果显示为负数。 那立刻促使我看了字向量数据文件。显然,字向量中的值可以为负。这就解释了为什么我看到负余弦相似度。 我习惯了频率向量的余弦相似度的概念,其值以[0,1]为界。我知道一个事实,根据向量之间的夹角,点积和余弦函数可以为正也可以为负。但是,我确实很难理解和解释这种负余弦相似性。 例如,如果我有一对相似度为-0.1的单词,它们是否比另一对相似度为0.05的单词少?如何比较-0.9与0.8的相似性? 还是我应该看看的最小角度差的绝对值?分数的绝对值?nπnπn\pi 非常感谢。

4
是否可以将可变大小的图像作为输入到卷积神经网络?
我们能否将尺寸可变的图像作为卷积神经网络的输入以进行目标检测?如果可能,我们该怎么做? 但是,如果我们尝试裁切图像,则会丢失图像的某些部分,如果尝试调整大小,则会丢失图像的清晰度。如果将图像清晰度作为主要考虑因素,这是否意味着使用固有的网络属性是最好的?


4
为什么独立意味着零相关?
首先,我不是在问这个: 为什么零相关性并不意味着独立? 这在这里得到解决(相当好):https : //math.stackexchange.com/questions/444408/why-does-zero-correlation-not-imply-independence 我要问的是相反的意思...说两个变量完全相互独立。 难道他们偶然之间没有一点联系吗? 不应该...独立意味着非常少的相关性吗?

4
关于乔治·博克斯(George Box),加利特·斯穆利(Galit Shmueli)和科学方法?
(这个问题似乎更适合于哲学SE。我希望统计学家可以澄清我对Box和Shmueli陈述的误解,因此我将其张贴在这里)。 ARIMA名望的George Box说: “所有模型都是错误的,但有些是有用的。” Galit Shmueli在她著名的论文“ To Explain or Predict”中指出(并引用了其他同意她的观点): 解释和预测并不相同,尽管某些模型在预测方面做得不好,但有些模型在解释方面做得很好。 我觉得这些与原则有些矛盾。 如果模型预测不好,是否有用? 更重要的是,如果模型能够很好地解释(但不一定能很好地预测),那么它在某种程度上必须是正确的(即没有错)。那么,这与Box的“所有模型都错了”又有什么关系呢? 最后,如果一个模型能够很好地解释但不能很好地预测,那么它如何科学?大多数科学标界标准(验证论,证伪论等)都暗示科学陈述必须具有预测能力,或者口语化:只有经过实证检验(或证伪)的理论或模型才是正确的。必须预测未来的结果。 我的问题: Box的陈述与Shmueli的观点是否确实矛盾,或者我是否缺少某些东西,例如,一种没有预测能力的模型仍然有用吗? 如果Box和Shmueli的陈述不矛盾,那么对一个模型错误并不能很好地预测却仍然具有解释力意味着什么?换句话说:如果一个人既丧失了正确性又缺乏预测能力,那么模型还剩下什么? 当模型具有解释力但没有预测力时,可以进行哪些经验验证?Shmueli提到了类似的事情:使用AIC进行解释,使用BIC进行预测,等等,但是我不知道这是如何解决问题的。对于预测模型,您可以使用AIC,BIC或R2R2R^2或L1L1L1正则化等,但是最终出于样本测试和生产性能的决定因素决定了模型的质量。但是对于解释得很好的模型,我看不到任何损失函数如何能够真正评估模型。在科学哲学中,存在不确定性的概念对于任何给定的数据集,总可以明智地选择某种分布(或分布的混合)和损失函数LLL,使其适合数据(因此可以声称可以解释它)。此外,对于有人声称模型足以解释数据的情况,LLL应当处于的阈值是任意的(类似p值,为什么p&lt;0.05p&lt;0.05p < 0.05而不是p&lt;0.1p&lt;0.1p < 0.1或p&lt;0.01p&lt;0.01p < 0.01?)。 基于以上所述,由于不可能进行样本外测试,因此如何客观地验证可以很好地解释但不能很好地预测的模型?



3
是否有多个“中位数”公式?
在我的工作中,当个人引用数据集的“平均值”值时,他们通常是指算术平均值(即“平均值”或“期望值”)。如果我提供了几何平均值,人们可能会认为我是在冷嘲热讽或无助,因为“均值”的定义是事先已知的。 我正在尝试确定数据集的“中位数”是否有多个定义。例如,由同事提供的用于查找元素数为偶数的数据集的中位数的定义之一是: 算法“ A” 将元素数除以2,向下舍入。 该值是中位数的指数。 即对于以下集合,中位数为5。 [4, 5, 6, 7] 尽管四舍五入方面似乎有些武断,但这似乎是有道理的。 算法“ B” 无论如何,另一位同事提出了一种单独的算法,该算法在他的统计资料教科书中(需要获得名称和作者): 将元素数除以2,并保留四舍五入和四舍五入的整数的副本。他们的名字n_lo和n_hi。 采取在元素的算术平均值n_lo和n_hi。 即对于以下集合,中位数为(5+6)/2 = 5.5。 [4, 5, 6, 7] 但是,这似乎是错误的,因为5.5在这种情况下,中间值实际上不在原始数据集中。当我们在某些测试代码中将算法“ A”换成“ B”时,它就破烂了(正如我们预期的那样)。 题 这两种计算数据集中位数的方法是否有正式的“名称”?即“两个中位数中的较少者”与“平均中间元素并制作新数据中位数”?

1
AUC是半正确的评分规则意味着什么?
正确的计分规则是“真实”模型最大化的规则,并且不允许“对冲”或对系统进行博弈(故意报告不同结果,因为该模型的真实信念是提高分数)。石棉分数是适当的,准确性(正确分类的比例)是不适当的,并且经常受到阻碍。有时我会看到AUC被称为半正确评分规则,这使其准确性不完全虚假,但不如适当规则敏感(例如,此处/stats//a/90705/53084)。 半正确评分规则是什么意思?它在某处定义吗?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.