统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
该图表是否有名称-饼形图和mekko图之间的交叉点
下面是否有这种图表的名称(来自新西兰商业,创新和就业部,我曾为之工作,但未参与创建此地块)?它由面积与变量成比例的矩形组成,类似于饼形图,镶嵌图和mekko图之间的交叉。它也许最接近mekko图,但其复杂之处在于我们不是在使用列,而是在使用更复杂的拼图。 由于每个区域的矩形之间都有白色边框,因此原始图像看起来要好一些。 令人惊讶的是,尽管可以通过更好地使用映射到有意义的颜色来改善统计图形,但实际上它对我来说还算不错。“纽约时报”使用了一个强大的互动版本显示美国2011年预算。 一个有趣的挑战是考虑一种自动算法来绘制一个并使它看起来也合理。需要允许矩形在可接受的范围内具有不同的纵横比。

1
有常规含义吗
我正在阅读有关贝叶斯曲线拟合的论文(Dimatteo等人,带有自由结样条的贝叶斯曲线拟合,2001年),遇到符号≏≏\bumpeq。整篇论文都使用了它几次,但从未明确定义。经过几次google和stackexchange搜索之后,该符号似乎没有得到广泛使用或常规定义。 下面,我给出一个引用文献的上下文示例。我为未定义任何其他符号而提前表示歉意,但是这样做将等于从我链接的论文中复制了大量文本,并且对该问题没有多大用处。 从p1059(公式8)开始: 顺便说一下,我们也可以在等式(6)中的正常模型的似然比近似中看到这一点 p (ÿ|ķC,ξC)p (ÿ| ķ,ξ)≏1个ñ--√((y-乙ķ ,ξβ^)Ť(y-乙ķ ,ξβ^)(y-乙ķ ,ξCβC^)Ť(y-乙ķ ,ξCβC^))n / 2= È X p (- BIC / 2 )p(ÿ|ķC,ξC)p(ÿ|ķ,ξ)≏1个ñ((ÿ-乙ķ,ξβ^)Ť(ÿ-乙ķ,ξβ^)(ÿ-乙ķ,ξCβC^)Ť(ÿ-乙ķ,ξCβC^))ñ/2=ËXp(-工商银行/2)\frac{p(y|k^c,\xi^c)}{p(y|k,\xi)}\bumpeq\frac{1}{\sqrt{n}}\left(\frac{(y-B_{k,\xi}\hat{\beta})^T(y-B_{k,\xi}\hat{\beta})}{(y-B_{k,\xi^c}\hat{\beta^c})^T(y-B_{k,\xi^c}\hat{\beta^c})}\right)^{n/2}=exp(-\text{BIC}/2) 从上下文来看,\ bumpeq似乎是≏≏\bumpeq一个近似值。如果是这种情况,那么它是否类似于≈≈\approx或\ sim的更常规符号的同义词〜〜\sim?还是用它来表示≈≈\approx或〜〜\sim不足或具有误导性的某种近似?

2
结合敏感性和特异性的分类器性能指标?
我有2个类别的标签数据,正在使用多个分类器对其进行分类。并且数据集是很好平衡的。在评估分类器的性能时,我需要考虑分类器在确定真实肯定因素和真实否定因素方面的准确性。因此,如果我使用准确性,并且如果分类器偏向正值并将所有分类都归为正值,那么即使它未能对任何真实的负数进行分类,我也会获得约50%的准确性。此属性扩展到精度和召回率,因为它们仅关注一个类,而后又关注F1评分。(这是我什至从本文中了解的内容,例如“ 超越准确性,F分数和ROC:性能评估的判别方法系列 ”)。 因此,我可以使用敏感性和特异性(TPR和TNR)来查看分类器对每个类别的表现,以最大程度地提高这些值为目标。 我的问题是,我正在寻找一种将这两个值组合成一个有意义的量度的量度。我研究了该文件中提供的措施,但是发现它并不简单。基于我的理解,我想知道为什么我们不能应用像F分数这样的东西,但是我不使用精度和召回率而是使用灵敏度和特异性?因此公式为 ,我的目标是最大化这个措施。我觉得它很有代表性。已经有类似的公式吗?这是否有意义,或者在数学上是否合理?my Performance Measure=2∗sensitivity∗specificitysensitivity+specificitymy Performance Measure=2∗sensitivity∗specificitysensitivity+specificity \text{my Performance Measure} = \frac{2 * \text{sensitivity} * \text{specificity}}{\text{sensitivity} + \text{specificity}}

3
给初学者的建议(生物统计学入门)
我今年秋天在教我的第一堂课(生物统计学入门)。有人对更好地统计教学有什么建议吗?也许您希望您的第一任老师曾经使用过一些例子?我正在使用Pagano和Gauvreau的《生物统计学原理》。 编辑:详细信息 该课程是在线课程,每周两次,每次1.5小时。学生们将在观看幻灯片和笔迹演示时(无聊?)和一些平板电脑/笔动作(令人兴奋?)混合在一起时听我的演讲。本课是非常初学者的统计资料,主要教给生物医学工程师(本科生)和一些非统计资料研究生(护理,医学生,公共卫生等) 教学大纲: 1)什么是生物统计学? 2)概率 3)诊断测试(例如,特异性,敏感性,ROC曲线。通常在此处b / c,它使我们可以应用从概率中学到的一些知识,例如贝叶斯规则) 4)发行 5)抽样分布 6)置信区间 7)假设检验(一个样本,两个样本,比例) 8)功效和样本量计算 9)非参数方法 10)偶然性表(卡方检验,渔民检验,麦克内马尔检验,相对风险,优势比) 11)相关 主要目的是让学生学习统计推断的核心概念,例如,您如何量化“哪种药更好?”这一问题。类似的东西。 对于上面列出的部分,您是否有任何建议或警告来教他们。 例如:在推断比例时,我已经看到/听说过许多不同的方法将学生介绍给wald测验和score测验。如果教学效果不佳,学生很容易感到困惑(“为什么要使用其中两个?”,“我要使用哪个?”,“它们对我来说看起来是一样的。”)有些老师甚至不提这些名字而只是说:这样做是为了置信区间,而另一件事是进行假设检验。您将如何解决这个问题或其他类似问题?

1
用于(最佳)实验统计设计的良好,有用和特征性实验
与替代的有效设计策略相比,可以应用实验设计的现象更多。这是对的,尽管有许多方法可以适当地设计实验。 什么是最好的“问题”,才能真正证明不同类型的实验优化设计的价值和细微差别?(A,D,E,C,V,phi,....) 您能否提供书籍,链接,文章,参考资料,或者至少提供以经验为依据的良好见解?

5
当接近100%的类别标签属于一个类别时,如何衡量分类器的性能?
在我的数据,我有一个类变量,记为。此类变量的值为(二进制)。几乎所有对观察都为0(接近100%,更准确地说是97%)。我想在不同的分类模型上进行“性能”测试(可能是准确性)。我担心发生的事情是,如果我有一个分类模型始终将任何观察结果分类为0类,那么该模型将具有97%的准确度(即使它从未考虑任何其他变量)。CCC0 ,10,1个{0, 1}CCC 是否存在针对处理非常罕见事件的数据的分类模型的众所周知的性能测试?

2
与吉布斯抽样有关的混乱
我看到这篇文章时说,在吉布斯采样中,每个样本都被接受。我有点困惑。如果每个接受的样本都收敛到平稳分布,结果如何。 在一般的Metropolis算法中,我们接受为min(1,p(x *)/ p(x)),其中x *是采样点。我假设x *将我们指向密度很高的位置,因此我们正在向目标分布移动。因此,我认为经过一段时间的老化后,它会移动到目标分布。 但是,在吉布斯采样中,我们接受了所有内容,因此即使它可能将我们带到另一个地方,也不能说它收敛于平稳/目标分布 假设我们有一个分布 p (θ )= c (θ )/ Zp(θ)=C(θ)/žp(\theta) = c(\theta)/Z。我们无法计算Z。在大都会算法中,我们使用以下术语c (θñ Ë W ^)/ c (θÒ 升d)C(θñËw)/C(θØ升d)c(\theta^{new})/c(\theta^{old}) 合并发行版 c (θ )C(θ)c(\theta)加上归一化常数Z抵消了。这样很好 但是在吉布斯抽样中,我们在哪里使用分布 c (θ )C(θ)c(\theta) 例如在论文中http://books.nips.cc/papers/files/nips25/NIPS2012_0921.pdf其给定 所以我们没有确切的条件分布可用来进行抽样,我们只有与条件分布成正比的东西

1
使用百分位数作为预测变量-好主意吗?
我正在考虑一个问题,该问题是使用线性回归来预测客户的对数(支出)。 我正在考虑将哪些功能用作输入,并想知道将变量的百分位数用作输入是否可以。 例如,我可以将公司收入用作输入。我想知道的是,我是否可以使用公司收入百分比来代替。 另一个示例是分类行业分类器(NAICS)-如果我要查看每个NAICS代码的中位数支出,然后将每个NAICS代码分配给一个“ NAICS百分位数”,那将是我可以使用的有效解释变量吗? 只想知道使用百分位数时是否有任何需要注意的问题?它在某种程度上等同于一种要素缩放吗?

2
在逻辑回归中为高度偏斜的数据集添加权重
我使用的是Logistic回归的标准版本,以使我的输入变量适合二进制输出变量。 但是,在我的问题中,负输出(0s)远大于正输出(1s)。比例为20:1。因此,当我训练分类器时,似乎即使强烈暗示正输出可能性的特征对于其对应参数仍然具有非常低(非常负)的值。在我看来,发生这种情况是因为有太多否定示例将参数拉向它们的方向。 所以我想知道我是否可以为正例添加权重(例如,使用20而不是1)。这可能完全有益吗?如果是这样,我应该如何添加权重(在以下等式中)。 成本函数如下所示: J=(−1/m)⋅∑i=1my⋅log(h(x⋅θ))+(1−y)(1−log(h(x⋅θ)))J=(−1/m)⋅∑i=1my⋅log⁡(h(x⋅θ))+(1−y)(1−log⁡(h(x⋅θ)))J = (-1 / m) \cdot\sum_{i=1}^{m} y\cdot\log(h(x\cdot\theta)) + (1-y)(1 - \log(h(x\cdot\theta))) 此成本函数的梯度(wrt)为:θθ\theta grad=((h(x⋅θ)−y)′⋅X)′grad=((h(x⋅θ)−y)′⋅X)′\mathrm{grad} = ((h(x\cdot\theta) - y)' \cdot X)' 这里, =测试用例数, =特征矩阵, =输出向量, = S型函数, =我们要学习的参数。mmmxxxyyyhhhθθ\theta 最后,我运行梯度下降以找到可能的最低该实现似乎正常运行。JJJ

1
R / caret:训练和测试集与交叉验证?
这可能是一个愚蠢的问题,但是当使用插入符号生成模型并使用诸如LOOCV或(甚至更重要)时LGOCV,如果这实际上是交叉验证步骤的话,将数据分为训练集和测试集有什么好处?反正吗? 我阅读了一些相关的问题,他们建议一些交叉验证方法(例如,在插入符号处描述的方法)是出于特征选择的目的。但就我而言,我使用的是randomForest(method = "rf")和kernlab(method = svmRadial),它们在试图清除预测变量的组中未列出。 所以,我的问题是,如果我使用类似的方法cross_val <- trainControl(method = "LGOCV", p = 0.8),那与对80%的数据进行训练,对其余20%的数据进行测试所得模型并反复进行以了解模型是否有效? 如果是这样,是否有必要将我的数据分为训练/测试集? PS:我在根据经验生成的DOE原型进行模型处理时会提出一些要求(想想一些硬货,我们会调整输入,然后使用测试方法来测量该原型的各种属性)。 因此,我没有庞大的数据集,可以使用许多重叠的预测变量级别进行建模-我们经常在每个DOE兴趣点进行一次试验,因为在这种情况下,数据生成非常昂贵。因此,我想使用所有可能的数据建立一个准确的模型,但我想在这里检查一下,我没有遗漏明显的东西,也没有通过拆分来制作一个不好的模型。 编辑:针对@topepo的问题,我正在根据调整配方的化学输入来对化合物的物理测量属性进行建模。我无法讨论我的实际应用,但是我将基于配制内部乳胶​​漆组成一个示例。我正在运行设计的实验,我们将4-5种化学物质混合在一起,也许与%的固体混合,并花费一定的时间加热聚合物溶液以调节聚合度。 然后,我们可以测量流变性,分子量,油漆涂层的硬度,耐水性等。 我们有几个变量的不错的复制品,但是从每个DOE级别完全相同的意义上讲,真正复制品很少。总数据集为〜80个观察值,也许4-5是精确重复。我们已经进行了15种不同的测试,也许对每个观察都进行了5-6次测试。对于25-50%的数据,存在一些响应。 从这里开始,我们想对输出的属性上的7个预测变量的效果进行建模,然后进行优化以定位最有可能提供所需属性的新设计空间。 (因此,请在这里提出我的问题。一旦我拥有训练有素的模型,最好进行“反向”操作并输入所需的响应,以在可能的输入水平上获得最佳的猜测,然后再尝试)。

3
LDA与感知器
我正在尝试了解LDA如何“适合”其他受监督的学习技术。我已经在这里阅读了有关LDA的一些LDA风格的帖子。我已经熟悉感知器,但是现在才学习LDA。 LDA如何“适应”监督学习算法系列?与其他方法相比,它的缺点可能是什么?它可能会更好地用于哪些方面?为什么要使用LDA,例如当人们只能使用感知器时?


1
交互项是否使用中心变量分层回归分析?我们应该集中哪些变量?
我正在运行分层回归分析,但我有一些疑问: 我们是否使用居中变量计算交互作用项? 除了因变量外,我们是否必须将数据集中所有连续变量居中? 当我们必须记录一些变量时(因为它们的sd远远高于平均值),我们是否应该将刚刚记录的变量或初始变量居中? 例如:变量“ Turnover” --->记录的成交量(因为sd相对于平均值而言过高)---> Centered_Turnover? 或直接是营业额-> Centered_Turnover(我们一起工作) 谢谢!!

4
如果我有很多积极的,微不足道的结果,我是否可以测试“ 这些结果中至少是积极的”?
假设我分别对100个不同的人进行了相同的回归分析。我感兴趣的系数是正的(并且彼此之间有很大差异),但在所有100个结果中统计上都无关紧要(假设每个p值= 0.11)。 有没有一种方法可以将这些p值组合起来,以得出“这些结果中至少有80个是阳性”的结论,其意义远大于p = 0.11?我的在线搜索仅显示了我如何通过Fisher或类似测试怎么说“这些结果中至少有1项是肯定的”,但我无法对此结果进行概括。我想测试“ H0 =所有100种效果在0时都相同”对“ HA =至少80种效果是正值”。 我的目标不是说平均有一个正系数,也不是专门测量该系数。我的目标是有意义地证明,至少有80个人面对着一些积极的影响,而不论80个人,以及每个人感受到的影响程度如何。

2
如何在荟萃分析中最好地处理子分数?
我正在使用metafor包对R中的效果大小d进行荟萃分析。d代表患者与健康者之间的记忆评分差异。但是,一些研究仅报告了感兴趣的度量d的子分数(例如,几个不同的内存分数或来自三个单独的内存测试块的分数)。请查看以下带有d的虚拟数据集,它们代表研究的效应量及其标准偏差sd: d <- round(rnorm(5,5,1),2) sd <- round(rnorm(5,1,0.1),2) study <- c(1,2,3,3,3) subscore <- c(1,1,1,2,3) my_data <- as.data.frame(cbind(study, subscore, d, sd)) library(metafor) m1 <- rma(d,sd, data=my_data) summary(m1) 我想征询您的意见,以最佳方式处理这些子评分-例如: 从每个报告多个得分的研究中选择一个子得分。 包括所有子分数(这将违反rfx模型独立性的假设,因为一项研究的子分数来自同一样本) 对于每个报告评分的研究:计算平均得分和平均标准差,并将此“合并效应量”包括在rfx荟萃分析中。 包括所有子评分并添加一个虚拟变量,以指示从哪个研究中得出某个分数。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.