统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
当对不平衡的类进行过度/欠采样时,最大化准确性与最小化错误分类成本是否有所不同?
首先,我想描述一些数据挖掘书籍用来解释如何处理不平衡数据集的常见布局。通常,主要部分名为不平衡数据集,它们涵盖了以下两个子部分:成本敏感分类和抽样技术。 似乎面对一个罕见的类问题,您可以执行成本敏感的分类和抽样。相反,我认为,如果稀有类别也是分类的目标,并且对该类别的记录进行错误分类的代价高昂,则应该应用成本敏感的技术。 另一方面,如果分类的目标总体上具有良好的准确性,而不关注特定类别,则采样技术(例如过采样和欠采样)将很有用。 这种信念来自MetaCost的基本原理,MetaCost是使分类器对成本敏感的一种通用方法:如果一个人希望使分类器对成本敏感,以便惩罚稀有类的分类错误,则他应该对另一类进行过采样。粗略地讲,分类器尝试适应其他类别,并且变为稀有类别所特有的。 这与对稀有类进行过度采样相反,这是解决此问题的通常建议方法。稀有类别的过采样或其他类别的过采样有助于提高整体准确性。 拜托,如果您确认我的想法,那将是很棒的。 如此说来,不平衡数据集面临的常见问题是: 我是否应该尝试获取与其他稀有记录一样多的稀有记录? 我的答案是,如果您正在寻找准确性:好的。您可以执行此操作,以查找更多罕见的类示例,或者删除其他类的某些记录。 如果您使用成本敏感技术专注于稀有类,我会回答:您只能找到更多稀有类示例,但不应删除其他类的记录。在后一种情况下,您将无法让分类器适应其他类别,并且罕见的类别错误分类错误可能会增加。 你会怎么回答?


1
在SVM中解释与超平面的距离
在直观地理解SVM时,我有一些疑问。假设我们已经使用一些标准工具(例如SVMLight或LibSVM)训练了SVM模型进行分类。 当我们使用该模型对测试数据进行预测时,该模型将为每个测试点生成一个具有“ alpha”值的文件。如果alpha值为正,则测试点属于1类,否则它属于2类。现在,我们可以说具有更大“ alpha”值的测试点属于具有“较高”概率的相应类吗? 与第一个问题类似,当我们训练了SVM时。SV非常靠近超平面。那么这是否意味着SV很有可能属于该类别?我们可以将一个点属于一个类的概率与到“超平面”的距离联系起来吗?“ alpha”值代表距“超平面”的距离吗? 感谢您的输入。


2
贝叶斯和常识性EDA方法是否存在差异?
简而言之:探索性数据分析的贝叶斯和频率论方法有什么区别吗? 我不知道EDA方法中的固有偏差,因为直方图是直方图,散点图是散点图等,我也没有找到关于EDA的讲授或呈现方式差异的示例(忽略了A. Gelman的特别理论论文) 。最后,我看了CRAN,它是所有应用的仲裁者:我没有找到适合贝叶斯方法的软件包。但是,我认为CV可能会有一些人对此有所了解。 为什么要有差异? 对于初学者: 在确定适当的先验分布时,不应该用肉眼进行调查吗? 在汇总数据并建议是使用常客模型还是贝叶斯模型时,EDA是否不建议选择哪个方向? 两种方法在如何处理混合模型方面有非常明显的区别。鉴定样本可能来自人群混合是具有挑战性的,并且与用于估计混合物参数的方法直接相关。 两种方法都包含随机模型,并且通过了解数据来驱动模型的选择。更复杂的数据或更复杂的模型需要在EDA中花费更多时间。鉴于随机模型或生成过程之间的这种区别,EDA活动存在差异,因此,难道不应该因不同的随机方法而产生区别吗? 注1:我并不关心“阵营”的哲学-我只想解决我的EDA工具包和方法中的任何空白。

3
如何在R中使用Levene测试功能?
我是统计学和R的新手,使用Levene函数时遇到了麻烦(我想检查两个样本的方差是否相等)。文档说我应该运行: levene.test(y,组) 但是我不知道我应该作为y和group放置什么?我有两个不同的样本,我想检查方差是否相等。我是否应该将样本值之一作为y,将第二个值作为组参数? 有什么提示吗?

2
Box-Jenkins选型
时间序列分析中的Box-Jenkins模型选择过程从查看序列的自相关和部分自相关函数开始。这些图可以建议ARMA (p ,q )模型中的适当和q。通过要求用户应用AIC / BIC标准来选择那些具有白噪声误差项的模型中最简化的模型,从而继续执行该过程。pppqqq(p,q)(p,q)(p,q) 我想知道这些目视检查和基于标准的模型选择步骤如何影响最终模型的估计标准误差。我知道,例如,横截面域中的许多搜索过程都会使标准误向下偏移。 第一步,通过查看数据(ACF / PACF)选择适当的滞后次数如何影响时间序列模型的标准误差? 我猜想根据AIC / BIC分数选择模型会产生与横截面方法类似的影响。我实际上对这方面也不了解,所以在这一点上任何评论也将不胜感激。 最后,如果您写下用于每个步骤的精确标准,是否可以引导整个过程来估计标准误差并消除这些担忧?

3
如何按比例绘制小提琴图以进行比较?
我正在尝试绘制小提琴图,并想知道是否存在公认的最佳实践,可以在各个组之间进行缩放。这是我使用R mtcars数据集尝试过的三个选项(1973年的Motor Trend Cars,在此处找到)。 等宽 似乎是原始纸张 *和R的vioplot作用(示例)。适合比较形状。 均等面积 由于每个图都是概率图,因此感觉不错,因此在某个坐标空间中每个图的面积应等于1.0。适用于比较每个组中的密度,但如果将图重叠,则似乎更合适。 加权面积 面积相等,但按观察次数加权。6缸变得相对稀薄,因为这些汽车较少。适用于比较各组的密度。 *小提琴图:箱形图-密度踪迹协同效应(DOI:10.2307 / 2685478)

1
从多元高斯分布中产生值
目前我正在试图到的模拟值维随机变量具有与平均向量一个多元正态分布和协方差矩阵。NNNXXXμ=(μ1,...,μN)Tμ=(μ1,...,μN)T\mu = (\mu_1,...,\mu_N)^TSSS 我希望能使用类似于逆CDF方法的过程,这意味着我想首先生成维均匀随机变量,然后把它插入到这个分布的逆CDF,所以生成值。NNNUUUXXX 我遇到问题是因为该过程没有得到很好的记录,并且MATLAB中的mvnrnd函数与我在Wikipedia上找到的描述之间存在细微的差异。 就我而言,我还随机选择分布的参数。特别是,我从均匀分布生成每个均值。然后,我使用以下过程构建协方差矩阵:μiμi\mu_iU(20,40)U(20,40)U(20,40)SSS 创建一个下三角矩阵,其中对于,,对于 ,LLLL(i,i)=1L(i,i)=1L(i,i) = 1i=1..Ni=1..Ni=1..NL(i,j)=U(−1,1)L(i,j)=U(−1,1)L(i,j) = U(-1,1)i&lt;ji&lt;ji < j 令,其中表示的转置。S=LLTS=LLTS = LL^TLTLTL^TLLL 此过程使我可以确保是对称且为正定的。它还提供了一个较低的三角矩阵因此,我认为需要从该分布生成值。SSSLLLS=LLTS=LLTS = LL^T 使用Wikipedia上的指南,我应该能够使用维统一生成值,如下所示:XXXNNN X=μ+L∗Φ−1(U)X=μ+L∗Φ−1(U)X = \mu + L * \Phi^{-1}(U) 但是,根据MATLAB函数,通常按以下方式完成: X=μ+LT∗Φ−1(U)X=μ+LT∗Φ−1(U)X = \mu + L^T * \Phi^{-1}(U) 其中是一个的逆CDF维,可分离,正态分布,并且这两种方法之间的唯一区别是简单地是否使用或。Φ−1Φ−1\Phi^{-1}NNNLLLLTLTL^T 是MATLAB还是维基百科?还是都错了?

3
生成总和为一的均匀分布的权重?
通常在混合模型之类的应用程序中使用权重并线性组合基函数。权重必须经常服从和。我想从此类向量的均匀分布中随机选择一个权重向量。wiwiw_iwi≥wi≥w_i ≥∑iwi=1∑iwi=1\sum_{i} w_i=1w=(w1,w2,…)w=(w1,w2,…)\mathbf{w} = (w_1, w_2, …) 使用w_i = \ frac {\ omega_i} {\ sum_ {j} \ omega_j}可能很诱人,wi=ωi∑jωjwi=ωi∑jωjw_i = \frac{\omega_i}{\sum_{j} \omega_j}其中ωi∼ωi∼\omega_i \sim U(0,1),但是正如下面的注释所讨论的,\ mathbf {w的分布}ww\mathbf{w}是不统一的。 但是,给定约束∑iwi=1∑iwi=1\sum_{i} w_i=1,问题的基本维度似乎为n−1n−1n-1,并且应该有可能通过根据以下方法选择n-1个参数来选择ww\mathbf{w}:进行某种分布,然后根据这些参数计算相应的\ mathbf {w}(因为一旦指定了权重的n-1,就完全确定了剩余的权重)。n−1n−1n-1ww\mathbf{w}n−1n−1n-1 这个问题似乎是类似球面点采摘的问题(但不是采摘3载体,其ℓ2ℓ2ℓ_2标准是统一的,我想挑选nnn -载体,其ℓ1ℓ1ℓ_1标准是统一)。 谢谢!

2
使用R(tm包)进行文本挖掘的示例
tm在阅读了一位朋友的草稿后,我花了三天时间,他在那儿用UCINET探索了文本语料库,显示了文本云,两模式网络图和单值分解(带有使用Stata的图形)。我遇到了很多问题:在Mac OS X上,诸如Snowball(填充)或Rgraphviz(图形)之类的库背后存在Java问题。 可能有人点出不包 -我已经看过tm,wordfish并wordscores和了解NLTK -但研究,如果可能的代码,在文本数据,成功地使用tm或别的东西来分析像议会辩论和立法文件数据?我似乎在这个问题上找不到太多的东西,甚至学到的代码也更少。 我自己的项目是为期两个月的议会辩论,这些变量以CSV文件形式提供:议会会议,发言人,议会小组,口头干预文本。我希望在演讲者之间,尤其是在议会团体之间,在使用罕见和较不罕见的术语时出现分歧,例如,“安全对话”与“公民自由”对话。
14 r  text-mining 

1
如何在mgcv GAM模型中调整平滑
我试图弄清楚如何在mgcv:gam模型中控制平滑参数。 我有一个二项式变量,我想主要将其建模为固定网格上x和y坐标的函数,以及一些其他影响较小的变量。过去,我使用locfit包和(x,y)值构建了一个相当不错的局部回归模型。 但是,我想尝试将其他变量合并到模型中,看起来通用加性模型(GAM)很有可能。看完gam和mgcv软件包后,它们都具有GAM功能,我选择了后者,因为邮件列表线程中的许多注释似乎都推荐它。缺点是它似乎不支持像黄土或locfit这样的局部回归平滑器。 首先,我只想尝试仅使用(x,y)坐标来复制locfit模型。我尝试使用常规和张量积平滑: my.gam.te &lt;- gam(z ~ te(x, y), family=binomial(logit), data=my.data, scale = -1) my.gam.s &lt;- gam(z ~ s(x, y), family=binomial(logit), data=my.data, scale = -1) 但是,绘制来自模型的预测,与locfit模型相比,它们要平滑得多。因此,我一直在尝试调整模型,使其不会过度平滑。我曾尝试过调整参数sp和k,但是我不清楚它们如何影响平滑度。在locfit中,nn参数控制所使用邻域的跨度,较小的值允许较少的平滑和更多的“摆动”,这有助于捕获网格上二项式结果的概率快速变化的某些区域。我将如何设置gam模型以使其表现相似?
14 r  smoothing  mgcv 

1
如何计算持续期间的预测误差(置信区间)?
我经常需要通过每月的数据系列来预测未来的时期。 可以使用公式来计算时间序列中下一个时段在alpha处的置信区间,但这永远不会包括如何处理第二个时段和第三个时段等。 我可以从视觉上想象,如果任何预测都用上下置信区间作图,那么通常这些区间应相对于平均预测成指数地增加或减少,因为不确定性是一种累积力。 假设我有4月= 5月10日= 6月8日= 7月11日= 13的单位销售,没有其他背景,例如季节性或人口数据 我们需要预测(尽管盲目地)八月,九月,十月。 您将使用哪种方法?更重要的是,您将如何衡量9月和10月的信心? 抱歉,对于某些专家来说,这可能是一个简单的问题-我一直在努力寻找一个明确的答案,而且我敢肯定,这是像我这样的所有业余爱好者都希望理解的事情。

3
是否有人使用或L .5度量进行聚类,而不是使用L 2? Aggarwal等人, 关于距离度量在高维空间中的令人惊讶的行为, 他说(2001年)大号1个大号1个L_1大号.5大号.5L_.5大号2大号2L_2 对于高维数据挖掘应用, L 1始终比欧几里德距离度量 L 2更可取 大号1个大号1个L_1大号2大号2L_2 并声称或L .1会更好。大号.5大号.5L_.5大号.1大号.1L_.1 使用或L .5的原因可能是理论上的或实验上的,例如对异常值/Kabán论文的敏感性,或基于真实或合成数据运行的程序(请复制)。一个例子或一张照片会帮助我的外行直觉。大号1个大号1个L_1大号.5大号.5L_.5 这个问题是鲍勃·杜兰特(Bob Durrant)对“ 当下就是最近的邻居今天有意义”的回答的后续行动 。正如他所说,的选择既取决于数据又取决于应用程序。尽管如此,真实经验的报告还是有用的。ppp 6月7日(星期二)添加的注释: 我偶然发现了“基于L1范数和相关方法的统计数据分析”,道奇(Dodge)编辑,2002年,454p,isbn 3764369205 —数十篇会议论文。 谁能分析iid指数特征的距离集中?指数的原因之一是 ; 另一个(非专家)是最大熵分布≥0;第三,某些真实数据集,尤其是SIFT,看起来大致呈指数形式。| exp−exp | 〜ëXp|ËXp-ËXp|〜ËXp|exp - exp| \sim exp≥≥\ge


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.