统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
通过数据集的随机子样本初始化K均值中心吗?
如果我有某个数据集,那么使用该数据集的随机样本来初始化聚类中心有多么聪明? 例如,假设我要5 clusters。我可以5 random samples说size=20%是原始数据集。然后,我可以对这5个随机样本中的每个样本取平均值,然后将这些均值用作我的5个初始聚类中心吗?我不知道我在哪里读这本书,但我想知道你们对这个想法的看法。 更新:请参阅此线程初始化K-means聚类:现有的方法有哪些?有关各种初始化方法的一般讨论。

1
使用广义矩法(GMM)计算逻辑回归参数
我想计算与逻辑回归非常相似的回归系数(实际上是具有另一个系数的逻辑回归: 当可以给出时)。我曾考虑过使用GMM来计算系数,但是我不确定应该使用什么时刻条件。A一种1 + e− (b0+ b1个X1个+ b2X2+ … ),A1+e−(b0+b1x1+b2x2+…), \frac{A}{1 + e^{- (b_0 + b_1 x_1 + b_2 x_2 + \ldots)}},一种AA 有人可以帮我吗? 谢谢!


3
有什么好的,免费的期刊来跟踪机器学习的最新发展?
随时用“新闻”代替任何其他有用的知识门户。 我有兴趣关注机器学习的新发展,以期达到实际应用。我不是要发表自己的著作的学者(至少不是在该领域),但我确实想知道可能在实践上有用的新算法或技巧。 唯一需要注意的是,日记/会议记录或任何内容都必须免费提供而不需要订阅。

2
线性回归时,你只知道
假设。Xβ=YXβ=YX\beta =Y 我们地知道,只知道它与每个预测变量。YYYXtYXtYX^\mathrm{t}Y 普通的最小二乘(OLS)解决方案是,这没有问题。β=(XtX)−1XtYβ=(XtX)−1XtY\beta=(X^\mathrm{t} X)^{-1} X^\mathrm{t}Y 但是,假设接近奇异(多重共线性),那么您需要估计最佳的岭参数。所有方法似乎都需要的确切值。XtXXtXX^\mathrm{t}XYYY 当仅知道时,是否有其他方法?XtYXtYX^\mathrm{t}Y

6
随机森林:如何处理测试集中的新因子水平?
我正在尝试使用R中的随机森林模型进行预测。 但是我得到了错误,因为某些因素在测试集中与训练集中具有不同的值。例如,一个因子在测试集中的Cat_2值34, 68, 76等不出现在训练集中。不幸的是,我无法控制测试集...我必须原样使用它。 我唯一的解决方法是使用将问题因子转换回数值as.numeric()。它的工作原理,但我不是很满意,因为这些值是没有意义的数字代码... 您是否认为还有另一种解决方案,可以从测试集中删除新值?但是,不删除1, 2, 14, 32训练和测试中所有其他因素值(比如说值等),并且包含可能对预测有用的信息。

3
对均方根误差和均值偏差的概念理解
我想对“均方根误差(RMSE)”和“均值偏差(MBD)”有一个概念上的理解。在为我自己的数据比较计算了这些度量之后,我常常感到困惑,发现RMSE高(例如100千克),而MBD低(例如小于1%)。 更具体地说,我正在寻找参考(而非在线参考),其中列出并讨论了这些度量的数学原理。计算这两种度量的通常可接受的方法是什么,我应该如何在期刊论文中报告它们? 在这篇文章的背景下,拥有一个“玩具”数据集可以用来描述这两种量度的计算是非常有帮助的。 例如,假设我要查找装配线生产的200个小部件的质量(以千克为单位)。我也有一个数学模型,它将尝试预测这些小部件的质量。该模型不必是经验模型,也可以基于物理模型。我在实际测量值和模型之间计算了RMSE和MBD,发现RMSE为100千克,MBD为1%。这在概念上意味着什么,我将如何解释这一结果? 现在假设我从该实验的结果中发现,RMSE为10千克,MBD为80%。这是什么意思,关于这个实验我能说些什么? 这些措施的含义是什么,两者(合起来)意味着什么?与RMSE一起考虑时,MBD还提供哪些其他信息?

2
如何将问卷中的顺序数据转换为适当的间隔数据?
是否有任何简单的方法可以将序数级别的数据转换为间隔级别(正好相反)?可以在Excel或SPSS中执行吗? 有了数据,说:序数级别上的10个问题(例如0-5比例,其中0 =“完全不”,5 =“一直”),我想对其进行转换,以便可以将其视为适当的问题用于参数测试目的的时间间隔级别数据(正态分布,无法进行的非参数测试)。 将非常感谢您的回答!

2
通过泊松回归生成数据样本
我想知道如何从R中的泊松回归方程生成数据?我对如何解决这个问题感到困惑。 因此,如果我假设我们有两个分布为预测变量和。截距为0,两个系数都等于1。那么我的估计很简单:X1个X1X_1X2X2X_2ñ(0 ,1 )N(0,1)N(0,1) 日志(是)= 0 + 1 ⋅ X1个+ 1 ⋅ X2log⁡(Y)=0+1⋅X1+1⋅X2\log(Y) = 0+ 1\cdot X_1 + 1\cdot X_2 但是,一旦计算出log(Y),如何基于该值生成泊松计数?泊松分布的速率参数是多少? 如果有人可以编写一个简短的R脚本来生成泊松回归样本,那将太棒了!

2
什么是组块测试?
在回答存在多重共线性的模型选择问题时,Frank Harrell 建议: 将所有变量放入模型中,但不测试针对竞争变量的影响而调整的一个变量的影响...竞争变量的块测试功能强大,因为共线性变量在整体多自由度关联测试中共同作用,而不是当您分别测试变量时,彼此竞争。 什么是块测试?你能举一个例子说明他们的应用r吗?

3
二维Kolmogorov-Smirnov
我想运行一些二维Kolmogorov-Smironov测试,以确定二维分布是否适合参考。 我是否可以相对简单的方式使用任何软件包或应用程序?还是有其他更可取的算法?我只有基本的统计知识。


3
Ruby作为统计工作台
这也是一个与Python作为统计工作台和excel作为统计工作台非常相关的问题。我知道关于Ruby与Python的讨论很多,但这不是这个问题的重点。我认为Ruby比Python快并且语法非常自然,这可以使我理解统计数据,并且可以很好地替代R(这也是我感兴趣的,在我对R的其他问题中也提到过)。例如,在我见过的一次Google Tech讲座中(引用了这里的链接问题,讲师抱怨R在创建for循环时速度很慢)。有了Ruby,也有了Rails,因此也许也有可能将两者结合在一起(Python确实有Django,但我不再赘述)。 因此,对于我来说,问题与Ruby相同: 如果我想使用Ruby作为“统计工作台”来代替R,SPSS,Python,Excel等,您能推荐什么? 根据您的经验,我会有什么得失? 请注意,我正在基于先前的Python和Excel问题来考虑此问题。如果您认为使用Ruby和Python(或Excel)会产生相同的影响,请这么说并指向任何先前问题的论点,该问题的目的是不要为相同的答案复制先前的问题。但是,我确实相信存在差异(例如语言和语法的速度),但是我也特别想知道针对Ruby的建议,或者是否有比它说的少得多的可用建议。 Python或Excel。因此,对于其他非常相似的问题,但对于其他语言/程序,请考虑先前的答案。 编辑:只是要突出显示,因为答案似乎是相反的,所以我一直在寻找答案,例如我链接到的Python问题中选择的答案。它不是与Ruby一起学习统计信息。我确实指出了用R学习统计的问题。如果可能的话,但是我不希望同时使用Ruby学习统计信息。您可以假设此问题的统计背景。
13 r  python  software  ruby 

2
重要性抽样产生的蒙特卡洛估计结果
在过去的一年中,我一直在非常接近地进行重要性抽样工作,并且有一些开放性问题,希望能对此有所帮助。 我在重要性采样方案上的实践经验是,它们有时可以产生出色的低方差和低偏差估计。但是,更常见的是,它们倾向于产生高误差估计值,该估计值具有较低的样本方差,但具有很高的偏差。 我想知道是否有人可以确切解释影响重要性抽样估计有效性的哪些因素?我尤其想知道: 1)当偏倚分布具有与原始分布相同的支持时,重要性抽样估计是否可以保证收敛到正确的结果?如果是这样,为什么在实践中似乎要花这么长时间? 2)通过重要性抽样得出的估计误差与偏差分布的“质量”(即,与零方差分布有多少匹配)之间是否存在可量化的关系? 3)部分基于1)和2)-有没有一种方法可以量化您必须了解的分布“多少”,然后再使用重要性抽样设计比简单的蒙特卡洛方法更好。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.