统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
基于字符串长度和可能字符的简单组合/概率问题
假设“完全随机”,并给出一个长度为20个字符的字符串,其中每个字符可能是62个可能的字符之一: 总共可能有多少种组合?(将20乘以62的幂。) 另外,如果新的字符串是一个接一个地随机选择的,并添加到到目前为止选择的字符串列表中,那么在选择已经选择的字符串之前,必须选择多少个字符串的比例低于1到100000()?10−510−510^{-5} 注意: 62来自:数字(0-9),大写字母(AZ)和小写字母(az)。

2
归因于调查答复中的系统错误
我进行了一项大型调查,其中询问了学生,尤其是母亲的教育水平。有些人跳过了,有的回答错误。我知道这一点,因为后来有一个最初受访者母亲的子样本接受了采访,并提出了同样的问题。(我敢肯定,与母亲的回答有关的错误也要少一些。) 我的挑战是决定如何最好地利用第二个更可靠的数据源。至少,与只能依靠完整案例的情况相比,我可以使用它来更智能地估算丢失的数据。但是,如果我可以交叉核对数据的孩子中有3/4回答“我的母亲从未读完小学”的孩子与他们母亲的回答相矛盾,那么看来我应该使用估算来创建多个数据集以捕获那里的不确定性。[补充:我说的是3/4,但是现在我已经检查了数据,我还想告诉您,接近40%的数据是不对的] 我个人将在混合模型中使用母亲的教育作为预测因子,但是如果有人对其他情况有话要说,我也希望了解它们。 我很想收到有关广泛技巧或特定方面的建议。谢谢! 更新:尽管感谢Will和Conjugate_Prior的回答,但我暂时还没有解决问题,但我希望获得更多具体和技术反馈。 下面的散点图将让您了解在存在10,000个案例的情况下这两个变量如何关联。它们嵌套在100余所学校中。它们的相关系数为0.78,学生的答案-均值:5.12 sd = 2.05,妈妈的答案,均值= 5.02,sd = 1.92在大约15%的情况下,学生的答案缺失。


3
R中矩阵之间的相关性
我在使用cor()和cor.test()函数时遇到问题。 我只有两个矩阵(只有数值,行和列的数目相同),我想拥有相关数和相应的p值。 当我使用时,cor(matrix1, matrix2)我得到所有细胞的相关系数。我只需要一个数字作为cor的结果。 此外,我cor.test(matrix1, matrix2)收到以下错误消息 Error in cor.test.default(matrix1, matrix2) : 'x' must be a numeric vector 如何获得矩阵的p值? 您可以在此处找到我想要关联的简单表: http://dl.dropbox.com/u/3288659/table_exp1_offline_MEANS.csv http://dl.dropbox.com/u/3288659/table_exp2_offline_MEANS.csv
9 r  correlation 


2
有序逻辑回归中的AUC
我使用2种逻辑回归-一种是简单类型,用于二进制分类,另一种是序数逻辑回归。为了计算前者的准确性,我使用了交叉验证,其中我计算了每一折的AUC,然后计算了平均AUC。如何进行顺序逻辑回归?我听说过针对多类预测器的广义ROC,但是我不确定如何计算它。 谢谢!


3
如何将系数项应用于线性方程中的因子和交互项?
使用R,我为来自连续和离散预测变量混合的单个响应变量拟合了线性模型。这是非常基础的,但是我很难理解离散因子的系数是如何工作的。 概念:显然,连续变量'x'的系数是以以下形式应用的,y = coefx(varx) + intercept但是如果该因子是非数值的,那么该因子对因子z怎么起作用?y = coefx(varx) + coefz(factorz???) + intercept 具体:我在R中拟合了一个模型,lm(log(c) ~ log(d) + h + a + f + h:a)其中h和f是离散的非数值因素。系数为: Coefficients: Estimate (Intercept) -0.679695 log(d) 1.791294 h1 0.870735 h2 -0.447570 h3 0.542033 a 0.037362 f1 -0.588362 f2 0.816825 f3 0.534440 h1:a -0.085658 h2:a -0.034970 h3:a -0.040637 我如何使用它们来创建预测方程: …

2
互相关与互信息
互相关和互信息有什么区别。使用这些措施可以解决什么样的问题,何时才适合使用一个问题。 感谢您的评论。为了澄清,这个问题是由对图像分析而不是时间序列分析的兴趣提示的,尽管对该领域的任何启发也将受到赞赏。

1
季节性调整后的每月逐月增长以及潜在的每周季节性
作为附带的兴趣,我一直在探索预测时间序列(尤其是使用R)。 就我的数据而言,我有每天的访问次数,可以追溯到将近4年的每天。在此数据中,有一些不同的模式: 周一至周五的访问量很多(周一/周二最高),但周六至周日的访问量则大大减少。 一年中的某些时段下降(例如,美国假期前后的访问量减少,夏季显示出较少的增长) 年比显着增长 能够使用这些数据来预测未来的一年,并使用它来进行季节性调整后的逐月增长,这将是很好的。每月查看的主要内容是: 某些月份的星期一/星期二会比其他月份要多(而且多年以来也不一致)。因此,需要对平日较多的一个月进行相应的调整。 探索周似乎也很困难,因为周编号系统会根据年份从52-53更改,并且似乎ts无法解决这一问题。 我正在考虑为一个月的工作日取平均值,但是结果得出的单位有点奇怪(平均工作日访问次数的增长),并且会删除有效的数据。 我觉得这种数据在时间序列中很常见(例如,办公楼中的用电量可能是这样的),有人对如何建模有任何建议,尤其是在R中? 我正在使用的数据非常简单,它开始如下: [,1] 2008-10-05 17607 2008-10-06 36368 2008-10-07 40250 2008-10-08 39631 2008-10-09 40870 2008-10-10 35706 2008-10-11 18245 2008-10-12 23528 2008-10-13 48077 2008-10-14 48500 2008-10-15 49017 2008-10-16 50733 2008-10-17 46909 2008-10-18 22467 并以这种方式一直延续到现在,总体呈增长趋势,在美国假期周前后有所下降,而夏季的增长总体上放缓。

2
如何在R中为SVM输入变量执行遗传算法变量选择?
我在R中使用kernlab软件包来构建SVM,以对某些数据进行分类。 SVM运行良好,因为它提供了不错的准确性的“预测”,但是我的输入变量列表比我想要的要大,而且我不确定不同变量的相对重要性。 我想实现一个遗传算法,以选择产生最佳训练/最适合的SVM的输入变量子集。 在尝试此GA实施时(可能是一个简短的psuedo示例),我想选择使用哪个R包时需要一些帮助。 我已经查看了大部分R GA / P软件包(RGP,genalg,subselect,GALGO),但是我在概念上很难解决如何将ksvm函数作为健身函数的一部分传递并输入我的变量数组作为人口池...? 在正确的方向上得到的任何帮助,想法或推动都将不胜感激。 谢谢 解决此问题的代码在稍后的EDIT中添加 # Prediction function to be used for backtesting pred1pd = function(t) { print(t) ##add section to select the best variable set from those available using GA # evaluation function - selects the best indicators based on miminsied training error …

4
预期值与非正态分布中的均值,中位数等有何关系?
连续随机变量的期望值在非正态分布(例如偏正态)中如何与算术平均值,中位数等相关?我对任何常见/有趣的分布都感兴趣(例如,对数正态分布,简单的双向/多峰分布,其他任何奇怪而奇妙的分布)。 我主要在寻找定性答案,但是也欢迎任何定量或公式化答案。我特别希望看到任何使其更清晰的视觉表示。


2
如何对R中的生存数据执行Wilcoxon符号秩检验?
假设您有以下生存数据: obs <- data.frame( time = c(floor(runif(100) * 30), floor((runif(100)^2) * 30)), status = c(rbinom(100, 1, 0.2), rbinom(100, 1, 0.7)), group = gl(2,100) ) 要执行标准的日志等级测试,可以使用 survdiff(Surv(time, status) ~ group, data = obs, rho = 0) 对? 但是其他测试呢?您如何执行Wilcoxon签名秩检验,Peto检验或Fleming-Harrington检验? R提供了执行Wilcoxon测试的可能性,但是我没有找到如何让它考虑审查的方法。 此外,文档指出,设置rho = 1将使测试成为“ Gehan-Wilcoxon测试的Peto和Peto修改”。但这是否与Peto测试相同?

2
从训练集中删除重复项以进行分类
假设我有很多关于分类问题的行: X1,...XN,YX1,...XN,YX_1, ... X_N, Y 其中是 /预测变量,是该行的要素组合所属的类。X1,...,XNX1,...,XNX_1, ..., X_NYYY 许多特征组合及其类在数据集中重复进行,我正在使用它来拟合分类器。我只是想知道是否可以删除重复项(我基本上group by X1 ... XN Y在SQL中执行a )?谢谢。 PS: 这是针对仅二进制存在的数据集,其中类先验非常偏斜

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.