统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
乍一看数据集
请原谅我的无知,但是... 我不断遇到自己设法找到的大量新数据的情况。这些数据通常看起来像这样: Date Number1 Number2 Category1 Category2 20120125 11 101 Dog Brown 20120126 21 90 Cat Black 20120126 31 134 Cat Brown (...) 通常乍一看,我真的无法分辨这里是否有任何趋势。各个列之间的相关性可能不是很重要,但是如果我不必为每种可能的列/类别组合手动创建图,我将感到非常高兴。 是否有工具可以接受数据表以及信息,哪些列应被视为数字,日期和类别,然后进行绘制: 每两个数值列之间的相关性 每两个数值列之间的相关性,每个类别具有单独的趋势线 每个数字列作为时间序列, 每个数字列都是一个时间序列,按类别分开, 等等 最后,这将生成大量图,其中大多数图仅显示噪声。理想情况下,该工具可以通过相关性对图进行评分,最后显示从得分最高的图开始的幻灯片显示。这将是非常不完美的,但乍一看对数据集很有用。 所以?是否有每个人都使用的工具,而我对此却一无所知,还是我们需要制作此工具?

1
如何估算两个周期性时间序列之间的相位差?
我有2个每日时间序列,每个时间序列长达6年。虽然嘈杂,但它们都明显是周期性的(频率为〜1年),但似乎异相。我想估计这些时间序列之间的相位差。 我考虑过将形式曲线拟合到每个时间序列,并只是比较b的两个不同值,但是我怀疑还有更好的方法(和严格的!)方法(也许使用傅立叶变换?)。如果可能的话,我也希望对相位差估计中的不确定性有某种了解。asin(2π365t−b)asin⁡(2π365t−b)a\sin(\frac{2\pi}{365}t - b) 更新: 阴影区域为95%CI。 两个时间序列之间的样本互相关:

1
曼·惠特尼检验中的原假设是什么?
令为分布1的随机值,令为分布2的随机值。我认为曼恩·惠特尼检验的原假设为。X1X1X_1X2X2X_2P(X1&lt;X2)=P(X2&lt;X1)P(X1&lt;X2)=P(X2&lt;X1)P(X_1 < X_2) = P(X_2 < X_1) 如果我对均值均等且方差相等的正态分布的数据进行的Mann-Whitney检验模拟,则得出的I类错误率非常接近0.05。但是,如果我使方差不相等(但均值相等),则拒绝原假设的模拟比例将大于0.05,这是我没有想到的,因为仍然成立。这发生在我使用的R,不管我是否拥有,或。α=0.05α=0.05\alpha=0.05P(X1&lt;X2)=P(X2&lt;X1)P(X1&lt;X2)=P(X2&lt;X1)P(X_1 < X_2) = P(X_2 < X_1)wilcox.testexact=TRUEexact=FALSE, correct=TRUEexact=FALSE, correct=FALSE 零假设与我上面写的有所不同吗?或者,如果方差不相等,那么就类型I错误而言,检验是否不准确?

1
梯度树增强中的树大小
弗里德曼(Friedman)提出的梯度树增强使用具有J终端节点(= leaves)的决策树作为基础学习者。可以通过多种方式来生长具有确切J节点的树,例如,可以以深度优先或宽度优先的方式生长树... 有没有建立好的方法来生长带有完全J末端节点的树以进行梯度树增强? 我检查了R gbm包的树生长过程,似乎它以深度优先的方式扩展树,并使用基于错误改进的启发式方法选择扩展左还是右子节点-是正确的吗?
10 r  cart  boosting 


4
如何在线性回归中解释对数变换的系数?
我的情况是: 我已经对数转换了1个连续因变量和1个连续预测变量,以对它们的残差进行归一化,以进行简单的线性回归。 对于将这些转换后的变量与其原始上下文相关联的任何帮助,我将不胜感激。 我想使用线性回归来基于2010年缺勤的天数来预测2011年缺勤的天数。大多数学生缺勤0天或仅几天,数据正向左偏斜。因此,需要进行变换以使用线性回归。 我对两个变量都使用了log10(var + 1)(对于缺勤0天的学生使用+1)。我使用回归是因为我也想添加分类因素-性别/种族等。 我的问题是: 我想反馈给的听众不会理解log10(y)= log(constant)+ log(var2)x(坦率地说,我也不是)。 我的问题是: a)是否有更好的方法来解释回归中的转换变量?即在2010年永远错失1天,而在2011年错失2天,而在2010年永远错失1个日志单位,2011年是否错失x个日志单位? b)具体而言,鉴于此消息来源的引用语段如下: “这是数学标准化考试成绩每增加一个单位的负二项式回归估计,因为模型中的其他变量保持不变。如果学生将她的数学考试成绩提高一个点,则对数的对数差在使模型中的其他变量保持不变的同时,预期计数将减少0.0016单位。” 我想知道: 这句话是不是说UNTRANSFORMED变量数学分数的每增加一单位,常数(a)UNTRANSFORMED就会减少0.0016 ,那么如果数学分数上升两点,我就要从常数a减去0.0016 * 2? 这是否意味着我通过使用指数(a)和指数(a + beta * 2)来获得几何平均值,并且我需要计算这两者之间的百分比差,以说明预测变量的影响/有因变量? 还是我完全错了? 我正在使用SPSS v20。很抱歉在一个很长的问题中提出这个问题。

3
给定连续M次,预期抛硬币的次数将连续N次
1月,Interviewstreet进行了第二次CodeSprint,其中包括以下问题。程序化答案已发布,但不包含统计解释。 (您可以使用Google信用登录到Interviewstreet网站,然后从此页面转到Coin Tosses问题,以查看原始问题和已发布的解决方案。) 投币 您有一个不偏不倚的硬币,您想要一直扔下去,直到获得N个连续的正面。您已经抛硬币了M次,令人惊讶的是,所有抛硬币都导致了正面的损失。 在您连续获得N个脑袋之前,需要进行的额外抛球次数是多少? 输入: 第一行包含个案T的数量。接下来的T行每一行包含两个数字N和M。 输出: 输出T行,其中包含相应测试用例的答案。打印答案,精确到小数点后两位。 样本输入: 4 2 0 2 1 3 3 3 2 样本输出: 6.00 4.00 0.00 8.00 示例说明: 如果N = 2且M = 0,则需要不断掷硬币,直到连续获得2个头。不难证明平均需要掷6枚硬币。 如果N = 2且M = 1,则需要连续2个头,并且已经有1个头。无论如何,都需要再次抛掷。在第一个折腾中,如果您有头脑,那就完成了。否则,您需要重新开始,因为连续计数器会重置,并且您需要不断掷硬币,直到获得N = 2个连续头。因此,预期的抛硬币次数为1 +(0.5 * 0 + 0.5 * 6)= 4.0如果N = 3且M = 3,您已经有3个头,因此您不再需要抛硬币。 …


4
R的summary.lm对象的LaTeX输出-在表外显示信息时[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 3年前关闭。 在我看来,这是基本知识,但似乎无法在线找到解决方案,因此我想知道自己可能会缺少什么。 我希望将lm摘要对象的输出包括在Sweave(.Rnw)文档中。我可以按原样输出summary.lm,也可以使用xtable / Hmisc包(通过xtable或latex命令)。是否有类似xtable的东西,它也提供了表外部可用的摘要信息?(,F统计等...?)R2R2R^2
10 r  regression 

3
在线约会网站的统计数据
我很好奇在线约会系统如何使用调查数据来确定匹配项。 假设他们具有过去比赛的结果数据(例如1 =幸福结婚,0 =没有第二个约会)。 接下来,假设他们有两个偏好问题, “您喜欢户外活动多少?(1 =非常不喜欢,5 =非常喜欢)” “您对生活有多乐观?(1 =非常不喜欢,5 =非常喜欢)” 还假设对于每个偏好问题,他们都有一个指标“配偶分享您的偏好有多重要?(1 =不重要,3 =非常重要)” 如果他们每对都有这4个问题,以及比赛是否成功的结果,那么将使用该信息预测未来比赛的基本模型是什么?

3
从大小为的牌组中抽出张卡片时,看不见的卡片的预期数量
我们有一副nnn张牌。我们随机更换,从中均匀地抽取卡片。2n2n2n抽奖后,从未选择的期望牌数是多少? 此问题是问题2.12中的第2部分 M. Mitzenmacher和E. Upfal,《概率与计算:随机算法和概率分析》,剑桥大学出版社,2005年。 而且,就其价值而言,这不是作业问题。这是自学的,我只是被卡住了。 到目前为止,我的回答是: 令XiXiX_i为第iii次抽奖后看到的不同纸牌的数量。然后: E[Xi]=∑k=1nk(knP(Xi−1=k)+n−k−1nP(Xi−1=k−1))E[Xi]=∑k=1nk(knP(Xi−1=k)+n−k−1nP(Xi−1=k−1))E[X_i] = \displaystyle \sum_{k=1}^{n} k (\frac{k}{n}P(X_{i-1}=k) + \frac{n-k-1}{n} P(X_{i-1}=k-1)) 这里的想法是,每次绘制时,我们要么绘制我们看到的卡片,要么绘制我们没有看到的卡片,然后我们可以递归地定义它。 最后,问题的答案是nE [X_ {2n}],我们在2n次抽签后还没看到多少?2n2n2nn−E[X2n]n−E[X2n]n-E[X_{2n}] 我相信这是正确的,但是必须有一个更简单的解决方案。 任何帮助将不胜感激。

1
进行多元回归时,何时转换预测变量?
我目前正在研究生阶段上我的第一个应用线性回归课程,并且在多元线性回归中努力应对预测变量转换。我正在使用的文本Kutner等人的“应用的线性统计模型”似乎没有涵盖我所遇到的问题。(除了建议使用Box-Cox方法转换多个预测变量外)。 当面对一个响应变量和几个预测变量时,每个预测变量要努力满足什么条件?我了解我们最终正在寻找误差方差和正态分布误差的恒定性(至少在到目前为止所学的技术中)。我进行了许多练习,例如y ~ x1 + (1/x2) + log(x3),解决方案在哪里一个或多个预测变量发生了变化。 我很了解简单线性回归下的基本原理,因为很容易查看y〜x1和相关的诊断(残差的qq图,残差与y,残差与x等),并测试一下y〜log( x1)更符合我们的假设。 在了解许多预测变量的情况下,是否有一个开始了解何时转换预测变量的好地方? 先感谢您。马特

1
两个独立的统一变量之差的分布,在0处截断
设和为两个独立的随机变量,它们具有相同的均匀分布且密度相同XXXÿÿYU(0 ,1)U(0,1个)U(0,1) F(x)=1f(x)=1f(x)=1如果(其他位置为),则。0≤x≤10≤x≤10≤x≤1000 令为定义为的真实随机变量:ZZZ Z=X−YZ=X−YZ=X-Y如果(在其他位置为),则。X&gt;YX&gt;YX>Y000 推导的分布。ZZZ 计算期望值和方差。E(Z)E(Z)E(Z)V(Z)V(Z)V(Z)

3
如何正式测试正态分布(或其他分布)中的“断裂”
在社会科学中经常会出现这样的情况:应该以某种方式分布的变量(通常说来)最终在某些点周围的分布不连续。 例如,如果存在特定的临界值,例如“通过/失败”,并且如果这些措施容易出错,那么此时可能会出现中断。 一个突出的例子(以下引用)是学生标准化考试成绩通常基本上分布在所有地方,除了60%的人(50-60%的质量很少)和60-65%的质量过多。这在教师为自己的学生考试评分的情况下发生。作者调查了教师是否真的在帮助学生通过考试。 毫无疑问,最令人信服的证据来自显示钟形曲线图,该钟形图在针对不同测试的不同截止点附近具有较大的不连续性。但是,您将如何进行统计检验?他们尝试了插值法,然后比较了高于或低于该分数的分数,还对了高于或低于该临界值的5个分数进行了t检验。虽然明智,但这些都是临时的。谁能想到更好的办法? 链接: 学生和学校评估中的规则和自由裁量权:以纽约州摄政官考试为例 http://www.econ.berkeley.edu/~jmccrary/nys_regents_djmr_feb_23_2011.pdf

1
使用R中的fda包预测新曲线的响应
基本上,我要做的就是使用一些曲线来预测标量响应。我已经做完了回归(使用fda包中的fRegress进行回归),但不知道如何将结果应用于一组新曲线(用于预测)。 我有N = 536曲线和536标量响应。到目前为止,这是我所做的: 我为曲线创建了基础。 我创建了一个fdPar对象来引入罚款 我已经使用smooth.basis创建了fd对象,以在指定的基础上以选定的代价对曲线进行平滑处理。 我使用fRegress()进行了回归,对标量响应上的曲线进行回归。 现在,我要做的就是使用该回归为我拥有的一组新数据生成预测。我似乎找不到简单的方法来做到这一点。 干杯

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.