统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
如何最好地以图形方式显示II型(beta)误差,功效和样本量?
我被要求写一篇关于统计学的入门书,我在努力用图形显示p值和幂之间的关系。我想出了这张图: 我的问题:有更好的显示方式吗? 这是我的R代码 x <- seq(-4, 4, length=1000) hx <- dnorm(x, mean=0, sd=1) plot(x, hx, type="n", xlim=c(-4, 8), ylim=c(0, 0.5), ylab = "", xlab = "", main= expression(paste("Type II (", beta, ") error")), axes=FALSE) axis(1, at = c(-qnorm(.025), 0, -4), labels = expression("p-value", 0, -infinity )) shift = qnorm(1-0.025, mean=0, …
16 r  teaching  power 

2
使用R的nls()进行变更点分析
我正在尝试实现“变化点”分析或nls()在R中使用的多阶段回归。 这是我制作的一些虚假数据。我想用来拟合数据的公式是: ÿ= β0+ β1个x + β2最大(0 ,X - δ)ÿ=β0+β1个X+β2最大值(0,X-δ)y = \beta_0 + \beta_1x + \beta_2\max(0,x-\delta) 这应该做的是使数据具有特定的截距和斜率(β0β0\beta_0和β1个β1个\beta_1),直到特定点,然后在某个x值(δδ\delta)之后,将斜率增加β2β2\beta_2。这就是整个最大事情。在δδ\delta点之前,它等于0,并且β2β2\beta_2将被清零。 因此,这是我的功能: changePoint <- function(x, b0, slope1, slope2, delta){ b0 + (x*slope1) + (max(0, x-delta) * slope2) } 我尝试以这种方式拟合模型 nls(y ~ changePoint(x, b0, slope1, slope2, delta), data = data, start = c(b0 = 50, …

1
基础科学中的顺序假设检验
我是一名药理学家,以我的经验,几乎所有基础生物医学研究论文都使用Student's t检验(以支持推理或符合期望...)。几年前,引起我注意的是,学生t检验不是可以使用的最高效的检验:顺序检验可为任何样本量提供更大的功效,或者平均等效功效的样本量要小得多。 在临床研究中使用了复杂程度不同的顺序程序,但我从未见过在基本的生物医学研究出版物中使用过这种程序。我注意到,入门级的统计教科书也没有这些内容,大多数基础科学家都可能会看到。 我的问题有三点: 鉴于顺序测试具有非常重要的效率优势,为什么没有更广泛地使用它们? 序贯方法的使用是否有缺点,这意味着不鼓励非统计学家使用序贯方法? 是否向统计专业的学生教授顺序测试程序?


3
在财务时间序列中进行可靠的异常值检测
我正在寻找一些健壮的技术,以从财务时间序列数据(即tickdata)中删除异常值和错误(无论原因如何)。 逐笔的财务时间序列数据非常混乱。当交易所关闭时,它包含巨大的(时间)差距,而当交易所再次打开时,则存在巨大的跳跃。当交易所开放时,各种因素都会以错误的价格水平(没有发生)和/或不能代表市场的价格(例如,由于错误地输入了买入或卖出价而导致价格飙升)引入了交易。tickdata.com(PDF)撰写的这篇论文很好地概述了问题,但提供了一些具体的解决方案。 我在网上可以找到的大多数论文都提到了此问题,或者忽略了该问题(假定报价数据已被过滤),或者将该过滤作为某种庞大的交易模型的一部分,该模型隐藏了任何有用的过滤步骤。 有谁知道在这方面做更深入的工作? 更新: 这个问题表面上看起来很相似,但是: 财务时间序列是非周期性的(至少在刻度级别上)。 开放效果是一个大问题,因为即使您真的愿意(因为否则您一无所有),您也不能简单地将最后一天的数据用作初始化。外部事件可能导致新的一天的开盘价在绝对水平和波动性上都与前一天大相径庭。 传入数据的频率异常不规则。在一天中几乎每天打开和关闭时,每秒数据点的数量可能是一天中平均值的10倍。另一个问题涉及定期采样的数据。 金融数据中的“异常值”表现出一些特定的模式,可以使用不适用于其他领域的特定技术来检测这些模式,而我(在某种程度上)正在寻找这些特定技术。 在更极端的情况下(例如闪存崩溃),在更长的时间间隔(> 10分钟)内,异常值可能占数据的75%以上。另外,传入数据的(高)频率包含有关情况异常方面的一些信息。

2
在Freedman等人的“统计”和Freedman等人的“统计模型:理论与实践”之间进行选择
我不是统计学家,但我对统计学非常感兴趣,我想买一本书作为参考。我有一些关于特定主题的书(例如用于机器学习的贝叶斯数据分析的统计学习元素)的......嗯,贝叶斯数据分析:)我也一直在寻找一个更通用的书。 弗里德曼的书通常在这里得到深思熟虑: 高级统计书籍推荐 您会为非统计学家的科学家推荐哪本书? Freedman,Pisani和Purves(A)的统计数据是后一个问题的选择答案,我打算购买。但是,我发现了有关统计模型的理论与实践(B)。这两本书看起来很相似(据我所知:即使阅读完整的ToC,亚马逊也限制了我……我不知道为什么)。出版日期非常接近。然而: B便宜得多。不过,我可以使用A,因此,如果A明显好于B,我愿意选择A。 A更长,但在我看来B缺少的主要章节与概率有关。我不需要那部分,所以如果那是唯一的不同或主要的不同,我宁愿购买更便宜,更便于携带的B :) 你会建议我买哪本书?
16 references 

4
为什么P(A,B | C)/ P(B | C)= P(A | B,C)?
我了解。条件是A和B的交集除以B的整个面积。P(甲∩ 乙)/ P(B )= P(一 | B)P(一种∩乙)/P(乙)=P(一种|乙)P(A\cap B)/P(B) = P(A|B) 但是为什么?P(甲∩ 乙| C ^)/ P(B | C)= P(甲|乙∩ Ç)P(一种∩乙|C)/P(乙|C)=P(一种|乙∩C)P(A\cap B|C)/P(B|C) = P(A|B \cap C) 你能给我一些直觉吗? 应该不是:吗?P(甲∩ 乙∩ Ç)/ P(B ,C)= P(甲|乙∩ Ç)P(一种∩乙∩C)/P(乙,C)=P(一种|乙∩C)P(A\cap B \cap C)/P(B,C) = P(A|B \cap C)


1
余弦相似度,皮尔逊相关度和z得分之间是否有任何关系?
我想知道这三项措施之间是否有任何关系。我似乎无法通过引用定义在它们之间建立联系(可能是因为我是这些定义的新手,并且在掌握它们时花了一些时间)。 我知道余弦相似度的范围可以是0-1,并且皮尔逊相关性的范围可以是-1到1,并且我不确定z得分的范围。 但是,我不知道余弦相似度的某个值如何告诉您有关皮尔逊相关性或z分数的信息,反之亦然?

2
回归的自然三次样条的定义
我正在从Hastie等人的《统计学习的数据挖掘,推理和预测的要素》一书中学习样条曲线。我在第145页上发现,自然三次样条曲线在边界结之外是线性的。有KKK结,ξ1,ξ2,...ξKξ1,ξ2,...ξK\xi_1, \xi_2, ... \xi_K在栓和下面给出关于在书中这样一个样。 问题1:如何释放4个自由度?我没有这部分。 问题2:在定义时ķ = ķ然后ð ķ(X )= 0dk(X)dk(X)d_k(X)k=Kk=Kk=K。作者在这个公式中想做什么?这如何帮助确保样条曲线在边界结之外是线性的?dK(X)=00dK(X)=00d_K(X) = \frac 0 0

1
卷积网络中卷积滤波器数量的意义是什么?
卷积层传送的滤波器数量是多少? 这个数字如何影响架构的性能或质量?我的意思是我们应该总是选择更多数量的过滤器吗?他们有什么好处?人们如何为不同的层分配不同数量的过滤器?我的意思是看这个问题:如何确定CNN中卷积运算符的数量? 答案指定了3个卷积层,它们具有不同数量的过滤器和大小,同样在这个问题中:卷积神经网络中特征图的数量 您可以从图片中看到,第一层有28 * 28 * 6过滤器,第二层conv层有10 * 10 * 16过滤器。他们如何得出这些数字,这是通过反复试验得出的吗?提前致谢

2
置信区间的解释
注意:如果这是重复的事,请提前致歉,我在搜索中没有找到类似的q 假设我们有一个真实的参数p。置信区间C(X)是RV,包含95%的时间。现在假设我们观察X并计算C(X)。常见的答案似乎是将其解释为“有95%的机会包含p”是不正确的,因为它“要么包含p,要么不包含p”。 但是,比方说,我从一个洗过的纸牌的顶部挑选一张卡片,并将其面朝下。凭直觉,我认为这张卡成为黑桃王牌的概率为1/52,即使实际上“不是黑桃王牌”。为什么我不能将这种推理应用于置信区间示例? 或者,如果说卡的“概率”是黑桃的王牌是没有意义的,因为它是“是或不是”,那么我仍然会以51:1的概率说它不是黑桃的王牌。还有另一句话来描述此信息吗?这个概念与“概率”有何不同? 编辑:从贝叶斯概率的解释中,也许更清楚一点,如果我被告知随机变量包含p的95%的时间,那么给定该随机变量的实现(并且没有其他要限制的信息)是正确地说随机变量有95%的概率包含p? 编辑:同样,从概率论的概率解释来看,假设频率论者同意不说“置信区间包含p的概率为95%”之类的话。对于常客来说,拥有置信区间包含p的“置信度”是否仍然合乎逻辑? 令alpha为显着性水平,令t = 100-alpha。K(t)是置信区间包含p的常客的“置信度”。K(t)应该在t中增加是有道理的。当t = 100%时,常客应该确定(根据定义)置信区间包含p,因此我们可以归一化K(1)=1。类似地,K(0)=0。大概K(0.95)在0和1,并且K(0.999999)更大。频率论者会认为K与P(概率分布)不同吗?

3
如何在非负矩阵分解中选择最佳潜在因子数量?
给定的矩阵Vm×nVm×n\mathbf V^{m \times n},非负矩阵分解(NMF)发现两个非负矩阵Wm×kWm×k\mathbf W^{m \times k}和Hk×nHk×n\mathbf H^{k \times n}(即与所有元素≥0≥0\ge 0)来表示分解矩阵为: V≈WH,V≈WH,\mathbf V \approx \mathbf W\mathbf H, 例如要求非负的WW\mathbf W和HH\mathbf H∥V−WH∥2.‖V−WH‖2.\|\mathbf V-\mathbf W\mathbf H\|^2. 是否有通用的方法来估算kkk NMF中?例如,如何将交叉验证用于此目的?


3
我们什么时候可以说共线性
在线性模型中,我们需要检查解释变量之间是否存在关系。如果它们之间的相关性太大,则存在共线性(即,变量在某种程度上相互解释)。我目前仅查看每个解释变量之间的成对相关性。 问题1: 什么被归类为太多的相关性?例如,皮尔逊相关系数是否为0.5? 问题2: 我们是否可以根据相关系数完全确定两个变量之间是否存在共线性,或者它是否取决于其他因素? 问题3: 对两个变量的散点图进行图形检查是否会增加相关系数指示的内容?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.