统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


4
如何(数值)估算具有较大alpha和beta的beta分布的近似值
是否存在一种数值稳定的方法来计算大整数alpha,beta(例如alpha,beta> 1000000)的beta分布值? 实际上,如果使问题变得更容易,我只需要围绕模式设置99%的置信区间即可。 补充:对不起,我的问题没有我想的那么清楚。我想要做的是:我有一台检查传送带上产品的机器。这些产品的一部分被机器拒绝。现在,如果机器操作员更改某些检查设置,我想向他/她显示估计的废品率,以及一些有关当前估计的可靠性的提示。 因此,我认为我将实际拒绝率视为随机变量X,并根据拒绝对象N和接受对象M的数量计算该随机变量的概率分布。如果我假设X的先验分布均匀,则这是一个beta分布取决于N和M。我可以直接向用户显示此分布,也可以找到一个区间[l,r],以便实际拒绝率在此区间内,且p> = 0.99(使用shabbychef的术语)并显示间隔。对于较小的M,N(即,在参数更改之后),我可以直接计算分布并近似间隔[l,r]。但是对于大的M,N,这种简单的方法会导致下溢错误,因为x ^ N *(1-x)^ M很小,可以表示为双精度浮点数。 我猜我最好的选择是对小M,N使用朴素的beta分布,并在M,N超过某个阈值后立即切换为具有相同均值和方差的正态分布。那有意义吗?

6
一个如何应对欧拉计划213问题(“跳蚤马戏”)?
我想解决Euler 213项目,但不知道从哪里开始,因为我是统计学领域的外行,请注意,需要准确的答案才能使用蒙特卡洛方法。您能推荐一些统计主题供我阅读吗?请不要在此处发布解决方案。 马戏团 一个30×30的正方形网格包含900条跳蚤,最初是每平方跳蚤。敲响钟声时,每条跳蚤会随机跳至相邻的正方形(通常有4种可能性,但网格边缘或角落处的跳蚤除外)。 铃响50次后,预计空置正方形数是多少?将答案四舍五入到小数点后六位。

6
如何在R中的data.frame中查找因子的所有唯一组合的摘要统计信息?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 2年前关闭。 我想为data.frame中每个唯一的因素组合计算data.frame中变量的摘要。我应该使用plyr做到这一点吗?我可以使用循环而不是apply(); 因此只要找出每种独特的组合就足够了。

6
在观察性(即非随机)研究中控制非独立协变量有多大问题?
Miller和Chapman(2001)认为,在观察性(非随机)研究中,控制与独立变量和因变量相关的非独立协变量绝对是不合适的,即使这在社会科学中是常规进行的。这样做有多大问题?如何解决这个问题的最佳方法是什么?如果您在自己的研究中例行控制观察性研究中的非独立协变量,那么您如何证明它合理?最后,在与同事争论方法论时(例如,这真的很重要),这值得一战吗? 谢谢 Miller,GA和Chapman,JP(2001)。对协方差的误解。异常心理学杂志,110,40-48。- http://mres.gmu.edu/pmwiki/uploads/Main/ancova.pdf

4
多项卡方检验
我在2 x 2 x 6表格中交叉分类了数据。让我们叫的尺寸response,A和B。我用模型对数据进行逻辑回归response ~ A * B。对该模型偏差的分析表明,术语及其相互作用都是重要的。 但是,从数据的比例来看,似乎只有2个左右的水平B对这些重要影响负责。我想测试一下是哪个级别的罪魁祸首。现在,我的方法是在的2 x 2表上执行6个卡方检验response ~ A,然后针对多个比较对这些检验的p值进行调整(使用Holm调整)。 我的问题是,对于这个问题是否有更好的方法。是否有更原则的建模方法或多重卡方检验比较方法?

5
有关如何计划研究的参考
在关于统计的平均(中位数?)对话中,您经常会发现自己正在讨论分析这种或那种数据的这种或那种方法。以我的经验,经常忽略对统计分析有特殊想法的仔细研究设计(从事生物学/生态学工作,这似乎很普遍)。统计人员经常发现自己陷入僵局,收集的数据不足(或完全错误)。用罗纳德·费舍尔(Ronald Fisher)来解释,他们被迫对数据进行事后检验,这往往导致结论很弱,即使有的话。 我想知道您使用哪些参考来构建成功的研究设计,最好是用于帮助您避免上述陷阱的多种方法(例如t检验,GLM,GAM,排序技术...)。

4
非独立观察的方差分析
很抱歉这个问题的详细背景: 有时,在动物行为调查中,实验者对受试者在测试设备中不同的预定区域所花费的时间感兴趣。我经常看到使用ANOVA分析这类数据;但是,鉴于ANOVA假设观测值是独立的,并且在这些分析中它们实际上并不是独立的,因此我从来没有完全相信这种分析的有效性(因为在一个区域中花费的时间越多,意味着在其他区域中花费的时间就越少! )。 例如, DR Smith,CD Striplin,AM Geller,RB Mailman,J.Drago,CP Lawler,M.Gallagher,缺乏D1A多巴胺受体的小鼠的行为评估,Neuroscience,第86卷,第1期,1998年5月21日,第135-146页 在上述文章中,它们将自由度降低了1,以补偿非独立性。但是,我不确定这种操作如何真正改善这种对ANOVA假设的违反。 卡方程序也许更合适?您将如何分析这样的数据(根据在区域中花费的时间来选择区域)? 谢谢!
11 anova 

10
除了预测建立模型之外还有其他原因吗?
约书亚·爱泼斯坦(Joshua Epstein)发表了一篇题为《为什么要模型》的论文。可从http://www.santafe.edu/media/workingpapers/08-09-040.pdf获得,其中有16个原因: 解释(与预测完全不同) 指导数据收集 照亮核心动力 建议动态类比 发现新问题 养成科学的思维习惯 绑定(括号)结果到合理范围 阐明核心不确定性。 提供近实时的危机选择 展示权衡/建议效率 通过微扰挑战主流理论的稳健性 揭露主流智慧与现有数据不符 培训从业人员 进行政策对话 教育大众 将看似简单(复杂)显示为复杂(简单) (Epstein在他的论文中详细阐述了许多原因。) 我想问一下社区: 爱泼斯坦没有列出其他原因吗? 有没有更优雅的方式来概念化(也许是不同的分组)这些原因? 爱泼斯坦的原因有缺陷还是不完整? 他们对这些原因的阐述是否更为明确?
11 modeling 

3
是否有调试MCMC程序的标准技术?
调试MCMC程序非常困难。出现此困难的原因是几个问题,其中一些是: (a)算法的循环性质 我们迭代绘制以所有其他参数为条件的参数。因此,如果实现不能正常工作,则很难隔离错误,因为问题可能存在于迭代采样器中的任何地方。 (b)正确答案不一定是已知的。 我们无法告诉我们是否已经实现融合。在某种程度上,可以通过在模拟数据上测试代码来缓解这种情况。 鉴于上述问题,我想知道是否存在可用于调试MCMC程序的标准技术。 编辑 我想分享我用来调试自己的程序的方法。我当然会做PeterR提到的所有事情。除此之外,我还使用模拟数据执行以下测试: 从真实值开始所有参数,并查看采样器是否偏离真实值太远。 我在迭代采样器中具有每个参数的标志,这些标志确定我是否在迭代采样器中绘制该参数。例如,如果将标志“ gen_param1”设置为true,则在迭代采样器中从其完整条件中提取“ param1”。如果将其设置为false,则将'param1'设置为其真实值。 完成采样器的编写后,我将使用以下配方测试程序: 将一个参数的generate标志设置为true,将其他所有参数设置为false,并评估关于真实值的收敛性。 结合第一个参数设置另一个参数的generate标志,然后再次评估收敛性。 以上步骤对我非常有用。
11 mcmc 

2
如何理解卷积深度信念网络进行音频​​分类?
Lee等人在“ 用于分层表示的可扩展无监督学习的卷积深度信念网络 ”中。(PDF)提出了卷积DBN。还对该方法进行了图像分类评估。这听起来很合逻辑,因为具有自然的局部图像特征,例如小角和边缘等。 Lee等人在“ 使用卷积深度置信网络进行音频​​分类的无监督特征学习 ”中。等 此方法适用于不同类别的音频。说话者识别,性别识别,电话分类以及一些音乐流派/艺术家分类。 如何将网络的卷积部分解释为音频,就像将图像解释为边缘一样?

1
有哪些好的方法选择框架?
我一直在研究方法选择的理论框架(注意:不是模型选择),却发现很少有系统的,基于数学的动机。“方法选择”是指一个框架,用于针对问题或问题类型区分适当的(或更好的,最优的)方法。 我发现,即使是零星的,也可以在特定方法及其调整(即贝叶斯方法中的优先选择)以及通过偏差选择(例如归纳策略:偏向选择的语用学)的方法选择上进行大量工作。在机器学习发展的这个早期阶段,我可能是不切实际的,但是我希望找到类似测量理论在按比例类型规定可允许的转换和测试的过程中所做的事情,只是在学习问题领域发挥了重要作用。 有什么建议么?

1
如何使ANOVA适应二进制数据?
我有四个竞争模型,可用来预测n个受试者的二元结果变量(例如,毕业后的就业状况,1 =就业,0 =失业)。模型性能的自然指标是命中率,命中率是每个模型的正确预测的百分比。 在我看来,由于数据违反了ANOVA的假设,因此我无法在此设置中使用ANOVA。在上述设置中,是否可以使用等效程序代替ANOVA来检验所有四个模型均等效的假设?

8
哪种统计软件适合教授社会科学专业的统计学入门课程?
我正在寻找一种统计软件包,可以在社会科学学习计划的统计学入门课程中使用。这些学生没有统计学的先验知识,也没有编程语言的经验。目的是向他们介绍基本的统计概念(例如均值,方差,平方和,p值,...,最后是线性回归),并使他们能够使用示例数据集自行进行基本分析。本课程应该是通过统计来学习概念,而不是记住公式(尽管我认为公式很重要)。 因此,我正在寻找一种替代常规语法(如普通R)或点击(如SPSS或Rcmdr)驱动软件的方法。该软件应易于学习,并且应具有清晰的图形用户界面,以可视化数据集并提供标准图形和表格。最好的办法是可视化分析的所有不同步骤(例如,读取和处理数据,描述性度量的计算,制作描述性表和图形,推论性度量的计算,推论性图形的绘制,导出到报告)。 您是否有适合学习和首次实践统计的(开源或免费)统计软件的建议? 编辑 感谢您的建议。我研究了gretl,以及在我自己的在线查询中发现的其他两个程序:RapidMiner和Statistics Lab。[1] 我发现gretl的接口和输出比Rcmdr,SPSS或Stata更加清晰和集中。因此,从我的角度来看,它是开始教授统计学的一个很好的工具。 但是,流程图GUI的RapidMiner和Statistical Lab当他们可视化统计分析的单个步骤(从加载数据开始)时,我印象深刻。我认为这可能对许多通常专注于数学解释的学生有所帮助。当然,对我来说,RapidMiner似乎对初学者来说功能,菜单和按钮太重了,而统计实验室则更加专注。统计实验室的最大优势是带有控制台的“ R计算器”和“ R代码向导”,可帮助产生真正的R语法,因为统计实验室依赖R其计算。 最后,我决定在第一学期开始统计实验室,同时介绍基本概念,并在第二学期切换到RStudio(和Rcmdr)。 [1]:在我看来,Gnumeric,SciPy,Scilab,GNU Octave等似乎都不是针对社会科学的。

2
工具与变量之间的因果关系方向是否重要?
关于因果关系(->)的工具变量的标准方案是: Z -> X -> Y 其中Z是工具,X是内生变量,Y是响应。 以下关系是否可能: Z <- X ->Y Z <-> X ->Y 也有效吗? 虽然满足了工具和变量之间的相关性,但在这种情况下我如何考虑排除限制? 注意:此符号<->不是明确的,可能导致对该问题的不同理解。答案仍然突出了这个问题,并用它来显示问题的重要方面。阅读时,请谨慎对待问题的这一部分。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.