统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
如何从曲线拟合中解释协方差矩阵?
我不太擅长统计,因此很抱歉,这是一个简单的问题。我以曲线拟合的一些数据,有时候我的数据最适合的形式负指数,有时配合是更接近于一个* é (- b * X 2) + c。但是,有时两者都失败了,我想回到线性拟合中。我的问题是,如何根据从模型返回的结果方差-协方差矩阵确定哪种模型最适合特定数据集一个* ê(- b * X )+ c一种∗Ë(-b∗X)+Ca * e^{(-b * x)} + c一个* ê(- b * X2)+ c一种∗Ë(-b∗X2)+Ca * e^{(-b * x^2)} + cscipy.optimize.curve_fit()函数?我相信方差在此矩阵的对角线之一上,但我不确定如何解释。 更新:基于类似的问题,我希望方差-协方差矩阵可以告诉我我正在尝试的三个模型中的哪个最适合数据(我正在尝试将许多数据集适合这三个模型之一)。 对于给定的示例,结果矩阵如下所示: pcov_lin [[ 2.02186921e-05 -2.02186920e-04] [ -2.02186920e-04 2.76322124e-03]] pcov_exp [[ 9.05390292e+00 -7.76201283e-02 -9.20475334e+00] [ -7.76201283e-02 6.69727245e-04 7.90218415e-02] …


1
使用样条线查找密度函数的局部极值
我正在尝试找到概率密度函数的局部最大值(使用R density方法找到)。由于存在大量数据,因此我无法执行一种简单的“环顾四周”方法(即环顾一个点以查看其是否是相对于其邻居的局部最大值)。此外,与使用容错和其他参数构建“环顾四周”相反,使用样条插值法然后找到一阶导数的根似乎更为有效和通用。 所以,我的问题是: 给定来自的函数splinefun,哪些方法可以找到局部最大值? 有没有一种简单/标准的方法来查找使用返回的函数的派生形式splinefun? 有没有更好的/标准的方法来找到概率密度函数的局部最大值? 供参考,以下是我的密度函数图。我正在使用的其他密度函数在形式上相似。我应该说我是R的新手,但不是编程的新手,因此可能会有一个标准的库或程序包来实现我所需要的。 谢谢你的帮助!!
15 r  pdf  splines  maximum 

2
分布反映情况,其中一些等待带领我们期待着更多的等待
在上彼得泰尔对初创企业的演讲阅读布莱克法师的笔记,我碰到这个比喻的技术前沿: 想象世界被池塘,湖泊和海洋所覆盖。您坐在船上,在水里。但这是非常有雾的,所以您不知道它到另一边有多远。您不知道自己是在池塘,湖泊还是海洋中。 如果您在池塘里,可能会需要大约一个小时的穿越时间。因此,如果您整天都在外面,那么您要么在湖中,要么在海洋中。如果您已经出门一年了,那么您正在穿越海洋。旅程越长,预期的剩余旅程就越长。的确,随着时间的流逝,您越来越接近另一端。但是在这里,时间的流逝也表明您还有很长的路要走。 我的问题是:是否存在一种可以最好地模拟这种情况的概率分布或统计框架,尤其是粗体部分?

4
确定性世界中的机会运作
在史蒂文·平克(Steven Pinker)的书《我们的天性更好的天使》中,他指出 概率是一个透视问题。在足够近的范围内观察,个别事件具有确定的原因。甚至可以从起始条件和物理定律预测出掷硬币的情况,熟练的魔术师每次都可以利用这些定律投头。但是,当我们进行放大以对大量此类事件进行广角观察时,我们会看到大量原因的总和,这些原因有时相互抵消,有时沿同一方向排列。物理学家和哲学家亨利·庞加莱(Henri Poincare)解释说,当大量的微不足道的原因加在一起产生可怕的影响,或者当一个小的原因未能引起我们注意时,我们便会在确定性世界中看到机会的运作,而​​我们无法错过。如果是有组织的暴力,可能有人会发动战争;他等待机会的时刻,可能会或可能不会到来;他的敌人决定参与或撤退;子弹飞 炸弹爆炸;人们死了。每个事件都可以由神经科学,物理学和生理学定律确定。但是,总的来说,进入此矩阵的许多原因有时可以改组为极端组合。(第209页) 我对加粗的句子特别感兴趣,但其余内容供我参考。我的问题是:是否有统计学方法描述Poincare描述的两个过程?这是我的猜测: 1)“大量微不足道的影响加起来令人震惊。” 我听到的“大量原因”和“累加”就像中心极限定理。但是,在CLT(的经典定义)中,原因需要是随机变量,而不是确定性影响。这里的标准方法是将这些确定性效应近似为某种随机变量吗? 2)“忽略我们的一个小原因决定了我们不能错过的一个大影响。” 在我看来,您可以将其视为某种隐藏的马尔可夫模型。但是,HMM中的(不可观察到的)状态转换概率就是那个概率,根据定义,它还是不确定的。

4
ROC曲线的优点
ROC曲线的优点是什么? 例如,我正在对一些图像进行分类,这是一个二进制分类问题。我提取了约500个特征,并应用了特征选择算法来选择一组特征,然后将SVM应用于分类。在这种情况下,如何获得ROC曲线?是否应该更改特征选择算法的阈值,并获得输出的灵敏度和特异性以绘制ROC曲线? 就我而言,创建ROC曲线的目的是什么?


1
卡方特征选择到底如何工作?
我知道,对于每个要素类对,都会计算卡方统计量的值并将其与阈值进行比较。 我有点困惑。如果有特征和类,那么如何构建列联表?如何确定保留哪些功能以及删除哪些功能?米米mķķk 任何澄清将不胜感激。提前致谢

3
稳健的均值估计中的速成过程
我有一堆(大约1000个)估计值,它们都应该是长期弹性的估计值。多一点的这些一半是使用方法A和使用方法B.带我读的东西,如“我认为B法估计的东西剩下的估计很不是方法的不同,因为估计是多少(50-60%)高”。我对稳健统计的了解几乎是零,所以我只计算了两个样本的样本均值和中位数...,我立即看到了差异。方法A非常集中,中位数和均值之间的差异很小,但是方法B样本变化很大。 我得出的结论是,离群值和测量误差使方法B的样本倾斜,因此我丢弃了大约50个值(约15%),这与理论非常不一致...并且突然之间,两个样本的均值(包括其CI)非常相似。密度图也是如此。 (为消除异常值,我查看了样本A的范围,并删除了样本B之外的所有样本点。)我想告诉你,我在哪里可以找到一些可靠的均值估算基础请允许我更严格地判断这种情况。并有一些参考。我不需要对各种技术有很深入的了解,而是通过对鲁棒估计方法的全面调查来阅读。 我在去除异常值后进行了t均值显着性检验,p值为0.0559(t约为1.9),对于全部样本,t stat约为4.5。但这并不是真正的重点,手段可能有所不同,但是如上所述,它们不应相差50-60%。而且我认为他们没有。

7
可以使用哪种机器学习算法来预测股市?
或者,预测外汇市场。我知道这可能会变得非常复杂,因此作为介绍,我正在寻找一种具有一定准确性的简单预测算法。 (这是为期四个月的硕士学位课程) 我读过多层神经网络可能会有用。有什么想法吗?另外,社交媒体的语义分析可以提供对影响股票市场的市场行为的洞察力。但是,语义分析目前不在项目范围内。




5
哪种统计分类算法可以预测输入序列的正确/错误?
给定一个输入序列,我需要确定此序列是否具有某些所需的属性。该属性只能为true或false,也就是说,一个序列只能属于两个可能的类。 序列与属性之间的确切关系尚不清楚,但我认为它是非常一致的,应该将其用于统计分类。我可能会在很多情况下对分类器进行训练,尽管这可能会有点嘈杂,但从某种意义上来说,在此训练集中,序列被分配了错误的类别的可能性很小。 训练数据示例: Sequence 1: (7 5 21 3 3) -> true Sequence 2: (21 7 5 1) -> true Sequence 3: (12 21 7 5 11 1) -> false Sequence 4: (21 5 7 1) -> false ... 粗略地说,属性由序列中的一组值(例如,出现“ 11”表示该属性几乎肯定为假)以及值的顺序(例如,“ 21 7 5 ”会大大增加该属性为真的机会)。 训练后,我应该能够给分类器一个以前看不见的序列,例如(1 21 7 5 3),它应该输出对属性为true的信心。是否存在用于使用这种输入/输出训练分类器的著名算法? …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.