统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


3
高度非线性函数的拟合策略
为了分析生物物理学实验的数据,我目前正在尝试使用高度非线性的模型进行曲线拟合。模型函数基本上看起来像: y=ax+bx−1/2y=ax+bx−1/2y = ax + bx^{-1/2} 在这里,尤其是的值引起了极大的兴趣。bbb 此函数的图解: (请注意,模型函数是基于对系统的全面数学描述,并且看起来效果很好---只是自动拟合很棘手)。 当然,模型函数是有问题的:到目前为止,我尝试过的拟合策略因处的渐近渐近线而失败,尤其是对于嘈杂的数据。x=0x=0x=0 我对这里问题的理解是,简单的最小二乘拟合(我在MATLAB中同时进行了线性和非线性回归;主要是Levenberg-Marquardt)对垂直渐近线非常敏感,因为x中的小误差被极大地放大了。 谁能指出我可以解决此问题的合适策略? 我有一些统计方面的基本知识,但是仍然很有限。我很想学习,如果我只知道从哪里开始的话:) 非常感谢您的建议! 编辑求您原谅忘记提及错误。唯一的显着噪声是,它是可加的。xxx 编辑2有关此问题背景的一些其他信息。上图对聚合物的拉伸行为进行了建模。正如@whuber在评论中指出的那样,您需要来获得如上的图形。b≈−200ab≈−200ab \approx -200 a 关于人们到目前为止如何拟合该曲线:似乎人们通常会切断垂直渐近线,直到找到合适的拟合为止。但是,截止选择仍然是任意的,这使拟合过程不可靠且不可重现。 编辑3&4固定图。

1
调和混合模型的符号
我熟悉以下符号: 其中β0Ĵ=β0+üĴ,和ÿ我Ĵ=β0+ β一世X我Ĵ+你Ĵ+ e我Ĵ= β0 Ĵ+ β一世X我Ĵ+ e我Ĵyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align}β0 Ĵ= β0+你Ĵβ0j=β0+uj\beta_{0j}=\beta_{0}+u_j 其中β0Ĵ=β0+ü0Ĵ和β1Ĵ=β1+ù1Ĵÿ我Ĵ=β0+ β1个X我Ĵ+ 你0 Ĵ+ 你1 ĴX我Ĵ+ e我Ĵ= β0 Ĵ+ β1 ĴX我Ĵ+ e我Ĵyij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eij\begin{align} y_{ij} &= \beta_0 + \beta_1 x_{ij} + u_{0j} + u_{1j} …

1
如果网球比赛是一个大型比赛,那么多少场比赛才能达到相同的准确性?
网球有一个独特的三层得分系统,我想知道从比赛的角度来看,这是否有任何统计学上的好处,以确定更好的球员。 对于那些不熟悉的人,通常情况下,只要您有2分的领先优势(通常是4-2,则获胜,但4-3则需要再增加1分,然后保持直到一名玩家领先2)。 一组是一组游戏,一组首先赢得6局,再次必须获得2局,除非这次是特殊的决胜局游戏,而不是继续进行(温网的最后一组等)。 ..) 根据比赛的不同,比赛将首先获得2到3套冠军。 现在,网球也很奇怪,因为比赛不公平。对于任何给定的点,服务器都具有巨大的优势,因此服务器交替进行每个游戏。 在决胜局游戏中,发球在每分之后交替进行,这是第一至7分,再次领先2分。 假设玩家A有可能在其发球和接收到时赢得积分。p [Rpspsp_sprprp_r 问题是这样的,假设我们 A)刚打网球是一项大型的“ N场最佳比赛”,多少场比赛的准确度与正常的5套网球相同 B)只是将网球作为一项重要的决胜局游戏,有多少分能像平常的5盘网球那样获得最佳准确性? 显然,这些答案将取决于和值本身,因此也很高兴知道p [Rpspsp_sprprp_r C)假设常数,是正常网球的预期比赛次数和得分是多少p [Rpspsp_sprprp_r 定义“准确性” 如果我们假设两个玩家的技能保持不变,那么如果他们玩了无限长的时间,那么无论玩法如何,一个或其他玩家几乎肯定会获胜。该球员是“正确”的赢家。我很确定正确的赢家是的玩家。pr+ps>1pr+ps>1p_r+p_s > 1 一种更好的比赛方式是,在相同的得分点上更频繁地产生正确的获胜者,或者相反,在很少的得分中以相同的概率产生正确的胜者。



2
我可以降低趋势并改变以使一系列静止吗?
我有一个随着时间推移而明显增加的数据集(一种货币的汇率,过去20年的月度数据),我的问题是:如果数据本身处于下降趋势,我是否可以对数据进行趋势去除然后再进行修正以使其保持不变没有做到这一点?如果是的话,这是否会被视为两次差异,或者只是被去趋势化而一次差异?

3
相关性或确定系数是否与沿回归线下降的值的百分比相关?
相关是两个变量之间线性关联的度量。确定系数r 2是一个变量的可变性可以由另一个变量的“解释”的量度。[Rrr[R2r2r^2 例如,如果是两个变量之间的相关性,则r 2 = 0.64。因此,一个方面的差异的64%可以通过另一个方面的差异来解释。对?r = 0.8r=0.8r = 0.8[R2= 0.64r2=0.64r^2 = 0.64 对于上述示例,我的问题是,以下任一陈述正确吗? 64%的值沿着回归线下降 80%的值沿着回归线下降

1
如何在Stata中使用工具化交互作用项进行工具变量回归?
我在Stata语法上有问题。我需要进行以下回归: y=ax+bz+c(xz)+ey=ax+bz+c(xz)+ey = ax + bz + c(xz) + e 其中和均已检测,并且交互项使用和的检测值。xxxzzzxzxzxzxxxzzz 仅生成和的预测值并将其用作回归变量会产生不正确的标准误差。xxxzzz 编辑:我还需要只对其中一个变量进行检测,并将其中一个变量作为交互项进行类似的回归。

2
什么是完整的足够的统计数据?
我在理解完整的足够统计信息时遇到了一些麻烦? 令为足够的统计量。T=ΣxiT=ΣxiT=\Sigma x_i 如果且概率为1,则对于某些函数,它是一个完全足够的统计量。E[g(T)]=0E[g(T)]=0E[g(T)]=0ggg 但是,这是什么意思?我看过制服和Bernoulli的示例(第6页http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf),但这不是直观的,我对集成感到困惑。 有人可以简单直观地解释吗?

2
为什么增加功能数量会降低性能?
我正试图了解为什么增加功能数量会降低性能。我目前正在使用LDA分类器,该分类器在某些功能中的双变量性能较好,但在查看更多功能时却较差。我的分类准确性是使用分层的10倍xval进行的。 是否存在一个简单的情况,即分类器在单维度上比双变量上更好地工作,以获得对这些更高维度中正在发生的事情的某种物理或空间直觉?


1
反季节化计数数据
我在R中使用stl()将计数数据分解为趋势,季节和不规则成分。结果趋势值不再是整数。我有以下问题: stl()是使计数数据反季节化的合适方法吗? 由于结果趋势不再是整数值,因此我可以使用lm()建模趋势成分吗?


6
哪些机器学习算法可用于估计更重要的功能?
我的数据具有不变的最少数量的功能,以及一些可以更改并对结果产生重大影响的其他功能。我的数据集如下所示: 功能包括A,B,C(始终存在)和D,E,F,G,H(有时存在) A = 10, B = 10, C = 10 outcome = 10 A = 8, B = 7, C = 8 outcome = 8.5 A = 10, B = 5, C = 11, D = 15 outcome = 178 A = 10, B = 10, C = 10, …

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.