3 用随机森林预测计数数据 是否可以训练随机森林以正确预测计数数据?这将如何进行?我的值范围很广,因此分类没有任何意义。如果我要使用回归分析,我会只截断结果吗?我在这里很迷路。有任何想法吗? 12 r regression random-forest prediction count-data
3 高度非线性函数的拟合策略 为了分析生物物理学实验的数据,我目前正在尝试使用高度非线性的模型进行曲线拟合。模型函数基本上看起来像: y=ax+bx−1/2y=ax+bx−1/2y = ax + bx^{-1/2} 在这里,尤其是的值引起了极大的兴趣。bbb 此函数的图解: (请注意,模型函数是基于对系统的全面数学描述,并且看起来效果很好---只是自动拟合很棘手)。 当然,模型函数是有问题的:到目前为止,我尝试过的拟合策略因处的渐近渐近线而失败,尤其是对于嘈杂的数据。x=0x=0x=0 我对这里问题的理解是,简单的最小二乘拟合(我在MATLAB中同时进行了线性和非线性回归;主要是Levenberg-Marquardt)对垂直渐近线非常敏感,因为x中的小误差被极大地放大了。 谁能指出我可以解决此问题的合适策略? 我有一些统计方面的基本知识,但是仍然很有限。我很想学习,如果我只知道从哪里开始的话:) 非常感谢您的建议! 编辑求您原谅忘记提及错误。唯一的显着噪声是,它是可加的。xxx 编辑2有关此问题背景的一些其他信息。上图对聚合物的拉伸行为进行了建模。正如@whuber在评论中指出的那样,您需要来获得如上的图形。b≈−200ab≈−200ab \approx -200 a 关于人们到目前为止如何拟合该曲线:似乎人们通常会切断垂直渐近线,直到找到合适的拟合为止。但是,截止选择仍然是任意的,这使拟合过程不可靠且不可重现。 编辑3&4固定图。 12 curve-fitting nonlinear
1 调和混合模型的符号 我熟悉以下符号: 其中β0Ĵ=β0+üĴ,和ÿ我Ĵ=β0+ β一世X我Ĵ+你Ĵ+ e我Ĵ= β0 Ĵ+ β一世X我Ĵ+ e我Ĵyij=β0+βixij+uj+eij=β0j+βixij+eij\begin{align} y_{ij} &= \beta_0 + \beta_i x_{ij} + u_j + e_{ij}\\ &= \beta_{0j} + \beta_i x_{ij} + e_{ij} \end{align}β0 Ĵ= β0+你Ĵβ0j=β0+uj\beta_{0j}=\beta_{0}+u_j 其中β0Ĵ=β0+ü0Ĵ和β1Ĵ=β1+ù1Ĵÿ我Ĵ=β0+ β1个X我Ĵ+ 你0 Ĵ+ 你1 ĴX我Ĵ+ e我Ĵ= β0 Ĵ+ β1 ĴX我Ĵ+ e我Ĵyij=β0+β1xij+u0j+u1jxij+eij=β0j+β1jxij+eij\begin{align} y_{ij} &= \beta_0 + \beta_1 x_{ij} + u_{0j} + u_{1j} … 12 mixed-model mathematical-statistics
1 如果网球比赛是一个大型比赛,那么多少场比赛才能达到相同的准确性? 网球有一个独特的三层得分系统,我想知道从比赛的角度来看,这是否有任何统计学上的好处,以确定更好的球员。 对于那些不熟悉的人,通常情况下,只要您有2分的领先优势(通常是4-2,则获胜,但4-3则需要再增加1分,然后保持直到一名玩家领先2)。 一组是一组游戏,一组首先赢得6局,再次必须获得2局,除非这次是特殊的决胜局游戏,而不是继续进行(温网的最后一组等)。 ..) 根据比赛的不同,比赛将首先获得2到3套冠军。 现在,网球也很奇怪,因为比赛不公平。对于任何给定的点,服务器都具有巨大的优势,因此服务器交替进行每个游戏。 在决胜局游戏中,发球在每分之后交替进行,这是第一至7分,再次领先2分。 假设玩家A有可能在其发球和接收到时赢得积分。p [Rpspsp_sprprp_r 问题是这样的,假设我们 A)刚打网球是一项大型的“ N场最佳比赛”,多少场比赛的准确度与正常的5套网球相同 B)只是将网球作为一项重要的决胜局游戏,有多少分能像平常的5盘网球那样获得最佳准确性? 显然,这些答案将取决于和值本身,因此也很高兴知道p [Rpspsp_sprprp_r C)假设常数,是正常网球的预期比赛次数和得分是多少p [Rpspsp_sprprp_r 定义“准确性” 如果我们假设两个玩家的技能保持不变,那么如果他们玩了无限长的时间,那么无论玩法如何,一个或其他玩家几乎肯定会获胜。该球员是“正确”的赢家。我很确定正确的赢家是的玩家。pr+ps>1pr+ps>1p_r+p_s > 1 一种更好的比赛方式是,在相同的得分点上更频繁地产生正确的获胜者,或者相反,在很少的得分中以相同的概率产生正确的胜者。 12 probability inference games
2 转换后的随机变量的协方差 我有两个随机变量X>0X>0X > 0和Y>0Y>0Y > 0。 鉴于我可以估计Cov(X,Y),Cov(X,Y),\text{Cov}(X, Y),我如何估计Cov(log(X),log(Y))?Cov(log(X),log(Y))?\text{Cov}(\log(X), \log(Y))? 12 data-transformation covariance random-variable
2 比较具有不同链接功能的GLM模型时出现问题 给定相同的协变量和分布族集,如何比较具有不同链接函数的模型? 我认为正确的答案是“ AIC / BIC”,但我不确定100%。 如果嵌套模型具有不同的链接,是否可以使用嵌套模型? 12 generalized-linear-model aic link-function
2 我可以降低趋势并改变以使一系列静止吗? 我有一个随着时间推移而明显增加的数据集(一种货币的汇率,过去20年的月度数据),我的问题是:如果数据本身处于下降趋势,我是否可以对数据进行趋势去除然后再进行修正以使其保持不变没有做到这一点?如果是的话,这是否会被视为两次差异,或者只是被去趋势化而一次差异? 12 time-series stationarity
3 相关性或确定系数是否与沿回归线下降的值的百分比相关? 相关是两个变量之间线性关联的度量。确定系数r 2是一个变量的可变性可以由另一个变量的“解释”的量度。[Rrr[R2r2r^2 例如,如果是两个变量之间的相关性,则r 2 = 0.64。因此,一个方面的差异的64%可以通过另一个方面的差异来解释。对?r = 0.8r=0.8r = 0.8[R2= 0.64r2=0.64r^2 = 0.64 对于上述示例,我的问题是,以下任一陈述正确吗? 64%的值沿着回归线下降 80%的值沿着回归线下降 12 regression correlation r-squared
1 如何在Stata中使用工具化交互作用项进行工具变量回归? 我在Stata语法上有问题。我需要进行以下回归: y=ax+bz+c(xz)+ey=ax+bz+c(xz)+ey = ax + bz + c(xz) + e 其中和均已检测,并且交互项使用和的检测值。xxxzzzxzxzxzxxxzzz 仅生成和的预测值并将其用作回归变量会产生不正确的标准误差。xxxzzz 编辑:我还需要只对其中一个变量进行检测,并将其中一个变量作为交互项进行类似的回归。 12 stata interaction instrumental-variables
2 什么是完整的足够的统计数据? 我在理解完整的足够统计信息时遇到了一些麻烦? 令为足够的统计量。T=ΣxiT=ΣxiT=\Sigma x_i 如果且概率为1,则对于某些函数,它是一个完全足够的统计量。E[g(T)]=0E[g(T)]=0E[g(T)]=0ggg 但是,这是什么意思?我看过制服和Bernoulli的示例(第6页http://amath.colorado.edu/courses/4520/2011fall/HandOuts/umvue.pdf),但这不是直观的,我对集成感到困惑。 有人可以简单直观地解释吗? 12 self-study estimation intuition decision-theory
2 为什么增加功能数量会降低性能? 我正试图了解为什么增加功能数量会降低性能。我目前正在使用LDA分类器,该分类器在某些功能中的双变量性能较好,但在查看更多功能时却较差。我的分类准确性是使用分层的10倍xval进行的。 是否存在一个简单的情况,即分类器在单维度上比双变量上更好地工作,以获得对这些更高维度中正在发生的事情的某种物理或空间直觉? 12 classification feature-selection
1 如何使用R计算“通向白宫的路径”? 我刚遇到了一个很好的分析,它既有趣又美观: http://www.nytimes.com/interactive/2012/11/02/us/politics/paths-to-the-white-house.html 我很好奇如何使用R来构造这样的“路径树”。构造这样的路径树需要什么数据和算法? 谢谢。 12 r data-visualization politics
1 反季节化计数数据 我在R中使用stl()将计数数据分解为趋势,季节和不规则成分。结果趋势值不再是整数。我有以下问题: stl()是使计数数据反季节化的合适方法吗? 由于结果趋势不再是整数值,因此我可以使用lm()建模趋势成分吗? 12 r time-series poisson-distribution
1 我可以将二次项包含在逻辑回归中解释为指示转折点吗? 在仅具有线性和二次项的Logistic回归中,如果我具有线性系数和二次系数,我可以说在-\ beta_1 /(2 \ beta_2)处存在概率的转折点?β1β1\beta_1β2β2\beta_2−β1/(2β2)−β1/(2β2)-\beta_1 / (2\beta_2) 12 interpretation logit polynomial
6 哪些机器学习算法可用于估计更重要的功能? 我的数据具有不变的最少数量的功能,以及一些可以更改并对结果产生重大影响的其他功能。我的数据集如下所示: 功能包括A,B,C(始终存在)和D,E,F,G,H(有时存在) A = 10, B = 10, C = 10 outcome = 10 A = 8, B = 7, C = 8 outcome = 8.5 A = 10, B = 5, C = 11, D = 15 outcome = 178 A = 10, B = 10, C = 10, … 12 machine-learning feature-selection