统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
在多项式中运行glmnet时出错
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 9个月前关闭。 在R包glmnet的1.7.3版本中解决了此问题中提到的问题。 我在使用family = multinomial运行glmnet时遇到一些问题,并且想知道是否遇到了类似的问题,或者是否能够告诉我我在做什么错。 当我放入自己的虚拟数据时,运行时会报告错误“ apply(nz,1,中位数):dim(X)必须具有正长度的错误” cv.glmnet,除了说“它没有用”之外,对我来说并没有提供太多信息。 y=rep(1:3,20) #=> 60 element vector set.seed(1011) x=matrix(y+rnorm(20*3*10,sd=0.4),nrow=60) # 60*10 element matrix glm = glmnet(x,y,family="multinomial") #=> returns without error crossval = cv.glmnet(x,y,family="multinomial") #=> Error in apply(nz, 1, median) : dim(X) must have a positive length crossval = cv.glmnet(x,y,family="multinomial",type.measure="class") #=> Error …
9 r  multinomial  glmnet 

1
使用SVM处理不平衡的多类数据集的最佳方法
我正在尝试在相当不平衡的数据上使用SVM构建预测模型。我的标签/输出有三个类别,正,中性和负。我会说正面的例子约占我数据的10-20%,中立的约占50-60%,负数约占30-40%。我正在尝试平衡类,因为与类之间的错误预测相关的成本并不相同。一种方法是对训练数据进行重采样并生成一个相等的数据集,该数据集比原始数据集更大。有趣的是,当我这样做时,我倾向于对其他类别做出更好的预测(例如,当我平衡数据时,我增加了正面类别的示例数量,但在样本预测之外,负面类别的表现更好)。任何人都可以大致解释为什么会这样吗?如果我增加否定类别的榜样数量,我会从样本预测(例如更好的预测)中得到与肯定类别相似的东西吗? 关于如何通过对错误分类施加不同的成本或使用LibSVM中的类权重来解决不平衡数据的其他想法也非常开放,尽管我不确定如何正确选择/调整那些数据。

2
如何在R中拟合像的回归?
我有一些时间序列数据,其中测得的变量是离散的正整数(计数)。我想测试一下是否随着时间的推移出现上升趋势(或没有)。自变量(x)的范围是0-500,因变量(y)的范围是0-8。 我以为我可以通过y = floor(a*x + b)使用普通最小二乘法(OLS)拟合形式的回归来回答这个问题。 我将如何使用R(或Python)执行此操作?是否有现有的程序包,还是最好编写自己的算法? PS:我知道这不是理想的技术,但是我需要做一个我可以理解的相对简单的分析-我的背景是生物学而不是数学。我知道我违反了有关测量变量误差以及测量随时间变化的独立性的假设。
9 r  regression  python 


1
给统计研究生的建议
我已于今年开始获得统计学博士学位,我正在就如何成长并成为统计学/机器学习领域的优秀学术研究人员寻找您的最佳实践,建议和(元建议)。 欢迎一般的思想和链接,但是为了开始进行讨论,以下是迈克尔·斯蒂尔(Michael Steele)的精彩文章“ 统计学研究生的建议 ”中收集的一系列问题(如果我错过了重要问题,或者是否有一些问题没有意义-也请对此发表评论): 论文与论文-在博士期间,人们应该专注于发表论文多少?现实中应该写几篇论文? 人们应该努力在哪些期刊上发表论文?(相关问题link1,link2) 一个人一天应该花几个小时进行研究(开发/处理您的研究问题)和学习(阅读新论文/参加课程) 在哪里可以找到“热门话题”,或者甚至更好-“很快成为热门话题”?(link1,link2) 一旦找到“热门话题”,应该如何在学习问题的多个方面的基础与专注于一个方面之间取得平衡? 显然,这些问题非常笼统,有很多角度去思考/回答它们-我希望阅读您对如何思考这些笼统问题的看法。 提前致谢!
9 careers  phd  academia 

1
当预测模型中的响应变量不同时,如何合并预测?
介绍 在预测组合中,一种流行的解决方案是基于某些信息准则的应用。以对模型估计的Akaike准则为例,可以从计算的差,然后将RP_j = e ^ {(AIC ^ *-AIC_j)/ 2}解释为模型j的相对概率是真实的。然后将权重定义为一个我CĴAICjAIC_jĴjj一个我CĴAICjAIC_j一个我C∗=分Ĵ一个我CĴAIC∗=minjAICjAIC^* = \min_j{AIC_j}[RPĴ=Ë(一我C∗− A ICĴ)/ 2RPj=e(AIC∗−AICj)/2RP_j = e^{(AIC^*-AIC_j)/2}Ĵjj wĴ=[RPĴ∑Ĵ[RPĴwj=RPj∑jRPjw_j = \frac{RP_j}{\sum_j RP_j} 问题 我试图克服的一个困难是,这些模型是根据不同转换的响应(内生)变量估算的。例如,某些模型基于年增长率,另一种模型基于季度间增长率。因此,提取的一个我CĴAICjAIC_j值不能直接比较。 尝试过的解决方案 由于重要的是一个我CAICAIC的差异,因此可以采用基本模型的一个我CAICAIC(例如,我尝试提取lm(y~-1)不带任何参数的模型),该AIC对于响应变量转换是不变的,然后比较第Ĵjj个模型与AIC的差异。基本模型一个我CAICAIC。然而在这里似乎不足之处遗迹-区别是由响应变量的转型的影响。 结束语 注意,可以使用“根据相同的响应变量估计所有模型”之类的选项,但是非常耗时。如果没有其他方法可以解决问题,我想在做出痛苦的决定之前先寻求快速的“治愈”方法。


4
如何定量判断一维数据是否聚集在1或3个值附近?
我有一些关于人的心跳之间的时间的数据。异位(额外)心跳的一种迹象是,这些间隔围绕三个值而不是一个值聚集。如何获得对此的定量度量? 我正在寻找比较多个数据集的方法,这两个100 bin直方图代表了所有这些数据集。 我可以比较方差,但是我希望我的算法能够检测每种情况下是否存在一个或三个聚类,而无需与其他情况进行比较。 这是用于脱机处理的,因此,如果需要的话,有很多计算能力。

1
回归系数的倒数分布
假设我们有一个线性模型 ÿ一世=β0+β1个X一世+ϵ一世yi=β0+β1xi+ϵiy_i = \beta_0 + \beta_1 x_i + \epsilon_i符合所有标准回归(Gauss-Markov)假设。我们有兴趣θ = 1 /β1个θ=1/β1\theta = 1/\beta_1。 问题1:分配的必要条件是什么θ^θ^\hat{\theta} 定义清楚吗? β1个≠ 0β1≠0\beta_1 \neq 0 会很重要-其他吗? 问题2:添加假设误差遵循正态分布。我们知道,如果β^1个β^1\hat{\beta}_1 是MLE, G(⋅ )g(⋅)g(\cdot) 是单调函数,则 G(β^1个)g(β^1)g\left(\hat{\beta}_1\right) 是MLE g(β1)g(β1)g(\beta_1)。单调性仅在β1β1\beta_1?换句话说,是θ^=1/β^θ^=1/β^\hat{\theta} = 1/\hat{\beta}MLE?连续映射定理至少告诉我们该参数是一致的。 问题3: Delta方法和自举程序是否都是寻找分布的合适方法?θ^θ^\hat{\theta}? 问题4:这些答案如何更改参数γ=β0/β1γ=β0/β1\gamma = \beta_0 / \beta_1? 旁白:我们可能会考虑重新布置问题以解决 xi=β0β1+1β1yi+1β1ϵi=γ+θyi+1β1ϵixi=β0β1+1β1yi+1β1ϵi=γ+θyi+1β1ϵi\begin{align*} x_i &= \frac{\beta_0}{\beta_1} + \frac{1}{\beta_1} y_i + \frac{1}{\beta_1} \epsilon_i \\ …


3
对于“假设族”(关于家庭错误率),可能有一个清晰,实用的定义?
尝试评估实验/项目/分析中的假设族的构成时,我发现“目的相似”和“内容相似”作为划定族的指导原则,但这些都为解释提供了很大的开放空间(至少可以说)。 似乎很明显,如果在分析过程中,我对组均值进行了几次检验,对比例均一性进行了另一批检验,那么我就不会将所有东西捆绑在一起成为一个假设家族。 但是,如果我有几批关于组均值的测试,那么什么标准可以将它们组合成一个家庭(或将它们分成不同的家庭)?一个家庭的所有成员都应该具有相同的响应变量吗?如果我的回答变量不同,但涉及的案件相同,那么所有这些都将捆绑成一个假设族吗?

2
如果变量是自相关的,我可以相信回归吗?
这两个变量(因变量和自变量)均显示自相关效应。数据是时间序列且固定的 当我运行回归残差似乎不相关。我的Durbin-Watson统计量大于上临界值,因此有证据表明误差项没有正相关。同样,当我为错误绘制ACF时,看起来那里没有相关性,并且Ljung-Box统计量小于临界值。 我可以相信我的回归输出吗,t统计量可靠吗?


1
可视化连续比例
我正在尝试可视化一些消费者数据,该数据有4个类别。用户可以自由在不同类别之间切换。我想将每个人的最后三个或四个开关可视化。 因此,我们将从具有4个堆叠比例的列的图开始。在那之后,我们将有16个类别,每个类别细分为上次人们所做的事情,然后是64个,依此类推,直到垃圾箱变得太小而无法使用。 我认为在marimekko图表和堆积的条形图或树状图之间的某个位置应该起作用,但我什至不知道该怎么称呼! 如果有人可以帮助我解决我应该使用的绘图类型,并且,如果您想变得更好,那么如何在R中实现它,我将非常感激。

1
文档摘要中的对数似然比
我最初是在堆栈溢出时问这个问题的,后来被提到这个站点,所以去了: 我正在实现基于内容选择/提取的文档摘要的一些无监督方法,我对我的教科书所说的“对数似然比”感到困惑。Jurafsky&Martin撰写的《语音和语言处理》一书对此进行了简要描述: 单词的LLR通常称为lambda(w),它是在输入语料库和背景语料库中观察w的概率(假设两个语料库中的概率相同)与在两个语料库中观察w的概率(假设存在不同概率)之间的比率。输入和背景语料库中的w。 分解一下,我们得到了分子:“在输入语料库和背景语料库中观察w的概率假设两个语料库中的概率相等”-如何计算在这里使用的概率? 分母:“在假设输入语料库和背景语料库中w的概率不同的情况下,观察w的概率”。-这是否像单词在输入中出现的概率乘以单词在语料库中出现的概率一样简单?例如: (数量(单词,输入)/输入中的单词总数)*(数量(单词,语料库)/语料中单词总数) 我一直在看我的书所引用的论文,《惊奇和巧合的统计的准确方法》(Dunning,1993年),但是我发现在基于提取的摘要中,很难为单个单词计算LLR值的问题。这里的任何澄清将不胜感激。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.