统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
预期的最佳性能数据集
说我有一个简单的机器学习问题,例如分类。作为视觉或听觉识别方面的一些基准,我作为人类是一个很好的分类器。因此,我对分类器的性能有一个直觉。 但是有大量数据,有一点是我不知道我训练的分类器有多好。这是我个人不是很好的分类器的数据(例如,从EEG数据分类一个人的情绪)。很难直觉我的问题有多难。 现在,如果遇到机器学习问题,我想知道我能得到什么。是否有任何原则性的方法?你会怎么做? 可视化数据?从简单的模型开始?从非常复杂的模型开始,看看我是否可以过拟合?如果您想回答这个问题,您正在寻找什么?您什么时候停止尝试?

2
用随机斜率和截距拟合Poisson GLM混合模型
我目前正在研究一系列Poisson时间序列模型,试图估计计数获取方式变化的影响(从一种诊断测试转换为另一种诊断测试),同时控制一段时间内的其他趋势(例如疾病的发生率)。我有许多不同站点的数据。 虽然我也一直在修改GAM,但我已经将一系列具有时间趋势的基本GLM进行了拟合,然后汇总结果。在SAS中,此代码看起来像这样: PROC GENMOD data=work.data descending; model counts = dependent_variable time time*time / link=log dist = poisson; run; 或在R: glm(counts ~ dependent_variable + time + time*time, family="poisson") 然后进行估算,并将其汇总到各个站点中。也有人建议我尝试使用具有随机斜率的Poisson混合模型,并针对每个站点进行拦截,而不是合并。因此,从本质上讲,您将具有固定的dependent_variable效果,然后是截距和时间(或者理想情况下是时间和时间^ 2的随机效果,尽管我知道这有点毛茸茸)。 我的问题是我不知道如何适合这些模型之一,而且似乎每个人的文档突然变得很不透明,而混合模型似乎是这样。任何人都有一个简单的解释(或代码),以了解如何适应我要适应的东西以及要寻找的东西?

1
挑战性数据集的哪种模型?(数百个具有大量嵌套的时间序列)
我要分析的数据集非常复杂,我找不到适合的解决方案。 这是东西: 1.原始数据实质上是昆虫歌曲的录音。每首歌曲均由多个突发组成,而每个突发均由子单元组成。所有个人都记录了5分钟。个体之间的猝发数及其在录音中的位置以及每个猝发的子单元数可能会非常不同。 2.我有每个子单元的载波频率(基本频率),这就是我要分析的内容。 我的问题: 1.突发中的频率显然不是独立的(尽管它相当稳定,但是子单元n-1的频率会影响子单元n)。 2.突发在录音中也不是独立的。 3.随着频率随着时间的推移而下降,它们变得更加独立(个人厌倦了唱歌,因此歌曲的频率越来越低)。下降似乎是线性的。 4.嵌套=我在A和B两个位置有3个重复种群。所以我有A1,A2,A3和B1,B2,B3。 我想做的是: 1.表征两个地点之间的频率差异(进行统计测试) 2.刻画两个位置之间的频率下降特性(看看其中之一下降得更快) 怎么做: 那就是为什么我需要帮助:我不知道。看来,我的案例结合了通常看不到的问题。我已经读过关于混合模型,关于GAM,关于ARIMA,随机和固定效果的信息,但是我不能真正确定做到这一点的最佳方法。当我绘制它的频率(频率〜子单元编号n)时,两个位置之间的差异非常明显。我还必须考虑其他变量,例如温度(使频率更高)等。 我想到了: 将个体嵌套在其来源的副本中,然后将副本嵌套在位置(单个/副本/位置)中。 使用随机的“突发”效果,因此我考虑了每个突发中的可变性。 使用固定的“记录中的突发位置”效果来测量频率下降(希望它实际上是线性的)。 正确吗? 我可以在这种情况下使用一种特殊类型的模型吗?

1
逻辑回归:分组变量和非分组变量(使用R)
我正在阅读A. Agresti(2007),《分类数据分析简介》,第二版。版本,并且不确定我是否正确理解本段(第106页,4.2.1)(尽管应该很容易): 在上一章有关打ing和心脏病的表3.1中,每天有254名受试者报告打呼night,其中30名患有心脏病。如果数据文件具有分组的二进制数据,则数据文件中的一行报告的样本量为254,其中30种是心脏病病例。如果数据文件具有未分组的二进制数据,则数据文件中的每一行都引用一个单独的主题,因此30行包含1的心脏病,而224行包含0的心脏病。这两种数据文件的ML估计值和SE值都相同。 转换一组未分组的数据(1个相关数据,1个独立数据)将花费更多的时间来包含所有信息! 在以下示例中,创建了一个(不切实际的!)简单数据集,并构建了逻辑回归模型。 分组数据的实际外观如何(变量标签?)?如何使用分组数据构建相同的模型? > dat = data.frame(y=c(0,1,0,1,0), x=c(1,1,0,0,0)) > dat y x 1 0 1 2 1 1 3 0 0 4 1 0 5 0 0 > tab=table(dat) > tab x y 0 1 0 2 1 1 1 1 > mod1=glm(y~x, data=dat, family=binomial())

3
一般加性泊松模型问题中的样条df选择
我一直在使用SAS的泊松通用加性模型拟合一些时间序列数据PROC GAM。一般来说,我一直使用它的内置通用交叉验证程序为我的单个样条生成至少一个体面的“起点”,这是时间的非线性函数以及单个参数项(其实很感兴趣)。 到目前为止,除了我的数据集之一之外,它的运行相当流畅。该数据集中有132个观测值,GCV建议使用128个自由度的样条曲线。看来...错了。错了 更重要的是,它也不是很稳定。我尝试了第二种方法,当参数项的估计值停止更改时,使用“估计更改”条件之类的方法停止添加自由度,因为如果没有什么不同,为什么还要继续添加控制权? 问题在于估算值根本不稳定。我尝试了以下自由度,如您所见,参数项疯狂地反弹: DF: Parametric Estimate: 1 -0.76903 2 -0.56308 3 -0.47103 4 -0.43631 5 -0.33108 6 -0.1495 7 0.0743 8 0.33459 9 0.62413 10 0.92161 15 1.88763 20 1.98869 30 2.5223 40-60 had convergence issues 70 7.5497 80 7.22267 90 6.71618 100 5.83808 110 4.61436 128 1.32347 …

3
通过所谓的平均观测值归一化的RMSE是多少?
我一直在使用Root Mean Squared Error(RMSE)来衡量使用模型预测的值的准确性。我知道返回的值使用的是我的度量单位(而不是百分比)。但是,我想用百分比来表示我的值。我采用的方法是RMSE通过观察值的平均值标准化。 有RMSE/mean什么用吗?

3
auto.arima警告在标准错误下产生的NaN
我的数据是从业人口L的时间序列,以及时间跨度的年份。 n.auto=auto.arima(log(L),xreg=year) summary(n.auto) Series: log(L) ARIMA(2,0,2) with non-zero mean Coefficients: ar1 ar2 ma1 ma2 intercept year 1.9122 -0.9567 -0.3082 0.0254 -3.5904 0.0074 s.e. NaN NaN NaN NaN 1.6058 0.0008 sigma^2 estimated as 1.503e-06: log likelihood=107.55 AIC=-201.1 AICc=-192.49 BIC=-193.79 In-sample error measures: ME RMSE MAE MPE MAPE -7.285102e-06 1.225907e-03 9.234378e-04 -6.836173e-05 …
9 r  regression  arima 

2
使用回归模型进行预测:何时停止?
为了进行预测,我从实验中计算出了一个简单的线性回归模型。我读过您不应该为偏离可用数据太远的点计算预测。但是,我找不到任何指导可以帮助我知道我可以推断的范围。例如,如果我计算50GB磁盘的读取速度,我想结果将接近实际情况。磁盘大小分别为100GB,500GB呢?我怎么知道我的预测是否接近现实? 我的实验细节如下: 我正在通过使用不同的磁盘大小来测量软件的读取速度。到目前为止,我已经通过在两次实验之间增加5GB的磁盘大小(总共6项措施)来测量5GB至30GB的磁盘空间。 我认为我的结果是线性的,标准误差很小。

1
如何在R中拟合Bradley–Terry–Luce模型,而无需复杂的公式?
Bradley-Terry-Luce(BTL)模型指出,其中是对象被判定为“更好” 的概率,参数比对象,而和是参数。pĴ 我= 升Ô 克一世Ť− 1(δĴ-δ一世)pĴ一世=升ØG一世Ť-1个(δĴ-δ一世)p_{ji} = logit^{-1}(\delta_j - \delta_i)p我Ĵp一世Ĵp_{ij}ĴĴj一世一世iδ一世δ一世\delta_iδĴδĴ\delta_j 这似乎是glm函数的候选者,family =二项式。但是,公式将类似于“成功〜S1 + S2 + S3 + S4 + ...”,其中Sn是虚拟变量,如果对象n是比较中的第一个对象,则为1,如果为n,则为-1。第二个,否则为0。那么Sn的系数将是对应的。dÈ 升吨一个ñdË升Ť一个ñdelta_n 仅使用几个对象,这将相当容易管理,但可能导致公式很长,并且需要为每个对象创建一个虚拟变量。我只是想知道是否有更简单的方法。假设要比较的两个对象的名称或数量是变量(因数),对象1和对象2,如果判断对象1更好,则成功为1,如果对象2为更好,则成功为0。

2
如何在R中模拟重复测量的多元结果?
@whuber已经演示了如何在一个时间点上模拟多元结果(,和)。ÿ1个y1y_1ÿ2y2y_2ÿ3y3y_3 众所周知,纵向数据经常出现在医学研究中。我的问题是如何在R中模拟重复测量的多元结果?例如,对于两个不同的治疗组,我们在5个不同的时间点重复测量,和。ÿ1个y1y_1y2y2y_2y3y3y_3

1
用偏移量预测GLM泊松
我知道这可能是一个基本问题...但是我似乎找不到答案。 我正在为Poisson系列安装GLM,然后尝试查看预测,但是似乎确实考虑了偏移量: model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003), offset=(log(population)), data=data, subset=28:36, family=poisson()) predict (model_glm, type="response") 我得到的情况不是费率... 我也尝试过 model_glm=glm(cases~rhs(data$year,2003)+lhs(data$year,2003)+ offset(log(population)), data=data, subset=28:36, family=poisson()) 结果相同。但是,当我使用mgcv从GAM进行预测时,这些预测会考虑偏移量(我得到比率)。 我想念什么吗?

1
如何从R中的线性SVM获取决策边界?
我需要一个可以为我提供线性SVM模型方程式的软件包。目前,我正在像这样使用e1071: library(e1071) m = svm(data, labels, type='C', kernel='linear', cost=cost, probability=FALSE, scale=scale) w = t(m$coefs) %*% data[m$index,] #Weight vector b = -model$rho #Offset 但是,我不确定如何e1071::svm()选择肯定和否定类,因此我认为这可能会使不同的数据集搞砸。谁能确认该函数如何确定哪个类别为正,哪个类别为负? 另外,有更好的包装吗?
9 r  svm  e1071 

3
频繁的推理和对观测条件的限制(来自Wagenmakers等的示例)
我不是统计学专家,但是我认为对于概率的“常客”或“贝叶斯”解释是否是“正确”的说法存在分歧。来自Wagenmakers等。al p。183: 考虑均值和width的均匀分布。从该分布中随机抽取两个值,分别标记最小的和最大的,并检查均值是否位于和之间。如果此过程重复很多次,则在一半情况下,平均将位于和之间。因此,给出的50%频繁置信区间。但假设对于特定抽签,且μμ\mu1个11sss升llμμ\musss升llμμ\musss升ll(小号,升)(s,l)(s, l)μμ\mus =9.8s=9.8s = 9.8l =10.7l=10.7l = 10.7。这些值之间的差为,这覆盖了分布范围的9/10。因此,对于和这些特定值,我们可以对 100%的置信度,即使常客的置信区间会让您相信您应该仅拥有50%的置信度。0.90.90.9sss升lls &lt; μ &lt;ls&lt;μ&lt;ls < \mu < l 真的有人相信在这种情况下只有50%的信心吗? 我想更一般地说,这本书似乎是在说常客不能表达一个有条件的主张,例如“给定且 , 的概率为1”。条件是否暗含贝叶斯推理是真的吗?s = 9.8s=9.8s = 9.8l = 10.7l=10.7l = 10.7s &lt; μ &lt; ls&lt;μ&lt;ls<\mu<l

1
具有一个主要预测因子的分类
我有一个(级)分类问题,具有100个实值预测变量的数量级,其中一个似乎比其他任何一个都具有更多的解释能力。我想更深入地了解其他变量的影响。但是,标准的机器学习技术(随机森林,SVM等)似乎被一个强大的预测因素所淹没,并且没有给我提供很多有关其他方面的有趣信息。ķķk 如果这是一个回归问题,我将仅针对强预测变量进行回归,然后将残差用作其他算法的输入。我真的看不到如何将这种方法转换为分类上下文。 我的直觉是,这个问题必须相当普遍:是否有标准的处理方法?


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.