统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
是否有公式或规则来确定randomForest的正确sampSize?
我正在与randomForest一起玩,并且发现通常增加sampSize会导致更好的性能。是否有一条规则/公式/等建议最佳sampSize应该是什么,或者是反复试验的事情?我想这是另一种措辞方式。sampSize太小或太大(过度拟合)有什么风险? 这个问题是指randomForest软件包中随机森林的R实现。该函数randomForest具有一个参数sampSize,该参数在文档中描述为 要抽取的样本大小。对于分类,如果sampsize是长度为层数的向量,则将采样按层进行分层,并且sampsize的元素指示要从层中提取的数字。
13 r  random-forest 

2
分析比例
我有一个包含多个总计为1的比例的数据集。我对这些比例沿梯度的变化感兴趣(请参见下面的示例数据)。 gradient <- 1:99 A1 <- gradient * 0.005 A2 <- gradient * 0.004 A3 <- 1 - (A1 + A2) df <- data.frame(gradient = gradient, A1 = A1, A2 = A2, A3 = A3) require(ggplot2) require(reshape2) dfm <- melt(df, id = "gradient") ggplot(dfm, aes(x = gradient, y = value, …
13 r  multinomial 

3
AR(1)是马尔可夫过程吗?
诸如的AR(1)进程 是马尔可夫过程吗?ÿŤ= ρ ÿt − 1+ εŤyt=ρyt−1+εty_t=\rho y_{t-1}+\varepsilon_t 如果是,那么VAR(1)是马尔可夫过程的向量版本吗?


6
个体回归显着但VIF较低时的多重共线性
我有6个变量(),我使用预测ÿ。在执行数据分析时,我首先尝试了多元线性回归。因此,只有两个变量是重要的。但是,当我进行线性回归将每个变量分别与y进行比较时,除一个变量外,其他所有变量都是显着的(p范围从小于0.01到小于0.001)。有人认为这是由于多重共线性。X1个。。。X6x1...x6x_{1}...x_{6}ÿyyÿyyppp 我对此的初步研究建议使用VIF检查多重共线性。我从R下载了适当的软件包,并最终得到了VIF:3.35、3.59、2.64、2.24和5.56。根据在线上的各种消息来源,您应该担心与VIF的多重共线性是4还是5。 我现在对这对我的数据意味着什么感到困惑。我还是没有多重共线性问题?如果这样做,该如何进行?(我无法收集更多数据,并且变量是模型中没有明显关联的部分)如果我没有这个问题,那我应该从我的数据中获取什么,尤其是这些变量具有很高的意义单独,但组合起来根本不重要。 编辑:有关数据集的一些问题,所以我想扩展... 在这种特殊情况下,我们希望了解特定的社交提示(手势,凝视等)如何影响某人产生其他提示的可能性。我们希望我们的模型包括所有重要的属性,因此我不愿意删除一些似乎多余的属性。 目前没有任何假设。相反,这个问题尚未研究,我们正在寻求对哪些属性很重要的更好的理解。据我所知,这些属性应该彼此相对独立(您不能只说凝视和手势相同,或者是另一个子集)。能够报告所有结果的p值将是一件很高兴的事情,因为我们希望其他研究人员能够了解所研究的内容。 编辑2:由于它出现在下面的某处,所以我的是24。ñnn



2
普通英语使用R解释和验证Cox比例风险回归模型
有人可以用简单的英语向我解释我的Cox模型吗? 我使用该函数将以下Cox回归模型拟合到我的所有数据中cph。我的数据保存在名为的对象中Data。变量w,x和y是连续的;z是两个层次的因子。时间以月为单位。我的一些患者缺少变量数据z(注意:下面我已经适当地指出了Harrell博士的建议,即我估算这些值,以避免对我的模型造成偏见,以后会这样做)。 > fit <- cph(formula = Surv(time, event) ~ w + x + y + z, data = Data, x = T, y = T, surv = T, time.inc = 12) Cox Proportional Hazards Model Frequencies of Missing Values Due to Each Variable Surv(time, event) w x y z …

2
在应用中使用脉冲神经网络的方式是什么?
脉冲或尖峰神经网络包含更多生物神经元的膜动力学,其中脉冲将信息传送到下一层。例如,神经元不必像在反向传播器中那样同时全部“发射”。 但是,对于将这些模型用于机器学习问题似乎存在障碍。机器学习从业人员使用更生物学的模型会遇到哪些具体问题?

2
n克在什么n会适得其反?
在进行自然语言处理时,可以采用语料库并评估下一个单词按n序列出现的概率。n通常选择为2或3(二元组和三元组)。 给定对特定语料库进行一次分类所花费的时间,是否存在已知的第n条链数据追踪适得其反的地方?还是给定从(数据结构)字典中查找概率所需的时间?

2
系统发生因变量:方差分析?
我了解从系统发育数据中导出协方差矩阵,以使要进行回归的两个变量的。但是,如果您有一个连续变量(先前已证明依赖于系统发育)和一个序数变量,会发生什么?后者是序数,我不确定如何将其与系统发育依赖性导致测试统计数据偏倚的方式联系起来。Ç ø v (X,Y)= 0cov(X,Y)=0cov(X,Y) = 0 在连续变量上计算费尔森斯坦的系统发生独立对比度并将其用于方差分析是否有意义? PIC值为:C我Ĵ= (X一世- XĴ)d我Ĵ--√Cij=(Xi−Xj)dijC_{ij} = \frac{(X_i - X_j)}{\sqrt{d_{ij}}} 其中是物种是物种,并且是系统树上物种和之间的成对距离。 X i ,X j X j d i j i jX一世XiX_iXXX我,XĴi,Xji, X_jXXXjjjdijdijd_{ij}iiijjj
13 anova  phylogeny 

1
生日问题的真正答案是什么?
“要使找到同一生日的两个人的概率至少达到50%,班级必须有多大?” 我在Facebook上有360个朋友,并且正如预期的那样,他们生日的分布根本不统一。我有一天和9个朋友同一个生日。(大假期和情人节之后的9个月似乎是个大假期,大声笑。)因此,考虑到生日更有可能是几天,所以我假设23个数字是上限。 对于这个问题是否有更好的估计?

1
生物标志物研究的功效计算/样本量
我们有一个潜在的生物标志物,可以预测患者是否患有癌症。生物标志物测试结果为二进制为阳性或阴性。我们希望对需要测试的患者数量有所了解,以确定该生物标记物是否是良好的预测指标。 通过在互联网上阅读,似乎要走的路是看灵敏度(对于病例数)和特异性(对于对照数)。建议您将这种情况视为单样本比例测试,但仍不清楚如何估算灵敏度以及准备除的范围。如果说我认为灵敏度高于0.8的任何生物标记物都为“良好”,您将如何设置这两个变量?我希望我的零假设是生物标记,并不比随机分配好,即灵敏度为0.5。任何人都可以举例说明执行此操作的最佳方法(尤其是在R中)。
13 r  power 

2
进行约翰逊协整检验时选择滞后的正确程序是什么?
在对2个时间序列(简单情况)进行约翰逊协整测试时,您需要确定要使用的滞后时间。对不同的滞后进行测试会返回不同的结果:对于某些滞后水平,原假设可以被拒绝,而对于其他滞后则不能。 我的问题是,基于输入数据的正确方法是什么,以确定在执行约翰逊测试时需要使用哪些滞后? ps我将这个问题提交给了quant.stackexchange,但有人认为它更适合该小组。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.