统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

4
改善糖尿病的SVM分类
我正在使用SVM来预测糖尿病。我为此使用BRFSS数据集。数据集的维度为并且存在偏斜。s在目标变量中的百分比为而s构成其余的。11 %89 %432607 × 136432607×136432607 \times 136Y11 %11%11\%N89 %89%89\% 我只使用了数据集中15的136独立变量。减少数据集的原因之一是当NA省略包含s的行时具有更多的训练样本。 15在运行统计方法(例如随机树,逻辑回归)并从结果模型中找出哪些变量很重要之后,才选择这些变量。例如,在运行逻辑回归之后,我们通常p-value对最重要的变量进行排序。 我进行变量选择的方法正确吗?任何建议都非常欢迎。 以下是我的R实现。 library(e1071) # Support Vector Machines #-------------------------------------------------------------------- # read brfss file (huge 135 MB file) #-------------------------------------------------------------------- y <- read.csv("http://www.hofroe.net/stat579/brfss%2009/brfss-2009-clean.csv") indicator <- c("DIABETE2", "GENHLTH", "PERSDOC2", "SEX", "FLUSHOT3", "PNEUVAC3", "X_RFHYPE5", "X_RFCHOL", "RACE2", "X_SMOKER3", "X_AGE_G", "X_BMI4CAT", "X_INCOMG", "X_RFDRHV3", "X_RFDRHV3", "X_STATE"); target …

3
不可衡量的事件的概率
从测度理论中我们知道,有些事件是无法测度的,也就是说,它们是不可测量的。我们怎么称呼没有定义概率度量的事件?我们将对此类事件做出哪些类型的陈述?

6
比较来自两个不同随机森林模型的R平方
我正在R中使用randomForest包来开发随机森林模型,以试图解释“宽”数据集中的连续结果,其预测因子比样本多。 具体来说,我正在拟合一个RF模型,允许该过程从大约75个我认为重要的预测变量中进行选择。 我正在使用先前在此处发布的方法,测试该模型对保留测试集的实际结果的预测效果如何,即 ...或在R中: 1 - sum((y-predicted)^2)/sum((y-mean(y))^2) 但是现在我可以添加大约25个预测变量。当使用〜100个预测变量集时,R²较高。我要统计测试,换句话说,使用set〜100预测的时候,做了模型试验显著更好比使用〜75个预测模型拟合测试数据。即,测试射频模型在整个数据集上的拟合度所产生的R²明显高于测试射频模型在缩减后的数据集上进行拟合所产生的R²。 这对我来说很重要,因为这是试验数据,要获得额外的25个预测指标非常昂贵,而且我需要知道是否应该在较大的后续研究中为这些预测指标进行测量。 我正在尝试考虑某种重采样/置换方法,但是什么也没想到。

1
是否有用于训练统计模型的“足够”数据的概念?
我从事很多统计建模工作,例如隐马尔可夫模型和高斯混合模型。我看到在每种情况下训练好的模型都需要大量的数据(对于HMM来说> 20000句子),这些数据是从与最终使用类似的环境中获取的。我的问题是: 文献中是否有“足够的”训练数据的概念?多少训练数据“足够好”? 如何计算要训练的“良好”(识别准确率高(> 80%)的模型)需要多少个句子? 我如何知道模型是否经过正确训练?模型中的系数会开始出现随机波动吗?如果是这样,我该如何区分由于模型更新而引起的随机波动和实际变化? 如果需要更多标签,请随时重新标记该问题。

3
相关系数的阈值,以指示相关矩阵中相关的统计意义
我已经计算出包含455个数据点的数据集的相关矩阵,每个数据点包含14个特征。因此,相关矩阵的维数为14 x 14。 我想知道相关系数的值是否存在阈值,该阈值指出其中两个特征之间存在显着的相关性。 我的价值介于-0.2到0.85之间,我一直认为重要的是那些高于0.7的价值。 是否为阈值考虑了相关系数的一般值,或者仅仅是上下文取决于我正在研究的数据类型?

2
是否存在模型拟合统计量(例如AIC或BIC)可用于绝对比较而不是相对比较?
我对这本文献不那么熟悉,所以如果这是一个明显的问题,请原谅我。 由于AIC和BIC依赖于最大化可能性,因此似乎只能将它们用于试图拟合给定数据集的一组模型之间的相对比较。根据我的理解,在数据集1上计算模型A的AIC,在数据集2上计算模型B的AIC,然后比较两个AIC值并判断(例如),这没有任何意义。模型A适合数据集1比模型B适合数据集2。或者也许我弄错了,这是合理的做法。请告诉我。 我的问题是:是否存在可以用于绝对而非相对比较的模型拟合统计量?对于线性模型,像这样的东西会起作用。它具有定义范围,并针对什么是“良好”价值制定了特定于学科的想法。我正在寻找更一般的东西,并认为我可以先在这里联系专家。我敢肯定有人曾经考虑过这种事情,但是我不太了解在Google学术搜索上进行有效搜索的正确用语。[R2[R2R^2 任何帮助,将不胜感激。

1
如何在保持函数形状的同时将函数转换为概率密度?
我有一系列函数,据推测每个函数代表跨代理的随机变量的密度。每个函数还具有一个域,该域描述随机变量的哪些值有效。 现在,如果我正确地记住了stats类,并且在函数域所描述的值中采用了其中一个函数的积分,那么我应该得到1.0的值。但是,这不会发生。 是否有一种标准化技术可以将函数转换为真实的概率密度,但又可以保持函数的形状? 所有函数的格式均为,其中是随机变量,而是变化的常数。abx+cabx+c\frac{a}{bx}+cxxxa,b,ca,b,ca,b,c

3
通过平均数据点组合两个时间序列
我想通过最小化均方预测误差,将一个时间序列数据集的预测值和预测值(即过去的预测值)组合为一个时间序列。 假设我有一个2001-2010年的时间序列,与2007年之间有一个间隔。我已经能够使用2001-2007年数据(红线-称为YfYfY_f)来预测2007年,并能够使用2008-2009年数据进行反向预测(光蓝线-称为YbYbY_b)。 我想将YfYfY_f和的数据点合并为每个月的估算数据点Y_i。理想情况下,我希望获得权重,以使其最小化的均方预测误差(MSPE)。如果这不可能,那么我如何才能找到两个时间序列数据点之间的平均值? w ^ ÿ 我YbYbY_bwwwYiYiY_i Yi=w⋅Yf+(1−w)⋅YbYi=w⋅Yf+(1−w)⋅YbY_i = w\cdot Y_f + (1-w)\cdot Y_b 作为一个简单的例子: tt_f <- ts(1:12, start = 2007, freq = 12) tt_b <- ts(10:21, start=2007, freq=12) tt_f Jan Feb Mar Apr May Jun Jul Aug Sep Oct Nov Dec 2007 1 2 3 4 5 6 7 …

2
M估计器收敛到真实均值的条件
给定来自高斯分布和M估计量的iid样本,,上的哪些属性足以保证的概率?是是严格凸和严格递增足够了吗?X1,...,Xn∼N(μ,σ)X1,...,Xn∼N(μ,σ)X_1,...,X_n \sim N(\mu,\sigma) μm=argmina∑ρ(|Xi−a|)μm=argmina∑ρ(|Xi−a|)\mu_m = \underset{a}{\operatorname{argmin}} \sum\rho(|X_i-a|)ρρ\rhoμm→μμm→μ\mu_m \rightarrow \muρρ\rho
10 estimation 

5
可视化2个字母的组合
关于SO的此问题的答案返回了一组大约125个一到两个字母的名称:https : //stackoverflow.com/questions/6979630/what-1-2-letter-object-names-conflict-with-existing -r-对象 [1] "Ad" "am" "ar" "as" "bc" "bd" "bp" "br" "BR" "bs" "by" "c" "C" [14] "cc" "cd" "ch" "ci" "CJ" "ck" "Cl" "cm" "cn" "cq" "cs" "Cs" "cv" [27] "d" "D" "dc" "dd" "de" "df" "dg" "dn" "do" "ds" "dt" "e" "E" [40] "el" "ES" "F" …

4
在线离群值检测
我想处理自动分段的显微镜图像,以检测故障图像和/或故障分割,作为高通量成像管线的一部分。可以为每个原始图像和分割计算很多参数,当图像有缺陷时,这些参数将变为“极端”。例如,图像中的气泡将导致异常,例如检测到的“单元”之一的尺寸过大,或者整个场的单元计数异常低。我正在寻找一种检测这些异常情况的有效方法。理想情况下,我更喜欢一种具有以下属性的方法(大致按需要排序): 不需要预定义的绝对阈值(尽管可以使用预定义的百分比); 不需要将所有数据都存储在内存中,甚至不需要查看所有数据;该方法具有自适应性并可以在看到更多数据时更新其标准就可以了;(显然,以很小的概率,异常可能会在系统看到足够的数据之前发生,并且会丢失等)。 是可并行化的:例如,在第一轮中,许多并行工作的节点会产生中间候选异常,然后在第一轮完成后进行第二轮选择。 我正在寻找的异常情况并不细微。如果人们看一下数据的直方图,它们就是显而易见的类型。但是,所讨论的数据量以及在生成图像时实时执行此异常检测的最终目标,排除了需要人工评估者检查直方图的任何解决方案。 谢谢!
10 outliers  online 

1
是否可以在混合模型中将时间作为预测变量?
我一直认为时间不应该用作回归(包括gam的预测)的预测因子,因为这样一来,人们就可以简单地“描述”趋势本身。如果一项研究的目的是找到诸如温度等环境参数来解释动物活动的变化,那么我想知道时间如何发挥作用?作为未测参数的代理? 在这里可以看到港口海豚活动数据的一些时间趋势:-> 在进行GAMM时如何处理时间序列中的缺口? 我的问题是:当我在模型中加入时间(以朱利安天数为单位)时,所有其他参数的90%就变得微不足道了(来自mgcv的ts收缩平滑器将其排除在外)。如果我没有时间,那么其中一些很重要... 问题是:时间是否可以用作预测变量(甚至可能需要?),或者这弄乱了我的分析? 提前谢谢了

4
为什么人口统计学家会给出每100,000人的比率?
人口统计数字以每年100,000人口的形式给出似乎是普遍的。例如,自杀率,凶杀率,伤残调整生命年等等。为什么? 如果我们谈论化学,则百万分率(ppm)很常见。为什么计数人数的行为从根本上不同。100,000的数字在SI系统中没有基础,据我所知,它完全没有经验基础,只是与百分比的关系不大。每100,000个计数可以解释为百分之m%。我以为可能会吟。 这是历史文物吗?还是有任何理由捍卫该单位?
10 demography  units 


2
时间序列集比较
我要比较三组时间序列数据。他们在大约12天的3个不同时期服用。它们是在决赛周期间在大学图书馆中记录的平均,最大和最小人数。我必须做平均值,最大值和最小值,因为每小时的人头计数不是连续的(请参阅时间序列中的常规数据空白)。 现在数据集看起来像这样。每个晚上有一个数据点(平均,最大或最小),持续12个晚上。仅在所关注的12天之内,收集了3个学期的数据。因此,例如,2010年春季,2010年秋季和2011年5月每个都有12点。这是一个示例图表: 我已经覆盖了整个学期,因为我想看看每个学期的模式如何变化。但是,正如我在链接线程中所知,将两个学期并排拍打不是一个好主意,因为它们之间没有数据。 问题是:我可以使用哪种数学方法来比较每个学期的出勤模式? 我必须对时间序列进行任何特殊处理,还是可以简单地采用百分比差异?我的目标是说这几天的图书馆使用量正在上升或下降。我只是不确定应该使用哪种技术来显示它。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.