统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
为治疗组寻找可比的对照组?
我有一个30人的治疗小组(加利福尼亚州30所学校),使用的是数学补​​充软件。通过简单的分析,我想比较我们的治疗组和可比较的对照组之间学生的平均数学增长。加州有许多学校没有使用该软件。我希望对照组包括表现相似的学校(他们的基线分数与治疗学校相近,但误差范围合理)。另外,我希望对照组的样本量是我的治疗量的3倍(这里是90所学校)。在CA的1000余所学校中,有90所学校可供选择。您将如何选择对照组?

3
信息论中心极限定理
信息理论CLT的最简单形式如下: 设X1,X2,…X1,X2,…X_1, X_2,\dots等于均值000和方差111。令fnfnf_n为归一化总和∑ n i = 1 X i的密度∑ni=1Xin√∑i=1nXin\frac{\sum_{i=1}^n X_i}{\sqrt{n}}ϕϕ\phiD(fn∥ϕ)=∫fnlog(fn/ϕ)dxD(fn‖ϕ)=∫fnlog⁡(fn/ϕ)dxD(f_n\|\phi)=\int f_n \log(f_n/\phi) dxnnnD(fn∥ϕ)→0D(fn‖ϕ)→0D(f_n\|\phi)\to 0n→∞n→∞n\to \infty 从某种意义上说,由于Pinsker不等式,这种收敛肯定比文献中公认的收敛,分布收敛和 -metric 收敛“更强”。即,KL散度的收敛意味着分布的收敛和距离的收敛。L1L1L_1(∫|fn−ϕ|)2≤2⋅∫fnlog(fn/ϕ)(∫|fn−ϕ|)2≤2⋅∫fnlog⁡(fn/ϕ)\left(\int |f_n-\phi|\right)^2\le 2\cdot \int f_n \log(f_n/\phi)L1L1L_1 我想知道两件事。 结果什么?D(fn∥ϕ)→0D(fn‖ϕ)→0D(f_n\|\phi)\to 0 难道仅仅是因为在第三段指出,我们说收敛KL散度(的原因,即,)是强?D(fn∥ϕ)→0D(fn‖ϕ)→0D(f_n\|\phi)\to 0 注意:我前段时间在math.stackexchange中问了这个问题,但没有得到任何答案。

2
如何估算积分的精度?
在计算机图形学中,一种非常普遍的情况是某些像素的颜色等于某些实值函数的积分。函数通常过于复杂而无法解析求解,因此我们只需要进行数值逼近即可。但是该函数的计算量通常也非常昂贵,因此我们在可计算的样本数量上受到极大的限制。(例如,您不能只是决定抽取一百万个样本并留在此处。) 通常,您要做的是在随机选择的点上评估函数,直到估计的积分变得“足够精确”为止。这使我想到了一个实际的问题:您如何估算积分的“准确性”? 更具体地说,我们有,它是由一些复杂的,缓慢的计算机算法实现的。我们要估计f:R→Rf:R→Rf : \mathbb{R} \rightarrow \mathbb{R} k=∫baf(x) dxk=∫abf(x) dxk = \int_a^b f(x) \ dx 我们可以为所需的任何x计算,但这很昂贵。因此,我们想随机选择几个x值,并在k的估计变得可接受的准确时停止。当然,要做到这一点,我们需要知道当前估计的实际准确性。f(x)f(x)f(x)xxxxxxkkk 我什至不确定哪种统计工具适合此类问题。但是在我看来,如果我们对f绝对一无所知,那么这个问题就无法解决。例如,如果您计算f (x )一千次且始终为零,则估计积分将为零。但是,一无所知约˚F,它仍然可能是˚F (X )= 1 ,000 ,000处处除非你碰巧样本点,因此您的估计是错得离谱!ffff(x)f(x)f(x)ffff(x)=1,000,000f(x)=1,000,000f(x) = 1,000,000 也许,那么,我的问题应该从“我们需要了解以便使我们估计积分的精度成为可能fff?”开始。例如,我们经常知道不可能为负,这似乎是一个高度相关的事实...fff 编辑:好的,所以这似乎产生了很多响应,这很好。与其单独回答每个问题,不如尝试在此处补充一些其他背景。 ffffffffffff fffffffff fff 另外,考虑到“蒙特卡洛”的出现次数,我猜这是这种集成的技术术语吗?

5
聚类是拆分数据以进行逻辑回归的一种方法
我正在尝试通过逻辑回归模型基于某些功能来预测学生的成败。为了提高模型的性能,我已经考虑过根据明显的差异将学生分为不同的组,并为每个组构建单独的模型。但是我认为可能很难通过考试来确定这些群体,因此我想通过根据学生的特征将学生分类。这是建立此类模型的常见做法吗?您是否建议我将其分为明显的组(例如,第一学期学生与回国学生),然后对这些组进行聚类,或者从一开始就聚类? 尝试澄清: 我的意思是说我正在考虑使用聚类算法将逻辑回归的训练集分成几组。然后,我将为每个组分别进行逻辑回归。然后,当使用Logistic回归预测学生的学习成绩时,我将根据他们最适合的群体选择要使用的模型。 也许我可以通过包含一个组标识符来做同样的事情,例如,如果学生要返回,则返回1,否则返回0。 现在,您让我开始思考,对训练数据集进行聚类并使用其聚类标签作为逻辑回归中的功能是否有利,而不是为每个总体建立单独的逻辑回归模型。 如果为回国学生和新生的学生添加组标识符很有用,扩展组列表是否也有用?群集似乎是执行此操作的自然方法。 我希望这很清楚...


6
识别离群值以进行非线性回归
我正在研究螨的功能响应领域。我想做一个回归来估计Rogers II型函数的参数(攻击率和处理时间)。我有一个测量数据集。 我怎样才能最好地确定异常值? 对于我的回归,我在R中使用以下脚本(非线性回归):(日期集是一个简单的2列文本文件,称为data.txt文件,具有N0值(初始猎物数量)和FR值(24小时内被猎物食用的数量): library("nlstools") dat <- read.delim("C:/data.txt") #Rogers type II model a <- c(0,50) b <- c(0,40) plot(FR~N0,main="Rogers II normaal",xlim=a,ylim=b,xlab="N0",ylab="FR") rogers.predII <- function(N0,a,h,T) {N0 - lambertW(a*h*N0*exp(-a*(T-h*N0)))/(a*h)} params1 <- list(attackR3_N=0.04,Th3_N=1.46) RogersII_N <- nls(FR~rogers.predII(N0,attackR3_N,Th3_N,T=24),start=params1,data=dat,control=list(maxiter= 10000)) hatRIIN <- predict(RogersII_N) lines(spline(N0,hatRIIN)) summary(RogersII_N)$parameters 为了绘制残差图,我使用以下脚本: res <- nlsResiduals (RogersII_N) plot (res, type = 0) hist …

3
课堂活动/实验以教授统计概念?
我打算给青少年一个小时的统计讲座。我可能只会看到一次。这种情况可能会一再发生。 我想给他们一些活动,让他们体验统计数据。 但是我被迫与对概率,统计推断,探索性分析一无所知的人一起做。 我的想法是浏览一些媒体有时使用的简单可视化“技巧”,然后对它们进行一些揭穿。(请不要给我链接“如何撒谎”)) 另一个想法是(也)给他们分配任务,让他们进行实验以发现一些东西。例如:发现他们是否可以检测可口可乐和RC可乐之间的区别。 我正在寻找有关如何处理它们的建议,或正在寻找相关材料的资源。
11 teaching 

3
涵盖数据预处理和异常检测技术的好书
就像标题一样,有谁知道一本很好的,最新的书,该书涵盖了一般的数据预处理,尤其是异常检测技术? 这本书并不需要专心于此,但是它应该详尽地处理上述主题-我对以起点为起点的论文感到满意,并引用了一系列论文,对各种技术的解释必须出现在本书中。这本书本身。 处理丢失数据的技术更可取,但不是必需的...

2
计算神经网络的VC维度
如果我有输入神经元的乙状神经元的固定非递归(DAG)拓扑(固定的节点和边集,但是学习算法可以改变边的权重),它们只能采用作为输入并导致一个输出(输出的实数值,如果它是固定的阈值(远离0),则我们向上舍入为1或向下舍入为-1)。是否有任何快速方法可以计算(或近似)该网络的VC尺寸?nnn{−1,1}n{−1,1}n\{-1,1\}^n 笔记 我在CS.SE上提出了一种更为精确的算法重新制定: 有效地计算或近似神经网络的VC维


2
如何使用混合效应模型对交互作用词进行事后比较?
我正在研究一个数据集,以评估干燥对沉积物微生物活动的影响。目的是确定干燥的影响是否随沉积物类型和/或沉积物中深度的变化而变化。 实验设计如下: 第一因子沉积物对应于三种沉积物类型(编码为Sed1,Sed2,Sed3)。对于每种沉积物,在三个地点进行采样(Sed1为3个地点,Sed2为3个地点,Sed3为3个地点)。 网站编码:Site1,Site2,...,Site9。 下一个因素是水文:在每个站点内,在干地和湿地(编码为干/湿)中进行采样。 在每个上一个图中,以两个深度(D1,D2)一式三份进行采样。 总共有n = 108个样本= 3个沉积物* 3个地点* 2个水文学* 2个深度* 3个重复项。 我lme()在R(nlme软件包)中使用该函数,如下所示: Sediment <- as.factor(rep(c("Sed1","Sed2","Sed3"),each=36)) Site <- as.factor(rep(c("Site1","Site2","Site3","Site4","Site5", "Site6","Site7","Site8","Site9"),each=12)) Hydrology <- as.factor(rep(rep(c("Dry","Wet"),each=6),9)) Depth <- as.factor(rep(rep(c("D1","D2"),each=3),18)) Variable <- rnorm(108) mydata <- data.frame(Sediment,Site,Hydrology,Depth,Variable) mod1 <- lme(Variable ~ Sediment*Hydrology*Depth, data=mydata, random=~1|Site/Hydrology/Depth) anova(mod1) 我想进行事后比较,以测试一个术语是否有意义。 我能够做到这一点,以获得简单的主要效果(例如,沉积物): summary(glht(mod1,linfct=mcp(Sediment="Tukey"))) 但是该glht()功能不适用于交互条件。 我发现以下方法可以用于两向方差分析: mod1 <- lme(Variable~Sediment*Hydrology, …

2
如何改善神经网络的稳定性?
我在R中使用神经网络来构建具有14个输入和一个输出的NN。我使用相同的输入训练数据和相同的网络体系结构/设置几次构建/训练网络。 生成每个网络之后,我将其用于独立的一组测试数据上以计算一些预测值。我发现,尽管每次构建网络时所有输入(训练数据和测试数据)都保持不变,但预测数据的每次迭代都存在较大差异。 我知道每次在NN中产生的权重都会有所不同,并且没有两个神经网络会是相同的,但是在给定相同数据的情况下,我该如何尝试在每个列车上产生更一致的网络?

4
评估时间序列的可预测性
假设我有从05年1月到11年12月的每月超过20.000个时间序列。每个代表不同产品的全球销售数据。如果我只想关注少数几个“实际上很重要”的产品,而不是计算每个产品的预测,该怎么办? 我可以按年收入总额对这些产品进行排名,并使用经典的Pareto来精简列表。在我看来,尽管它们对底线的贡献不大,但某些产品是如此容易预测,以至于将它们拒之门外是不好的判断。在过去的10年中,每月售出价值50美元的产品听起来似乎不算什么,但它几乎不需要花太多力气就可以得出有关未来销售额的预测,我也可以这样做。 所以说我将产品分为四类:高收入/易于预测-低收入/易于预测-高收入/难以预测-低收入/难以预测。 我认为只留下那些属于第四组的时间序列是合理的。但是,我究竟该如何评估“可预测性”呢? 变异系数似乎是一个很好的起点(我也记得前一段时间看过有关它的文章)。但是,如果我的时间序列表现出季节性/水平变化/日历效应/强烈趋势怎么办? 我想我应该仅根据随机成分的可变性而不是“原始”数据之一进行评估。还是我错过了什么? 以前有没有人偶然发现过类似的问题?你们会怎么做? 一如既往,我们将不胜感激!

1
基尼系数和误差范围
我有一个时间序列的数据,每个时间点的N = 14个计数,我想在每个时间点计算此估计的基尼系数和标准误差。 由于我在每个时间点只有N = 14个计数,因此我通过计算折刀方差来进行计算,即从方程7汤臣Ogwang的标准误差”“计算基尼系数和它的一种方便的方法”。其中G ^(Ñ,ķ)是N个值的无元件的基尼系数ķ和 ˉ ģ(X)是平均的的G ^(Ñ,ķ)。变种(G )= n − 1ñ× ∑ñk = 1(G (n ,k )− G¯(n ))2变种⁡(G)=ñ-1个ñ×∑ķ=1个ñ(G(ñ,ķ)-G¯(ñ))2\operatorname{var}(G) = \frac{n-1}{n} \times \sum_{k=1}^n (G(n,k)-\bar{G}(n))^2G (n ,k )G(ñ,ķ)G(n,k)ķķkG¯(x )G¯(X)\bar{G}(x)G (n ,k )G(ñ,ķ)G(n,k) 上面的方差公式的直接天真实现。 calc.Gini.variance <- function(x) { N <- length(x) # using jacknifing as suggested by Tomson Ogwang …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.