统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
在什么设置下,随着样本数量的增加,置信区间不会变好吗?
在博客文章中,我发现有这样的说法: “我相信Cochrane工作组首先指出(大约在1970年代),在观察环境中具有置信区间时,小样本量会导致更好的覆盖率,而足够大的样本会提供接近零的覆盖率!” 现在,我假设CI宽度应随着样本大小的增加而接近0,但是覆盖范围会同时变差的想法对我来说并不令人信服。这个说法是正确的,在什么情况下?还是我看错了? 我已经使用随机正态分布数据进行了模拟,样本大小为10000至1000000(一次样本t检验,95%CI),每个样本大小运行1000次,对于更大样本量,覆盖率并没有恶化(相反,我发现了预期的接近5%的恒定错误率)。

2
时间序列分类-非常差的结果
我正在研究时间序列分类问题,其中输入的是手机帐户前21天的时间序列语音使用数据(以秒为单位)。相应的目标变量是该帐户是否在35-45天范围内被取消。因此,这是一个二进制分类问题。 到目前为止,我尝试过的所有方法(在不同程度上)的效果都非常差。首先,我尝试了k-NN分类(进行了各种修改),但结果却非常糟糕。这使我从时间序列中提取特征-即均值,方差,最大值,最小值,总零天,总尾随零天,上半年平均值与下半年平均值之间的差等,而最具预测性的特征似乎是总计零天和总尾随零天(使用几种分类算法)。这表现最好,但是性能仍然不是很好。 我的下一个策略是对我的训练集中的负面实例进行过度采样,因为它们很少。这导致更正确的抵消预测,但以更多的假阳性为代价。 我开始认为,时间序列使用情况数据本身可能并不能很好地预测(尽管常识认为应该如此)。也许有些潜在的变量我没有考虑。查看数据还显示出一些奇怪的行为。即,一些示例显示很少使用或减少使用(有时甚至根本不使用)并且不取消,而一些示例显示使用取消的使用量增加。也许这种矛盾的行为不会为分类器产生非常清晰的决策边界。 另一个可能的错误来源是许多训练示例都很稀疏(即许多天使用0的事实)。我还没有尝试过的一个想法是将时间序列分成多个部分并以这种方式生成一些功能,但是我并不抱有很大希望。

1
R神经网络-计算给出恒定答案
我正在尝试使用R的neuralnet软件包(此处的文档)进行预测。 这是我想做的: library(neuralnet) x <- cbind(runif(50, min=1, max=500), runif(50, min=1, max=500)) y <- x[, 1] * x[, 2] train <- data.frame(x, y) n <- names(train) f <- as.formula(paste('y ~', paste(n[!n %in% 'y'], collapse = ' + '))) net <- neuralnet(f, train, hidden = c(5, 5), threshold=0.01) print(net) all: neuralnet(formula = …

1
最大后验估计的示例
我一直在阅读有关最大似然估计和最大后验估计的信息,到目前为止,我仅遇到了有关最大似然估计的具体示例。我已经找到了一些最大后验估计的抽象示例,但是还没有具体的数字:S 它可能非常庞大,只使用抽象变量和函数,并且为了不被这种抽象淹没,不时将事物与现实世界联系起来是很好的。但是,当然,这只是我(和其他一些人)的观察:) 因此,有谁能给我一个简单但具体的例子,即关于最大后验估计的数字?那会很有帮助:) 谢谢! 我最初在MSE上发布了此问题,但无法在此处得到答案: /math/449386/example-of-maximum-a-posteriori-estimation 我已按照交叉发布此处的指示进行操作: http://meta.math.stackexchange.com/questions/5028/how-do-i-move-a-post-to-another-forum-like-cv-stats

1
如何解释已记录的结果变量的负线性回归系数?
我有一个线性回归模型,其中记录了因变量,而自变量是线性的。关键自变量的斜率系数为负: .。不确定如何解释。− .0564−.0564-.0564 我是否使用绝对值然后将其变为负值,如下所示: (exp(0.0564 )- 1 )⋅ 100 = 5.80(exp⁡(0.0564)−1)⋅100=5.80(\exp(0.0564)-1) \cdot 100 = 5.80 要么 我是否要像这样插入负系数: (exp(- 0.0564 )- 1 )⋅ 100 = - 5.48(exp⁡(−0.0564)−1)⋅100=−5.48(\exp(-0.0564)-1) \cdot 100 = -5.48 换句话说,我是使用绝对数字然后将其变为负数还是插入负系数?我如何用X的单位增加与Y的__%减少相关的方式表达我的发现?如您所见,这两个公式产生两个不同的答案。

1
预期平均值将超过一个值的预期次数
给定一系列iid随机变量,例如,对于,为,我试图限制经验均值的预期次数会超过一个值,因为我们继续绘制样本,即: Xi∈[0,1]Xi∈[0,1]X_i \in [0,1]i=1,2,...,ni=1,2,...,ni = 1,2,...,n1n∑ni=1Xi1n∑i=1nXi\frac{1}{n}\sum_{i=1}^n X_ic≥0c≥0c \geq 0T=def∑j=1nP({1j∑i=1jXi≥c})T=def∑j=1nP({1j∑i=1jXi≥c}) \mathcal{T} \overset{def}{=} \sum_{j=1}^n \mathbb{P} \left(\left\{ \frac{1}{j}\sum_{i=1}^j X_i \geq c\right\}\right) 如果我们假设对于,我们可以使用Hoeffding不等式得出c=a+E[X]c=a+E[X]c = a + \mathbb{E}[X]a>0a>0a > 0 T≤∑j=1ne−2ja2=1−e−2a2ne2a2−1T≤∑j=1ne−2ja2=1−e−2a2ne2a2−1\begin{align} \mathcal{T} & \leq \sum_{j=1}^n e^{-2ja^2} \\ & = \frac{1 - e^{-2 a^2 n}}{e^{2 a^2}-1} \end{align} 哪个看起来不错(也许),但实际上是一个松散的界限,是否有更好的方法来限制此值?我希望可能会有一种方法,因为不同的事件(每个)显然不是独立的,我不知道有任何方法可以利用这种依赖性。同样,最好删除大于平均值的限制。jjjccc 编辑:如果我们使用马尔可夫不等式,可以消除对大于均值的限制:ccc T≤∑j=1n1jE[X]c=E[X]HncT≤∑j=1n1jE[X]c=E[X]Hnc\begin{align} \mathcal{T} & \leq \sum_{j=1}^n \frac{\frac{1}{j}\mathbb{E}[X]}{c} \\ …

5
神经网络的数学背景
不知道这是否适合本网站,但是我正在开始我的计算机科学硕士学位(应用数学学士学位),并希望拥有强大的机器学习背景(我很可能会攻读博士学位)。我的次级兴趣之一是神经网络。 人工神经网络的良好数学背景是什么?像在机器学习的其他领域一样,我认为线性代数很重要,但是数学的其他哪些领域也很重要? 我计划阅读《神经网络:系统介绍或用于模式识别的神经网络》。是否有人提出任何建议或替代建议?

1
基于月收益率方差的年收益率方差
我试图了解财务回报的时间序列中的全部方差/标准差错误,但我觉得很棘手。我有一系列的月度股票回报数据(我们称其为),其预期值为1.00795,差异为0.000228(标准偏差为0.01512)。我正在尝试计算年收益率的最坏情况(假设期望值减去标准误差的两倍)。哪种方法是最好的方法?一。计算一个月(),然后将其自身乘以12倍(= 0.7630)。乙。假设月份是独立的,则将 12次,求出其期望值μ X - 2 ⋅ σ X = 0.977 Ŷ = X ⋅ X ⋅ 。。。⋅ X ë [ Ý ] = (ë [ X ] )12XXX μX-2 ·&σX= 0.977μX-2⋅σX=0.977\mu_X-2\cdot \sigma_X=0.977 ÿ= X⋅ X⋅ 。。。⋅Xÿ=X⋅X⋅。。。⋅XY=X\cdot X\cdot ...\cdot XË[ Y] = (E[ X] )12Ë[ÿ]=(Ë[X])12E[Y]=(E[X])^{12})和方差。在这种情况下,标准的开发是0.0572,和预期值减去STD。dev的两次是0.9853。ç。乘以每月的std。dev的与获得年度之一。用它来查找最坏的情况下每年的值(),结果为0.9949, 哪一个是正确的?如果您仅知道每月数据的这些属性,则计算预期年值减去标准差两倍的正确方法是什么? ?(通常-如果 12次并且,变种[ Y] = …


2
协方差矩阵的度量标准:缺点和优势
什么是协方差矩阵的“最佳”指标,为什么?在我看来,Frobenius&c不合适,角度参数化也存在问题。直觉上可能希望在这两者之间做出折衷,但是我也想知道是否还有其他方面需要牢记,也许还有完善的标准。 通用指标具有各种弊端,因为它们对于协方差矩阵而言并不自然,例如,它们通常不会特别惩罚非PSD矩阵或表现不佳(考虑两个旋转的低秩协方差椭球体:我也想同样-中间旋转的距离要小于分量平均距离,这与以及Frobenius的情况不同,请在此处进行校正。同样,并不总是保证凸度。很高兴看到“好”指标解决了这些问题和其他问题。大号1个L1L_1 这是对一些问题的很好的讨论,一个来自网络优化的示例,另一个来自计算机视觉的示例。这是一个类似的问题,它得到了一些其他指标,但没有讨论。

1
多项式对比变量的计算
请让我知道如何有效地将分类变量(因子)重新编码为正交多项式对比变量的集合。 对于许多类型的对比变量(例如,偏差,简单,Helmert等),通过是: 组成对应类型的对比度系数矩阵。 对其进行逆运算或广义逆运算可获得代码矩阵。 例如: Suppose there is 3-group factor and we want to recode it into a set of deviation contrast variables. The last group is treated as reference. Then the contrast coefficients matrix L is Group1 Group2 Group3 var1 2/3 -1/3 -1/3 var2 -1/3 2/3 -1/3 and ginv(L) …

3
两个参数乘积的置信区间
让我们假设我们有两个参数和。我们还具有两个最大似然估计量和以及这些参数的两个置信区间。有没有办法建立的置信区间?p1p1p_1p2p2p_2p1^p1^\hat{p_1}p2^p2^\hat{p_2}p1p2p1p2p_1p_2

1
多武装匪徒进行一般性奖励分配
我正在研究一个多武装的土匪问题,我们没有有关奖励分配的任何信息。 我发现许多论文都保证了对具有已知边界的分布以及在[0,1]中具有支持的一般分布的后悔边界的保证。 我想找出一种方法,在奖励分配无法保证其支持的环境中,能否表现良好。我正在尝试计算非参数公差极限,并使用该数字缩放奖励分布,因此我可以使用本文指定的算法2(http://jmlr.org/proceedings/papers/v23/agrawal12/agrawal12.pdf)。有人认为这种方法行得通吗? 如果没有,谁能指出我正确的地方? 谢谢一群!


2
欧几里得模上的尾边界,用于在
关于统一选择元素的欧几里得范数多久的已知上限 {−n, −(n−1), ..., n−1, n}d{−n, −(n−1), ..., n−1, n}d\:\{-n,~-(n-1),~...,~n-1,~n\}^d\: 将大于给定的阈值? 我主要对当nnn远小于时以指数收敛到零的范围感兴趣ddd。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.