统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
如何在R中垂直堆叠具有相同x比例但不同y比例的两个图?
问候, 目前,我正在R中执行以下操作: require(zoo) data <- read.csv(file="summary.csv",sep=",",head=TRUE) cum = zoo(data$dcomp, as.Date(data$date)) data = zoo(data$compressed, as.Date(data$date)) data <- aggregate(data, identity, tail, 1) cum <- aggregate(cum, identity, sum, 1) days = seq(start(data), end(data), "day") data2 = na.locf(merge(data, zoo(,days))) plot(data2,xlab='',ylab='compressed bytes',col=rgb(0.18,0.34,0.55)) lines(cum,type="h",col=rgb(0,0.5,0)) summary.csv的片段: date,revision,file,lines,nclass,nattr,nrel,bytes,compressed,diff,dcomp 2007-07-25,16,model.xml,96,11,22,5,4035,991,0,0 2007-07-27,17,model.xml,115,16,26,6,4740,1056,53,777 2007-08-09,18,model.xml,106,16,26,7,4966,1136,47,761 2007-08-10,19,model.xml,106,16,26,7,4968,1150,4,202 2007-09-06,81,model.xml,111,16,26,7,5110,1167,13,258 ... 最后两行绘制了我需要的信息,其结果类似于以下内容: 蓝线是我感兴趣的工件的熵(以字节为单位)。绿线代表变化的熵。 现在,在此图中,它的效果很好,因为比例没有太大差异。但是我还有其他图表,其中的绿线变得很小,一个人看不到。 我正在寻找的解决方案涉及两件事: …

5
线性回归模型中的变量是否显着?
我有一个包含样本和变量观测值的线性回归模型,我想知道: 一个特定变量是否足够重要以至于仍包含在模型中。 模型中是否应包含另一个变量(带有观察值)。 哪些统计数据可以帮助我?如何最有效地获得它们?

4
如何找到事件总数的置信区间
我有检测器,它将以概率p检测事件。如果检测器说发生了事件,则情况总是如此,因此不会出现假阳性。运行一段时间后,我检测到k个事件。我想以一定的可信度(例如95%)计算发生,检测到或以其他方式发生的事件总数。 举例来说,假设我检测到13个事件。我希望能够基于p计算出13到19个事件,置信度为95%。 到目前为止,这是我尝试过的方法: 如果总共有n个事件,则检测到k个事件的概率为: binomial(n, k) * p^k * (1 - p)^(n - k) 从k到无穷大的n的总和为: 1/p 这意味着总共有n个事件的概率为: f(n) = binomial(n, k) * p^(k + 1) * (1 - p)^(n - k) 因此,如果我想确保95%的比例,我应该找到f(k) + f(k+1) + f(k+2) ... + f(k+m)至少为0.95 的第一部分和,答案为[k, k+m]。这是正确的方法吗?还有答案的封闭公式吗?

2
如何确定缺少数据的生存模型是否合适?
稍微简化一点,我有大约一百万条记录,记录了系统中大约十年的人员进入和退出时间。每个记录都有一个进入时间,但不是每个记录都有一个退出时间。系统中的平均时间约为1年。 缺少退出时间的原因有两个: 捕获数据时,该人尚未离开系统。 没有记录该人的离开时间。碰巧是记录的50% 感兴趣的问题是: 人们在系统上花费的时间更少了吗? 是否记录了更多的退出时间,以及有多少。 我们可以通过说出口被记录的概率随时间线性变化,并且系统中的时间具有一个威布尔(Weibull),其参数随时间线性变化来对此建模。然后,我们可以对各种参数进行最大似然估计,并仔细研究结果并认为它们是合理的。我们选择了Weibull分布,因为它似乎用于测量寿命,并且说起来有趣,而不是比说gamma分布更好地拟合数据。 我应该在哪里寻找有关如何正确执行此操作的线索?我们在数学上有些精明,但在统计学上却不是很精明。


2
可视化多个“直方图”(条形图)
我很难选择正确的方式来可视化数据。假设我们有一家书店出售书籍,每本书至少都有一个类别。 对于书店,如果我们计算书籍的所有类别,我们将获得一个直方图,该直方图显示属于该书店特定类别的书籍数量。 我想形象化书店的行为,我想看看他们是否喜欢某个类别而不是其他类别。我不想看看他们是否一起都喜欢科幻小说,但我想看看他们是否平等地对待每个类别。 我有约100万家书店。 我想到了4种方法: 采样数据,仅显示500家书店的直方图。使用10x10网格在5个单独的页面中显示它们。4x4网格的示例: 与#1相同。但是这次根据它们的计数desc对x轴值进行排序,因此如果有帮助,就很容易看到。 想象一下将#2中的直方图像一个甲板一样放在一起并以3D形式显示它们。像这样: 代替使用第三轴使用颜色来表示颜色,而是使用热图(2D直方图): 如果通常书店偏爱某些类别而不是其他类别,它将以从左到右的漂亮渐变显示。 您还有其他表示多个直方图的可视化想法/工具吗?


2
交叉验证实施是否会影响其结果?
如您所知,交叉验证有两种流行的类型,即K折和随机子采样(如Wikipedia中所述)。尽管如此,我知道有些研究人员正在撰写和发表论文,其中描述为K折的简历确实是随机的二次抽样,因此在实践中,您永远不知道所读文章的真实含义。 通常,差异当然并不明显,因此我的问题也是如此-当一种类型的结果与另一种类型的结果显着不同时,您能想到一个例子吗?

4
计算用于模型拟合/训练和验证的样本数据的比率
提供了我计划用来预测数据的样本量“ N”。有哪些方法可以细分数据,以便我使用其中的一些数据来建立模型,而其余数据可以用来验证模型? 我知道对此没有黑白答案,但是了解一些“经验法则”或通常使用的比率将很有趣。我知道在大学时,我们的一位教授曾经说过要在60%的情况下建模并在40%的情况下进行验证。

7
正态分布和单调变换
我听说自然界中发生的许多数量都是正态分布的。通常使用中心极限定理证明这一点是正确的,该定理表示,当对大量iid随机变量求平均时,将获得正态分布。因此,例如,由大量基因的加和效应决定的性状可能近似正态分布,因为基因值的行为可能大致类似于同义随机变量。 现在,令我困惑的是,在单调变换下,正态分布的特性显然不是不变的。因此,如果有两种方法可以测量与单调变换相关的事物,则它们不可能都呈正态分布(除非单调变换是线性的)。例如,我们可以通过直径,表面积或体积来测量雨滴的大小。假设所有雨滴的形状相似,则表面积与直径的平方成正比,而体积与直径的立方成正比。因此,所有这些测量方法均不能正态分布。 因此,我的问题是,分布确实变为正态的特定缩放方式(即,单调变换的特定选择)是否必须具有物理意义。例如,高度是应该正态分布还是高度的平方,或者高度的对数,或者高度的平方根?有没有一种方法可以通过理解影响身高的过程来回答这个问题?




1
朴素贝叶斯与递归神经网络(LSTM)之间的区别
我想对文本进行情感分析,浏览了几篇文章,其中一些正在使用“朴素贝叶斯”,另一些是“递归神经网络(LSTM)”,另一方面,我看到了用于情感分析的python库,是nltk。它使用“朴素贝叶斯”(Naive Bayes)谁能解释使用两者的区别? 我也阅读了这篇文章,但对两者都不清楚。 贝叶斯网络,神经网络,决策树和Petri网之间的差异

4
蠕虫和苹果期望值
一个苹果位于五边形顶点处,一个蠕虫位于相距两个顶点C处。每天,蠕虫以相等的概率爬行到两个相邻顶点之一。因此,一天后,蠕虫位于顶点B或D处,每个顶点的概率为1/2。两天后,该蠕虫可能会再次回到C位置,因为它没有存储以前的位置。当到达顶点A时,它停止进餐。AAAABCDEABCDEABCDECCCBBBDDD1/21/21/2CCCAAA (a)直到晚餐的天数是多少? (b)令p为天数等于或大于的概率。马尔可夫不等式对什么看法?100100100ppp 对于(a),令为随机变量,由直到晚餐的天数定义。因此XXXP(X=0)=0P(X=1)=0P(X=2)=1(52)⋮P(X=0)=0P(X=1)=0P(X=2)=1(52)⋮ P(X = 0) = 0 \\ P(X=1) = 0 \\ P(X=2) = \frac{1}{\binom{5}{2}} \\ \vdots 一般分布是什么? 对于(b),如果我们知道(a),则我们知道P(X≥100)≤E(X)100P(X≥100)≤E(X)100P(X \geq 100) \leq \frac{E(X)}{100}

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.