统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
图像是否由空间相连的独立区域组成的统计量度
考虑以下两个灰度图像: 第一张图片显示了蜿蜒的河流格局。第二张图片显示了随机噪声。 我正在寻找一种统计量,可以用来确定图像是否可能显示河流图案。 河流图像有两个区域:河流=高价值,其他地方=低价值。 结果是直方图是双峰的: 因此,具有河流图案的图像应具有较高的方差。 但是上面的随机图像也是如此: River_var = 0.0269, Random_var = 0.0310 另一方面,随机图像具有较低的空间连续性,而河流图像具有较高的空间连续性,这在实验方差图中清楚显示: 就像方差“汇总”一个数量的直方图一样,我正在寻找一种空间连续性的度量,以“汇总”实验方差图。 我希望这种度量可以在较小的滞后比较大的滞后更“惩罚”高半方差,因此我想出了: s v a r = ∑ñh = 1γ(小时)/ 小时2 svar=∑h=1nγ(h)/h2\ svar = \sum_{h=1}^n \gamma(h)/h^2 如果我仅从滞后= 1到15加起来,我得到: River_svar = 0.0228, Random_svar = 0.0488 我认为河流图像应该具有较高的方差,但空间方差较低,因此我引入了方差比: r a t i o = v a r / s …

1
双胞胎研究数据的线性混合效应建模
假设我有一些响应变量,该变量是从第个家庭中的第个兄弟姐妹测得的。另外,从每个受试者同时收集了一些行为数据。我正在尝试使用以下线性混合效应模型来分析情况: j i x i jyijyijy_{ij}jjjiiixijxijx_{ij} yij=α0+α1xij+δ1ixij+εijyij=α0+α1xij+δ1ixij+εijy_{ij} = \alpha_0 + \alpha_1 x_{ij} + \delta_{1i} x_{ij} + \varepsilon_{ij} 其中和分别是固定截距和斜率, 是随机斜率,而是残差。α 1 δ 1 我 ε 我Ĵα0α0\alpha_0α1α1\alpha_1δ1iδ1i\delta_{1i}εijεij\varepsilon_{ij} 随机效应和残余的假设是(假设每个家庭中只有两个同胞) ε 我Ĵδ1iδ1i\delta_{1i}εijεij\varepsilon_{ij} δ1 我(ε我1,ε我2)Ť〜dñ(0 ,τ2)〜dñ((0 ,0 )Ť,R )δ1i∼dN(0,τ2)(εi1,εi2)T∼dN((0,0)T,R)\begin{align} \delta_{1i} &\stackrel{d}{\sim} N(0, \tau^2) \\[5pt] (\varepsilon_{i1}, \varepsilon_{i2})^T &\stackrel{d}{\sim} N((0, 0)^T, R) \end{align} 其中是未知方差参数,方差-协方差结构是2 x 2形式的对称矩阵 - …

2
向非统计学家解释分位数回归
我最近向心理学杂志提交了一篇论文,其中我使用了分位数回归。尽管我以为我已经对分位数回归进行了清晰的阐述,但审阅者要求对分位数回归技术仅熟悉标准OLS回归进行更好的解释。 那么,在经验论文中,向非统计学家解释分位数回归的最佳方法是什么?

1
JAGS中的正则贝叶斯逻辑回归
有许多数学方面的文章描述了贝叶斯套索,但是我要测试可以使用的正确JAGS代码。 有人可以发布实现正则逻辑回归的示例BUGS / JAGS代码吗?任何方案(L1,L2,Elasticnet)都不错,但是Lasso是首选。我也想知道是否有有趣的替代实施策略。

1
PCA双线图中的箭头是什么意思?
考虑以下PCA双线图: library(mvtnorm) set.seed(1) x <- rmvnorm(2000, rep(0, 6), diag(c(5, rep(1,5)))) x <- scale(x, center=T, scale=F) pc <- princomp(x) biplot(pc) 有一堆红色箭头,它们是什么意思?我知道标有“ Var1”的第一个箭头应指向数据集变化最大的方向(如果我们认为它们是2000个数据点,则每个都是大小为6的向量)。我还从某处读取,变化最大的方向应该是第一特征向量的方向。 但是,请阅读R中的biplot代码。有关箭头的线是: if(var.axes) arrows(0, 0, y[,1L] * 0.8, y[,2L] * 0.8, col = col[2L], y实际在哪里是荷载矩阵,它是特征向量矩阵。所以它看起来像第一个箭头实际上是从指向(0, 0)到(y[1, 1], y[1, 2])。我了解我们正在尝试在2D平面上绘制高维箭头。这就是为什么我们要使用y[1, ]向量的第一和第二元素。但是我不明白的是: 第一特征向量方向y[, 1]不是由表示的向量y[1, ]吗?(同样,这y是通过PCA或通过的特征分解获得的特征向量矩阵t(x) %*% x),即特征向量应该是列向量,而不是那些水平向量。 即使我们将它们绘制在2D平面上,我们也应该绘制第一个方向从(0, 0)指向(y[1, 1], y[2, 1])?
14 r  pca  linear-algebra  biplot 

4
什么是随机性?
在概率和统计中,经常使用“随机”和“随机”的概念。通常,随机变量的概念用于对由于偶然而发生的事件进行建模。 我的问题是关于“随机”一词的。什么是随机的?随机性真的存在吗? 我很好奇那些在处理随机事件方面有丰富经验的人会想到并相信随机性。

4
检查准确性是否显着提高
假设我有一种算法可以将事物分为两类。我可以在1000个测试对象上测量算法的准确性-假设80%的对象被正确分类。 假设我以某种方式修改了算法,以便对81%的事物进行正确分类。 统计资料能否告诉我有关我对该算法的改进是否具有统计意义的信息?在这种情况下,是否具有统计意义意义的概念?请向我指出一些可能有用的资源。 非常感谢。

2
如何从神经网络获取实值连续输出?
到目前为止,在我所见过的大多数神经网络示例中,都使用该网络进行分类,并使用S型函数对节点进行变换。但是,我想使用神经网络来输出连续的实际值(实际上,输出通常在-5到+5范围内)。 我的问题是: 1. Should I still scale the input features using feature scaling? What range? 2. What transformation function should I use in place of the sigmoid? 我希望最初实现它来描述这些层类型的 PyBrain 。 所以我在想应该有3个都是线性层的图层开始(输入,隐藏和输出层)?那是合理的方法吗?还是可以在-5到5的范围内“拉伸” S型函数?

2
R中的梯度下降与lm()函数?
我正在看吴安德(Andrew Ng)的免费在线机器学习课程中的视频在斯坦福大学中。他讨论了梯度下降作为解决线性回归的算法,并在Octave中编写函数来执行该算法。大概我可以用R重写那些函数,但是我的问题是lm()函数是否已经给了我线性回归的输出?为什么要编写自己的梯度下降函数?有优势还是纯粹作为学习练习?lm()会进行梯度下降吗?

3
为什么经常采用高斯分布?
引自维基百科上有关朴素贝叶斯分类器参数估计的文章:“一个典型的假设是,与每个类关联的连续值均根据高斯分布进行分布。” 我了解出于分析原因,高斯分布很方便。但是,还有其他现实世界中的原因可以做这种假设吗?如果人口由两个子群体(聪明/愚蠢的人,大/小苹果)组成,该怎么办?

3
中心极限定理与大数定律
中心极限定理指出,随着趋于无穷大,iid变量的均值变得正态分布。NNN 这提出了两个问题: 我们可以由此推论出大数定律吗?如果大数定律告诉我们,随机变量的值的样本均值等于真实平均作为趋于无穷大,那么似乎更强地说,(作为中心极限表示),该值变为其中是标准偏差。那么说中心极限意味着大数定律是否公平?Ñ Ñ(μ ,σ )σμμ\muNNNN(μ,σ)N(μ,σ)\mathcal N(\mu, \sigma)σσ\sigma 中心极限定理是否适用于变量的线性组合?

4
用R中的随机效应估计折断的棒/分段线性模型中的断点[包括代码和输出]
当我还需要估计其他随机效应时,有人可以告诉我如何让R估计分段线性模型中的断裂点(作为固定或随机参数)吗? 我在下面提供了一个玩具示例,该示例适合曲棍球杆/折断的杆回归,其随机点的斜率变化和y轴截距的随机变化为4的断裂点。我想估算断裂点而不是指定断裂点。它可以是随机效果(最好)或固定效果。 library(lme4) str(sleepstudy) #Basis functions bp = 4 b1 <- function(x, bp) ifelse(x < bp, bp - x, 0) b2 <- function(x, bp) ifelse(x < bp, 0, x - bp) #Mixed effects model with break point = 4 (mod <- lmer(Reaction ~ b1(Days, bp) + b2(Days, bp) + (b1(Days, …

8
如何对多个未知结进行分段线性回归?
是否有任何软件包可以进行分段线性回归,从而可以自动检测多个结?谢谢。当我使用strucchange包时。我无法检测到更改点。我不知道它如何检测更改点。从地块中,我可以看到有一些要点可以帮助我挑选出来。有人可以在这里举个例子吗?

1
如何针对重复测量设计计算方差分析:R中的aov()vs lm()
标题说明了一切,我很困惑。下面的代码在R中运行重复的aov(),并运行我认为是等效的lm()的调用,但是它们返回不同的误差残差(尽管平方和相同)。 显然,来自aov()的残差和拟合值是模型中使用的残差和拟合值,因为它们的平方和加到summary(my.aov)中报告的每个模型/残差平方和。那么,应用于重复测量设计的实际线性模型是什么? set.seed(1) # make data frame, # 5 participants, with 2 experimental factors, each with 2 levels # factor1 is A, B # factor2 is 1, 2 DF <- data.frame(participant=factor(1:5), A.1=rnorm(5, 50, 20), A.2=rnorm(5, 100, 20), B.1=rnorm(5, 20, 20), B.2=rnorm(5, 50, 20)) # get our experimental conditions conditions <- …


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.