统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
什么是“最大相关系数”?
典型的图像处理统计数据是使用Haralick纹理特征(即14)。 我想知道其中的第14个特征:给定一个邻接图(我们可以简单地查看两个整数i的经验分布,j &lt; 256),其定义为:Q的第二个特征值的平方根,其中,Q为:PPP我,Ĵ &lt; 256i,j&lt;256i,j < 256问QQ问QQ 问我Ĵ= ∑ķP(i ,k )P(j ,k )[ ∑XP(x ,i )] [ ∑ÿP(ķ ,ÿ)]Qij=∑kP(i,k)P(j,k)[∑xP(x,i)][∑yP(k,y)]Q_{ij} = \sum_k \frac{ P(i,k) P(j,k)}{ [\sum_x P(x,i)] [\sum_y P(k, y)] } 即使经过大量的搜索,我也找不到该统计信息的任何参考。它有什么特性?它代表什么? (上面的值是在值j的像素旁边找到值i的像素的标准化次数)。P(i ,j )P(i,j)P(i,j)一世iiĴjj

2
有没有办法解释来自随机森林模型的预测?
假设我有一个基于随机森林的预测分类模型(使用R中的randomForest包)。我想对其进行设置,以便最终用户可以指定要为其生成预测的项目,并且它将输出分类可能性。到目前为止,没有问题。 但是能够输出诸如可变重要性图之类的东西,但对于要预测的特定项目而不是训练集,将是有用/很酷的。就像是: 预计X项是狗(可能性为73%), 因为: 腿= 4 呼吸=不良 毛皮=短 食=讨厌 你明白了。是否存在从受过训练的随机森林中提取此信息的标准或至少合理的方法?如果是这样,是否有人有代码可以对randomForest软件包执行此操作?

3
测量非线性相关性
两个随机变量之间的协方差定义了一种衡量它们彼此线性相关程度的方法。但是如果联合分布是圆形的怎么办?当然分布中有结构。如何提取此结构?

4
如何生成具有给定标准偏差的近似正态分布的非对角项的随机相关矩阵?
我想生成一个随机相关矩阵,以使其非对角元素的分布看起来近似正态。我该怎么做? 动机是这样的。对于一组时间序列数据,相关分布通常看起来非常接近正态分布。我想生成许多“常规”相关矩阵来表示一般情况,并使用它们来计算风险数。ñnn 我知道一种方法,但由此产生的标准偏差(非对角元素的分布)太小了,无法达到我的目的:生成矩阵均匀或正常随机行,标准化行(减去均值,除以标准偏差),则样本相关矩阵具有非对角线正态分布[ 注释后更新:标准偏差为 ]。X 1ñnnXX\mathbf X〜ñ-1/21个n − 1X X⊤1n−1XX⊤\frac{1}{n-1}\mathbf X \mathbf X^\top〜ñ- 1 / 2∼n−1/2\sim n^{-1/2} 谁能建议一种更好的方法来控制标准偏差?

2
如何选择用于独立成分分析的成分数量?
由于缺乏对“独立组件分析”中要请求的组件数量的先验猜测,我希望实现选择过程的自动化。我认为,合理的标准可能是使计算出的各个成分之间相关性的全球证据最小化的数字。这是这种方法的伪代码: for each candidate number of components, n: run ICA specifying n as requested number of components for each pair (c1,c2) of resulting components: compute a model, m1: lm(c1 ~ 1) compute a model, m2: lm(c1 ~ c2) compute log likelihood ratio ( AIC(m2)-AIC(m1) ) representing the relative likelihood of …
11 ica 

1
基本自举置信区间的覆盖概率
我正在研究的课程存在以下问题: 进行蒙特卡洛研究,以估计标准正常自举置信区间和基本自举置信区间的覆盖概率。从正常人群中抽样,并检查样本均值的经验覆盖率。 标准普通引导程序CI的覆盖率很容易: n = 1000; alpha = c(0.025, 0.975); x = rnorm(n, 0, 1); mu = mean(x); sqrt.n = sqrt(n); LNorm = numeric(B); UNorm = numeric(B); for(j in 1:B) { smpl = x[sample(1:n, size = n, replace = TRUE)]; xbar = mean(smpl); s = sd(smpl); LNorm[j] = xbar + …

2
如何绘制具有置信区间的交互图?
我的尝试: 我无法获得置信区间 interaction.plot() 另一方面plotmeans(),“ gplot”包不会显示两个图表。此外,我不能在两个plotmeans()图之间加上两个图,因为默认情况下轴是不同的。 我使用plotCI()了'gplot'包并叠加了两个图形,但取得了一些成功,但是轴的匹配并不完美。 关于如何制作具有置信区间的交互图的任何建议?通过一个函数,或有关如何叠加plotmeans()或plotCI()图形的建议。 代码样本 br=structure(list(tangle = c(140L, 50L, 40L, 140L, 90L, 70L, 110L, 150L, 150L, 110L, 110L, 50L, 90L, 140L, 110L, 50L, 60L, 40L, 40L, 130L, 120L, 140L, 70L, 50L, 140L, 120L, 130L, 50L, 40L, 80L, 140L, 100L, 60L, 70L, 50L, 60L, 60L, 130L, 40L, 130L, …

4
一项研究超负荷意味着什么?
一项研究超负荷意味着什么? 我的印象是,这意味着您的样本量太大,以至于您有能力检测微小的效应量。这些影响的大小可能很小,以至于它们比变量之间的因果关系(不一定是直接因果关系)更可能是由采样过程中的轻微偏差引起的。 这是正确的直觉吗?如果是这样,我不认为有什么大不了的,只要以这种方式解释结果,然后您手动检查并查看估计的效果大小是否足够大以至于“有意义”。 我想念什么吗?关于在这种情况下该怎么做,有更好的建议吗?

3
Z得分和p值有什么区别?
在网络主题算法中,返回统计信息的p值和Z分数似乎很常见:“输入网络包含子图G的X个副本”。满足要求的子图被视为主题 p值&lt;A, Z得分&gt; B和 X&gt; C,对于某些用户定义(或社区定义)的A,B和C。 这激发了一个问题: 问题:p值和Z得分有什么区别? 和子问题: 问题:是否存在相同统计的p值和Z分数可能提出相反假设的情况?上面列出的第一条件和第二条件是否基本相同?



4
比较各个模型之间的逻辑回归系数?
我已经开发了一个logit模型,该模型将应用于六组不同的横截面数据。我要揭示的是,给定自变量(IV)对因变量(DV)的实质性影响是否发生变化,从而控制了在不同时间和跨时间的其他解释。 我的问题是: 如何评估IV和DV之间关联的大小增加/减少? 我可以简单地查看模型中系数的不同大小(大小),还是需要执行其他过程? 如果我需要做其他事情,那是什么,它可以完成/如何在SPSS中完成? 而且,在单个模型中 如果所有变量都编码为0-1,是否可以基于非标准化分数比较自变量的相对大小?还是需要将它们转换为标准化分数? 标准化分数有问题吗?
11 logistic  spss 

1
确定一组广告中哪个具有最高点击率所需的样本量
我是一名行业软件设计师,并且正在为一个客户从事项目,因此我想确保我的分析在统计上是正确的。 考虑以下情况: 我们有n个广告(n &lt;10),我们只是想知道哪个广告效果最好。 我们的广告服务器将随机投放这些广告之一。成功的前提是用户点击了广告-我们的服务器会对其进行跟踪。 给出:置信区间:95% 问题:估计的样本量是多少?(我们必须投放多少个广告),为什么?(记住我是个假人) 谢谢

4
在R中标记箱线图
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 我需要构建一个没有任何轴的箱线图并将其添加到当前图线(ROC曲线)中,但是我需要向箱线图添加更多文本信息:最小和最大标签。当前代码行在下面(也是当前图形)。 非常感谢您的协助。 boxplot(data, horizontal = TRUE, range = 0, axes=FALSE, col = "grey", add = TRUE) 另一种解决方案是将线从0添加到1(而不是x轴),但是我希望它穿过中心线...例如,如下图所示
11 r  boxplot 

2
在给定自由度和输入矩阵的情况下,如何在岭回归中计算正则化参数?
设A 为自变量的n×pñ×pn \times p矩阵,而B为因变量的相应n ×矩阵。在岭回归,我们定义一个参数使得:。现在让[usv] = svd(A)和对角线输入s。我们定义自由度(df)=。岭回归缩小了低方差分量的系数,因此参数控制自由度。因此对于n×1ñ×1个n \times 1λλ\lambdaβ= (AŤ一个+ λ 我)− 1一种Ť乙β=(一种Ť一种+λ一世)-1个一种Ť乙\beta=(A^\mathrm{T}A+\lambda I)^{-1}A^\mathrm{T}Bd一世= 我Ť ^ hd一世=一世ŤHd_{i}=i^{th}∑ñ我= 1(d一世)2(d一世)2+ λ∑一世=1个ñ(d一世)2(d一世)2+λ\sum_{i=1}^{n} \frac{(d_{i})^2}{(d_{i})^2+\lambda}λλ\lambdaλ = 0λ=0\lambda=0,这是正态回归df = n的情况,因此将考虑所有自变量。我面临的问题是找到给定'df'和矩阵's' 的值。我试图重新排列上面的方程式,但没有得到封闭形式的解决方案。请提供任何有用的指示。λλ\lambda

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.