统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
“无免费午餐定理”是否适用于一般统计检验?
我正在工作的一位女士要求我对某些数据进行单向方差分析。我回答说,这些数据是重复测量(时间序列)数据,并且我认为违反了独立性的假设。她回答说,我不必担心这些假设,只需进行测试即可,她会考虑到可能未满足这些假设。 在我看来,这似乎不合适。我进行了一些研究,发现David Robinson撰写的精彩博客文章说,K-means聚类不是免费的午餐,这使我接触了“免费午餐”定理。我看了看原始论文,然后看了一些后续内容,坦率地说,数学有点让我头疼。 根据大卫·罗宾逊(David Robinson)的说法,其要旨似乎是统计检验的力量来自其假设。他列举了两个很好的例子。当我浏览有关它的其他文章和博客文章时,似乎总是从监督学习或搜索的角度来引用它。 所以我的问题是,该定理是否普遍适用于统计检验?换句话说,可以说t检验或ANOVA的功效来自对假设的坚持,并引用了“免费午餐定理”吗? 我欠前老板一份关于我所做工作的最终文件,我想知道我是否可以参考“免费午餐定理”来说明您不能仅仅忽略统计检验的假设,并说您会考虑到这一点在评估结果时考虑。


2
如何将负值转换为对数?
我想知道如何将负值转换为Log(),因为我有异方差数据。我读到它适用于公式,Log(x+1)但不适用于我的数据库,因此我继续得到NaN。例如,我收到以下警告消息(我没有放入完整的数据库,因为我认为使用负值之一足以显示示例): > log(-1.27+1) [1] NaN Warning message: In log(-1.27 + 1) : NaNs produced > 提前致谢 更新: 这是我的数据的直方图。我正在使用化学测量的古生物学时间序列,例如Ca和Zn之类的变量之间的差异太大,那么我需要某种类型的数据标准化,这就是为什么我要测试log()功能。 这是我的原始数据
12 r  logarithm 

1
人们为什么不将更深的RBF或RBF与MLP结合使用?
因此,在查看径向基函数神经网络时,我注意到人们只建议使用1个隐藏层,而对于多层感知器神经网络,则认为多层更好。 鉴于可以用反向传播的版本训练RBF网络,是否有任何原因为什么较深的RBF网络不起作用,或者RBF层不能用作深度MLP网络中的倒数第二层或第一层?(我一直在考虑倒数第二层,因此基本上可以对之前的MLP层学习的功能进行训练)

2
扔硬币是将一组随机分为两组的一种公平方法吗?
因此,我自己和叔叔都在争论一次硬币翻转是否真的是随机的。我认为这不是因为实际上硬币投掷者总是会操纵硬币,所以结果不是50/50,因此,作为在临床试验中分配组的随机化技术不是一个好的选择。但是他认为,抛硬币的微小缺陷是造成随机性的原因。因此,他然后假定了一种机器,该机器将永远能够抛弃一个公平的硬币,并使它落在头上,说实话,我只需要有人为我解决这个论点。扔硬币是将一组随机分为两组的一种公平方法吗?

1
自动关键字提取:使用余弦相似度作为特征
我有一个文档项矩阵,现在我想使用一种监督学习方法(SVM,Naive Bayes等)为每个文档提取关键字。在此模型中,我已经使用了Tf-idf,Pos标签,...MMM 但是现在我想知道下一个。我有一个矩阵,两个词之间的余弦相似。CCC 是否可以将这种相似性用作模型的功能?我的想法是对长期在文档d,用平均所有条款的余弦相似的文档d足月我。这有用吗?iiiddddddiii

1
我何时应该担心贝叶斯模型选择中的Jeffreys-Lindley悖论?
我正在考虑使用RJMCMC探索各种复杂性的大型(但有限)模型。每个模型的参数向量的先验是非常有用的。 在哪种情况下(如果有),当更复杂的模型之一更适合时,我应该担心Jeffreys-Lindley悖论偏爱更简单的模型吗? 有没有简单的例子可以突出贝叶斯模型选择中的悖论问题? 我已经读了几篇文章,分别是西安的博客和安德鲁·盖尔曼的博客,但是我仍然不太了解这个问题。

1
如何解释密度图的高度
我应该如何解释密度图的高度: 例如,在上面的图中,峰值在x = 18处约为0.07。我可以推断出大约7%的值在18左右吗?我能比这更具体吗?在x = 30处还有一个第二个峰,高度为0.02。这是否意味着大约2%的值在30左右? 编辑:关于概率分布值超过1的问题可以吗?讨论了> 1的概率值,这在这里根本不是问题。它还讨论了关于朴素贝叶斯分类的问题,这也不是重点。我想用简单的语言从这些密度曲线中得出数值推论。讨论了曲线下面积的作用,但我的问题是具体地,我们可以对存在于曲线上的特定x和y组合得出什么推论。例如,如何在该图上关联x = 30和y = 0.02。关于30和0.02之间的关系,我们可以写什么陈述。因为密度是一个单位值,所以可以说2%的值出现在29.5到30.5之间吗?如果是这样,我们如何解释值是否仅在0到1之间变化,如下图所示: 如果100%的值出现在0和1之间,为什么在0和1之外存在任何曲线? 在x = 0.1到x = 0.2处有一个平坦部分,其中y等于0.8。它形成一个矩形。我们如何找出在x = 0.1和x = 0.2之间出现值的比例 (附言:如果您觉得这个问题有趣/重要,请对其进行投票;)

2
为什么在文字语言识别中使用n-gram代替单词?
在两个流行的语言识别库中,C ++的紧凑语言检测器2和Java的语言检测器都使用了(基于字符的)n-gram提取文本特征。为什么不使用单词袋(单个单词/词典)?单词袋和n-gram的优缺点是什么? 另外,n-grams模型在文本分类中还有哪些其他用途? 哎呀 似乎这里有一个类似的问题: 关于使用bigram(N-gram)模型为文本文档构建特征向量 但是有人可以给出更全面的答案吗?在识别语言的情况下哪个更好? (希望我能正确理解n-gram和词袋的含义,哈哈,如果不能,请帮助我。)

3
关于概率收敛
让{Xn}n≥1{Xn}n≥1\{X_n\}_{n\geq 1}是随机变量ST的序列Xn→aXn→aX_n \to a在概率,其中a&gt;0a&gt;0a>0是固定不变的。我正在尝试显示以下内容: Xn−−−√→a−−√Xn→a\sqrt{X_n} \to \sqrt{a} 和 aXn→1aXn→1\frac{a}{X_n}\to 1 的概率均相同。我在这里看看我的逻辑是否正确。这是我的工作 尝试 对于第一部分,我们有 |Xn−−−√−a−−√|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn−−−√+a−−√|=ϵ|(Xn−−−√−sqrta)+2a−−√||Xn−a|&lt;ϵ⟸|Xn−a|&lt;ϵ|Xn+a|=ϵ|(Xn−sqrta)+2a||\sqrt{X_n}-\sqrt{a}|<\epsilon \impliedby |X_n-a|<\epsilon|\sqrt{X_n}+\sqrt{a}|=\epsilon|(\sqrt{X_n}-sqrt{a})+2\sqrt{a}| ≤ϵ|Xn−−−√−a−−√|+2ϵa−−√&lt;ϵ2+2ϵa−−√≤ϵ|Xn−a|+2ϵa&lt;ϵ2+2ϵa\leq \epsilon|\sqrt{X_n}-\sqrt{a}|+2\epsilon\sqrt{a}<\epsilon^2+2\epsilon\sqrt{a} 注意, ϵ2+2ϵa−−√&gt;ϵa−−√ϵ2+2ϵa&gt;ϵa\epsilon^2+2\epsilon\sqrt{a}>\epsilon\sqrt{a} 则 P(|Xn−−−√−a−−√|≤ϵ)≥P(|Xn−a|≤ϵa−−√)→1asn→∞P(|Xn−a|≤ϵ)≥P(|Xn−a|≤ϵa)→1asn→∞P(|\sqrt{X_n}-\sqrt{a}|\leq \epsilon)\geq P(|X_n-a|\leq \epsilon\sqrt{a})\to 1 \;\;as\;n\to\infty ⟹Xn−−−√→a−−√inprobability⟹Xn→ainprobability\implies \sqrt{X_n}\to\sqrt{a} \;\;in\;probability 对于第二部分,我们有 现在,由于 X n → a为 n → ∞,我们得到 X n是有界序列。换句话说,存在一个实数中号&lt; ∞ ST | X n | ≤ 中号。因此, | …

1
N正态id的乘积的近似分布?特例μ≈0
给定 iid和,寻找:X Ñ ≈ Ñ(μ X,σ 2 X)μ X ≈ 0ñ≥ 30N≥30N\geq30Xñ≈ ñ(μX,σ2X)Xn≈N(μX,σX2)X_n\approx\mathcal{N}(\mu_X,\sigma_X^2)μX≈ 0μX≈0\mu_X \approx 0 精确封闭形式分布近似值 ÿñ= ∏1个ñXñYN=∏1NXnY_N=\prod\limits_{1}^{N}{X_n} 相同乘积的渐近(指数?)逼近 这是一个特殊情况,是一个更一般的问题。μX≈ 0μX≈0\mu_X \approx 0

1
使用所有可能的对来创建正态混合物分布的密度估计方法的名称是什么?
我只是想到一种创建一维密度估计的整洁(不一定好)的方法,我的问题是: 这种密度估算方法有名称吗?如果不是,这是文献中某些其他方法的特例吗? 这是方法:我们有一个向量我们假设从一些不知名的分布,我们想估计得出。一种方法是采用X中所有可能的值对,并使用最大似然对每对[ x i,x j ] i ≠ j拟合正态分布。然后,所得的密度估算值是由所有所得的法线组成的混合物分布,其中,每个法线的权重均相等。X= [ x1个,X2,。。。,Xñ]X=[x1,x2,...,xn]X = [x_1,x_2,...,x_n]XXX[ x一世,XĴ]i ≠ j[xi,xj]i≠j[x_i,x_j]_{i \neq j} 下图说明了使用这种方法的矢量。这里的圆圈是数据点,彩色的法线是使用每个可能的对估计的最大似然分布,粗黑线显示了所得的密度估计值(即混合分布)。[ - 1.3 ,0.15 ,0.73 ,1.4 ][−1.3,0.15,0.73,1.4][-1.3,0.15,0.73,1.4] 顺便说一句,在R中实施一个方法很容易,该方法可以从所得混合物分布中提取样品: # Generating some "data" x &lt;- rnorm(30) # Drawing from the density estimate using the method described above. density_estimate_sample &lt;- replicate(9999, { pair …

1
科恩统计量的方差
Cohen是我们测量效果大小的最常见方法之一(请参阅Wikipedia)。它仅根据合并的标准偏差来测量两个均值之间的距离。我们如何推导Cohen的方差估计的数学公式? dddddd 2015年12月编辑:与该问题相关的是计算附近的置信区间的想法。本文指出ddd σ2d=n+n×+d22n+σd2=n+n×+d22n+\sigma_{d}^2 = \dfrac{n_{+}}{n_{\times}} + \dfrac{d^2}{2n_{+}} 其中是两个样本大小的总和,是两个样本大小的乘积。n+n+n_{+}n×n×n_{\times} 该公式如何得出?

2
使用贝叶斯神经网络的优点是什么
最近,我阅读了有关贝叶斯神经网络(BNN)[Neal,1992],[Neal,2012]的一些论文,这些论文给出了神经网络中输入和输出之间的概率关系。通过MCMC训练这种神经网络,这与传统的反向传播算法不同。 我的问题是:使用这种神经网络有什么优势?更具体地说,您能否提供一些更适合BNN而非NN的示例?

3
量化两个数据集之间的相似性
摘要:试图找到最佳方法,使用一个值总结两个对齐的数据集之间的相似性。 详细资料: 我的问题最好用图表来解释。下图显示了两个不同的数据集,每个数据集都标有nf和nr。沿x轴的点表示进行测量的位置,而y轴上的值表示结果的测量值。 对于每个图,我想要一个数字来总结每个测量点的相似度nf和nr值。在此示例中,从视觉上看,第一张图的结果与第二张图的结果不太相似。但是我还有很多其他数据,差异不那么明显,因此能够对此进行定量排名将很有帮助。 我认为可能存在通常使用的标准技术。搜索统计相似性会得出很多不同的结果,但是我不确定最好选择什么,或者我是否准备好解决我的问题。因此,我认为在有一个简单答案的情况下,这个问题可能值得在这里提出。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.