统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答


1
在两个样本的置换测试中将尾部加倍
假设我们有两个样本,我们希望确定它们是否来自相同的分布,样本A,B由一些整数组成。 如果我们使用两个样本的置换检验来测试这一点,特别是通过查看样本均值差异与观察到的差异一样极端的置换:是否有理由认为我们可以计算出两尾p-通过观察一条尾巴并加倍概率来获得价值? 这就是我在讲义中似乎要说的,但是我不明白为什么我们可以假设尾巴是对称的(或者为什么它不需要这种假设)。没有解释。

4
找到特定碱基对序列的可能性
考虑概率总是让我意识到自己在数数上有多糟糕... 考虑基本字母的序列,每个都可能出现。该序列包含特定感兴趣的碱基对长度的特定序列的概率是多少?一个,nnn- [R ≤ ÑA,T,C, and GA,T,C, and GA,\; T, \; C, \text{ and } Gr≤nr≤nr\leq n 有不同的(相等可能性)序列可能。在整个序列的开始处从感兴趣的序列开始;序列是可能的。我们可以在不同的位置开始感兴趣的序列。因此,我的答案是。4 ñ - - [R Ñ + 1 - - [R (Ñ + 1 - - [R )/ 4 - [R4n4n4^n4n−r4n−r4^{n-r}n+1−rn+1−rn+1 -r(n+1−r)/4r(n+1−r)/4r(n+1-r)/4^r 这个概率在增加,这对我来说很有意义。但是当时,该概率超过。但是那不可能。概率应在极限(接近我)范围内接近1,但不能超过该极限。n > 4 r + r − 1nnnn>4r+r−1n>4r+r−1n>4^r +r-1 我认为我在重复计算。我想念什么?谢谢。 (仅供参考,而不是功课,只是准备考试的一个玩具示例。我的分子生物学家朋友提出了一个问题。)


1
如何计算时间序列预测的置信区间?
我有一个时间序列(假设到),我需要使用模型预测下一个样本(假设)例如神经网络或多元线性回归。在时间n,我拥有从到所有样本,并且需要预测;在时间,我拥有从到所有样本,并且需要预测;等等。X1X1X_1XnXnX_nXn+1,Xn+2,…,Xn+kXn+1,Xn+2,…,Xn+kX_{n+1}, X_{n+2},\dots, X_{n+k}X1X1X_1XnXnX_nXn+1Xn+1X_{n+1}n+1n+1n+1X1X1X_1Xn+1Xn+1X_{n+1}Xn+2Xn+2X_{n+2} 假设我已经使用模型预测了值。如何计算这些预测值的置信区间?Yn+1,Yn+2,…,Yn+kYn+1,Yn+2,…,Yn+kY_{n+1}, Y_{n+2},\dots, Y_{n+k} 如果有人可以在这个问题上帮助我,我将不胜感激。(到目前为止,我已经阅读了用于计算样本均值的置信区间的公式,但是我没有看到有关如何为时间序列的预测值计算置信区间的任何信息)。

3
关于使用bigram(N-gram)模型构建文本文档的特征向量
用于文本挖掘的特征构造的传统方法是词袋方法,并且可以使用tf-idf进行增强,以建立表征给定文本文档的特征向量。目前,我正在尝试使用Bi-gram语言模型或(N-gram)来构建特征向量,但还不太清楚该怎么做?我们是否可以仅遵循单词袋的方法,即以二元语法代替单词来计算频率计数,并使用tf-idf加权方案对其进行增强?

3
聚类分布
我有几个发行版(下图中的10个发行版)。 实际上,这些是直方图:在x轴上有70个值,它们是溶液中某些粒子的大小,对于x的每个值,y的对应值是大小在x值附近的粒子所占的比例。 我想对这些分布进行聚类。目前,例如,我使用具有欧几里得距离的层次聚类。我对距离的选择不满意。我已经尝试过诸如Kullback-Leibler之类的信息理论距离,但是数据中有很多零,这会造成困难。您是否有适当距离和/或其他聚类方法的建议?
10 clustering 

2
二分和连续变量之间的相关性
我试图找到二分和连续变量之间的相关性。 从我对此的基础工作中,我发现我必须使用独立的t检验,其前提是变量的分布必须是正态的。 我进行了Kolmogorov-Smirnov检验以测试正态性,发现连续变量是非正态变量并且存在偏斜(针对约4,000个数据点)。 我对变量的整个范围进行了Kolmogorov-Smirnov检验。我应该将它们分组并进行测试吗?就是说,如果我有risk level(0=没有危险,1=有危险)和胆固醇水平,那么我应该: 将它们分为两组,例如 Risk level =0 (Cholestrol level) -> Apply KS Risk level =1 (Cholestrol level) -> Apply KS 一起带他们参加考试吗?(我仅对整个数据集执行了此操作。) 之后,如果仍然不正常,该怎么办? 编辑: 上面的情况只是我试图提供我的问题的描述。我有一个数据集,其中包含1000多个变量和大约4000个样本。它们本质上是连续的或绝对的。我的任务是根据这些变量预测一个二分变量(也许想出一个逻辑回归模型)。因此,我认为最初的调查将涉及发现二分法和连续变量之间的相关性。 我试图查看变量的分布情况,因此尝试进行t检验。在这里,我发现正常性是一个问题。在大多数这些变量中,Kolmogorov-Smirnov检验的显着性值为0.00。 我应该在这里假设正常吗?这些变量的偏斜度和峰度还表明,几乎在所有情况下数据都偏斜(> 0)。 根据下面给出的注释,我将进一步研究点-二元相关性。但是关于变量的分布,我仍然不确定。


2
如何按常见主题对字符串进行分组?
我试图将例如关于编程的字符串与其他关于编程的字符串,关于物理的字符串与关于物理的其他字符串等进行分组,以涵盖广泛的主题。尽管问题在语言学方面令人眼花aspect乱,但我仍希望使用编程/软件来实际执行此操作。 总结:给定大量字符串,我该如何按语义主题对它们进行分组? 特定的应用程序:我有大约200,000个琐事问题,我想将其归类为常见的组别(汽车,计算机,政治,加拿大,食品,巴拉克·奥巴马(Barack Obama)等)。 我研究的内容: Wikipedia 列出了自然语言处理工具包(假设我要尝试的工作实际上是NLP),因此我查看了一些内容,但似乎没有一个能满足我的需求。 注意:已经指出,这样做需要更多的知识(例如,保时捷是汽车,C ++是编程语言)。当时我认为需要训练数据,但是如果我只有问题和答案的列表,那么如何生成训练数据?然后如何使用训练数据? 更多说明:如果我的问与答帮助的当前格式(尽管看起来像JSON,但基本上是原始文本文件): // row 1: is metadata // row 2: is a very specific kind of "category" // row 3: is the question // row 4: is the answer { 15343 A MUSICAL PASTICHE Of classical music's "three B's", he was the …

1
测试比例和二进制分类器
我有一台生产零件的原型机。 在第一次测试中,该机器生产了零件,并且一个二进制分类器告诉我零件有缺陷(,通常且),而零件是好的。d 1 d 1 &lt; Ñ 1 d 1 / Ñ 1 &lt; 0.01 Ñ 1 ≈ 10 4 Ñ 1 - d 1ñ1个N1N_1d1个d1d_1d1个&lt; N1个d1&lt;N1d_1 < N_1d1个/N1个&lt; 0.01d1/N1&lt;0.01d_1/N_1<0.01ñ1个≈ 104N1≈104N_1\approx10^4ñ1个-d1个N1−d1N_1-d_1 然后,技术人员对机器进行一些更改,以减少缺陷零件的数量。 在第二次和随后的测试中,修改后的机器生成零件,并且相同的二进制分类器(未触及)告诉我零件有缺陷,无论如何与非常相似。d 2 d 2 / N 2 d 1 / N 1ñ2N2N_2d2d2d_2d2/ N2d2/N2d_2/N_2d1个/ N1个d1/N1d_1/N_1 技术人员想知道他的更改是否有效。 假设分类器是完美的(灵敏度为100%,特异性为100%),则可以对比例进行测试(使用R,我只输入prop.test(c(d1,d2),c(N1,N2)))。 但是分类器不是完美的,那么我如何考虑分类器的敏感性和特异性(都是未知的),以便正确地回答技术人员的问题?

3
在线材料学习时间序列分析
我的问题是,是否有任何良好的在线材料可供学习。介绍得很好的东西,尤其是ARMA模型和相关的数学。 编辑:我正在寻找高端本科水平的东西。布罗克韦尔(Brockwell)和戴维斯(Davis)的《时间序列与预测简介》中的内容

2
如何选择最佳变换以实现线性?
我想进行多元线性回归,然后以很少的推算来预测新值。我的响应变量的范围是-2到+7,并且有三个预测变量(范围是+10-+200)。分布几乎是正常的。但是响应和预测变量之间的关系不是线性的,我在图中看到了曲线。例如这样的例子:http : //cs10418.userapi.com/u17020874/153949434/x_9898cf38.jpg 我想应用变换来实现线性。我尝试通过检查不同的函数并查看生成的图来变换响应变量,以查看响应和预测变量之间的线性关系。而且我发现有很多函数可以给我可见的线性关系。例如功能 t1=log(y+2.5)t1=log⁡(y+2.5)t_1=\log(y+2.5) t2=1log(y+5)t2=1log⁡(y+5)t_2=\frac{1}{\log(y+5)} t3=1y+5t3=1y+5t_3=\frac{1}{y+5} t4=1(y+10)3t4=1(y+10)3t_4=\frac{1}{(y+10)^3} t5=1(y+3)13t5=1(y+3)13t_5=\frac{1}{(y+3)^\frac{1}{3}}等给出类似的结果:http : //cs10418.userapi.com/u17020874/153949434/x_06f13dbf.jpg 在我将预测值进行反变换之后(对于为等)。分布或多或少与正态分布相似。t=1(y+10)3t=1(y+10)3t=\frac{1}{(y+10)^3}y′=1t13−10y′=1t13−10y’=\frac{1}{t^\frac{1}{3}}-10 如何为数据选择最佳转换?是否存在定量(且不是很复杂)的线性度评估方法?证明所选的转换是最好的,或者在可能的情况下自动找到它。 还是唯一的方法是进行非线性多元回归?

3
从m个人的列表中选择n个人从y个人的列表中随机选择x个人的概率是多少?
如果我要从363人中选择232人而不进行替换,那么在此选择的12个人中,有2个人的概率是多少? 这是一场超级比赛的随机抽签,共有363名参赛者获得232个位置。关于选择是否偏向特定的12人小组存在争议。 我最初的计算方法是有232个选择363个可能的选择。十二个列表中任何一个人的组合数是1选择12 + 2选择12 + ... + 11选择12 + 12选择12。因此1选择12 + 2选择12 .... / 232选择363 。最终是一个非常低的数字,显然太低了。 我该如何计算?

2
二项式效应大小显示(BESD)是否会误导效应大小?
我很难接受唐纳德·鲁宾(Donald Rubin)提出过一个真正的技巧。然而,这是我的BESD [感悟1,2,3 ]。 Rosenthal和Rubin(1982)的原始论文声称,显示“无论原始数据是连续的还是分类的,如何将任何产品-时刻的相关性重塑到这种[2x2]的显示器中”都是有价值的。 下表来自p。上方第二个链接451: 这项技术似乎夸大了几乎所有效果大小的大小。在这里,原始数据的 = .01,但是当“转换”为2x2列联表时,我们似乎要面对更大的影响。我并不否认,当以这种方式将数据重新转换为分类格式时,确实为.1,但是我觉得翻译中有些东西很失真。 ϕ[R2R2R^2ϕϕ\phi 我在这里错过真正有价值的东西吗?另外,我给人的印象是,在过去的十年左右的时间里,统计界普遍拒绝将此作为一种合法方法,我对此是否错? 分别计算实验()和控制()成功率()的方程式很简单:Ç 小号[RËEECCC小号[Rsrsr Ë小号[R= .50 + r / 2Esr=.50+r/2E_{sr} = .50 + r/2 和 C小号[R= .50 − r / 2Csr=.50−r/2C_{sr} = .50 - r/2 参考: Rosenthal,R。和Rubin,DB(1982)。一个简单的通用显示实验效果的大小。教育心理学杂志,74,166–169。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.