统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
根据混合顺序分配“未混合”零件
假设我已将成对iid的观测值配对为对于。令和表示由的Ĵ的第最大观测值ž。X_ {i_j}的(条件)分布是什么?(或等效地,Y_ {i_j}的值)Xi∼N(0,σ2x),Yi∼N(0,σ2y),Xi∼N(0,σx2),Yi∼N(0,σy2),X_i \sim \mathcal{N}\left(0,\sigma_x^2\right), Y_i \sim \mathcal{N}\left(0,\sigma_y^2\right),i=1,2,…,ni=1,2,…,ni=1,2,\ldots,nZi=Xi+Yi,Zi=Xi+Yi,Z_i = X_i + Y_i,ZijZijZ_{i_j}jjjZZZXijXijX_{i_j}YijYijY_{i_j} 也就是说,在Z_i是Z的n个观测值的第j大时,X_i的分布是什么?XiXiX_iZiZiZ_ijjjnnnZZZ 我猜想,当ρ=σxσy→0ρ=σxσy→0\rho = \frac{\sigma_x}{\sigma_y} \to 0,X_ {i_j}的分布XijXijX_{i_j}收敛为X的无条件分布XXX,而当ρ→∞ρ→∞\rho \to \infty,X的分布XijXijX_{i_j}收敛到X的jjj阶统计量的无条件分布。不过在中间,我不确定。XXX

1
如何计算几率的标准误?
我有两个来自全基因组关联研究的数据集。唯一可用的信息是第一个数据集的比值比和p值。对于第二个数据集,我具有几率,p值和等位基因频率(AFD =疾病,AFC =对照)(例如:0.321)。我正在尝试对这些数据进行元分析,但是我没有effect size参数来执行此操作。是否有可能仅使用提供的信息来计算每个数据的SE和OR置信区间? 先感谢您 示例:可用数据: Study SNP ID P OR Allele AFD AFC 1 rs12345 0.023 0.85 2 rs12345 0.014 0.91 C 0.32 0.25 利用这些数据,我可以计算出SE和CI95%OR吗?谢谢


2
通过制定可全局优化的成本函数来解决问题的优势
这是一个相当普遍的问题(即不一定特定于统计),但是我注意到机器学习和统计文献中的一种趋势,作者更喜欢采用以下方法: 方法1:通过制定可能(例如从计算的角度来看)找到全局最优解决方案的成本函数(例如通过制定凸成本函数)来获得对实际问题的解决方案。 而不是: 方法2:通过公式化成本函数来获得相同问题的解决方案,而对于该函数,我们可能无法获得全局最优解(例如,我们只能为其获得局部最优解)。 请注意,严格地说,这两个问题是不同的。假设我们可以为第一个找到全局最优解,而第二个找不到。 除了其他考虑因素(例如速度,易于实施等),我正在寻找: 对这种趋势的解释(例如数学或历史论证) 解决实际问题时,采用方法1而不是方法2带来的收益(实际和/或理论上)。

1
如何解释降维/多维缩放的结果?
为了更好地理解数据的结构,我同时执行了SVD分解和6维数据矩阵的多维缩放。 不幸的是,所有奇异值都具有相同的阶数,这意味着数据的维数确实为6。但是,我希望能够解释奇异矢量的值。例如,第一个似乎在每个维度上都差不多相等(即(1,1,1,1,1,1)),第二个也有有趣的结构(类似(1,-1,1,-1,-1,1))。 我如何解释这些向量?您能指出一些有关该主题的文献吗?

3
k-均值算法中的循环
根据Wiki,最广泛使用的收敛标准是“辅助功能没有改变”。我想知道如果使用这样的收敛准则是否会发生循环?如果有人指出了一篇提供自行车运动示例或证明这是不可能的文章,我将感到高兴。

5
自动确定阈值以进行异常检测
我正在处理时间序列的异常分数(背景是计算机网络中的异常检测)。每分钟,我都会得到一个异常分数,它告诉我网络的当前状态有多么“意外”或异常。分数越高,当前状态越异常。理论上接近5分是可能的,但几乎不会发生。XŤ∈ [ 0 ,5 ]xt∈[0,5]x_t \in [0, 5] 现在,我想提出一种算法或公式,该算法或公式可以自动确定此异常时间序列的阈值。一旦异常分数超过此阈值,就会触发警报。 下面的频率分布是一个超过1天的异常时间序列的示例。然而,这是不是安全的假设,每一个异常的时间序列是要像她那样。在此特殊示例中,异常阈值(例如.99分位数)将是有意义的,因为最右边的分数可被视为异常。 并且具有与时间序列相同的频率分布(由于时间序列中没有更高的异常分数,因此它的范围从0到1): 不幸的是,频率分布可能具有一定的形状,其中.99分位数无效。下面是一个示例。右尾非常低,因此,如果将.99分位数用作阈值,则可能会导致许多误报。该频率分布似乎不包含异常,因此阈值应位于0.25左右的分布范围之外。 总结起来,这两个示例之间的区别在于第一个示例似乎表现出异常,而第二个则没有。 从我幼稚的角度来看,该算法应考虑以下两种情况: 如果频率分布具有较大的右尾(即几个异常分数),则.99分位数可能是一个很好的阈值。 如果频率分布的右尾非常短(即没有异常分数),则阈值应位于分布之外。 / edit:也没有基本事实,即可以使用带标签的数据集。因此,该算法针对异常得分的性质是“盲目的”。 现在,我不确定如何用算法或公式来表达这些观察结果。有人建议如何解决这个问题吗?我希望我的解释足够充分,因为我的统计背景非常有限。 谢谢你的帮助!

3
节省空间的集群
我见过的大多数聚类算法都始于在所有点之间创建每个到每个的距离,这在更大的数据集上变得很成问题。有没有这样做的人吗?还是采用某种部分/近似/交错方式? 哪种聚类算法/实现占用的空间少于O(n ^ 2)? 是否在某处列出了算法及其对时间和空间的要求?

3
处理分类变量的“不知道/拒绝”级别
我正在使用Logistic回归建模糖尿病预测。所使用的数据集是疾病控制中心(CDC)的 行为危险因素监视系统(BRFSS)。自变量之一是高血压。分为以下级别“是”,“否”,“不知道/拒绝”。在构建模型时,是否应使用“不知道/拒绝”删除那些行?从模型中保留或删除这些行有什么区别?

1
当协变量缺少一些数据时,如何评估GEE /逻辑模型拟合?
我已经将两个广义估计方程(GEE)模型拟合到我的数据中: 1)模型1:结果是纵向的是/否变量(A)(1,2,3,4,5年),纵向连续预测变量(B)是1,2,3,4,5年。 2)模型2:结果是相同的纵向是/否变量(A),但现在我的预测变量固定为第1年的值,即被强制为时间不变(B)。 由于在不同情况下几个时间点上我的纵向预测器中缺少测量值,因此模型2中的数据点数比模型1中的要多。 我想知道我可以在两个模型的比值比,p值和拟合度之间进行有效的比较,例如: 如果模型1中预测变量B的OR较大,是否可以有效地说出模型1中A和B之间的关联性更强? 我如何评估哪种数据更适合我的数据。我是否正确地认为,如果观察次数不同,则不应该在各个模型之间比较QIC / AIC伪R平方吗? 任何帮助将不胜感激。
9 logistic  gee 

4
如何在2 X 3桌子上进行多个事后卡方检验?
我的数据集包括近海,中海道和近海三种地点类型的生物的总死亡率或生存率。下表中的数字表示站点数。 100% Mortality 100% Survival Inshore 30 31 Midchannel 10 20 Offshore 1 10 我想知道根据地点​​类型,发生100%死亡率的地点数量是否显着。如果我运行2 x 3卡方,则会得到显着的结果。我是否可以进行事后成对比较,或者实际上应该使用对数方差分析或二项分布的回归?谢谢!

2
5点李克特项目随时间变化的统计意义
内容: 我有两年来同一份问卷中的两个数据集。每个问题均采用5 Likert量表进行评估。 Q1:编码方案 目前,我已将响应编码为[0,1]间隔,其中0表示“最负面的响应”,1表示“最正面的响应”,其他的响应平均间隔。 用于李克特量表的“最佳”编码方案是什么? 我意识到这可能有点主观。 问题2:多年的意义 确定两年内是否存在统计上的重大变化的最佳方法是什么? 也就是说,查看每年问题1的结果,如何判断2011年结果和2010年结果之间的差异是否具有统计显着性?我对学生的t检验在这里的使用有一个模糊的回忆,但我不确定。

4
如何在荟萃分析中计算合并奇数比的置信区间?
我有两个来自全基因组关联研究的数据集。唯一可用的信息是每种基因型SNP的奇数比及其置信区间(95%)。我想生成一个比较这两个比值比的森林图,但是我找不到计算组合的置信区间以可视化汇总效果的方法。我使用程序PLINK使用固定效果执行荟萃分析,但该程序未显示这些置信区间。 如何计算置信区间? 可用数据为: 每个研究的赔率, 95%的置信区间和 标准错误。

2
博彩公司对足球比赛赔率定价错误的可能性是多少?
一个英国足球队与能力不同的不同对手进行一系列比赛。庄家会为每场比赛提供赔率,包括是主场胜利,客场胜利还是平局。在整个赛季的中途,这支球队参加了场比赛,并吸引了其中的k场,这超出了预期。nnnkkk 庄家对这些比赛的赔率定价错误而不仅仅是不幸的概率是多少?如果博彩公司继续以类似的方式为球队剩余的比赛定价,而我押注$1$1\$1每笔都将是平局,那么我的预期收益是多少?

2
在为支持向量机选择学习参数的背景下,如何适当地应用交叉验证?
出色的libsvm软件包提供了python接口和文件“ easy.py”,该文件可自动搜索学习参数(cost和gamma),以最大程度地提高分类器的准确性。在给定的一组候选学习参数中,可以通过交叉验证来实现准确性,但是我觉得这破坏了交叉验证的目的。也就是说,就学习参数本身而言,可能会导致数据过度拟合的方式选择,我觉得更合适的方法是在搜索本身的级别上应用交叉验证:执行搜索在训练数据集上进行评估,然后通过在单独的测试数据集中进行评估来评估由最终选择的学习参数得出的SVM的最终准确性。还是我在这里想念什么?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.