统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答



1
了解TF-IDF对数中对数的使用
我正在阅读: https://zh.wikipedia.org/wiki/Tf%E2%80%93idf#Definition 但是我似乎无法确切地理解为什么以这种方式构造公式。 我的理解: iDF应该在某种程度上衡量术语S在每个文档中出现的频率,并随着术语S出现频率的增加而降低其价值。 从这个角度来看 我d ˚F(S)= # 文献# 含S-文献一世dF(小号)=# 文件数量# 包含S的文档 iDF(S) = \frac{\# \text{ of Documents}}{\# \text{ of Documents containing S}} 此外,术语“频率”可以正确地描述为 Ť ˚F(S,d )= #在文件d S的出现次数的 #文档D中任何字符串Q的最大出现次数 ŤF(小号,d)=# D中S的出现# 文档D中任何字符串Q的最大出现次数 tf(S,D) = \frac{\# \ \text{of Occurrences of S in document D}}{\# \ \text{maximum number of occurrences …

2
泰勒级数逼近(整个)函数的期望何时收敛?
对一些单变量随机变量和整个函数采取形式的期望(即,收敛区间为整个实线)E(f(X))E(f(X))E(f(X))XXXf(⋅)f(⋅)f(\cdot) 我有一个矩生成函数,因此可以轻松计算整数矩。在周围使用泰勒级数,然后将期望值应用于一系列中心矩 = f(\ mu)+ \ sum_ {n = 2 } ^ {\ infty} \ frac {f ^ {(n)}(\ mu)} {n!} E \ left [(x-\ mu)^ n \ right] 截断该系列, E_N(f(x) )= f(\ mu)+ \ sum_ {n = 2} ^ {N} \ frac {f ^ {(n)}(\ mu)} {n!} E \ …

1
为什么Elo评分系统使用错误的更新规则?
Elo评级系统使用成对比较中预期和观察到的结果概率之间的交叉熵损失函数的梯度下降最小化算法。我们可以写成一般的损失函数为 Ë= - Σñ ,我p一世大号Ò 克(q一世)E=−∑n,ipiLog(qi) E=-\sum_{n,i} p_i Log (q_i) 其中所有结果和所有反对者的总和。 是事件的所观察到的频率和预期频率。Ñ p 我我q 我一世iiñnnp一世pip_i一世i_iq一世qiq_i 如果只有两个可能的结果(赢或输)和一个对手 Ë= - p 大号ö 克(q)− (1 − p )L o g(1 − q)E=−pLog(q)−(1−p)Log(1−q) E=-p Log (q)-(1-p)Log(1-q) 如果是玩家的排名,而是玩家的排名,我们可以建立期望概率为 然后使用梯度下降更新规则我π Ĵ Ĵ q 我 = È π 我π一世πi\pi_i一世iiπĴπj\pi_jĴjj qĴ=È π Ĵq一世= eπ一世Ëπ一世+ eπĴqi=eπieπi+eπj q_i=\frac{e^{\pi_i}}{e^{\pi_i}+e^{\pi_j}} qĴ= eπĴËπ一世+ …


1
为什么所有PLS组件一起只能解释原始数据的一部分差异?
我有一个由10个变量组成的数据集。我运行偏最小二乘(PLS)来预测这10个变量的单个响应变量,提取10个PLS分量,然后计算每个分量的方差。在原始数据上,我得出所有变量的方差之和为702。 然后,我将每个PLS分量的方差除以该总和,得到由PLS解释的方差的百分比,令人惊讶的是,所有分量一起解释了原始方差的44%。 对此有什么解释?不应该是100%吗?

1
为什么样本比例也没有二项分布
在二项式设置中,给出成功次数的随机变量X是二项式分布的。然后可以将样本比例计算为,其中是样本量。我的教科书指出 nXnXn\frac{X}{n}nnn 这一比例也不会有二项分布 但是,由于只是二项分布随机变量的缩放版本,它不也应具有二项分布吗? XXnXn\frac{X}{n}XXX

2
凸序是否暗示着右尾优势?
给定两个连续分布FXFX\mathcal{F}_X和FYFY\mathcal{F}_Y,我不清楚它们之间的凸优势地位之间的关系: (0)FX&lt;cFY(0)FX&lt;cFY(0)\quad \mathcal{F}_X <_c \mathcal{F}_Y 暗示 (1)F−1Y(q)≤F−1X(q),∀q∈[0.5,1](1)FY−1(q)≤FX−1(q),∀q∈[0.5,1](1)\quad F_Y^{-1}(q) \leq F_X^{-1}(q),\quad \forall q\in[0.5,1] 是否成立,或者如果需要进一步假设(1)(1)(1)? 凸优势的定义。 如果两个连续分布FXFX\mathcal{F}_X和FYFY\mathcal{F}_Y满足: (2)F−1YFX(x) is convex in x(2)FY−1FX(x) is convex in x(2)\quad F_Y^{-1}F_X(x)\text{ is convex in } x [0]然后我们写: FX&lt;cFYFX&lt;cFYF_X <_c F_Y 并说比F X更右偏。因为F X和F Y是概率分布,所以(2 )还暗示F − 1 Y F X(x )的导数是单调非递减且非负的[1],即 F − 1 Y F …

2
基于精度(即反方差)的加权是否是荟萃分析不可或缺的?
基于精度的加权是荟萃分析的核心吗?Borenstein等。(2009)写道,为了使荟萃分析成为可能,所有必要的是: 研究报告的点估计值可以表示为单个数字。 可以为该点估计计算方差。 我尚不清楚为什么(2)绝对必要。但是,实际上,所有被广泛接受的荟萃分析方法都依赖于基于精度的(即逆方差)加权方案,这确实需要估算每个研究的效应量的方差。请注意,虽然对冲方法(Hedges&Olkin,1985; Hedges&Vevea,1998)和Hunter and Schmidt's Method(Hunter&Schmidt,2004)基本上都使用样本大小加权,但这些方法仅适用于归一化均值差,因此需要其他地方的标准差。在每个研究中与方差成反比的权重将使总效应量估计器中的方差最小化是有意义的,那么这种加权方案是否是所有方法的必要特征? 是否有可能进行系统的评估而无需访问每种效应量的方差,仍将结果称为荟萃分析?当方差不可用时,样本量似乎有可能替代精度。例如,在一项将效应量定义为原始均值差的研究中,可以使用样本量权重吗?这将如何影响结果平均大小的一致性和效率?

1
混合效果模型的模型矩阵
在lmer函数内lme4的R存在是构建随机效应,模型矩阵的呼叫,作为解释在这里,7页- 9。ZZZ 计算需要两个矩阵和 KhatriRao和/或Kronecker积。 ZZZJiJiJ_iXiXiX_i 矩阵是一个的:“分组因子索引的指标矩阵”,但是它似乎是带有伪编码的稀疏矩阵,用于选择对应于较高层次级别的哪个单元(例如,重复测量的主题)在“任何观察。所述矩阵似乎作为在较低层级测量的选择器,以便两个“选择器”的组合将产生一矩阵,通过下面的例子中的纸张所示的形式的:JiJiJ_iXiXiX_iZiZiZ_i (f&lt;-gl(3,2)) [1] 1 1 2 2 3 3 Levels: 1 2 3 (Ji&lt;-t(as(f,Class="sparseMatrix"))) 6 x 3 sparse Matrix of class "dgCMatrix" 1 2 3 [1,] 1 . . [2,] 1 . . [3,] . 1 . [4,] . 1 . [5,] . . 1 …

2
为什么要使用Durbin-Watson而不是测试自相关?
Durbin-Watson检验测试滞后1处的残差自相关,但是直接检验滞后1处的自相关也是如此。另外,您可以在滞后2,3,4处测试自相关,并且有很好的portmanteau测试可以在多个滞后处进行自相关,并获得漂亮的,易于解释的图形[例如R中的acf()函数]。杜宾·沃森(Durbin-Watson)不够直观,经常会得出不确定的结果。那么为什么要使用它呢? 这个问题的灵感源于某些Durbin-Watson检验的不确定性,但显然与之分离。


2
除了Durbin-Watson,还有哪些假设检验可以得出不确定的结果?
所述德宾沃森检验统计量可以位于一个不确定区域,其中它是不可能要么拒绝或不拒绝零假设(在这种情况下,零自相关的)。 还有哪些其他统计检验可以得出“不确定”的结果? 对于为什么这组测试无法做出二进制的“拒绝” /“拒绝失败”决定,是否有一般的解释(挥手就好)? 如果有人可以将决策理论的涵义作为他们对后一个查询的答案的一部分,那将是一个额外的奖励—是否存在(结论)附加类别是否意味着我们需要考虑第一类和第二类的成本错误以更复杂的方式?

1
克里格插值如何工作?
我正在研究一个问题,我需要使用克里金法基于周围的一些变量来预测某些变量的值。我想自己实现它的代码。因此,我阅读了太多文档以了解其工作原理,但我感到非常困惑。通常,我知道它是加权平均值,但是我无法完全理解计算权重然后预测变量值的过程。 谁能简单地向我解释这种插值方法的数学方面及其工作原理?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.