统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
用过度分散对泊松分布建模
我有一个数据集,我希望它遵循泊松分布,但它的分散程度约为3倍。目前,我正在使用R中的以下代码对这种过度分散进行建模。 ## assuming a median value of 1500 med = 1500 rawdist = rpois(1000000,med) oDdist = rawDist + ((rawDist-med)*3) 从视觉上看,这似乎非常符合我的经验数据。如果我对拟合感到满意,是否有任何理由应该做一些更复杂的事情,例如使用负二项式分布(如此处所述)?(如果是这样,那么这样做的任何指针或链接将不胜感激)。 哦,我知道这会创建一个稍微呈锯齿状的分布(由于乘以三),但这对我的应用程序来说并不重要。 更新: 为了其他人搜索和发现此问题,这里有一个简单的R函数,它使用负二项分布来建模过度分散的泊松。将d设置为所需的均值/方差比: rpois.od<-function (n, lambda,d=1) { if (d==1) rpois(n, lambda) else rnbinom(n, size=(lambda/(d-1)), mu=lambda) } (通过R邮件列表:https : //stat.ethz.ch/pipermail/r-help/2002-June/022425.html)

3
何时使用GAM与GLM
我意识到这可能是一个潜在的广泛问题,但我想知道是否存在可概括的假设,表明使用GAM(广义附加模型)而不是GLM(广义线性模型)? 最近有人告诉我,仅当我认为数据结构是“可加的”时才应使用GAM,即我期望x的加法能够预测y。另一个人指出,GAM与GLM进行的回归分析类型不同,当可以假定线性时,首选GLM。 过去,我一直使用GAM来获取生态数据,例如: 连续时间序列 当数据不具有线性形状时 我有多个x来预测y,以为我认为我可以使用“表面曲线”和统计检验来可视化某些非线性相互作用 对于GAM与GLM的不同之处,我显然不了解。我认为这是一个有效的统计检验,(而且我看到GAM的使用有所增加,至少在生态期刊中如此),但是我需要比其他回归分析更好地了解何时使用了GAM。

1
为什么单个ReLU无法学习ReLU?
作为我神经网络甚至无法学习欧几里德距离的后续操作,我进一步简化了方法,并尝试将单个ReLU(具有随机权重)训练为单个ReLU。这是目前最简单的网络,但有一半时间未能融合。 如果初始猜测与目标的方位相同,则它会快速学习并收敛到正确的权重1: 如果最初的猜测是“向后”,则它的权重为零,并且永远不会经过它到达较低损失的区域: 我不明白为什么。梯度下降不应该轻易遵循损耗曲线达到全局最小值吗? 示例代码: from tensorflow.keras.models import Sequential from tensorflow.keras.layers import Dense, ReLU from tensorflow import keras import numpy as np import matplotlib.pyplot as plt batch = 1000 def tests(): while True: test = np.random.randn(batch) # Generate ReLU test case X = test Y = test.copy() Y[Y < 0] …

3
Kullback-Leibler(KL)散度的最大值是多少
我将在我的python代码中使用KL散度,并获得了本教程。 在该教程中,实现KL散度非常简单。 kl = (model * np.log(model/actual)).sum() 据我所知,的概率分布model和actual应<= 1。 我的问题是,k的最大界限/最大可能值是多少?我需要知道我代码中的最大界限,即kl distance的最大可能值。

2
计算逻辑回归的置信区间
我正在使用二项式逻辑回归来确定是否暴露has_x或has_y影响用户点击某事的可能性。我的模型如下: fit = glm(formula = has_clicked ~ has_x + has_y, data=df, family = binomial()) 这是我模型的输出: Call: glm(formula = has_clicked ~ has_x + has_y, family = binomial(), data = active_domains) Deviance Residuals: Min 1Q Median 3Q Max -0.9869 -0.9719 -0.9500 1.3979 1.4233 Coefficients: Estimate Std. Error z value Pr(>|z|) (Intercept) -0.504737 …

4
接受原假设
这是关于统计学和其他科学交叉的讨论问题。我经常遇到同样的问题:我领域的研究人员倾向于说,当p值不小于显着性水平时,没有任何影响。一开始,我经常回答这不是假设检验的工作原理。鉴于这个问题多久出现一次,我想与经验丰富的统计学家讨论这个问题。 让我们考虑一下 “最佳出版集团”《自然通讯生物学》最近在科学期刊上发表的一篇论文(有多个示例,但我们只关注其中一个) 研究人员通过以下方式解释不具有统计意义的结果: 因此,长期适度的热量限制可以延长寿命并增强灵长类动物的健康,但它会影响大脑灰质的完整性,而不会影响认知能力。 证明: 然而,对照和限制热量的动物在Barnes迷宫任务中的表现没有差异(LME:F = 0.05,p = 0.82;图2a)。同样,自发的轮换任务也没有揭示对照动物和受卡路里限制的动物之间的任何差异(LME:F = 1.63,p = 0.22;图2b)。 作者还提出了对缺乏效果的解释-但关键不是解释,而是主张本身。所提供的图对我来说看起来很不一样(图2)。 此外,作者忽略了先验知识: 已经报道了热量限制对大鼠以及人类大脑和情绪功能的有害影响 对于庞大的样本量,我可以理解相同的主张(没有影响=在那里没有实际的显着影响),但是在特定情况下,使用了复杂的测试,而且对我来说执行功率计算并不明显。 问题: 我是否忽略了使他们的结论成立的任何细节? 考虑到需要报告科学中的负面结果,如何证明这不是“没有结果”(),而是“负面结果(例如,各组之间没有差异)”使用统计数据?我了解到,对于巨大的样本量,即使与零值的偏差很小,也会导致拒绝,但让我们假设我们拥有理想的数据,并且仍然需要证明零值实际上是正确的。p > αp>αp > \alpha 统计学家是否应该始终坚持数学上正确的结论,例如“拥有这种能力,我们无法检测出巨大​​的影响”?来自其他领域的研究人员强烈不喜欢这种负面结果的表述。 我很高兴听到对这个问题的任何想法,并且已经阅读并理解了该网站上的相关问题。从统计的角度来看,对问题2)-3)有明确的答案,但是我想了解在跨学科对话的情况下必须如何回答这些问题。 UPD:我认为阴性结果的一个很好的例子是医学试验的第一阶段,即安全性。什么时候科学家可以确定这种药物是安全的?我猜他们将两组进行比较并对此数据进行统计。有没有办法说这种药是安全的?Cochrane使用准确的“未发现副作用”,但医生说这种药物是安全的。当描述的准确性和简单性之间达到平衡时,我们可以说“对健康没有影响”吗?

3
解决机器学习中数据丢失问题的方法
几乎我们要使用机器学习算法进行预测的任何数据库都会发现某些特征的缺失值。 有几种解决此问题的方法,以排除具有缺失值的线,直到它们填充特征的平均值为止。 我想使用一种更健壮的方法,该方法基本上将运行回归(或其他方法),其中因变量(Y)将是每个缺少值但仅包含表行的列包含所有数据的对象,并使用此方法预测缺失值,按表填写表格并移至具有缺失值的下一个``列'',然后重复该方法直到所有内容都填满。 但这给了我一些疑问。 为什么任何列开始?我相信缺失值最小的那个直到最大的一个 是否有任何缺失值的阈值不值得尝试完成?(例如,如果此特征仅填充了10%的值,将其排除会更有趣) 在传统软件包或其他方法中是否有任何对丢失有鲁棒性的实现?

2
什么是机器学习中的贝叶斯错误?
http://www.deeplearningbook.org/contents/ml.html第116页说明了贝叶斯错误,如下所示 理想的模型是一个预言家,它仅知道生成数据的真实概率分布。即使这样的模型在许多问题上仍然会产生一些错误,因为分布中可能仍然存在一些噪音。在监督学习的情况下,从x到y的映射可能是内在随机的,或者y可能是确定性函数,除了x中包括的变量之外,还涉及其他变量。预言家根据真实分布p(x,y)进行预测而引起的错误称为贝叶斯错误。 问题 请直观地解释贝叶斯错误? 它与不可减少的误差有何不同? 我可以说总误差=偏差+方差+贝叶斯误差吗? “ y可能固有地是随机的”是什么意思?

2
相关的伯努利试验,多元伯努利分布?
我正在简化我正在工作的研究问题。想象一下,我有5个硬币,让我们称之为成功。这些是非常有偏见的硬币,成功概率为p = 0.1。现在,如果硬币是独立的,那么获得至少1个头或更多的概率非常简单,即。在我的情况下,我的伯努利试验(掷硬币)不是独立的。我获得的唯一信息是成功的概率(每个概率为p = .1)和二进制变量之间的理论Pearson相关性。1−(1−1/10)51−(1−1/10)51-(1-1/10)^5 有什么方法可以仅凭此信息来计算一次成功或更多次成功的概率?我试图避免基于仿真的方法,因为这些理论结果将用于指导仿真研究的准确性。我一直在研究多元伯努利分布,但我认为仅凭相关性和成功的边际概率不能完全说明它。我的一个朋友建议构造一个具有bernoulli边际的高斯copula(使用R包copula),然后pMvdc()在一个大样本上使用该函数来获得我想要的概率,但是我不确定如何处理它。

1
如何解释微分熵?
我最近看了这个文章的离散概率分布的熵。它描述了一种关于熵的好方法,在给定所用单词的概率分布的,当编码最佳时,对消息进行编码所需的期望位数(至少在熵定义中使用时)。日志2log2\log_2 但是,当扩展到像这样的连续情况时,我认为这种思维方式会,因为对于任何连续概率分布,(如果那是错误的,请纠正我),所以我想知道是否有一种很好的方式来思考连续熵的含义,就像离散情况一样。p (X )∑Xp (x )= ∞∑xp(x)=∞\sum_x p(x) = \inftyp (x )p(x)p(x)

2
Scikit使用CalibratedClassifierCV校准分类器的正确方法
Scikit具有CalibratedClassifierCV,它使我们能够在特定的X,y对上校准模型。它还明确指出data for fitting the classifier and for calibrating it must be disjoint. 如果它们必须不相交,则对分类器进行以下训练是否合法? model = CalibratedClassifierCV(my_classifier) model.fit(X_train, y_train) 我担心使用相同的训练集会违反disjoint data规则。另一种可能是设置验证集 my_classifier.fit(X_train, y_train) model = CalibratedClassifierCV(my_classifier, cv='prefit') model.fit(X_valid, y_valid) 这样做的缺点是要保留较少的数据用于训练。另外,如果CalibratedClassifierCV只适合于适合其他训练集的模型,为什么默认选项为cv=3,也适合基本估计量?交叉验证是否可以自行处理不相交规则? 问题:使用CalibratedClassifierCV的正确方法是什么?

2
精确召回曲线中的“基线”是什么
我试图了解精度召回曲线,了解什么是精度和召回率,但我不了解的是“基准”值。我正在阅读此链接 https://classeval.wordpress.com/introduction/introduction-to-the-precision-recall-plot/ 并且我不理解“完美分类器的精确召回曲线”中显示的基线部分,它有什么作用?以及如何计算呢?我们选择的仅仅是基线吗?例如,我有具有诸如retweet,status_countetc之类的属性的twitter数据,Favorited如果被收藏,我的班级标签为1,如果未被收藏,我的班级标签为0,我在其上应用了朴素贝叶斯,现在我想绘制精确调用曲线,在这种情况下应如何设置基线?

3
为什么总是至少有一项政策优于或等于所有其他政策?
强化学习:简介。 理查德·萨顿(Richard S.Sutton)和安德鲁·G·巴托(Andrew G.Barto)(c)2012年第二版,第67-68页。 解决强化学习任务,粗略地讲,是找到一种从长远来看会获得很多回报的政策。对于有限的MDP,我们可以通过以下方式精确定义最佳策略。值函数定义了对策略的部分排序。策略被定义为优于或等于政策如果它的预期收益大于或等于的,所有状态。换句话说,对于且仅对于所有,仅当。总有至少一项策略优于或等于所有其他策略。这是一个最佳策略。ππ\piπ′π′\pi'π′π′\pi'π≥π′π≥π′\pi \geq \pi'vπ(s)≥vπ′(s)vπ(s)≥vπ′(s)v_\pi(s) \geq v_{\pi'}(s)s∈Ss∈Ss \in \mathcal{S} 为什么总是至少有一项政策优于或等于所有其他政策?

3
Frisch-Waugh定理的效用
我应该教计量经济学的弗里什·沃夫定理,但我还没有研究过。 我已经了解了其背后的数学原理,也希望这个想法“如果您“消除”其他回归变量的影响,则从多重线性模型中为特定系数获得的系数等于简单回归模型的系数”。因此,理论上的想法有点酷。(如果我完全误解了,我欢迎您提出更正) 但是它有一些经典/实用用法吗? 编辑:我已经接受了一个答案,但仍然愿意有新的带来其他示例/应用程序。


By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.