统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
模型构建过程是交互式的时进行回测或交叉验证
我有一些预测模型,我想对其性能进行回测(即,获取我的数据集,将其“倒带”到上一个时间点,并查看该模型的预期性能)。 问题是我的某些模型是通过交互过程构建的。例如,按照弗兰克·哈雷尔(Frank Harrell)的回归建模策略中的建议,在一个模型中,我使用了受限制的三次样条来处理特征与响应之间可能的非线性关联。我根据领域知识和关联强度的单变量度量来分配每个样条的自由度。但是,我要允许模型的自由度显然取决于数据集的大小,在进行回测时,数据集的变化很大。如果我不想在每次对模型进行回测时都分别手动选择自由度,那么我还有其他选择吗? 再例如,我目前正在通过发现具有高杠杆作用的点来进行离群值检测。如果我愿意手工进行此操作,则只需查看每个高杠杆数据点,仔细检查数据是否干净,然后过滤掉或手工清理。但这依赖于很多领域知识,因此我不知道如何使过程自动化。 我将不胜感激建议和解决方案,无论是(a)解决模型构建过程中交互部分自动化的一般问题,还是(b)针对这两种情况的具体建议。谢谢!

2
袋外误差估计是否可以增强?
在随机森林中,每棵树都是在数据的唯一Boostrap样本上并行生长的。由于预计每个Bo​​ostrap样本将包含约63%的独特观测值,因此将约37%的观测值排除在外,可用于测试树。 现在,似乎在随机梯度增强中,还有一个类似于RF中的估计:OOBerrorOOBerrorOOB_{error} 如果bag.fraction设置为大于0(建议为0.5),则gbm将计算出袋装的预测性能改善估计值。它评估在选择下一个回归树时未使用的那些观察结果的偏差减少。 资料来源:Ridgeway(2007),第3.3节(第8页)。 我无法理解其工作方式/是否有效。说我要按顺序添加一棵树。我正在原始数据集的随机子样本上生长这棵树。我可以在不用于生长的观察结果上测试这棵树。同意 但是,由于Boosting是顺序的,所以我宁愿使用到目前为止构建的整个树序列来为那些遗漏的观察提供预测。而且,前面的许多树木很有可能已经看到了这些观察结果。因此,不是真的像RF一样在每个回合上都未对模型进行过测试,对吗? 那么,这怎么称为“袋外”误差估计呢?对我来说,似乎已经被发现了吗?

1
如何使用准则找到和评估连续变量的最佳离散化?
我有一个包含连续变量和二进制目标变量(0和1)的数据集。 我需要相对于目标变量离散化连续变量(用于逻辑回归),并约束每个间隔的观察频率应该保持平衡。我尝试了机器学习算法,例如Chi Merge,决策树。Chi merge给我的间隔在每个间隔中具有非常不平衡的数字(一个间隔有3个观测值,另一个间隔有1000个观测值)。决策树很难解释。 我得出的结论是,最佳离散化应最大化离散化变量和目标变量之间的统计量,并且其间隔应包含大致相同数量的观察值。χ2χ2\chi^2 有解决这个问题的算法吗? 这在R中看起来是这样(def是目标变量,x是要离散化的变量)。我计算了Tschuprow的来评估转换后的变量与目标变量之间的“相关性”,因为统计量倾向于随着间隔数的增加而增加。我不确定这是否是正确的方法。χ 2ŤTTχ2χ2\chi^2 除了Tschuprow的(当班级数量减少时会增加)之外,还有其他方法可以评估我的离散化是否最佳吗?ŤTT chitest <- function(x){ interv <- cut(x, c(0, 1.6,1.9, 2.3, 2.9, max(x)), include.lowest = TRUE) X2 <- chisq.test(df.train$def,as.numeric(interv))$statistic #Tschuprow Tschup <- sqrt((X2)/(nrow(df.train)*sqrt((6-1)*(2-1)))) print(list(Chi2=X2,freq=table(interv),def=sum.def,Tschuprow=Tschup)) }

2
如何找到权重来衡量差异性
我想学习(推论)可以用于聚类的差异度量的属性权重。 我有一些例子对对象的是“相似的”(应该是相同的簇中),以及一些实施例中(Ç 我,ð 我)对对象的是“不相似”(不应位于同一群集中)。每个对象都有许多属性:如果您愿意,我们可以将每个对象视为特征的d维向量,其中每个特征都是非负整数。是否有技术使用类似/相似对象的此类示例,从中估算出相似度度量的最佳特征权重?(一个一世,b一世)(一个一世,b一世)(a_i,b_i)(c一世,d一世)(C一世,d一世)(c_i,d_i)ddd 如果有帮助,在我的应用程序中,集中精力学习作为加权L2范数的相异性度量可能是合理的: d(x ,y)= ∑ĴαĴ(x [ j ] − y[ j ] )2。d(X,ÿ)=∑ĴαĴ(X[Ĵ]-ÿ[Ĵ])2。d(x,y) = \sum_j \alpha_j (x[j] - y[j])^2. 其中权重不知道和应该汲取的。(或者,某种加权余弦相似度的可能是合理的了。)是否有好的算法来学习权重α Ĵ对于这样的措施,给出的例子?还是我应该考虑其他方法来学习相似性度量/相异性度量?αĴαĴ\alpha_jαĴαĴ\alpha_j 不幸的是,维数非常大(数千个或更高;它是从单词袋特征派生的)。但是,我确实有数以万计的示例。然后,我有成千上万个要聚类的对象,因此对示例进行归纳以学习良好的相异性度量很重要。 我认为这属于半监督聚类的范畴,这听起来像是“适应相似性”的范畴,但是我无法找到用于此目的的算法的清晰描述。

4
Fisher对配对数据的精确测试
假设有例肺癌患者和匹配的对照组(无肺癌)(根据年龄,性别等进行匹配)。为了找到吸烟对肺癌的影响之间的证据,我在列联表上使用了Fisher的精确检验。但是,这没有考虑到控制和案例是匹配的。 404040404040 所以我想知道是否有一种方法可以使用费舍尔的精确测试来考虑两组之间的匹配?

2
CART树是否捕获预测变量之间的交互?
此纸的权利要求,在CART,因为在每一步骤的单个协变量执行二进制分裂,所有分割是协变量之间正交,并因此相互作用不考虑。 但是,相反,许多非常严肃的参考文献声称,树的层次结构可以保证自动对预测变量之间的交互进行建模(例如,本文,当然还有Hastie)。 谁是对的?CART生长的树是否捕获输入变量之间的相互作用?

2
在对学生论文进行评分时,如何使用这些数据校准具有不同慷慨程度的标记?
12名老师在教600名学生。这些老师教的12个群组的规模从40至90名学生不等,我们预计这两个群组之间会有系统的差异,因为研究生被分配给特定群组的比例不成比例,并且以往的经验表明,研究生的平均得分大大高于本科生。 老师对他们队列中的所有论文进行了评分,并给他们满分100分。 每位教师还查看了其他三位教师随机选择的一篇论文,并在100分中给了满分。每位教师的三篇论文都被另一位老师标记。因此,已经用这种方式对36篇不同的论文进行了标记,我称之为校准数据。 我还可以看到每个队列中有多少名研究生。 我的问题是: A)如何使用此校准数据来调整原始标记,以使其更公平?特别是,我想尽可能地消除过于慷慨/多余的制造商的影响。 B)我的校准数据是否合适?在本课程中获得的校准数据的有限的36个数据点中,我别无选择,并且在本学期没有选择的余地。但是,如果这种情况再次发生,我也许能够收集更多的校准数据,或者收集不同类型的校准数据。 这个问题与我问过的一个普遍问题有关: 我如何在对学生论文进行评分时最好地应对慷慨程度不同的标记的影响?。但是,这是另一回事,我不确定阅读该问题作为当前背景的有用之处,因为主要问题是我没有校准数据。

2
如何相对于平均温度按年表示千瓦时使用量?
只是为了好玩,我想逐年绘制每月的家庭用电图表。但是,我希望对每月温度有所参考,以便可以确定我的房屋或行为在用电量方面是否在改善,恶化或保持稳定。 我正在使用的数据: +----------+--------+-----------+----------------+----------+-----------+------------+ | Month | # Days | kWh Usage | Daily kWh Avg. | Avg. Low | Avg. High | Avg. Temp. | +----------+--------+-----------+----------------+----------+-----------+------------+ | Mar 2015 | 32 | 1048 | 33 | 40 | 60 | 50 | | Feb 2015 | 29 | 1156 | …

2
仍然是同一族的两个随机非法线的线性组合
众所周知,两个随机正态变量的线性组合也是一个随机正态变量。是否有任何共同的非正态分布族(例如Weibull)也共享此属性?似乎有许多反例。例如,制服的线性组合通常不是均匀的。特别是,是否存在以下两个都成立的非正态分布族: 来自该族的两个随机变量的线性组合等效于该族中的某些分布。 可以根据原始参数和线性组合中的常数来确定结果参数。 我对这种线性组合特别感兴趣: Y=X1⋅w+X2⋅(1−w2)−−−−−−−√Y=X1⋅w+X2⋅(1−w2)Y = X_1 \cdot w + X_2 \cdot \sqrt{(1-w^2)} 其中和是从某个具有参数和非正常族中采样的,而来自同一个具有参数非正规族。X 2 θ 1 θ 2 Ŷ θ Ý = ˚F (θ 1,θ 2,瓦特)X1X1X_1X2X2X_2θ1θ1\theta_1θ2θ2\theta_2YYYθY=f(θ1,θ2,w)θY=f(θ1,θ2,w)\theta_Y = f(\theta_1, \theta_2, w) 为了简单起见,我将描述一个带有1个参数的发布系列,但是我愿意接受带有多个参数的发布系列。 另外,我正在寻找一个示例,其中和上有足够的参数空间可用于模拟目的。如果您只能找到一个适用于某些非常特定的和的示例,那将没有太大帮助。θ 2 θ 1 θ 2θ1θ1\theta_1θ2θ2\theta_2θ1θ1\theta_1θ2θ2\theta_2

1
X,Y是从N(0,1)开始的id。X> 2Y的概率是多少
我在想,因为来自并且它们是独立的,所以X,YX,YX, YN(0,1)N(0,1)N(0,1) X−2YX−2YX - 2Y具有)的分布。那么概率为。N(0,5)N(0,5)N(0, 5)X−2Y>0X−2Y>0X-2Y > 01/21/21/2 以上对我来说似乎是正确的,尽管看起来 概率为。好像有点不对劲。我有做错什么吗?X>nYX>nYX>nY1/21/21/2

1
信息论在应用数据科学中的应用
今天,我翻阅了詹姆斯·斯通(James Stone)的《信息理论:教程简介》一书,并思考了一两个片刻,以探讨信息理论在应用 数据科学中的应用程度(如果您不满意这个仍然有些模糊的术语,想想数据分析,这是恕我直言数据科学的荣耀版)。我很清楚的显著使用的信息理论为基础的途径,方法和措施,特别是熵,引擎盖下的各种统计技术和数据分析方法。 但是,我对应用社会科学家成功选择和应用这些概念,方法和工具所需要的知识的程度/水平感到好奇,而不必深入理论的数学渊源。我期待您的回答,这些回答可能会在上述书籍(或其他类似书籍-随时推荐)或总体上解决我的关注。 我还要感谢一些针对印刷或在线资源的建议,这些建议在(与之相比)其他(更多)传统统计方法(常客和贝叶斯方法)的背景下讨论信息理论及其概念,方法,方法和措施。

4
掷骰子的期望数量要求总和大于或等于K?
6面模具反复滚动。求和大于或等于K所需的预期卷数是多少? 编辑之前 P(Sum>=1 in exactly 1 roll)=1 P(Sum>=2 in exactly 1 roll)=5/6 P(Sum>=2 in exactly 2 rolls)=1/6 P(Sum>=3 in exactly 1 roll)=5/6 P(Sum>=3 in exactly 2 rolls)=2/6 P(Sum>=3 in exactly 3 rolls)=1/36 P(Sum>=4 in exactly 1 roll)=3/6 P(Sum>=4 in exactly 2 rolls)=3/6 P(Sum>=4 in exactly 3 rolls)=2/36 P(Sum>=4 in exactly …

5
两个参数的泊松假设检验
因此,为了好玩,我从工作所在的呼叫中心获取一些呼叫数据,并尝试对它们进行假设检验,特别是一周内收到的呼叫数量,并使用泊松分布进行拟合。由于我工作的主题,星期有两种类型,让我们称其为我假设有更多呼叫的工作周中的一种,而假设为更少的非工作周称为一种。 我有一种理论认为,每周的(称为)大于非一周的(称为)λλ\lambdaλ1λ1\lambda_1λ2λ2\lambda_2 所以我要检验的假设是H0:λ1个> λ2,小时1个:λ1个≤ λ2H0:λ1个>λ2,H1个:λ1个≤λ2H_0: \lambda_1 > \lambda_2, H_1: \lambda_1 \leq \lambda_2 我知道如何测试一个参数(例如 ),但不确定如何在给定数据集的情况下进行2个操作。假设我从每个星期和以及每个星期和的每个中获取两周的数据。有人可以帮助我浏览这个更简单的版本,以便将其应用于更大的数据集吗?任何帮助表示赞赏,谢谢。H0:λ1个> 1 ,ħ1个:λ1个≤ 1H0:λ1个>1个,H1个:λ1个≤1个H_0: \lambda_1 > 1, H_1: \lambda_1 \leq 1 X1个= 2X1个=2X_1 = 2X2= 3X2=3X_2 = 3ÿ1个= 2ÿ1个=2Y_1 = 2ÿ2= 6ÿ2=6Y_2=6

1
对回归变量进行条件处理与将其视为固定条件有什么区别?
有时我们假设回归变量是固定的,即它们是非随机的。我认为这意味着我们所有的预测变量,参数估计等都是无条件的,对吧?我什至可能已经不再是随机变量了吗? 另一方面,如果我们接受经济学家所说的大多数回归变量是随机的,因为没有外界的力量在进行某种实验的基础上就决定了它们。然后,计量经济学家会根据这些随机回归变量进行调整。 这与将它们视为固定的有何不同? 我了解什么是调节。从数学上讲,这意味着我们将所有观察和推论都以该组特定的回归器为条件,并且没有雄心勃勃地说,如果我们看到回归器的实现不同,则推论,参数估计,方差估计等将是相同的。时间序列的症结所在,每个时间序列只能看到一次)。 但是,要真正掌握固定回归变量与随机回归变量的条件之间的区别,我想知道这里是否有人知道一个对固定回归变量有效但在随机回归时会分解的估计或推断过程的示例视情况而定)。 我期待看到这些示例!

1
LASSO用于解释性模型:参数是否缩小?
我正在进行分析,其主要目标是了解数据。数据集足够进行交叉验证(10k),并且预测变量包括连续变量和虚拟变量,并且结果是连续的。主要目标是查看踢出一些预测变量是否有意义,以使模型更易于解释。 问题: 我的问题是“哪些变量解释了结果,并且是该解释的“足够强的”部分”。但是要为套索选择lambda参数,可以使用交叉验证,即预测有效性作为准则。在进行推断时,预测效度是否足以代替我要问的一般问题? 说LASSO仅保留了8个预测变量中的3个。现在我问自己:“这些对结果有什么影响”。例如,我发现了性别差异。套索收缩后,该系数表明女性得分比男性高1分。但是没有缩水(即在实际数据集上),它们的得分高出2.5分。 我将哪一个作为我的“真实”性别效果?仅根据预测效度,它将是收缩系数。 或者说,我正在为不精通统计的人们编写报告。我要向他们报告哪个系数?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.