统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

2
考克斯比例风险模型和非随机选择的样本
是否有任何方法可以纠正由非随机选择的样本引起的Cox比例风险模型中的偏差(类似于Heckman校正)? 背景:可以 说情况如下: -在最初的两年中,所有客户都被接受。 -两年后,建立了Cox PH模型。模型预测客户将使用我们的服务多长时间。 -根据公司的政策,从现在开始,只有生存3个月大于0.5的客户被接受,其他客户则被拒绝。 -再过两年,需要建立一个新模型。问题在于我们仅将目标客户指定为接受的客户,并且仅使用这些客户可能会导致一些严重的偏差。
9 bias  cox-model 

4
使用Matlab自相关和神经网络时,如何处理时间序列数据中的缺口/ NaN?
我有一个时间序列的测量值(高度一维序列)。在观察期内,测量过程下降了一些时间点。因此,所得数据是带有NaN的矢量,其中数据中存在间隙。使用MATLAB,这在计算自相关(autocorr)和应用神经网络(nnstart)时给我带来了问题。 这些差距/ NaN应该如何处理?我应该将它们从载体中删除吗?还是将其条目替换为插值?(如果是这样,那么在MATLAB中如何操作)

4
测试正态分布随机变量比率的显着差异
与分析变量的比率有关,以及如何参数化两个正态分布变量的比率或一个变量的倒数?。 假设我有来自四个不同连续随机分布的多个样本,我们可以假设所有这些样本都是大致正态的。在我的情况下,这些对应于两个不同文件系统(例如ext4和XFS)的一些性能指标,无论有没有加密。该指标可能是,例如,每秒创建的文件数,或某些文件操作的平均延迟。我们可以假设从这些分布中抽取的所有样本将始终严格为正。我们称这些分布Perffstype,encryptionPerffstype,encryption\textrm{Perf}_{fstype,encryption} 哪里 fstype∈{xfs,ext4}fstype∈{xfs,ext4}fstype \in \{xfs,ext4\} 和 encryption∈{crypto,nocrypto}encryption∈{crypto,nocrypto}encryption \in \{crypto,nocrypto\}。 现在,我的假设是,加密会使一个文件系统比另一个文件系统减慢的速度更大。对假设是否有一些简单的检验E[Perfxfs,crypto]E[Perfxfs,nocrypto]&lt;E[Perfext4,crypto]E[Perfext4,nocrypto]E[Perfxfs,crypto]E[Perfxfs,nocrypto]&lt;E[Perfext4,crypto]E[Perfext4,nocrypto]\frac{E[\textrm{Perf}_{xfs,crypto}]}{E[\textrm{Perf}_{xfs,nocrypto}]} < \frac{E[\textrm{Perf}_{ext4,crypto}]}{E[\textrm{Perf}_{ext4,nocrypto}]}?

1
从现有的多输入最大熵分类器创建最大熵马尔可夫模型
最大熵马尔可夫模型(MEMM)的概念引起了我的兴趣,我正在考虑将其用于词性(POS)标记器。目前,我正在使用常规的最大熵(ME)分类器来标记每个单词。这使用了许多功能,包括前面的两个标签。 MEMM使用维特比算法找到通过马尔可夫链的最优路径(即为句子找到完整的最优标签集,而不是为每个单词找到单独的最优值)。读到它,这似乎具有奇妙的优雅和简约。但是,每个阶段仅依赖于上一个阶段的“结果”(即,根据马尔可夫链)。 但是,我的ME模型使用了前两个阶段(即前两个单词的标签)。看来我有两种可能的方法: 与传统的Viterbi实现一样,使用根据一个(上一个)阶段存储的一组路径。我的ME分类器将使用此阶段和此阶段之前的“冻结”阶段(冻结到所考虑的路径中)来产生传递函数。 或者我编写算法来跟踪两个阶段。这更加复杂,将不再是真正的马尔可夫模型,因为每个传递函数(即,来自ME模型)将取决于前两个阶段而不是一个阶段。 令我惊讶的是,第二秒将更加准确,尽管它将更加复杂。 在文献搜索过程中,我还没有找到任何示例。是否尝试过?两阶段方法是否改善了整体精度?

3
在变量对数转换之前或之后进行相关
关于是否应在进行对数转换之前或之后为两个随机变量X和Y计算出皮尔逊相关性,是否有一个普遍的原则?有测试哪个程序更合适?它们产生相似但不同的值,因为对数变换是非线性的。是否取决于对数后X或Y是否更接近常态?如果是这样,那为什么重要呢?这是否意味着应该对X和Y与log(X)和log(Y)进行正态性检验,并据此确定pearson(x,y)是否比pearson(log(x),log( y))?

7
寻找2D人工数据以演示聚类算法的属性
我正在寻找遵循不同分布和形式的二维数据点(每个数据点是两个值(x,y)的向量)的数据集。生成此类数据的代码也将有所帮助。我想使用它们来绘制/可视化某些聚类算法的性能。这里有些例子: 星状云数据 四个集群,一个容易分离 螺旋形(无簇) 戒指 两片几乎分开的云 两个平行的簇形成螺旋 ...等等

4
学习LaTeX,Sweave和Beamer的最有效命令?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 3年前关闭。 我对学习如何从我的R代码和ggplot2可视化文件创建重复报告非常感兴趣。 我了解LaTeX似乎是一个可能的答案,并且将其与R一起使用时,大多数使用Sweave。对于从R到LaTeX的演示,人们可以使用Beamer。 我的问题是,我应该首先学习什么,或者我应该同时学习什么?我不知道Sweave或LaTeX。我应该学习LaTeX(至少一点),然后学习Sweave吗?还是建议您同时学习? 链接到支持您的答案的教程非常感谢。
9 r 

1
R中的粒子过滤器–简单代码示例
我正在寻找一个如何在R中运行粒子过滤器的简单代码示例。pomp程序包似乎支持状态空间数学位,但是对于像我这样的简单OO开发人员,这些示例很难以编程方式进行遵循如何将观察到的数据加载到pomp对象中。 此处的示例:http : //cran.r-project.org/web/packages/pomp/vignettes/intro_to_pomp.pdf 可以说我有一个带有1列嘈杂数据的csv文件作为输入,并且我希望通过“粒子过滤器”运行它,以便希望将其清理为输出,并将其输出为另一个csv文件。 y &lt;- read.csv("C:/Dev/VeryCleverStatArb/inputData.csv", header=FALSE) #CSV to Pomp object ??? #Run Particle Filter #Write estimates to csv. 这些示例的主要困难是将csv数据加载到pomp对象中。 现在,一个非常简单的状态空间模型应该已经足够了。 对R好奇有什么想法吗?
9 r 

4
减少多元回归中的变量数量
我有一个庞大的数据集,其中包含数百个金融变量的值,这些变量可以用于多元回归,以预测指数基金随时间的行为。我想将变量的数量减少到十个左右,同时仍保留尽可能多的预测能力。 补充:减少的变量集必须是原始变量集的子集,以保留原始变量的经济意义。因此,例如,我不应该以原始变量的线性组合或聚合结局。 有关如何执行此操作的一些想法(可能是幼稚的): 对每个变量执行简单的线性回归,然后选择具有最大值的十个变量。当然,不能保证十个最佳个体变量的组合将是十个最佳组。R2R2R^2 执行主成分分析,并尝试查找与前几个主轴关联最大的十个原始变量。 我认为我不能执行分层回归,因为变量不是真正嵌套的。尝试使用十个变量的所有可能组合在计算上是不可行的,因为组合太多。 是否有标准方法来解决减少多元回归中变量数量的问题? 似乎这将是一个足够普遍的问题,因此将存在一种标准方法。 一个非常有用的答案将是不仅提及标准方法,而且概述其工作方式和原因。或者,如果没有一种标准的方法,而是多种方法各有优缺点,那么讨论其优缺点的答案将非常有用。 Whuber在下面的评论表明,最后一段中的要求太宽泛。相反,我会接受一个主要方法列表作为一个好的答案,也许对每个方法都有一个非常简短的描述。一旦有了条款,我就可以挖掘每个人的详细信息。

1
GLM和GEE有什么区别?
具有二进制响应变量(包括主题和时间作为协变量)的GLM模型(逻辑回归)与考虑了多个时间点之间的相关性的类似GEE模型之间有什么区别? 我的GLM看起来像: Y(binary) ~ A + B1X1(subject id) + B2X2(time) + B3X3(interesting continuous covariate) 具有logit链接功能。 我正在寻找一个简单的解释(针对社会科学家),以解释两个模型中如何以及为什么对时间进行区别对待,以及解释的含义。

1
如何基于RMSE计算精度度量?我的大型数据集是否呈正态分布?
我有几千个点的数据集。每个数据集中的值是X,Y,Z,表示空间中的坐标。Z值表示坐标对(x,y)处的高程差。 通常在我的GIS领域,通过将地面真点减去一个测量点(LiDAR数据点)在RMSE中引用高程误差。通常至少使用20个地面检查点。使用此RMSE值,根据NDEP(国家数字高程指南)和FEMA指南,可以计算出准确度:准确度= 1.96 * RMSE。 该精度表示为:“基本垂直精度是可以对数据集之间的垂直精度进行公平评估和比较的值。基本精度是在95%置信水平下计算的,是垂直RMSE的函数。” 我了解正态分布曲线下的面积的95%位于1.96 * std.deviation之内,但这与RMSE不相关。 通常,我会问这样一个问题:使用从2个数据集计算出的RMSE,我如何将RMSE与某种精度相关(即我的数据点的95%在+/- X cm内)?另外,如何使用适用于如此大数据集的测试确定我的数据集是否正态分布?什么是正态分布的“足够好”?所有测试的p &lt;0.05还是应该与正态分布的形状匹配? 我在以下论文中找到了关于此主题的一些很好的信息: http://paulzandbergen.com/PUBLICATIONS_files/Zandbergen_TGIS_2008.pdf

1
如何公平地确定区域科学博览会的获奖者?
我需要帮助,以找出正确的方法来计算我们的Science Fair获奖者。我不希望我对统计和数学的无知会妨碍孩子获得获胜的机会。(大量的奖学金和晋升福利at可危)。在此先感谢您的帮助。 首先介绍一下我们如何进行设置: 我们的博览会通常有大约600个学生项目。这些项目由单个学生或一组学生完成并介绍。一个团队可以包含2个或3个孩子。 学生分为两个部分:小学(6-8年级)和中学(9-12年级)。每个部门都有不同的类别:小学项目9个类别,中学项目17个类别。 每个部门的每个类别分别获得第一,第二和第三名的奖项。超过第三名的位置也会获得荣誉奖。 对于每个项目,我们分配4至6名法官。我们根据法官的资格,他们的类别偏好和他们过去的评审经验来进行分配。(经验丰富的人员被分配到高级部门的项目中)。 评委如何为项目评分: 对于每个项目,都有5个分配了点的标准。每个标准可以在1到20分之间奖励。一般标准是: 总体目标+假设+资源使用(1..20) 设计+程序(1..20) 数据收集+结果(1..20) 讨论+结论(1..20) 面试(1..20) 对于团队项目,第六个标准被评估为“团队扣除”,在该标准中,法官可以为未参加或未出席的队友扣分(最多15分)。 团队扣除(0 ..- 15) 因此,法官可以为每个项目打5至100分。如果该项目是团队项目,则得分可以降低15分。 原始数据: 在几个小时的过程中,我们从法官那里收集了3600个分数。这些分数被输入到数据库中,我可以在其中进行各种排序,平均,标准差计算等。我只是不知道该如何处理这些原始分数。现在,我正在为每个项目做一个简单的平均,但是我担心我没有针对法官的偏见,团队扣除或其他我没有考虑的其他因素进行调整。 所需结果: 最后,我想对分数进行处理,以便可以为每个类别分别授予第一,第二和第三名,然后为随后的各个地方授予荣誉奖。我想相信位置计算正确,获胜的孩子应该得到认可(和奖金)。 非常感谢您阅读我的冗长问题并为您解决这个问题提供了帮助。我很乐意回答您可能遇到的任何后续问题。


1
何时选择PCA与LSA / LSI
题: 是否有关于输入数据特性的一般准则,可用于决定在应用PCA与LSA / LSI之间? PCA与LSA / LSI的简要概述: 从主要成分分析(PCA)和潜在语义分析(LSA)或潜在语义索引(LSI)的角度来看,它们都基本都依赖于奇异值分解(SVD)在矩阵上的应用。 据我所知,LSA和LSI是同一件事。LSA与PCA的根本区别不在于PCA,而在于在应用SVD之前对矩阵条目进行预处理的方式。 在LSA中,预处理步骤通常涉及规范化计数矩阵,其中列对应于“文档”,行对应于某种单词。可以将条目视为某种(规范化的)文档出现字数。 在PCA中,预处理步骤涉及从原始矩阵计算协方差矩阵。从概念上讲,原始矩阵在本质上比LSA更具“一般性”。在涉及PCA的情况下,通常称列指的是通用样本向量,而称行指的是要测量的单个变量。协方差矩阵的定义是平方和对称的,实际上,由于可以通过对角化分解协方差矩阵,因此不必应用SVD。值得注意的是,PCA矩阵几乎肯定比LSA / LSI变体更密集-零条目仅在变量之间的协方差为零(即变量独立)的情况下才会出现。 最后,另一个经常被用来区分两者的描述点是: LSA寻求Frobenius范数中的最佳线性子空间,而PCA则寻求最佳仿射线性子空间。 无论如何,这些技术的差异和相似性已在整个互联网的各个论坛中激烈辩论,并且显然存在一些显着差异,并且显然这两种技术将产生不同的结果。 因此,我重复我的问题:是否有关于输入数据特性的一般准则,可用于决定在应用PCA与LSA / LSI之间?如果我有类似术语文档矩阵的内容,那么LSA / LSI始终是最佳选择吗?在某些情况下,可能希望通过为LSA / LSI准备术语/文档矩阵,然后将PCA应用于结果,而不是直接应用SVD来获得更好的结果?

1
生存Coxph和RMS CPH的不同预测图
我已经创建了本示例中使用的术语图的略微增强版本,您可以在此处找到它。我以前在SO上发布过文章,但我想得更多,我认为这可能与Cox比例危害模型的解释有关,而不是与实际编码有关。 问题 当我查看危害比图时,我希望有一个参考点,其置信区间自然为0,这是当我从中使用cph()rms package而不是从中使用coxph()时的情况survival package。coxph()的行为是否正确,如果是,参考点是什么?另外,coxph()中的哑变量具有一个间隔,并且其值不是?Ë0Ë0e^0 例 这是我的测试代码: # Load libs library(survival) library(rms) # Regular survival survobj &lt;- with(lung, Surv(time,status)) # Prepare the variables lung$sex &lt;- factor(lung$sex, levels=1:2, labels=c("Male", "Female")) labels(lung$sex) &lt;- "Sex" labels(lung$age) &lt;- "Age" # The rms survival ddist &lt;- datadist(lung) options(datadist="ddist") rms_surv_fit &lt;- cph(survobj~rcs(age, 4)+sex, data=lung, x=T, y=T) …
9 r  survival  cox-model 

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.