统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

1
离散数据和PCA的替代方案
我有一个离散的数据集(常规,特征和名义),这些变量描述了几种紧密相关的昆虫的形态翅膀特征。我要做的是进行某种分析,以便根据形态特征直观地呈现不同物种的相似性。首先出现在我脑海中的是PCA(这是我要创建的可视化类型),但是在研究之后(尤其是其他问题,例如:主成分分析可以应用于包含连续数据的混合数据集吗?和分类变量?),似乎PCA可能不适用于离散数据(文献中这些类型的研究中使用了PCA,但始终使用连续数据)。忽略了为什么该数据不合适的统计背景,PCA确实在我的生物学问题上给了我相对完美的结果(感兴趣的杂交人群恰好位于其父辈群体的中间)。 我还尝试了多种对应关系分析以安抚统计数据(至少就我的理解而言),但是我似乎无法获得与PCA相似的图,其中我的观察值(生物学个体)用颜色分开表示不同的分组(不同的物种,从生物学上来说)。似乎该分析旨在描述变量(在这里是我的形态特征)如何相互关联,而不是各个观察结果之间的关联。当我按组对观察结果进行绘制时,我只能得到描述整个个体的单个值(也许是平均值)。我已经在R中完成了分析,所以也许我还不够R精明,无法使我对工作情节有所了解。 我对数据进行这种分析是否正确,还是偏离轨道?如果您无法判断,我的统计专业知识是有限的,因此在这些分析下发生的方程式一直困扰着我。我正在尝试完全描述性地进行此分析(我不再需要进行任何下游数字运算),并且我已经读到,如果是这种情况,PCA就足够了,但是想确保我不会违反了太多的统计假设。

2
如何在R中使用简单的指数平滑?
我是R的初学者,能否请您解释一下如何在R Forecast的预测包中使用ses ?我想选择初始周期数和平滑常数。 d <- c(3,4,41,10,9,86,56,20,18,36,24,59,82,51,31,29,13,7,26,19,20,103,141,145,24,99,40,51,72,58,94,78,11,15,17,53,44,34,12,15,32,14,15,26,75,110,56,43,19,17,33,26,40,42,18,24,69,18,18,25,86,106,104,35,43,12,4,20,16,8) 我有70个周期,我想将40个周期用于初始样本,将30个周期用于样本外。 ses(d, h=30, level=c(80,95), fan=FALSE,initial=c("simple"), alpha=.1) 这是对的吗?

2
通过具有Logistic损失函数的矩阵分解进行协同过滤
考虑协作过滤问题。我们有#users * #items个大小的矩阵如果用户i喜欢项目j,则如果用户i不喜欢项目j,则,并且如果没有关于(i,j)对的数据。我们希望为将来的用户项对预测。中号中号M中号我,Ĵ= 1中号一世,Ĵ=1个M_{i,j} = 1中号我,Ĵ= 0中号一世,Ĵ=0M_{i,j} = 0中号我,Ĵ= ?中号一世,Ĵ=?M_{i,j}=?中号我,Ĵ中号一世,ĴM_{i,j} 标准协作过滤方法是将M表示为2个矩阵乘积,从而ü× Vü×VU \times V| | 中号- U× V||2||中号-ü×V||2||M - U \times V||_2 是最小的(例如,最小化已知元素的均方误差 中号中号M)。 对我来说,逻辑损失函数似乎更合适,为什么所有算法都使用MSE?

4
扩展逻辑回归以得到0到1之间的结果
我有一个回归问题,其中结果不是严格地为0、1,而是包括从0到1的所有实数,包括。ÿ= [ 0 ,0.12 ,0.31 ,。。。, 1 ]Y=[0,0.12,0.31,...,1]Y = [ 0, 0.12, 0.31, ..., 1 ] 尽管我的问题略有不同,但该问题已经在该线程中进行了讨论。 出于与通常使用逻辑回归相同的原因,我无法使用线性回归。在线性回归中,A)非常大的IVs值会使预测结果偏向1,而B)线性回归的结果不限于0.1的极限。 从我的教科书看这个逻辑成本函数,我认为方程式旨在计算仅当和的值不等于0或1 时,成本才大于0 。成本= - ÿ日志(h (x ))− (1 − y)日志(1 − h (x ))Cost=−ylog⁡(h(x))−(1−y)log⁡(1−h(x))\text{Cost} = -y \log(h(x)) - (1 - y) \log(1-h(x))ÿyyXxx 通过修改成本函数来度量所有假设误差是否有可能使用逻辑回归?

3
在回归中添加更多变量且幅度更大时,符号翻转
基本设置: 回归模型: y=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy=constant+β1x1+β2x2+β3x3+β4x4+αC+ϵy = \text{constant} +\beta_1x_1+\beta_2x_2+\beta_3x_3+\beta_4x_4+\alpha C+\epsilon 其中C是控制变量的向量。 我感兴趣的是 ββ\beta 并期待 β1β1\beta_1 和 β2β2\beta_2是负面的。但是,模型中存在多重共线性问题,相关系数由corr(x1x1x_1,x2)=x2)=x_2)= 0.9345,corr(x1x1x_1,x3)=x3)=x_3)= 0.1765,corr(x2x2x_2,x3)=x3)=x_3)= 0.3019。 所以 x1x1x_1 和 x2x2x_2是高度相关的,因此它们实际上应该提供相同的信息。我运行三个回归: 排除 x1x1x_1变量; 2.排除x2x2x_2变量; 3.两者兼有的原始模型x1x1x_1 和 x2x2x_2。 结果: 对于回归1和2,它提供了预期的符号β2β2\beta_2 和 β1β1\beta_1分别且幅度相似。和β2β2\beta_2 和 β1β1\beta_1 在对标准误差进行HAC校正后,两个模型中的均值在10%的水平上均显着。 β3β3\beta_3 在两个模型中均为正,但不显着。 但是3 β1β1\beta_1 具有预期的符号,但符号为 β2β2\beta_2 是正的,其幅度是其两倍 β1β1\beta_1绝对价值 而且两者β1β1\beta_1 和 β2β2\beta_2无关紧要。此外,β3β3\beta_3 与回归1和2相比减少了近一半。 我的问题是: 为什么在3中 β2β2\beta_2 变得积极并且远大于 …

2
从关系数据中学习
设置 许多算法对单个关系或表进行操作,而许多现实世界数据库将信息存储在多个表中(Domingos,2003年)。 问题 哪些类型的算法可以从多个(关系)表中很好地学习。特别是,我对适用于回归和分类任务的算法(而不是面向网络分析的算法,例如链接预测)感兴趣。 我知道下面列出了几种方法(但可以肯定的是我缺少了一些方法): 多关系数据挖掘(MRDM)(Dzeroski,2002) 归纳逻辑编程(ILP)(Muggleton,1992年) 统计关系学习(SRL)(Getoor,2007年) Džeroski,S。(2003)。多关系数据挖掘:简介。ACM SIGKDD勘探通讯。 Getoor,Lise和Ben Taskar编辑。统计关系学习简介。麻省理工学院出版社,2007。 S. Muggleton和C. Feng。逻辑程序的有效归纳。第一次算法学习理论会议论文集,第368–381页。1990年,东京,欧姆萨(Ohmsha)。

1
我应该如何标准化加速度传感器的数据?
我正在处理大量加速度计数据,这些数据是由许多对象佩戴的多个传感器收集的。不幸的是,这里似乎没有人知道设备的技术规格,而且我认为它们从未进行过校准。我没有关于设备的大量信息。我正在研究硕士学位论文,加速度计是从另一所大学借来的,所以情况有点不透明。那么,在设备上进行预处理?没有线索。 我所知道的是它们是具有20Hz采样率的三轴加速度计。数字的,大概是MEMS。我对非语言行为和手​​势感兴趣,根据我的消息来源,这些行为和手势通常会在0.3-3.5Hz的范围内产生活动。 规范化数据似乎很有必要,但是我不确定该使用什么。数据的很大一部分接近于其余值(从重力开始,原始值约为1000),但有些极端,例如某些日志中的最大值为8000,而另一些日志中的最大值为29000。请参见下图。我认为用max或stdev进行归一化是一个坏主意。 在这种情况下,通常的做法是什么?除以中位数?百分位数值?还有吗 作为附带问题,我也不确定是否应该限制极端值。 感谢您的任何建议! 编辑:这是大约16分钟的数据(20000个样本)的图表,可让您大致了解数据的分布方式。

4
Box Cox转换以进行回归
我正在尝试仅使用一个预测变量(例如(x,y))将线性模型拟合到某些数据上。数据使得对于较小的x值,y值与直线紧密匹配,但是,随着x值的增加,y值变得更加不稳定。这是此类数据(R代码)的示例 y = c(3.2,3.4,3.5,3.8,4.2,5.5,4.5,6.8,7.4,5.9) x = seq(1,10,1) 我很想知道是否存在任何幂变换(也许是Box cox?),这使我比简单地进行线性拟合(如下所示)更适合数据。 fit = lm(y ~ x)

1
LSA与pLSA之间的并列
在pLSA的原始论文中,作者Thomas Hoffman在pLSA和LSA数据结构之间画了一条相似的线,我想与您讨论一下。 背景: 从信息检索中获得启发,假设我们有一个 ññN 单据 D = {d1个,d2,。。。。,dñ}d={d1个,d2,。。。。,dñ}D = \lbrace d_1, d_2, ...., d_N \rbrace 和一个词汇 中号中号M 条款 Ω = {ω1个,ω2,。。。,ω中号}Ω={ω1个,ω2,。。。,ω中号}\Omega = \lbrace \omega_1, \omega_2, ..., \omega_M \rbrace 一个语料库 XXX 可以用 ñ× Mñ×中号N \times M 共生矩阵。 在SVD的潜在语义Analisys中,矩阵XXX 被分为三个矩阵: X= UΣVŤX=üΣVŤX = U \Sigma V^T 哪里 Σ = d我一个克{σ1个,。。。,σs}Σ=d一世一个G{σ1个,。。。,σs}\Sigma = …

2
PCA或因子分析中的变量偏斜
我想基于22个变量对SPSS进行主成分分析(因子分析)。但是,我的一些变量非常偏斜(根据SPSS计算得出的偏斜范围为2–80!)。 所以这是我的问题: 我应该保留这样的偏斜变量,还是可以在主成分分析中转换变量?如果是,我将如何解释因子得分? 我应该进行哪种类型的转换?log10还是ln? 最初,我的KMO(Kaiser–Meyer–Olkin)为0.413。许多文献建议最小值为0.5。我仍然可以进行因子分析,还是需要删除变量以将我的KMO提高到0.5?

5
预先聚类有助于建立更好的预测模型吗?
对于流失建模的任务,我正在考虑: 计算数据的k个聚类 分别为每个集群构建k个模型。 这样做的理由是,没有证据可以证明子代客群体是同质的,因此有理由假设数据生成过程可能因不同的“组”而异。 我的问题是,这是否合适?它违反任何东西,还是出于某种原因被认为是不好的?如果是这样,为什么? 如果不是,您是否会分享有关该问题的一些最佳实践?第二件事-做预聚类通常比模型树好还是坏(如Witten,Frank中定义的那样,分类/回归树在叶子上有模型。直觉上看来,决策树阶段只是聚类的另一种形式,但是如果它比“常规”群集有任何优势,请访问idk。)。

2
Benjamini-Hochberg依赖性假设是否成立?
我有一个数据集,用于测试三个总体之间在大约50个不同变量方面的显着差异。一方面,我使用Kruskal-Wallis检验,另一方面,通过嵌套GLM模型拟合的似然比检验(具有和不具有总体作为自变量)进行此操作。 结果,一方面,我列出了Kruskal-Wallis,另一方面,我认为是LRT比较中的卡方p值。pppppp 我需要做某种形式的多重测试校正,因为有50多种不同的测试,Benjamini-Hochberg FDR似乎是最明智的选择。 但是,变量可能不是独立的,它们中的几个“氏族”是相关的。然后的问题是:我如何确定我的p值的基础统计信息集是否ppp满足Benjamini-Hochberg过程仍然要绑定到FDR所需的正相关性要求? 2001年的Benjamini-Hochberg-Yekutieli论文指出,PRDS条件适用于多元正态分布和学生分布。对于模型比较,我的似然比检验卡方值怎么样?对于Kruskal-Wallis检验,我的ppp如何? 我可以使用Benjamini-Hochberg-Yekutieli最坏情况的FDR校正,该校正在假设依赖项时不做任何假设,但我认为在这种情况下,它可能过于保守,并且会丢失一些相关信号。

4
如何按时间序列绘制20年的每日数据
我有以下数据集:https : //dl.dropbox.com/u/22681355/ORACLE.csv, 并想按“日期”在“打开”中绘制每日变化,所以我做了以下工作: oracle <- read.csv(file="http://dl.dropbox.com/u/22681355/ORACLE.csv", header=TRUE) plot(oracle$Date, oracle$Open, type="l") 我得到以下信息: 现在这显然不是有史以来最好的图,所以我想知道在绘制这样的详细数据时使用什么正确的方法?

2
子集上的分布?
我想知道整数子集上是否有任何标准分布。等效地,我们可以将其表示为二进制结果的长度向量上的分布,例如,如果则对应于向量。{1个,2,。。。,Ĵ}{1,2,...,J}\{1, 2, ..., J\}ĴJJĴ=5J=5J = 5{1个,3,5}{1,3,5}\{1, 3, 5\}(1个,0,1个,0,1个)(1,0,1,0,1)(1, 0, 1, 0, 1) 理想情况下,我要寻找的是分布,它来自以有限维参数索引的族,该分布将以这样的方式分布其质量,即两个二元向量和具有相似的它们“靠近”在一起的概率,即和具有相似的概率。确实,我希望能做的是在上放置一个先验值,这样,如果我知道相当大,则相对于远离向量可能很大。νθ(⋅)νθ(⋅)\nu_\theta (\cdot)θθ\theta[R1个r1r_1[R2r2r_2[R1个=(0,0,1个,0,1个)r1=(0,0,1,0,1)r_1 = (0, 0, 1, 0, 1)[R2=(0,0,1个,1个,1个)r2=(0,0,1,1,1)r_2 = (0, 0, 1, 1, 1)θθ\thetaνθ([R1个)νθ(r1)\nu_\theta (r_1)νθ([R2)νθ(r2)\nu_\theta (r_2)[R1个r1r_1 我想到的一种策略是在上放置度量或其他色散度量,然后取或类似的东西。一个明确的例子是与正态分布类似。很好,但是我希望有一些标准的并且适合贝叶斯分析的方法。我不能写下标准化常数。dθdθd_\theta{0,1个}Ĵ{0,1}J\{0, 1\}^Jνθ([R)∝经验值(-dθ([R,μ))νθ(r)∝exp(−dθ(r,μ))\nu_\theta (r) \propto \exp (-d_\theta (r, \mu))经验值{-‖[R-μ‖2/(2σ2)}exp{−∥r−μ∥2/(2σ2)}\exp\left\{-\|r - \mu\|^2 / (2 \sigma^2)\right\}

1
频繁统计的参考资料,精通现代概率论的某人
来自严格的分析和现代概率论背景,我发现贝叶斯统计信息简单明了,易于理解,常客统计数据令人难以置信且令人困惑。似乎常客确实是在做贝叶斯统计,除非动机和动机没有明确定义的“秘密先验”。 另一方面,很多了解这两种观点的伟大统计学家都将归因于惯常论者的观点,因此那里肯定有些我不理解的东西。我不想放弃并宣布自己是贝叶斯主义者,而是想了解更多关于常客主义的观点,以尝试真正地“理解”它。 从严格的角度来学习频率统计资料有哪些好的参考?理想情况下,我正在寻找能防止定理定理的书籍,或者通过解决这些困难的习题集,可以获得正确的心态。我已经读过很多可能在互联网上找到的“哲学性东西”,例如Wiki页面,.edu /〜randomprof网站中的随机pdf等,但它没有帮助。

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.