统计和大数据

对统计,机器学习,数据分析,数据挖掘和数据可视化感兴趣的人的问答

3
平行坐标图的简单说明
我已经阅读并看到了许多平行坐标图。有人可以回答以下问题: 简单来说,什么是平行坐标图(PCP),以便外行可以理解? 可能的话凭直觉进行数学解释 PCP何时有用,何时使用? 如果是PCP 不是有用的时,应避免他们? PCP的可能优缺点

9
增强了python中的决策树?[关闭]
关闭。这个问题是题外话。它当前不接受答案。 想改善这个问题吗? 更新问题,使它成为交叉验证的主题。 5个月前关闭。 是否有一个好的Python库用于训练增强型决策树?
13 python  cart  boosting 

3
通过重复观察的数量来估计被抽样人群的数量
假设我有五千万个独特的事物,我采样了1000万个样本(有替换样本)...我附上的第一张图显示了我对相同的“事物”进行了多少次采样,这与人口大于我的样本。 但是,如果我的人口只有1000万,而我又进行了1000万采样,则如第二幅图所示,我将更频繁地对同一事物进行采样。 我的问题是-从我的观察频率表(条形图中的数据)中,当未知时,是否有可能获得原始人口规模的估计?如果您可以提供如何在R中进行此操作的指针,那就太好了。

1
如何有效地执行神经网络建模?
观察数与变量数之比应为多少?如何在神经网络模型中检测过度拟合,以及避免过度拟合的方法是什么?如果我想使用神经网络进行分类,那么班级应该有相等的频率吗?请帮帮我。

6
简短的在线视频可以帮助您进行统计讲座
在讲授统计数据时,合并偶尔的简短视频会很有用。 我的最初想法包括: 统计概念的动画和可视化 有关特定技术应用的故事 与统计创意相关的幽默视频 采访使用统计学的统计学家或研究人员 您在教统计资料时是否使用过任何您认为有用的视频? 请提供: 在线链接到视频 内容说明 视频可能与哪些统计主题相关


1
测试两个独立样本是否存在相同的偏斜?
哪些检验可用于检验两个独立样本的零假设,即它们来自具有相同偏斜的总体?有一个经典的1样本测试来检查偏斜是否等于一个固定数字(该测试涉及第6个采样矩!);有2个样本测试的直接翻译吗? 是否存在不涉及大量数据的技术?(我期待以'bootstrap it'的形式回答:已知Bootstrap技术适合于此问题吗?)

4
如何总结分类数据?
我一直在为以下问题而苦苦挣扎,希望对统计学家来说这是一个简单的问题(我是一个有统计学知识的程序员)。 我需要总结对调查的答复(用于管理)。该调查有100多个问题,分为不同区域(每个区域约5到10个问题)。所有答案都是分类的(按顺序,它们就像“一点也不”,“很少” ...“每天或更频繁”)。 管理层希望获得每个领域的摘要,这是我的问题:如何在相关问题中汇总分类答案?。问题太多了,无法为每个区域绘制图形甚至是格子图。与数字表相比,如果可能的话,我更喜欢采用视觉方法(例如,数字表不会读取)。 我唯一能想到的是计算每个区域中答案的数量,然后绘制直方图。 还有其他可用于分类数据的东西吗? 我使用R,但不确定是否相关,我觉得这更像是一个一般的统计问题。

3
在Box-Cox转换后的数据中以原始单位表示答案
对于某些测量,分析结果会以转换后的比例适当显示。但是,在大多数情况下,最好以原始的度量标准显示结果(否则您的工作或多或少就毫无价值)。 例如,在对数转换的数据的情况下,由于记录值的均值不是均值的对数,因此会出现原始标度解释的问题。在对数刻度上取均值估计值的对数,而在原始刻度上不给出均值估计值。 但是,如果日志转换后的数据具有对称分布,则以下关系成立(因为日志保留顺序): 均值[ log(是)] = 中位数[ log(是)] = 日志[ 中位数(Y)]Mean[log⁡(Y)]=Median[log⁡(Y)]=log⁡[Median(Y)]\text{Mean}[\log (Y)] = \text{Median}[\log (Y)] = \log[\text{Median} (Y)] (对数值的对数是原始测量范围的中位数)。 因此,我只能对原始度量标准上的中位数差异(或比率)做出推断。 如果总体大致正常且具有大约标准偏差,则两样本t检验和置信区间最为可靠,因此我们可能会倾向于将Box-Cox变换用作正态假设成立(我也认为这也是方差稳定变换)。 但是,如果将t工具应用于Box-Cox转换后的数据,则会推断出转换后的数据在方式上的差异。我们如何以原始的测量尺度来解释那些?(转换后的值的平均值不是转换后的平均值)。换句话说,在转换后的尺度上对均值的估计值进行逆转换,不会在原始尺度上给出均值的估计值。 在这种情况下,我还可以仅推断中位数吗?有没有可以让我回到原始状态的方法的转换? 这个问题最初是在这里发表评论的

3
使用信息几何来定义距离和体积……有用吗?
我遇到了大量文献,他们主张将Fisher信息量度作为概率分布空间中的自然局部量度,然后对其进行积分以定义距离和体积。 但是这些“综合”数量实际上对任何事情都有用吗?我没有找到任何理论依据,也没有实际应用。一个是Guy Lebanon的作品,他使用“费舍尔的距离”对文档进行分类,另一个是罗德里格斯的“ 模型选择 ” ABC…其中“费舍尔的体积”用于模型选择。显然,使用“信息量”相对于AIC和BIC进行模型选择具有“数量级”的改进,但是我没有看到有关该工作的任何后续报道。 理论上的证明可能是拥有一个泛化边界,该泛化边界使用距离或体积的这种度量,并且比从MDL或渐近参数得出的边界更好,或者有一种依赖于这些数量之一的方法在某些合理的实际情况下可证明是更好的任何这种结果?

1
循环统计中更高时刻的直觉
在循环统计中,圆上具有值的随机变量的期望值定义为 (请参阅Wikipedia)。这是一个非常自然的定义,方差 因此,我们不需要第二分钟即可定义方差!ZZZSSSm1(Z)=∫SzPZ(θ)dθm1(Z)=∫SzPZ(θ)dθ m_1(Z)=\int_S z P^Z(\theta)\textrm{d}\theta Var(Z)=1−|m1(Z)|.Var(Z)=1−|m1(Z)|. \mathrm{Var}(Z)=1-|m_1(Z)|. 尽管如此,我们定义了较高的矩 我承认,乍一看也很自然,并且与线性统计中的定义非常相似。但是我仍然感到有些不舒服,并且有以下几点mn(Z)=∫SznPZ(θ)dθ.mn(Z)=∫SznPZ(θ)dθ. m_n(Z)=\int_S z^n P^Z(\theta)\textrm{d}\theta. 问题: 1. 用上面定义的更高的矩(直觉)来衡量什么?分布的哪些特性可以用它们的矩来表征? 2.在较高矩的计算中,我们使用复数乘法,尽管我们将随机变量的值仅视为平面中的矢量或角度。我知道复数乘法在这种情况下本质上是角度的加法,但是仍然: 为什么复数乘法对循环数据有意义?

5
数据可视化技术的认知处理/解释
是否有人知道研究不同可视化技术的有效性(可理解性)的研究? 例如,人们相对于另一种形式的可视化理解有多快?与可视化的交互性是否可以帮助人们回忆数据?遵循这些原则。可视化示例可能是:散点图,图形,时间线,地图,交互式界面(如平行坐标)等。 我对非专业人群的研究特别感兴趣。

4
数据匿名化软件
已锁定。该问题及其答案被锁定,因为该问题是题外话,但具有历史意义。它目前不接受新的答案或互动。 有谁知道好的数据匿名软件?或者也许是用于R的数据匿名包?显然,不要指望不可破解的匿名化-只是想让它变得困难。
13 software 

5
不同长度时间序列的SVD维数缩减
我正在使用奇异值分解作为降维技术。 给定N维向量D,其思想是表示不相关维的变换空间中的特征,这将以重要性降序将大多数数据信息压缩到该空间的特征向量中。 现在,我正在尝试将此过程应用于时间序列数据。问题在于并非所有序列都具有相同的长度,因此我无法真正构建num-by-dim矩阵并应用SVD。我的第一个想法是通过构建num-by-maxDim矩阵并用零填充空白空间来用零填充矩阵,但是我不确定这是否正确。 我的问题是,如何将SVD降维方法应用于不同长度的时间序列?或者,是否还有其他通常用于时间序列的本征空间表示方法? 下面是一段MATLAB代码来说明这一想法: X = randn(100,4); % data matrix of size N-by-dim X0 = bsxfun(@minus, X, mean(X)); % standarize [U S V] = svd(X0,0); % SVD variances = diag(S).^2 / (size(X,1)-1); % variances along eigenvectors KEEP = 2; % number of dimensions to keep newX = U(:,1:KEEP)*S(1:KEEP,1:KEEP); % …

3
线性混合效应模型
我通常听说LME模型在准确性数据的分析(即心理学实验)中更为健全,因为它们可以处理传统方法(例如ANOVA)无法实现的二项分布和其他非正态分布。 LME模型的数学基础是什么,这些模型可以使它们合并其他分布,还有一些不太技术的论文对此进行了描述?

By using our site, you acknowledge that you have read and understand our Cookie Policy and Privacy Policy.
Licensed under cc by-sa 3.0 with attribution required.